Un Latido hace la misma pregunta cada hora y, la mayoría de las horas, la respuesta honesta es «nada nuevo». Desde septiembre de 2026 esa respuesta la da un modelo de decisión en lugar de un modelo de chat —unos segundos, una fracción de crédito— y el modelo principal solo se despierta cuando algo coincide de verdad. Esto es lo que cambió y lo que medimos.
Cuando lanzamos los Latidos, cada ejecución era una ejecución normal del agente: el modelo descargaba el feed, lo comparaba con lo ya visto, decidía que nada coincidía y escribía una respuesta de una palabra. De 33 ejecuciones programadas, 25 no encontraron nada, y cada una de esas ejecuciones silenciosas costaba igualmente 15–20 créditos y tardaba unos tres minutos, porque el modelo principal se llamaba tres veces solo para decir «no».
Es la herramienta equivocada. «¿Coincide esta publicación con lo que pedí vigilar?» es una pregunta de sí o no, repetida una y otra vez, y la respuesta casi siempre es no. Pagar a un modelo de chat, cuyo precio está pensado para escribir párrafos, por responderla es pagar precio de redacción por algo más parecido a una consulta.
Un modelo de decisión recibe texto y devuelve una respuesta tipada, no una frase. El 15 de septiembre de 2026 TypeSafe AI publicó Jev, el primero de lo que llaman modelos System One (por el «sistema 1» rápido e intuitivo de Daniel Kahneman). Se le entrega un estado —una publicación, un registro, una página de texto— y una o varias preguntas de tres formas:
Nunca escribe prosa, así que no puede inventar una cita ni salirse del esquema; responde en bastante menos de un segundo; y se cobra solo por la entrada, a una pequeña fracción de lo que cuesta un modelo de chat. El resumen de Simon Willison es el que más útil nos parece: encaja en todo lo que pueda expresarse como clasificación —spam, etiquetas, prioridad, orden—. Vigilar un feed buscando coincidencias es exactamente eso.
La otra propiedad que importa para automatizar es que cada respuesta lleva una confianza. A un modelo que acierta casi siempre pero no sabe decir en qué casos duda no se le puede dejar trabajar sin supervisión; a uno que informa de su incertidumbre, sí, porque su código decide qué hacer con los casos dudosos.
Dele a un Latido un feed RSS/Atom y el sistema hace los dos primeros pasos por sí mismo; el modelo de decisión hace el tercero; al modelo principal solo se llega en el último.
La confianza se usa, no solo se guarda. Por encima del umbral de coincidencia la entrada se informa; por debajo del umbral de descarte se elimina; la franja intermedia pasa al modelo principal para una segunda comprobación: es la casilla «no está seguro» de la figura. Y si el modelo de decisión no está disponible en una ejecución, todas las entradas nuevas van al modelo principal como antes: unos créditos más, nunca una ejecución perdida. Lo vimos el 21 de septiembre, cuando el proveedor devolvió errores durante veinte minutos: tres publicaciones nuevas las juzgó el modelo principal y no se perdió nada.
Medido en dos Latidos horarios que vigilan feeds de Reddit, solo ejecuciones programadas. «Antes» es del 17 al 19 de septiembre; «después», del 20 al 22, ya con el cambio en producción.
Adónde se fue el tiempo. Cada barra es una ejecución, a escala; los segmentos son lo que hacía en cada momento, tomados de la línea de tiempo por ejecución de nuestra consola.
| Una ejecución en la que… | Antes | Después |
|---|---|---|
| no apareció nada nuevo | ≈15–20 créditos · ≈3 min · 3 llamadas al modelo | 0 créditos · ≈5 s · 0 llamadas |
| hubo entradas nuevas pero ninguna coincidió | ≈15–20 créditos · ≈3 min | unas centésimas de crédito · ≈5 s · 0 llamadas |
| algo coincidió, o no estaba seguro | ≈30 créditos · ≈3 min | ≈4–7 créditos · ≈30–70 s · 1 llamada, sin herramientas |
| proporción de ejecuciones que llegaron al modelo principal | 100 % (33 de 33) | 11 % (7 de 63) |
El juicio en sí es pequeño: la primera ejecución de un Latido puntuó 25 entradas en una sola petición: unos 7.000 tokens, 2,2 segundos, alrededor de un tercio de crédito. Dos publicaciones que se quejaban de que el staging con IA cambiaba las habitaciones obtuvieron 0,90 y 0,80; todo lo demás, 0,12 o menos. Una ejecución normal solo tiene un par de entradas nuevas, así que juzgarlas cuesta unas centésimas de crédito. Todo lo que el modelo de decisión ha juzgado desde que entró en producción —cada ejecución, ambos Latidos— suma 22 peticiones, 41.000 tokens y 1,73 créditos.
Algo que aprendimos a golpes: hay que darle el cuerpo, no solo el título. En una publicación cuyo título no decía nada de IA, el título solo obtuvo 0,50 —un encogimiento de hombros—, mientras que título más las primeras 300 palabras obtuvo 0,79–0,90. El sistema ahora le da ambos.
Un modelo de decisión solo ayuda cuando el paso caro es un sí-o-no repetido. Las tareas de navegador no lo son: su coste está en decisiones abiertas —qué pulsar ahora, qué muestra una captura— que un modelo de sí/no no puede tomar, y en imágenes, que no puede leer. La memoria tiene la forma adecuada (¿merece recordarse esta frase?), pero ese paso ya cuesta unos 0,06 créditos, así que no hay nada que ahorrar, y un «no» equivocado sobre una de sus preferencias costaría más que eso.
La regla práctica: un modelo de decisión compensa cuando la entrada es texto, la respuesta es sí/no o una puntuación, la misma pregunta se hace muchas veces y cada respuesta cuesta hoy una llamada completa al modelo. Vigilar un feed cumple las cuatro; por eso es el primer sitio donde se nota la diferencia.