Agentic Hat
Agente
Galería
Precios
Buddy
Docs
Iniciar sesión
Registrarse
Agentic Hat
Plataforma de Agente IA Autónomo · Un producto de FewBox
Navegación
Agente
Galería
Precios
Buddy
Docs
Registrarse
Síguenos
Contáctenos
[email protected]
Agentic Hat
Plataforma de Agente IA Autónomo · Un producto de FewBox
Navegación
Agente
Galería
Precios
Buddy
Docs
Registrarse
Síguenos
Contáctenos
[email protected]
Política de Privacidad
Privacidad de la Extensión
© 2026 FewBox
Docs › Modelos de decisión

Por qué las comprobaciones sin novedades de un Latido casi no cuestan nada

Un Latido hace la misma pregunta cada hora y, la mayoría de las horas, la respuesta honesta es «nada nuevo». Desde septiembre de 2026 esa respuesta la da un modelo de decisión en lugar de un modelo de chat —unos segundos, una fracción de crédito— y el modelo principal solo se despierta cuando algo coincide de verdad. Esto es lo que cambió y lo que medimos.

Vigilar es, sobre todo, decir que no

Cuando lanzamos los Latidos, cada ejecución era una ejecución normal del agente: el modelo descargaba el feed, lo comparaba con lo ya visto, decidía que nada coincidía y escribía una respuesta de una palabra. De 33 ejecuciones programadas, 25 no encontraron nada, y cada una de esas ejecuciones silenciosas costaba igualmente 15–20 créditos y tardaba unos tres minutos, porque el modelo principal se llamaba tres veces solo para decir «no».

Es la herramienta equivocada. «¿Coincide esta publicación con lo que pedí vigilar?» es una pregunta de sí o no, repetida una y otra vez, y la respuesta casi siempre es no. Pagar a un modelo de chat, cuyo precio está pensado para escribir párrafos, por responderla es pagar precio de redacción por algo más parecido a una consulta.

Qué es un modelo de decisión

Un modelo de decisión recibe texto y devuelve una respuesta tipada, no una frase. El 15 de septiembre de 2026 TypeSafe AI publicó Jev, el primero de lo que llaman modelos System One (por el «sistema 1» rápido e intuitivo de Daniel Kahneman). Se le entrega un estado —una publicación, un registro, una página de texto— y una o varias preguntas de tres formas:

Nunca escribe prosa, así que no puede inventar una cita ni salirse del esquema; responde en bastante menos de un segundo; y se cobra solo por la entrada, a una pequeña fracción de lo que cuesta un modelo de chat. El resumen de Simon Willison es el que más útil nos parece: encaja en todo lo que pueda expresarse como clasificación —spam, etiquetas, prioridad, orden—. Vigilar un feed buscando coincidencias es exactamente eso.

  • Sí o no: «¿Se queja esta publicación de que el home staging con IA cambió la arquitectura?» → una probabilidad entre 0 y 1.
  • Elegir una: «¿Cuál de estas cinco categorías encaja?» → una opción, con una probabilidad para cada una.
  • Puntuar: «¿Cuánta frustración tiene este cliente, de 0 a 2?» → un número en la escala que usted definió.

La otra propiedad que importa para automatizar es que cada respuesta lleva una confianza. A un modelo que acierta casi siempre pero no sabe decir en qué casos duda no se le puede dejar trabajar sin supervisión; a uno que informa de su incertidumbre, sí, porque su código decide qué hacer con los casos dudosos.

Cómo lo usa un Latido

Dele a un Latido un feed RSS/Atom y el sistema hace los dos primeros pasos por sí mismo; el modelo de decisión hace el tercero; al modelo principal solo se llega en el último.

Descargar
El sistema descarga el feed, sin ningún modelo
→
Comparar
Las entradas ya vistas se descartan por id; solo siguen las realmente nuevas
→
Juzgar
Cada entrada nueva va al modelo de decisión con una sola pregunta: ¿coincide con lo que pidió vigilar?
→
Solo entonces, el modelo
Las coincidencias, y las entradas de las que no está seguro, pasan al modelo principal para leerlas e informar
Si no hay nada nuevo, o nada coincide, la ejecución termina en el paso 2 o 3 sin que el modelo principal se llame nunca.

La confianza se usa, no solo se guarda. Por encima del umbral de coincidencia la entrada se informa; por debajo del umbral de descarte se elimina; la franja intermedia pasa al modelo principal para una segunda comprobación: es la casilla «no está seguro» de la figura. Y si el modelo de decisión no está disponible en una ejecución, todas las entradas nuevas van al modelo principal como antes: unos créditos más, nunca una ejecución perdida. Lo vimos el 21 de septiembre, cuando el proveedor devolvió errores durante veinte minutos: tres publicaciones nuevas las juzgó el modelo principal y no se perdió nada.

Lo que hizo en producción

Medido en dos Latidos horarios que vigilan feeds de Reddit, solo ejecuciones programadas. «Antes» es del 17 al 19 de septiembre; «después», del 20 al 22, ya con el cambio en producción.

Adónde se fue el tiempo. Cada barra es una ejecución, a escala; los segmentos son lo que hacía en cada momento, tomados de la línea de tiempo por ejecución de nuestra consola.

Antes · una ejecución sin novedades
≈180 s · 3 llamadas al modelo · 2 herramientas
Después · una ejecución con coincidencia
67 s · 1 llamada al modelo · sin herramientas
Después · una ejecución sin novedades
≈5 s · sin modelo
modelo principalllamada a herramientasistema (descargar · comparar · juzgar)
Antes: el modelo descargaba el feed, volvía a escribir cada entrada para la herramienta de comparación y luego escribía «nada»: tres llamadas para decir que no. Después: una ejecución sin novedades nunca llega al modelo; una con coincidencia es una sola llamada con las entradas ya en la mano.
Una ejecución en la que…AntesDespués
no apareció nada nuevo≈15–20 créditos · ≈3 min · 3 llamadas al modelo0 créditos · ≈5 s · 0 llamadas
hubo entradas nuevas pero ninguna coincidió≈15–20 créditos · ≈3 minunas centésimas de crédito · ≈5 s · 0 llamadas
algo coincidió, o no estaba seguro≈30 créditos · ≈3 min≈4–7 créditos · ≈30–70 s · 1 llamada, sin herramientas
proporción de ejecuciones que llegaron al modelo principal100 % (33 de 33)11 % (7 de 63)
Después: 69 ejecuciones programadas en 47 horas; 54 terminaron sin el modelo principal, 7 llegaron a él (4 segundas comprobaciones sin nada, 3 informes), 6 fallaron por un error ajeno al juicio, 1 primera ejecución, 1 omitida.

El juicio en sí es pequeño: la primera ejecución de un Latido puntuó 25 entradas en una sola petición: unos 7.000 tokens, 2,2 segundos, alrededor de un tercio de crédito. Dos publicaciones que se quejaban de que el staging con IA cambiaba las habitaciones obtuvieron 0,90 y 0,80; todo lo demás, 0,12 o menos. Una ejecución normal solo tiene un par de entradas nuevas, así que juzgarlas cuesta unas centésimas de crédito. Todo lo que el modelo de decisión ha juzgado desde que entró en producción —cada ejecución, ambos Latidos— suma 22 peticiones, 41.000 tokens y 1,73 créditos.

Algo que aprendimos a golpes: hay que darle el cuerpo, no solo el título. En una publicación cuyo título no decía nada de IA, el título solo obtuvo 0,50 —un encogimiento de hombros—, mientras que título más las primeras 300 palabras obtuvo 0,79–0,90. El sistema ahora le da ambos.

Dónde se detiene

  • Solo texto. No puede mirar una imagen ni una captura. Lee el título y el texto de la entrada del feed; cualquier cosa que haya que «ver» va al modelo principal.
  • Da un número, no una razón. No puede preguntarle por qué una publicación obtuvo 0,12. Guardamos cada puntuación con la ejecución, y el modelo principal —que sí puede explicar— sigue siendo quien escribe lo que usted lee.
  • Solo Latidos con feed. Un Latido que necesita el navegador, o el criterio del modelo en cada ejecución, sigue siendo una ejecución normal del agente cada vez. La línea superior de la conversación de un Latido le dice de qué tipo es; vea la página de Latidos.
  • «No está seguro» sigue significando el modelo principal. Las afirmaciones del proveedor sobre calibración aún no han sido verificadas por terceros, así que mantenemos la franja de segunda comprobación en lugar de fiarnos de cada número.
  • Decide qué merece leerse; nunca le escribe a usted. Todo lo que ve en la conversación de un Latido sigue saliendo del modelo principal.

Por qué las tareas de navegador y la memoria no se abarataron también

Un modelo de decisión solo ayuda cuando el paso caro es un sí-o-no repetido. Las tareas de navegador no lo son: su coste está en decisiones abiertas —qué pulsar ahora, qué muestra una captura— que un modelo de sí/no no puede tomar, y en imágenes, que no puede leer. La memoria tiene la forma adecuada (¿merece recordarse esta frase?), pero ese paso ya cuesta unos 0,06 créditos, así que no hay nada que ahorrar, y un «no» equivocado sobre una de sus preferencias costaría más que eso.

La regla práctica: un modelo de decisión compensa cuando la entrada es texto, la respuesta es sí/no o una puntuación, la misma pregunta se hace muchas veces y cada respuesta cuesta hoy una llamada completa al modelo. Vigilar un feed cumple las cuatro; por eso es el primer sitio donde se nota la diferencia.

Para seguir leyendo

  • TypeSafe AI — System One (conceptos): qué devuelve el modelo y los tres tipos de pregunta.
  • Simon Willison — Jev introduces a new shape of LLM: dónde encaja un modelo de decisión (clasificación, orden) y la advertencia de la «caja negra».
  • TrueFoundry — TypeSafe AI's Jev: what actually shipped: qué afirmaciones del lanzamiento son verificables y cuáles siguen siendo del proveedor.