Agentic Hat
智能体
展示
定价
Buddy
文档
登录
注册
Agentic Hat
自主 AI Agent 平台 · FewBox 旗下产品
导航
智能体
展示
定价
Buddy
文档
注册
关注
联系我们
[email protected]
Agentic Hat
自主 AI Agent 平台 · FewBox 旗下产品
导航
智能体
展示
定价
Buddy
文档
注册
关注
联系我们
[email protected]
隐私政策
扩展隐私政策
© 2026 FewBox
文档 › 决策模型

心跳里安静的一轮为什么几乎不花钱

心跳每小时问同一个问题,而多数时候诚实的答案是「没有新东西」。2026 年 9 月起,这句话由一个决策模型来答,不再由聊天模型来答——几秒钟、不到一个积分——只有真的有东西匹配时才叫醒主模型。下面是改了什么、量到了什么。

监控这件事,多数时候是在说「不」

心跳刚上线时,每一轮都是一次正常的 Agent 运行:模型去取 feed、和上次看过的比、判断没有匹配的、再写一句话回复。33 轮定时运行里 25 轮什么都没发现——而这些安静的轮每轮仍要 15–20 积分、约三分钟,因为主模型被叫了三次,只为了说一声「没有」。

这是用错了工具。「这条帖子符不符合我要盯的东西」是个是非题,反复问,答案几乎总是「否」。拿一个按写段落定价的聊天模型来答它,等于为一次查表付了写作的价钱。

决策模型是什么

决策模型读进文字、给出一个有类型的答案——不是一句话。2026 年 9 月 15 日 TypeSafe AI 发布了 Jev,他们称之为 System One 模型的第一个(取自卡尼曼那个快速、直觉的「系统 1」)。您给它一段状态——一条帖子、一条记录、一页文字——再给一个或几个问题,问题只有三种形状:

它从不写文章,所以不会编出一条引用、也不会跑出您定的格式;不到一秒答完;只按输入计价,是聊天模型的一个零头。Simon Willison 的概括我们觉得最好用:凡是能表述成分类的事它都合适——垃圾邮件、打标签、排优先级、排序。盯一个 feed 找匹配,正是这种事。

  • 是或否:「这条帖子是不是在抱怨 AI 软装把房子结构改了?」→ 一个 0 到 1 的概率。
  • 选一个:「这五个类别里它属于哪个?」→ 一个选项,每个选项各带概率。
  • 打分:「这位客户有多不满,0–2?」→ 您定义的刻度上的一个数。

对自动化更要紧的另一个性质:每个答案都带 置信度。一个多数时候对、却说不出自己哪几次拿不准的模型,没法放心让它无人值守;一个会报告自己不确定的模型可以,因为拿不准的那些交给您的代码去处理。

心跳怎么用它

给心跳一个 RSS/Atom 源,前两步由运行时自己做,第三步由决策模型做,只有最后一步才碰到主模型。

抓取
运行时自己取 feed,不经过模型
→
比对
已经看过的条目按 id 丢掉,只有真正新的往下走
→
判断
每条新条目交给决策模型,只问一句:符不符合您要盯的?
→
这时才叫模型
符合的、以及它拿不准的,交给主模型去读并汇报
没有新条目、或新条目都不符合,这一轮在第 2 或第 3 步就结束了,主模型根本没被叫。

置信度不只是记下来,是拿来用的。高过匹配线的条目直接汇报;低过不匹配线的丢掉;夹在中间的交给主模型复核——就是图里「拿不准」那一档。若某一轮决策模型不可用,所有新条目照旧交给主模型:多花几个积分,但不会漏掉一轮。9 月 21 日供应商报错了二十分钟,我们正好撞上:三条新帖由主模型判了,一条没漏。

线上跑出来的数

在两条盯 Reddit 源的每小时心跳上量的,只算定时轮。「之前」是 9 月 17–19 日,「之后」是 9 月 20–22 日改动上线之后。

时间花在哪。每条是一轮,长度等比;分段是这一轮在做什么,取自控制台里按轮的耗时时间轴。

改前 · 安静的一轮
≈180 秒 · 叫 3 次模型 · 2 次工具
改后 · 有发现的一轮
67 秒 · 叫 1 次模型 · 不用工具
改后 · 安静的一轮
≈5 秒 · 不叫模型
主模型工具调用运行时(抓取 · 比对 · 判断)
改前:模型自己取 feed、把每条重打一遍传给比对工具、再写一句「没有」——叫三次模型只为说一声不。改后:安静的一轮根本碰不到模型;有发现的一轮是一次调用,符合的条目已经在手里。
这一轮……之前之后
没有新条目≈15–20 积分 · ≈3 分钟 · 叫 3 次模型0 积分 · ≈5 秒 · 不叫模型
有新条目,但都不符合≈15–20 积分 · ≈3 分钟百分之几个积分 · ≈5 秒 · 不叫模型
有符合的,或拿不准的≈30 积分 · ≈3 分钟≈4–7 积分 · ≈30–70 秒 · 叫 1 次模型、不用工具
碰到主模型的轮次占比100%(33 轮全部)11%(63 轮里 7 轮)
之后:47 小时 69 轮定时运行——54 轮没碰主模型就结束,7 轮碰了(4 轮复核后没事、3 轮汇报),6 轮因一个与判断无关的缺陷失败,1 轮首轮,1 轮跳过。

判断本身很小:一条心跳的首轮 一个请求判了 25 条——约 7,000 token、2.2 秒、约三分之一个积分。两篇抱怨 AI 软装把房间改了的帖子得 0.90 和 0.80,其余都在 0.12 以下。平常一轮只有两三条新条目,判断的花费是百分之几个积分。 它上线以来判过的全部内容——两条心跳、每一轮——加起来是 22 次请求、41,000 token、1.73 积分。

一条踩出来的经验:要给它正文,不能只给标题。一篇标题里没提 AI 的帖子,只给标题得 0.50——等于耸肩;给标题加正文前 300 字,得 0.79–0.90。运行时现在两样都给。

它到哪里为止

  • 只读文字。它看不了图片和截图。它读的是 feed 条目的标题和正文;任何要「看」的事都归主模型。
  • 它给一个数,不给理由。您没法问它一条帖子为什么得 0.12。我们把每个分数随轮次存下来;而会解释的主模型,仍然是写您看到的那段话的那个。
  • 只对有 feed 的心跳。需要用浏览器、或每轮都要模型判断的心跳,每一轮仍是一次正常的 Agent 运行。心跳会话顶部那一行会告诉您它属于哪一类——见心跳那一页。
  • 拿不准的仍交主模型。厂商关于校准的说法还没有第三方验证过,所以我们保留复核这一档,不把每个数字都当真。
  • 它决定什么值得读,从不替它写。您在心跳会话里看到的每一句话,仍然出自主模型。

为什么浏览器任务和记忆没有跟着变便宜

决策模型只在「贵的那一步是反复的是非题」时才有用。浏览器任务不是:它的钱花在开放式的决定上——下一步点哪、这张截图里是什么——是非题模型做不了这种决定,也读不了图。记忆的形状是对的(这句话值不值得记),但那一步本来就只要约 0.06 积分,没有可省的;而把您的一条偏好错判成「不记」,代价比这大。

一条经验法则:输入是文字、答案是是非或分数、同一个问题反复问、并且现在每次回答都要花一整次模型调用——四条都满足,决策模型才划算。盯一个 feed 四条全中,所以它是您最先看到差别的地方。

延伸阅读

  • TypeSafe AI — System One(概念):模型返回什么、三种问题类型。
  • Simon Willison — Jev introduces a new shape of LLM:决策模型适合放在哪(分类、排序)与「黑盒」的提醒。
  • TrueFoundry — TypeSafe AI's Jev: what actually shipped:发布时哪些说法能核实、哪些还只是厂商自己说的。