心跳每小时问同一个问题,而多数时候诚实的答案是「没有新东西」。2026 年 9 月起,这句话由一个决策模型来答,不再由聊天模型来答——几秒钟、不到一个积分——只有真的有东西匹配时才叫醒主模型。下面是改了什么、量到了什么。
心跳刚上线时,每一轮都是一次正常的 Agent 运行:模型去取 feed、和上次看过的比、判断没有匹配的、再写一句话回复。33 轮定时运行里 25 轮什么都没发现——而这些安静的轮每轮仍要 15–20 积分、约三分钟,因为主模型被叫了三次,只为了说一声「没有」。
这是用错了工具。「这条帖子符不符合我要盯的东西」是个是非题,反复问,答案几乎总是「否」。拿一个按写段落定价的聊天模型来答它,等于为一次查表付了写作的价钱。
决策模型读进文字、给出一个有类型的答案——不是一句话。2026 年 9 月 15 日 TypeSafe AI 发布了 Jev,他们称之为 System One 模型的第一个(取自卡尼曼那个快速、直觉的「系统 1」)。您给它一段状态——一条帖子、一条记录、一页文字——再给一个或几个问题,问题只有三种形状:
它从不写文章,所以不会编出一条引用、也不会跑出您定的格式;不到一秒答完;只按输入计价,是聊天模型的一个零头。Simon Willison 的概括我们觉得最好用:凡是能表述成分类的事它都合适——垃圾邮件、打标签、排优先级、排序。盯一个 feed 找匹配,正是这种事。
对自动化更要紧的另一个性质:每个答案都带 置信度。一个多数时候对、却说不出自己哪几次拿不准的模型,没法放心让它无人值守;一个会报告自己不确定的模型可以,因为拿不准的那些交给您的代码去处理。
给心跳一个 RSS/Atom 源,前两步由运行时自己做,第三步由决策模型做,只有最后一步才碰到主模型。
置信度不只是记下来,是拿来用的。高过匹配线的条目直接汇报;低过不匹配线的丢掉;夹在中间的交给主模型复核——就是图里「拿不准」那一档。若某一轮决策模型不可用,所有新条目照旧交给主模型:多花几个积分,但不会漏掉一轮。9 月 21 日供应商报错了二十分钟,我们正好撞上:三条新帖由主模型判了,一条没漏。
在两条盯 Reddit 源的每小时心跳上量的,只算定时轮。「之前」是 9 月 17–19 日,「之后」是 9 月 20–22 日改动上线之后。
时间花在哪。每条是一轮,长度等比;分段是这一轮在做什么,取自控制台里按轮的耗时时间轴。
| 这一轮…… | 之前 | 之后 |
|---|---|---|
| 没有新条目 | ≈15–20 积分 · ≈3 分钟 · 叫 3 次模型 | 0 积分 · ≈5 秒 · 不叫模型 |
| 有新条目,但都不符合 | ≈15–20 积分 · ≈3 分钟 | 百分之几个积分 · ≈5 秒 · 不叫模型 |
| 有符合的,或拿不准的 | ≈30 积分 · ≈3 分钟 | ≈4–7 积分 · ≈30–70 秒 · 叫 1 次模型、不用工具 |
| 碰到主模型的轮次占比 | 100%(33 轮全部) | 11%(63 轮里 7 轮) |
判断本身很小:一条心跳的首轮 一个请求判了 25 条——约 7,000 token、2.2 秒、约三分之一个积分。两篇抱怨 AI 软装把房间改了的帖子得 0.90 和 0.80,其余都在 0.12 以下。平常一轮只有两三条新条目,判断的花费是百分之几个积分。 它上线以来判过的全部内容——两条心跳、每一轮——加起来是 22 次请求、41,000 token、1.73 积分。
一条踩出来的经验:要给它正文,不能只给标题。一篇标题里没提 AI 的帖子,只给标题得 0.50——等于耸肩;给标题加正文前 300 字,得 0.79–0.90。运行时现在两样都给。
决策模型只在「贵的那一步是反复的是非题」时才有用。浏览器任务不是:它的钱花在开放式的决定上——下一步点哪、这张截图里是什么——是非题模型做不了这种决定,也读不了图。记忆的形状是对的(这句话值不值得记),但那一步本来就只要约 0.06 积分,没有可省的;而把您的一条偏好错判成「不记」,代价比这大。
一条经验法则:输入是文字、答案是是非或分数、同一个问题反复问、并且现在每次回答都要花一整次模型调用——四条都满足,决策模型才划算。盯一个 feed 四条全中,所以它是您最先看到差别的地方。