过去这两周,AI圈出现了一个特别反常的现象,值得每个做网站、做内容的人停下来看看。
一批新模型密集发布,个个都说自己"最强""第一"。但你要是真去看它们会干什么,会发现一个让人意外的事实——这些被热捧的新模型,连一句完整的话都不会写。
它们不能陪你聊天,不能写文章,不能回答开放性问题。它们只会干一件事:针对一个你提前框定好的问题,从几个固定选项里选一个,然后告诉你每个选项有几成把握。
这类东西有个名字,叫决策模型(decision model)。今天我带你把这件事捋清楚,因为它不只是又一个技术名词,它可能正在悄悄改变AI系统的底层结构——也包括AI怎么挑内容、推荐谁。
一、时间线:18天,一个新品类就这么炸了
事情得从一个叫 Jev 的模型说起。9月15日,一家叫 TypeSafe 的公司推出了它,给了个挺有意思的定位——"System One"模型。
它不生成文字。你给它一段"状态"(比如一段对话、一封邮件、一份工单),再给它一组有明确类型的问题,它就返回选项、分数,或者一个"是/否"的概率。关键是价格低到惊人:每百万输入token只要0.042美元,而且不收输出token的钱,因为它压根不输出文字。
这个小不点,意外地点燃了整个赛道。接下来发生的事,快得离谱:
- 9月29日,OpenAI 在 DevDay 上低调放出 Decisions API(背后是 Luna 模型),能力被收敛到"从有限选项里做确定性裁决",社区直接戏称它是"Jev克隆版";
- 同一天前后,Liquid AI 推出 d1,主打"零输出token、返回校准概率";
- 10月1日,Cloudflare 在生日周发布开源的 Clef(谱号),还配了个更快的轻量版 Clef-flash;亚马逊 Strands Labs 也几乎同时开源了 Strands Decider 2B;
- 再加上 Fastino Labs 的 GLiDE(号称第一个"会思考"的决策模型)等一堆玩家。
来源:MarkTechPost、Cloudflare 官方更新日志、36氪。
18天,从一个模型,变成一场"克隆大战"。这种速度在AI行业都算罕见。
二、为什么"更笨"反而成了卖点?
你可能会纳闷:大模型不都在拼谁更聪明、谁参数更多吗?怎么突然反过来,比拼谁功能更窄了?
原因很实在。真正让智能体崩溃的,往往不是它不会思考,而是它在某个岔路口选错了。
想象一个客服智能体。一封客户邮件进来,它首先要做的不是洋洋洒洒写回复,而是回答一连串很小的问题:这封信该路由给退款组、技术组还是物流组?客户情绪紧急吗?要不要先升级给真人?
这些问题有两个特点:答案是有限的,而且会被高频、重复地调用。
过去用大模型干这事,有三个毛病:慢(要等它一个词一个词生成)、贵(输出token也收费)、不稳(同一件事这次回"退款",下次可能回"技术支持",格式还可能跑偏)。
决策模型就是冲着这三点来的。它不"写",而是在一次前向传播里,把所有选项同时打分——你可以理解成它不挨个念答案,而是一眼扫过去,直接给每个选项贴上概率。
效果有多明显,看几个实测数字:
- Cloudflare 的 Clef 中位延迟约 209毫秒,轻量版 Clef-flash 只要 38.8毫秒;而 Jev 约524毫秒。Clef-flash 比 Jev 快了约13倍;
- OpenAI 的 Decisions API 在一次连续78步操作的回放里命中了76次,单次约230毫秒;
- 亚马逊 Strands Decider 2B 在 RTX 3090 上本地跑,中位延迟约115毫秒。
几十毫秒,意味着这类模型可以直接塞进智能体的"必经之路"上——每要做一个动作,先让它花零点几秒判断一下"该不该做",再决定要不要调用昂贵的大模型。
三、它到底"聪明"在哪、又"笨"在哪
别被"第一""领先"这些词带跑,我们客观看看。
强的地方确实有:
- 快和便宜,这是最硬的优势;
- 输出稳定、可复用。它永远返回固定格式的结构化结果,不会今天一个样明天一个样,方便写进程序;
- 能给概率,而不只是结论。比如它说"85%是退款问题",你就可以设个规则:把握低于80%的,不自动处理,直接交给真人。这个"置信度"在工程上特别有用;
- 新一代的 Clef 还带视觉编码器,能直接看截图、收据、表单,而 Jev 目前只能读纯文本。它的上下文也从 Jev 的32K扩到了64K。
但短板也很清楚,必须说在前面:
- 它不能推理、不能创造、不能处理没框定过的情况。你给的选项里要是压根没有正确答案,它也只能硬选一个;
- 它不是安全保证。模型点头不等于事情就对了,有研究指出,别有用心的文本可能诱导、欺骗它的判断;
- 开源的那些(亚马逊、Cloudflare)需要你自己有算力去跑。标着"免费",可你得自己出GPU或云资源,自托管到底省不省钱,还得算总账;
- 亚马逊自己也承认,同尺寸里它精度排第二,赢的是"完整公开训练配方"。换句话说,各家的"第一",往往是在自己设的榜单上。
四、这跟我们做内容、做GEO有什么关系?
说到你最关心的部分了。我的判断是:这事现在还是"方向性信号",但方向值得高度重视。
你想,未来一个AI系统很可能是分层的:成千上万次"该选谁、该路由到哪"的小决策,由这种几十毫秒、几乎免费的决策模型完成;真正复杂的理解和生成,才交给大模型。
而决策模型在做"推荐哪个来源"这种判断时,本质上就是在给内容打分、排序。这意味着——
第一,"被推荐"这件事,未来可能越来越多发生在一个不写文字、只算概率的环节里。这跟咱们一直说的GEO逻辑是相通的:你要争的不是一次点击,而是成为AI在做判断时打分最高的那个来源。
第二,能让模型"高置信度选中"的内容,会更有优势。什么样的内容能让它果断给高分?是观点明确、结构清晰、有独家数据、结论不含糊的内容。模棱两可、正确但空泛的"废话内容",在概率打分里天然吃亏——因为模型自己都判断不准你到底在说什么。
第三,还有个有意思的地缘细节。这波开源决策模型,绝大多数都建立在中国阿里的 Qwen(通义)底座上:Clef 基于 Qwen3.8-27B,亚马逊 Decider 基于 Qwen3.5-2B。中国开源模型正在成为全球AI"决策层"的地基,这本身就是个值得长期观察的趋势。
不过我也要泼盆冷水:这类模型目前主要还是英文优先,中文等语言上的表现、以及它们到底会不会直接用于公开的内容推荐,都还没有定论。现在就为它大改策略,为时过早;但完全不看,可能会错过下一个拐点。
五、给普通人的三个实在结论
第一,看懂这个分工趋势。AI正在从"一个大模型包打天下",变成"便宜的小模型做海量简单判断 + 贵的大模型做复杂思考"。这是个实打实的结构性变化,不只是厂商噱头。
第二,把内容做得"可被果断判断"。观点鲜明、信息独家、结构清楚、结论明确。让那个只认概率的模型,能毫不迟疑地把高分给你。这跟你做不做决策模型无关,对任何AI时代的内容都是对的。
第三,保持关注,但别恐慌、别盲目追新。赛道刚起,榜单会变,价格会变,谁笑到最后还远没定。
有意思的是,这场"比拼谁更笨"的竞赛,恰恰说明行业在变得更成熟——大家不再迷信一个全能的巨型大脑,而是开始认真思考:到底什么样的活儿,该用什么样的脑子。
对我们这些做内容的人来说,答案其实一直没变:与其去讨好每一个新模型,不如把自己做成那个选项明确、证据扎实、让人(和AI)都没法不选你的存在。