想象你是一家小店的客服,收件箱里躺着一封用户邮件。你只想知道三件事:这是不是投诉?急不急?该转给哪个部门?
你请AI帮忙。它清了清嗓子,开始一个Token一个Token地写小作文:"根据用户的描述,我认为这封邮件的情绪较为不满,可能属于售后类投诉,建议转交客服部门处理,同时考虑到……"三百字读完,你还得自己从这段话里把答案抠出来。
现在有人问:这三句话,AI能不能直接"说结论、不废话"?9月16日,一家叫 TypeSafe AI 的公司给出了它的方案——一个干脆不生成文本的模型,名字叫 Jev。
一个"闭嘴"的模型,什么来头
发布人 Diogo Almeida 来头不小:他是2022年 InstructGPT 论文的共同作者之一,参与过 OpenAI 早期的 RLHF 与 GPT-4 相关工作。换句话说,今天ChatGPT"能听懂人话、会和人聊天"这条技术路线,他是打地基的人之一。
但离开 OpenAI 后,他开始怀疑自己参与建造的这条路。据报道,有一个问题他想了四年:"大模型现在非常擅长聊天,但聊天能力真的是软件自动化需要的核心能力吗?"
他的答案是否定的。于是有了 Jev——官方称之为"System One Model"(系统一模型),借用心理学里"系统1"的概念:快速、直觉式的判断,对应那些固定选项、连续评分或是非判断的重复性决策任务。它不输出自然语言,只给三类固定结果:
- Choice(选择):从你预先定义的选项里选一个,最多支持255个选项,附带概率分布;
- Score(评分):在指定数值范围内打分,比如0到1的客户流失风险;
- Noul(布尔概率):对预设问题返回校准过的"是/否"概率,可以用来给其他模型的答案做二次验证。
训练方法叫"校准决策强化学习"(RLCD),目标是让置信度变得诚实:模型说70%有把握时,约70%的预测就该是对的。公司层面,TypeSafe AI 成立两年,本周结束隐身状态,并宣布完成由 DCVC 领投的4000万美元种子轮融资。官方给出的数字相当激进:同类结构化任务上速度比前沿大模型快20-200倍,成本最高可降至原来的1/400,输出Token免费——这些是官方口径,第三方复测还没跟上,先打个问号存着。
为什么"少说话"反而更值钱
这件事最值得琢磨的不是参数,而是一个方向性的问题:文字,是一种昂贵的中间产物。
大模型的自回归生成方式决定了它必须一个字一个字往外"吐",吐得越多,越慢越贵。可软件自动化里的大多数环节,要的从来不是文章,是判断——这封邮件是不是投诉、这份简历过不过初筛、这条评论该不该置顶。让AI先写三百字抒情,程序再从字缝里解析出"是/否",等于点外卖时逼骑手先给你朗诵一遍菜单。
Jev 把这层"朗诵"整个砍掉:非结构化状态进去,带类型的概率决策出来。而且决策之间不用排队,可以并行产生。
这也回应了知乎热榜上那个问题——它会不会成为 Agent 的新技术路线?我的看法是:Agent 的骨架本来就是"感知→决策→行动",真正需要生成文字的环节(写回复、写报告)其实只占少数,大量步骤是路由和判断。判断便宜了,Agent 才跑得起长链路。当然,这更多是给开发者省钱的路线,聊天陪伴、写作创作,依然属于"会说话"的模型。两条路不是谁取代谁,是分工。
普通人不写代码,也能偷师两招
**第一招:决策型任务,让AI"只给答案"。**你平时用任何大模型,都可以把提问方式改成Jev风格——"从A/B/C里选一个,只回复字母,不要解释"。分类、打标签、筛选信息这类活儿,砍掉解释文字,响应更快、Token更省,结果还更好统计。需要理由时,再单独追问一句"为什么选这个"。
**第二招:给AI的判断加一个"置信度"。**让它回答时顺手标注"很有把握/不太确定",你只对"很有把握"的部分放心采纳,"不太确定"的自己过目。这就是 RLCD 校准思想的平民版——不是全信或全不信,而是按把握程度分配你的注意力。
把这两招用到批量小事上——整理一百条客户反馈、给一摞资料分类——你会发现自己不知不觉跑通了一条微型自动化流水线。我平时也把这类按场景配好的AI工具组合沉淀在 spark1.cn/tools/ 里,需要时直接翻。
技术的钟摆很有意思:前几年所有人拼命教AI说话,现在开始有人教AI闭嘴。而对使用者来说,从来只有一条标准——该说话时说得清楚,该干活时干得利索。从容,就是知道什么时候要它的嘴,什么时候要它的手。
本文素材综合自IT之家、腾讯新闻、凤凰网、网易等公开报道。
💬 评论