先说结论:从2026年8月14日起,Anthropic的AI编程工具Claude Code将在Pro、Max和Team套餐中默认启用「自动模式」(Auto Mode)——AI可以自主执行更长时间的任务,不再每一步都弹窗问你「确定吗」,取而代之的是一个实时安全分类器,自动评估每次操作、拦截危险命令。 这不是一个普通的版本更新,它标志着AI工具的设计思路正在发生转变:从「人来监督AI」,走向「AI监督AI,人来做例外处理」。
什么是「自动模式」
用过AI编程工具的人都有体会:AI每做一步——改个文件、跑个命令——都要弹窗征求同意。点「允许」点到后面,大多数人已经不看内容直接点了。有媒体分析直言,这是Anthropic把自动模式设为默认的直接原因:人工确认早就流于形式,人只会一直按「yes」。
自动模式的做法是把这道「形式审查」换掉:
| 项目 | 之前 | 自动模式(8月14日起默认) |
|---|---|---|
| 任务执行 | 每步人工确认 | 长时间自主执行 |
| 安全把关 | 用户点「允许」 | 实时安全分类器逐次评估工具调用 |
| 拦截对象 | 无 | 不可逆、破坏性、越权操作 |
按Anthropic的公告,这个实时分类器会对每一次工具调用做评估,专门拦截三类操作:不可逆的(比如删库、发出去就收不回的消息)、破坏性的(覆盖重要文件、搞坏环境)、越权的(超出当前任务范围的操作)。Adobe、Nuro、Gusto等企业已经在生产环境中用了这套模式。企业版(Enterprise)和API暂时保持可选,未来几个月再逐步转为默认。
同周的另一个动作:误拦截减少85%
如果说自动模式是「放开手脚」,Anthropic同一周发布的另一个更新则是「修好刹车」。8月7日,Anthropic官方博客宣布优化Claude Fable 5模型的生物安全机制:测试显示,各产品线上生物相关的「降级切换」次数减少了约85%。
所谓「降级切换」,是指安全分类器一旦觉得问题敏感,就把请求甩给能力更弱的模型处理。之前的分类器过于敏感,日常健康咨询、实验结果解读、生物学教育这类完全正当的问题也经常被误拦。这次优化后,正常问题能正常回答了;但对病毒学、毒理学、分子设计这类「双重用途」风险领域,Fable 5仍会降级到能力较低的模型处理——该拦的还是拦。
一放一收放在一起看,就能看出头部AI厂商的竞争正在换赛道:从「能力竞赛」转向「可用性与安全工程竞赛」。 光能力强不够,还得敢放手用;敢放手的前提,是安全机制工程化到可信赖的程度。
对不写代码的普通人意味着什么
你可能会想:Claude Code是程序员用的工具,跟我有什么关系?关系在趋势里:
- 「AI代你执行」会成为普遍形态。 今天是AI自动写代码,明天就是AI自动订票、自动处理报销、自动打理日程。「逐步授权、自动执行、异常才打扰」的交互模式,会从编程工具扩散到所有AI助手。
- 「AI监督AI」是你未来要懂的机制。 安全分类器这类「给AI配一个AI监理」的设计,正在成为行业标配。以后判断一个AI工具靠不靠谱,可以问一句:它放开自动执行的同时,配了什么样的拦截机制?
- 国内工具也在同一条赛道上。 就在上周,Oracle因安全顾虑禁用AI生成代码的消息刚刷屏(详见这篇DeepSeek V4刷屏,Oracle却禁用AI代码),「AI写代码的账单与安全」话题也一直被持续关注(参考OpenAI解了10个数学难题,AI写代码工具却悄悄藏了账单)。企业侧一边拥抱、一边设防,恰恰说明「安全工程」是真需求。
如果你也想体验AI辅助编程,不必等专业工具——站内的AI代码助手可以帮你写脚本、查错误、解释代码,零基础也能上手。
常见问题
Q: Claude Code的自动模式需要我手动开启吗?
不需要。8月14日之后,Pro、Max和Team套餐新开启的工作会话会默认启用自动模式。如果你更习惯逐步确认,也可以手动切换回原来的确认模式;Enterprise和API用户目前仍是可选项,未来数月才会逐步转为默认。
Q: AI自己执行操作,会不会删错文件、搞坏我的环境?
这正是安全分类器要防的事。它会对每次工具调用做实时评估,拦截不可逆、破坏性和越权三类操作。当然,任何安全机制都不是100%的保险,重要的工作目录保持备份、在干净的环境里跑自动化任务,仍然是好习惯。
Q: 安全分类器把正常请求拦了怎么办?
这就是Fable 5这次更新解决的问题——通过重新调优分类器,生物相关场景的误拦截减少了约85%,日常健康咨询、实验解读、生物学教育等正当需求不再被频繁误伤。可以预期,「降低误拦、保持真拦」会是所有AI安全机制的长期优化方向。
💬 评论