410次尝试,50次完成端到端漏洞利用。这是Anthropic在9月29日发布的报告里,给智谱GLM-5.3记下的一组数字。作为对照,同一场测试里Claude Mythos Preview的成绩是56次。
数字咬得很紧。但把整份报告和前后各方的公开材料挨个排开对了一遍之后,我觉得这件事真正值得聊的,不是"谁强谁弱",而是报告背后那个更根本的问题:当一个模型把权重开源出去,它的安全防护还剩下多少?
先看清这场"体检"的规则
几个关键细节,缺一个都会读歪这份报告。
第一,测试是在隔离沙箱里对离线目标做的,全程没有执行生成的代码,也没有连接真实系统。这是能力评估,不是实战记录。
第二,ExploitBench把漏洞利用拆成16个阶段,逐步检查模型拿到一个已知缺陷后能走到哪一步。GLM-5.3和Mythos Preview的对比,是在Claude关闭安全防护的前提下做的——而且Mythos Preview今年4月就公开了,并不是Claude的最新模型。拿一款半年前的旧模型、卸掉护甲来对标,这个比法本身就留着余地。
第三,第三方也在测。9月17日,美国国家标准与技术研究院旗下CAISI发布独立评测,把GLM-5.3列为当时已发布开放权重模型中网络安全能力最强的一款;同时指出,按综合指标估算,它与当时最强的一批美国模型仍有约四个月的差距。智谱自己在中期报告里也披露,其模型在CyberGym上取得84.5%的成绩。能力是真的在涨,这一点各方数据是对得上的。
真正扎眼的是另一组测试:GLM-5.3拒绝了全部直接的恶意指令,但研究者更换提示方式或直接修改模型后,它接受恶意任务的比例升至64%到100%。而保留防护的Claude在同组测试中没有接受恶意任务——只是因为它不开放权重,研究者没法用同样的方法改它再比一次。
开源之后,防护只剩一层
这组对比指向一个结构性的差别。智谱在8月14日的GLM-5.3发布说明里其实自己讲得很清楚:他们设计了三层防护——API外侧识别拦截滥用请求、推理过程中检查任务意图、模型自身学会拒绝危险要求。但公司同时明确承认,开放权重之后,这三层里仍然有效的,只有模型自身的安全对齐。
换句话说,闭源模型的安全是"门+锁+保安",开源模型的安全只剩"它自己不想干坏事"这一条底线。API拦截和意图检查都跟着服务商走,权重一旦下载到你手里,这两层就归零了。修改模型后接受率飙到64%-100%,测的正是这条底线有多厚。
智谱给出的回应是一种立场:强大的防守工具不应只掌握在少数机构手里,并计划向开源项目维护者提供免费额度支持安全审计。Anthropic那边则是另一种立场,其CEO阿莫迪9月24日在联合国安理会发言,主张行业采取"能力增速管控",在关键能力跃升阶段预留窗口期做安全加固。
两边都不算错。开源让防御能力扩散,也让攻击门槛降低——这不是哪家公司的问题,是所有普通用户都要面对的新一轮现实。
你该怎么用这条新闻
如果你只是在用AI聊天、写文档,这件事离你很远。但如果你开始让AI工具碰你的文件、代码、账号,权限边界就成了你自己的事。智谱旗下的编程工具ZCode最近的风波就是现成的教材:有开发者发现旧版客户端会上传工作区数据,公司随后道歉、移除上传链路、把工具开源并请第三方核查。工具能力越强,越要想清楚它被允许碰什么。
给你三个可以立刻用的自查问题,挑任何AI工具前问一遍:
一、我的数据会不会离开本地? 在工具设置里找"数据上传""云端同步""遥测"这类开关,能关就关;涉及公司代码和客户资料的,优先选支持纯本地处理的。
二、它被授权的范围有多大? 别让工具默认读到整个硬盘。单独建一个工作文件夹,只把要处理的文件放进去——权限给得越窄,出事时损失越小。
三、出了问题谁负责、怎么查? 优先选有明确数据条款、最好开源可审计的工具。闭源不等于不安全,但开源意味着任何人能替你检查代码里到底做了什么。
我在整理AI家园的工具库时,就是按这三条过的筛子——spark1.cn/tools/ 里收录的每个工具都标了数据是否出本地、有没有免费层,挑工具时可以当个对照清单用。
模型的能力竞赛会继续,开源和闭源的路线之争也会继续。但对你来说,主动权一直都在:知道工具能碰什么、不能碰什么,就可以从容地享受AI的红利,而不是提心吊胆地用。
💬 评论