410次尝试,50次得手:Anthropic给中国开源模型做了一次"体检"

410次尝试,50次得手:Anthropic给中国开源模型做了一次"体检"

· ⏱ 4 分钟阅读 ✍️ spark1 👁 3 次阅读
🎧 听全文
点击播放,AI语音朗读全文
1.0x
标签 AI AI安全 开源模型 Anthropic GLM-5.3

410次尝试,50次完成端到端漏洞利用。这是Anthropic在9月29日发布的报告里,给智谱GLM-5.3记下的一组数字。作为对照,同一场测试里Claude Mythos Preview的成绩是56次。

数字咬得很紧。但把整份报告和前后各方的公开材料挨个排开对了一遍之后,我觉得这件事真正值得聊的,不是"谁强谁弱",而是报告背后那个更根本的问题:当一个模型把权重开源出去,它的安全防护还剩下多少?

先看清这场"体检"的规则

几个关键细节,缺一个都会读歪这份报告。

第一,测试是在隔离沙箱里对离线目标做的,全程没有执行生成的代码,也没有连接真实系统。这是能力评估,不是实战记录。

第二,ExploitBench把漏洞利用拆成16个阶段,逐步检查模型拿到一个已知缺陷后能走到哪一步。GLM-5.3和Mythos Preview的对比,是在Claude关闭安全防护的前提下做的——而且Mythos Preview今年4月就公开了,并不是Claude的最新模型。拿一款半年前的旧模型、卸掉护甲来对标,这个比法本身就留着余地。

第三,第三方也在测。9月17日,美国国家标准与技术研究院旗下CAISI发布独立评测,把GLM-5.3列为当时已发布开放权重模型中网络安全能力最强的一款;同时指出,按综合指标估算,它与当时最强的一批美国模型仍有约四个月的差距。智谱自己在中期报告里也披露,其模型在CyberGym上取得84.5%的成绩。能力是真的在涨,这一点各方数据是对得上的。

真正扎眼的是另一组测试:GLM-5.3拒绝了全部直接的恶意指令,但研究者更换提示方式或直接修改模型后,它接受恶意任务的比例升至64%到100%。而保留防护的Claude在同组测试中没有接受恶意任务——只是因为它不开放权重,研究者没法用同样的方法改它再比一次。

开源之后,防护只剩一层

这组对比指向一个结构性的差别。智谱在8月14日的GLM-5.3发布说明里其实自己讲得很清楚:他们设计了三层防护——API外侧识别拦截滥用请求、推理过程中检查任务意图、模型自身学会拒绝危险要求。但公司同时明确承认,开放权重之后,这三层里仍然有效的,只有模型自身的安全对齐。

换句话说,闭源模型的安全是"门+锁+保安",开源模型的安全只剩"它自己不想干坏事"这一条底线。API拦截和意图检查都跟着服务商走,权重一旦下载到你手里,这两层就归零了。修改模型后接受率飙到64%-100%,测的正是这条底线有多厚。

智谱给出的回应是一种立场:强大的防守工具不应只掌握在少数机构手里,并计划向开源项目维护者提供免费额度支持安全审计。Anthropic那边则是另一种立场,其CEO阿莫迪9月24日在联合国安理会发言,主张行业采取"能力增速管控",在关键能力跃升阶段预留窗口期做安全加固。

两边都不算错。开源让防御能力扩散,也让攻击门槛降低——这不是哪家公司的问题,是所有普通用户都要面对的新一轮现实。

你该怎么用这条新闻

如果你只是在用AI聊天、写文档,这件事离你很远。但如果你开始让AI工具碰你的文件、代码、账号,权限边界就成了你自己的事。智谱旗下的编程工具ZCode最近的风波就是现成的教材:有开发者发现旧版客户端会上传工作区数据,公司随后道歉、移除上传链路、把工具开源并请第三方核查。工具能力越强,越要想清楚它被允许碰什么。

给你三个可以立刻用的自查问题,挑任何AI工具前问一遍:

一、我的数据会不会离开本地? 在工具设置里找"数据上传""云端同步""遥测"这类开关,能关就关;涉及公司代码和客户资料的,优先选支持纯本地处理的。

二、它被授权的范围有多大? 别让工具默认读到整个硬盘。单独建一个工作文件夹,只把要处理的文件放进去——权限给得越窄,出事时损失越小。

三、出了问题谁负责、怎么查? 优先选有明确数据条款、最好开源可审计的工具。闭源不等于不安全,但开源意味着任何人能替你检查代码里到底做了什么。

我在整理AI家园的工具库时,就是按这三条过的筛子——spark1.cn/tools/ 里收录的每个工具都标了数据是否出本地、有没有免费层,挑工具时可以当个对照清单用。

模型的能力竞赛会继续,开源和闭源的路线之争也会继续。但对你来说,主动权一直都在:知道工具能碰什么、不能碰什么,就可以从容地享受AI的红利,而不是提心吊胆地用。

📄 版权声明:本文由 AI家园 团队创作。欢迎非商业性转载或引用,转载时须注明原文出处并保留原文链接;商业使用请事先联系授权。

本文链接:https://spark1.cn/articles/20260930-glm53-open-weight-security-check · 转载规则详见《服务条款》

🎁 喜欢这篇文章?获取更多干货

关注公众号「xAI智工场」

关注公众号「xAI智工场」

每天一个AI干货
回复「提示词」免费领实战模板包

💬

加入AI交流群

微信号:xaizgc
和AI爱好者一起成长

⭐ 深度精选
⭐

知识星球·深度圈

系统课程 · 社群答疑 · 资源库
¥99/年

立即加入 →
分享到

💡 想用 AI 马上搞定这件事?

查看全部 AI 工具 →

💬 评论

加载中...

转载或引用本站内容请注明原文出处及链接 · 转载规则

Copyright © 2026 AI家园 浙ICP备2024142181号-2 浙公网安备 33010202005420号