跟 Claude 随口聊起一个假设:如果一家安全公司或者国防部,专门拿漏洞库、CTF 题目、真实 CVE 去训练一个模型,而不是像 Mythos 那样靠通用能力”顺手”涨出网络安全本事,前者是不是应该更强、更可控?Claude 当场举了几个例子回我——DARPA 的 AIxCC,Google 的 Big Sleep——证明这个假设本身没错:专门训练确实能堆出专精能力,而且这事已经有人在系统性地做了。聊完觉得不过瘾,去查了查 Mythos 这半年到底经历了什么,结果发现现实比这个假设复杂得多,也讽刺得多。
AIxCC:假设成立的那一半
DARPA 的 AI Cyber Challenge 从 2023 年办到 2025 年,联合 Anthropic、Google、Microsoft、OpenAI,目标就是一件事:让 LLM agent 专门去发现和修复开源软件里的漏洞。这不是”顺手”的能力,是奖金堆出来的——冠军 Team Atlanta 的 ATLANTIS 系统用 multi-agent RL 专门针对漏洞挖掘和补丁生成做编排训练,今年 8 月在 DEF CON 33 拿下 400 万美元头奖(Trail of Bits);亚军 Trail of Bits 的 Buttercup 现已开源。Google 那边走的是同一条路——脱胎于 Project Naptime、专门针对漏洞挖掘调优的 Big Sleep,已经在 SQLite 里挖到过真实 zero-day(CVE-2025-6965),被称为”首例由 AI 独立发现并阻止武器化的案例”(Keysight)。
这两个例子摆在一起,就是原本那个假设的注脚:目标明确、数据针对性强、奖励函数直接对齐到”能不能触发漏洞”的训练,确实能产出比通用能力更专精、更集中的网络安全能力。而且做这件事的,恰好就是国防部和大厂安全团队——设想中的那个场景,人家已经在办公开赛事、发奖金了。
Mythos:官方口径是”没有刻意训练”
问题出在 Mythos 身上。今年 4 月 7 日 Anthropic 发布 Claude Mythos Preview 时,红队博客写得很清楚:这些漏洞发现能力的来源是通用推理和软件工程能力提升的下游产物,官方原话强调这套本事”并非刻意训练出来的专精技能”(Anthropic 红队博客)。翻译过来就是,公司自己都承认,这跟 AIxCC 那种专门喂 CVE、CTF 数据堆出来的模型不是一回事——Mythos 是个通用模型,漏洞发现能力是顺带涨出来的。
顺带涨出来的效果是什么样呢?英国 AI 安全研究院(AISI)的评测显示,在专家级 CTF 上 Mythos Preview 的成功率是 73%,是唯一一个走完”The Last Ones”——一个模拟企业网络、32 步、人类专家估计要打 20 小时的攻击链模拟——全流程的模型,10 次尝试成功 3 次,平均能走到 22 步;排第二的 Opus 4.6 平均只能走到 16 步(AISI)。Anthropic 自己的数据更直接:用同一套简单的 agent 脚手架,让 Mythos 去审 Firefox,112 个漏洞报告全部被 Address Sanitizer 验证为真实漏洞,命中率 100%(Anthropic 红队博客)。
一个”没有刻意训练”的模型,吊打了一个刻意训练了两年、有 DARPA 和四大厂商联合背书的专项赛事的头部选手。这已经够讽刺了,但还不是最讽刺的部分。
19 天里最诚实的一句话
Mythos 和它的公开版 Fable 5 在 6 月 9 日一起发布。三天后的 6 月 12 日周五傍晚,美国商务部以国家安全为由下达出口管制令,要求禁止任何外国国民访问这两个模型——因为无法实时核实用户国籍,Anthropic 干脆把两款模型对全体用户下线,包括美国用户自己。触发点是亚马逊研究人员上报的一份报告:他们找到绕过 Fable 5 防护的方法,让模型识别出若干软件漏洞,其中一例甚至输出了漏洞利用的演示代码(Anthropic)。这一停就是 19 天,直到今天(7 月 1 日)才恢复。
真正值得拿出来说的,是 Anthropic 6 月 30 日为自己辩护时说的那句话。他们把 Fable 5 和 Opus 4.8、GPT-5.5、Kimi K2.7 放在一起测试,发现触发这次出口管制的那个”漏洞识别”能力根本不是 Fable 5 独有——连 Haiku 4.5、Sonnet 4.6、Opus 4.6/4.7 都能生成同样的利用演示代码。公司据此主张:用这个理由让一个已经服务数亿用户的商用模型全线下架,理由站不住脚。
把这句话和 4 月那句”没有刻意训练”放在一起看,矛盾就出来了。4 月说的是
开源那道墙更没用
图灵研究所下属的 CETaS 在 5 月的分析里给出一个更悲观的判断
不只 Anthropic 一家
这套”先审后放”的剧本,6 月 26 日在 OpenAI 身上重演了一遍——同一天,Mythos 5 刚开始对部分美国机构恢复访问,白宫就以模型能力过强为由,要求 OpenAI 把新一代 GPT-5.6 的发布范围限制在一小批”可信合作伙伴”内。OpenAI 当天照办,但公开表态这种前置审查不该成为长期默认。两家公司选的应对策略不同——Anthropic 先全线下架再谈判重新上线,OpenAI 主动配合、换取有限度分批放开——殊途同归的是,两家头部实验室都默认了同一件事:通用模型的网络安全能力已经强到需要政府提前介入,而不是等出了事再管。
这不是纸上谈兵。咨询公司贝恩今年 5 月的分析给出一个参照系:全球网络犯罪的经济损失规模每年大约 5000 亿美元,而多数企业每年安全预算的涨幅只有 10% 左右,远远跟不上漏洞发现和利用速度的变化——贝恩的判断是不少组织需要把安全投入直接翻倍甚至更多才够用(Bain)。换句话说,监管层纠结”该不该管、管哪个型号”的这 19 天里,防守方面对的现实压力一天都没有停过。
圈不住的东西
回到最初那个假设。专门训练能造出比 Mythos 更强的网络安全能力,这一点 AIxCC 已经证明了——冠军奖金年年在发,专门针对漏洞挖掘调优的系统只会越做越细、越做越强。这才是这次出口管制真正站不住脚的地方:管制令按名字锁定 Mythos 和 Fable 5,潜台词是把这两个具体型号当成了当前网络安全风险的天花板。但天花板从来不在通用模型这条线上,专门训练的红队系统迟早会超过 Mythos,大概率用不了多久。一份按型号名字签发的管制令,结构上就是在追一个不断往前挪的靶子,想靠圈住一个名字来圈住整个风险,长期看做不到。
这不代表 Mythos 这一波没什么好担心。亚马逊触发管制令的那次绕过、Firefox 112 个漏洞百分之百命中率、73% 的专家级 CTF 成功率,都是实打实的能力跃升,不是虚惊一场;连 Haiku 都能复现部分能力这件事,也说明风险此刻已经比管制令划定的范围更宽。核心问题在于管制的形状对不上风险的形状:今天把 Mythos 关起来,防的是昨天那个天花板;明天真正踩线的,大概率是某个专门为找漏洞而生、压根不叫 Mythos 的东西。
至于那些专门盯着 CVE 库和漏洞赏金训练的团队,才是真正该被长期盯着的对象——他们的能力曲线不会停在通用模型顺手涨出来的这个水位上,迟早会把 Mythos 现在的位置甩在后面。Mythos 的麻烦在于,连造它的人都说不清楚这东西是怎么变成这样的——4 月说是通用能力涨出来的意外收获,6 月又说这份意外收获其实谁都有。19 天的停摆换来的不是一个更清楚的答案,只是把这份说不清楚、连同管制思路的过时,一起摆到了台面上。