1220 字
6 分钟
Anthropic 发布 Sonnet 5:逼近 Opus 4.8,但跑分目前只有官方自测

Anthropic 今天(6 月 30 日)发布了 Claude Sonnet 5,官方定位为迄今最具智能体能力的 Sonnet——能制定计划、调用浏览器和终端,以几个月前还要更大更贵模型才能达到的水平自主运行。核心卖点一句话:性能逼近 Opus 4.8,价格更低,模型 ID 是 claude-sonnet-5

一个前提得先摆出来:发布当天能看到的跑分,几乎全部出自 Anthropic 自己的测试。系统卡写明绝大多数评估在内部完成,独立第三方的复测还没跟上。下面的数字请带着这个背景读。

性能#

官方口径是:Sonnet 5 相比上一代 Sonnet 4.6,在推理、工具使用、编程、知识工作上全面提升,把 Sonnet 长期落后 Opus 的智能体差距明显收窄,但整体仍在 Opus 4.8 之下。据 TechCrunch 及多家转述,官方公布的几项数字如下(Opus 4.8 作为上限参照):

基准Sonnet 4.6Sonnet 5Opus 4.8
智能体编码 SWE-bench Pro58.1%63.2%69.2%
Terminal-Bench 2.167.0%80.4%74.6%
计算机使用 OSWorld-Verified78.5%81.2%83.4%
Humanity’s Last Exam(带工具)46.8%57.4%57.9%

后三行据 MarkTechPost 转自官方发布材料。两个点值得单拎出来:Terminal-Bench 2.1 上 Sonnet 5 反超 Opus 4.8(80.4% vs 74.6%);带工具的 HLE 上 57.4% 已贴到 Opus 4.8 的 57.9%。知识工作基准 GDPval-AA v2 是官方唯一明确让 Sonnet 5 略胜 Opus 4.8 的地方——MarkTechPost 记的是 1,618 对 1,615。

定价#

模型输入(/百万 token)输出(/百万 token)
Sonnet 5(8/31 前尝鲜价)$2$10
Sonnet 5(标准价)$3$15
Opus 4.8$5$25

“更便宜”有个技术前提。官方脚注说明,Sonnet 5 换了新 tokenizer,同样的输入会映射成更多 token,增幅约 1.0~1.35 倍,尝鲜价正是为把迁移成本压到大致持平。这层换算之前单独写过(见 posts/中英文token成本差异.md)。按标准价,Sonnet 5 比 Opus 4.8、GPT-5.5、Gemini 3.1 Pro 都便宜,但比 Gemini 3.5 Flash 贵(TechCrunch)。更完整的横向成本对比见 posts/2026-06-25-frontier-llm-speed-cost-comparison-june-2026.md

安全#

官方称 Sonnet 5 整体比 4.6 更安全:更善于拒绝恶意请求、更能抵抗提示注入劫持,幻觉率和谄媚率都更低。但在自动化行为审计里,它的失当率仍高于能力更强的 Opus 4.8 和 Claude Mythos Preview。网络能力被刻意压低——在与 Mozilla 合作、测试为 Firefox 漏洞写 exploit 的评估里,两款 Sonnet 都没能做出可用的利用程序(均 0.0%)。因为略强于前代,官方给 Sonnet 5 默认开了网络安全护栏,严格程度与 Opus 4.7/4.8 相同。

冷水:这些数字从哪来#

回到开头那句。官方发布博客里,那张对比图是一张 PNG——正文没有机器可读的表格,headline 编码数字是 SWE-bench Pro 的 63.2%。要更细的数值,得靠别人把图里的数字誊出来,而誊出来的结果并不一致。

一个直接的例子是到处能看到的 “SWE-bench Verified 85.2%”。这个数不在官方发布博客的正文表里;Kingy AIllm-stats 把它列出来,注明出自系统卡。麻烦在于官方发布图给的是 SWE-bench Pro(63.2%),Verified 是另一项——codersera 专门提醒别把两者搞混,因为 Verified 的分普遍更高。同一个模型,“85.2%” 和 “63.2%” 在不同文章里指着不同基准。

名字也在转录中走样。知识工作基准是 GDPval-AA v2,aimadetools 写成了 “GPQA-AAA v2”;GDPval 的分数各站也对不齐,MarkTechPost 记 1,618,llm-stats 记 1,603。更离谱的是发布前就挂出来的“评测”:有个 github.io 页面声称 Sonnet 5 在 2 月 3 日发布、SWE-bench Verified 82.1%、带一个 “Dev Team 多智能体模式”、内部代号 Fennec——全是编的,真实发布日是 6 月 30 日。

连 Anthropic 自己的图当天也改过。官方 changelog 写明,最初那版 BrowseComp 成本-性能图用了一套更简单的方法论、低估了 Sonnet 5,随后当天更新。Sonnet 4.6 的基线分也被追溯性重算——HLE 改成 34.6%/46.8%、OSWorld 改成 78.5%,这也是它们和 4.6 当初发布数字对不上的原因。基准的分母本身在动。

现在的状态因此很清楚:DataCamp 直接加了警告,说第三方给出的同名基准数字互相打架,应按“配置相关”看待;Neowin 更干脆——真实世界的独立跑分还不够,暂时只能拿官方发布博客当参照。

当前状态#

Sonnet 5 即日起在所有渠道可用:Free/Pro 默认模型,Max/Team/Enterprise 可用,同时上线 Claude Code、Claude API、Amazon Bedrock 和 GitHub Copilot。尝鲜价 2/2/10 到 2026 年 8 月 31 日,之后回到 3/3/15。官方同步上调了 Chat、Cowork、Claude Code 及平台的速率限制,以匹配更高努力程度的 token 消耗。SWE-bench、Artificial Analysis、vals.ai 这些独立榜单尚未贴出自己的 Sonnet 5 成绩;在它们跑完之前,上面每一个数字的来源都只有一家。

Anthropic 发布 Sonnet 5:逼近 Opus 4.8,但跑分目前只有官方自测
https://blog.lishuyu.app/posts/2026-06-30-anthropic-sonnet-5-benchmarks-self-reported/
作者
猫猫魔女
发布于
2026-06-30
许可协议
CC BY-NC-SA 4.0