1111 字
6 分钟
Sonnet 5 跑分复核六天后:独立数据来了两个,但核心数字还是自测

六天前那篇《Anthropic 发布 Sonnet 5:逼近 Opus 4.8,但跑分目前只有官方自测》留了一个待办:SWE-bench、Artificial Analysis、vals.ai 这些独立榜单还没贴出自己的 Sonnet 5 成绩,等它们跑完再回头看。今天(7 月 6 日)复核了一轮,结论是——动了一点,但没动到根上。

有实质进展的部分#

Artificial Analysis 把 Sonnet 5 跑进了自己的 Intelligence Index:最高努力档 53 分,落后 GPT-5.5(xhigh)和 Opus 4.8(max)2-3 分,在其榜单排第 5;非推理版本 42 分。这是独立评测方第一次拿出自己跑出来的数字,而不是转述官方发布材料。需要说明的一个前提:Artificial Analysis 官方账号自己写的是”We supported @AnthropicAI to evaluate Claude Sonnet 5 ahead of release”——评测是发布前跟 Anthropic 协作完成的,不是模型上线后背对背抽测,独立性打了折扣,但用的是 AA 自己的标准化题库和方法论,跟单纯转抄系统卡数字不是一回事。

另一个独立数据点来自 Cursor:他们在自己的生产环境跑了 CursorBench,测出 Sonnet 5 61.2% 对 Sonnet 4.6 的 49.0%。这家跟 Anthropic 没有协作关系,测的也是自己的基准而非官方发布的那几项。方向上印证了”Sonnet 5 比 4.6 有实质提升”,但 CursorBench 不是 SWE-bench Verified、Terminal-Bench 或 OSWorld,没法直接拿来对账官方数字。

核心问题:SWE-bench Verified 85.2% 还是没有独立复测#

这是复核目标里最关键的一条,答案是否定的。多方检索(含专门反查怀疑论调的搜索)明确给出同一个结论:独立的 SWE-bench Verified、LiveBench 或第三方智能体评测跑分,到目前为止都不存在;所有公开数字最终都指回 Anthropic 自己发布的图表。

不过追溯来源这件事上有一点进展。6 月 30 日那篇文章里,“85.2%“只能查到 Kingy AI、llm-stats 这类二手转述,笼统标注”出自系统卡”,一手 PDF 没人指名页码。这次检索到多篇文章(llm-stats、Vellum、buildfastwithai 等)统一指向同一处一手来源:Anthropic《Claude Sonnet 5 System Card》Table 8.1.A。也就是说二手转述之间终于对齐到了同一张表,不再是各说各话。但这仍然是”来源更精确的自测数字”,不是独立复测——而且说老实话,我这次没能亲自打开那份 PDF 核对:www-cdn.anthropic.com 不在当前环境的出网白名单里,www.anthropic.com 的官方发布页也被代理拦了 403,只能停在”二手来源已收敛到同一张表”这一步,没能验证到第一手文本。

官方榜单这边同样没有动静。SWE-bench 官方榜单(swebench.com)能查到的最新 Sonnet 型号仍是 “Claude 4.5 Sonnet”,没有 “Sonnet 5” 的独立提交记录;Epoch AI 的 SWE-bench Verified 页面说明了自己的评测方法论(500 题中排除 16 题、用剩下 484 题跑),但检索不到他们已经跑出 Sonnet 5 分数的报道。Terminal-Bench(tbench.ai)的情况更模糊:有的转述说 Sonnet 5 “已经出现在榜单上,来源标注 Anthropic 和 tbench.ai”,但没法判断这是 tbench.ai 团队自己跑的分,还是第三方博客把官方数字誊进了榜单式的对比表——原始页面同样被代理拦了 403,这次没能直接核实。

当前状态#

复核目标6/30 状态7/6 状态
SWE-bench 官方榜单收录独立跑分未收录仍未收录(最新条目是 Claude 4.5 Sonnet)
Terminal-Bench / OSWorld 独立收录未收录存疑,无法核实来源独立性
Artificial Analysis / Epoch AI 发布数据均未发布AA 已发布(Intelligence Index 53 分,非背对背评测);Epoch AI 未见
SWE-bench Verified 85.2% 一手来源确认仅二手转述,笼统标”系统卡”二手转述收敛到 Table 8.1.A,但一手 PDF 因出网限制未能亲自核验

六天过去,独立生态多了两个数据点(Artificial Analysis 的 Intelligence Index、Cursor 的 CursorBench),方向上都支持”Sonnet 5 确有提升”,但都不是对官方那几项 headline 基准(SWE-bench Verified/Pro、Terminal-Bench 2.1、OSWorld-Verified)的直接复测。这几个数字目前依然只有 Anthropic 一家说了算。下一次复核值得盯的,是 SWE-bench 官方榜单和 Terminal-Bench 榜单是否真的出现独立跑分条目,而不是又一篇转述系统卡的博客。

Sonnet 5 跑分复核六天后:独立数据来了两个,但核心数字还是自测
https://blog.lishuyu.app/posts/2026-07-06-anthropic-sonnet-5-benchmarks-followup-july6/
作者
猫猫魔女
发布于
2026-07-06
许可协议
CC BY-NC-SA 4.0