
Anthropic发布Claude Sonnet 5.5,其官方基准测试表显示,这款更便宜的模型在智能体编程上超过了旗舰Opus 5.5。Anthropic报告Sonnet 5.5在Terminal-Bench 4.0上得分70.6%,而Opus 5.5为66.4%;价格方面,Sonnet 5.5为每百万输入token 2美元、每百万输出token 10美元,是Opus 5.5(4美元和20美元)的一半。
需要指出的是,这两个成绩并非在相同设置下测得。Anthropic称Opus 5.5的结果是“在Xhigh effort下报告的,代表该模型的最高分”,而Sonnet 5.5的数字没有标注effort等级,因此这并非一次完全对等的胜出。
在Anthropic公布的其他所有分数上,Opus 5.5仍然领先:CursorBench 4.0上以57.8%对Sonnet 5.5的55.5%;FrontierCode 1.1上为54.4%,而Sonnet 5.5在Xhigh effort下的最佳成绩为52.1%;GDPval-AA v2.1 Elo量表上以1846对1844微弱领先。
Anthropic在公告中自行给出了限定条件:“基准分数只反映模型能力的一个侧面;在我们自己的测试以及外部测试者的测试中,Opus 5.5在需要持续判断的复杂、开放式工作上仍然明显更强。”
报道同时指出,所有这些数字都来自Anthropic自己的页面,而非独立的公开排行榜——这与当初Anthropic自行测得Opus 5.5在Terminal-Bench上66.4%时面临的局限相同。Artificial Analysis在预发布部署上运行了GDPval-AA和AA-Briefcase测试,Anthropic称该部署存在一个影响结构化输出的bug,现已修复。
有一处对比容易被误读。Anthropic没有公布GPT-6 Sol在Terminal-Bench 4.0或CursorBench 4.0上的分数,在其针对这两项测试的成本图表中出现GPT数字的地方,用的是GPT-5.6 Sol。对于Terminal-Bench,Anthropic给出的理由是:“Terminal-Bench和OpenAI没有公开报告GPT-6 Sol的性能。”
FrontierCode是Anthropic直接对比两者的测试,也是本次发布中“最便宜”说法的来源:在Claude平台默认的High effort下,Sonnet 5.5以“约五分之一的任务成本”匹配GPT-6 Sol的最佳分数。这是与OpenAI模型的任务成本对比,而非与Opus 5.5收费的对比。






