2026-09-30 09:53:02

Claude Sonnet 5.5上线:享受半价优惠,性能超越Opus!

摘要
Anthropic 在9月28日发布了Claude Sonnet 5.5,这是Claude 5.5系列的第二款模型,距离旗舰Opus 5.5上线还不到一周。官方表示,Sonnet...

Anthropic 在9月28日发布了Claude Sonnet 5.5,这是Claude 5.5系列的第二款模型,距离旗舰Opus 5.5上线还不到一周。官方表示,Sonnet 5.5 比前代Sonnet 5 快30%以上,多数工作的成本最多可再降30%;价格维持在每百万输入token 2美元、输出10美元,仅为Opus 5.5的一半。

跑分:写程序小胜Opus,其余项目紧追

根据Anthropic 公布的数据,Sonnet 5.5 最亮眼的是代理型程式测试Terminal-Bench 4.0,拿下70.6%,不但远高于Sonnet 5 的10.3%,也超过Opus 5.5 的66.4%。在衡量知识工作的GDPval-AA 上,Sonnet 5.5 拿到1,844 分,与Opus 5.5 的1,846 分几乎打平。

不过在其他项目上,Sonnet 5.5 仍略逊于旗舰:电脑操作测试OSWorld 2.1 为80.1%(Opus 5.5 为81.8%)、跨领域推理的Humanity's Last Exam 为64.5%(Opus 5.5 为67.7%)、程式测试FrontierCode 1.1 为46.2%(Opus 5.5 为54.4%)。换句话说,它不是全面超越Opus,而是在「明确范围的日常任务」上,用一半的价格拿到接近旗舰的表现。

Anthropic 研究产品经理Theo Chu 在接受CNBC 访问时说:「Sonnet 是给在意成本、不一定需要那么多智慧的客户。可能是只需要执行、不需要Opus 那种判断力的例行工作。」官方的定位也很清楚:Opus 处理需要审慎判断的复杂工作,Sonnet 5.5 则擅长范围明确的日常任务、修bug,以及制作精美的文件、简报与试算表。

更省token?官方与第三方说法不同

Anthropic 强调Sonnet 5.5 完成每项任务所需的token 明显减少,并引用避险基金Balyasny 的金融任务测试:Sonnet 5.5 每个答案约用12.1 万个token,Sonnet 5 则要49.7 万个。

但第三方评测机构Artificial Analysis 的结果不太一样。Decrypt 报导,Artificial Analysis 发现Sonnet 5.5 每项任务用掉的token 是它测过的模型中最多的,在最高推理强度下约19.3 万个,比Opus 5.5 多约60%,每项任务成本约7.6 美元。也就是说,单价只有一半,不代表实际帐单就是一半,开发者仍要依自己的工作量实测。

放慢呼声下的发布:不推进前沿,但加上资安防护

CNBC 指出,这是Anthropic 执行长Dario Amodei 本月稍早呼吁业界放慢模型开发后,公司推出的第二款模型。 Anthropic 表示,Sonnet 5.5 并未推进其模型能力的前沿,因此对齐测试主要聚焦在适用于各能力等级模型的特定风险;官方自动化行为稽核涵盖约1,850 个情境,结果显示Sonnet 5.5 在多数对齐指标上优于或持平Sonnet 5。

不过Anthropic 也承认,Sonnet 5.5 的资安能力比前代「大幅提升」,因此它成为第一款搭载与Opus 等级相同资安防护的Sonnet 模型,高风险的资安任务会改由Sonnet 5 处理。它也是第一款加入防蒸馏分类器的Sonnet 模型,用来防止推理过程被撷取。

Sonnet 5.5 即日起在Claude 平台、AWS、Google Cloud 与Microsoft Azure 上线,最便宜的Haiku 5.5 则将在未来几周推出。这次发布正好落在Anthropic公开说明书揭露庞大算力支出之际,中阶模型能否以更低价格吸引更多企业用量,将是市场观察的重点之一。

声明:文章不代表币圈子观点及立场,不构成本平台任何投资建议。投资决策需建立在独立思考之上,本文内容仅供参考,风险自担!转载请注明出处!侵权必究!
热门新闻
热门百科
回顶部