Anthropic 发布 Claude Haiku 5.5,在 Artificial Analysis 智能指数得 43 分,较上一代 Haiku 一年内提升 26 分,是首个支持 effort 设置和 adaptive thinking 的 Haiku。
同一新闻,精选展示《Claude Haiku 5.5 上线 Claude Platform 和 Claude Code,运行成本平均比 Haiku 4.5 低约 75%》
Anthropic 发布了 Claude Haiku 5.5,在 Artificial Analysis Intelligence Index 上得分 43——在上一个 Haiku 发布一年后提升了 26 分
Haiku 5.5 是首个带有 Anthropic effort 设置和自适应思考的 Haiku 模型,并且 Anthropic 引入了分层定价。
Haiku 5.5 比其前代更便宜——对于不超过 100k token 的提示,每 1M 输入/输出 token 收费 $0.10/$0.50(与 GPT-6 Luna 相同,是上一个 Haiku 模型的 10%)。然而,超过 100k 后,这一价格会上涨 5 倍至 $0.50/$2.50。网站尚未反映分层定价,因此 Haiku 5.5 的暂定成本数据不包含阶梯上涨成本。我们正在开发支持,并将很快跟进 Cost per Task 报道。
关键要点:
➤ 领先的小型级模型性能:在最大 effort 下,Haiku 5.5 略领先于 GLM-5.3 Flash(42)、Gemini 3.8 Flash(41)和 GPT-6 Luna(38)等模型。其得分与 Kimi K3(44)相当,后者是一个 2.8T 参数开放权重模型,并落后 Claude Sonnet 5.5(max,56)13 分
➤ 相比 GPT-6 Luna token 使用量很大:Haiku 5.5(max)在每个 Intelligence Index 任务上使用约 162k 输出 token,约为 GPT-6 Luna(max,约 50k)的 3 倍。从 xhigh 移到 max 增加 2 分,token 约为 1.8 倍。在相近智能水平下,它也使用比 GPT-6 Luna 更多的 token:Haiku 5.5(high)得分为 38,每任务约 55k token,而 Luna(max)为 38,约 50k,并且在较低 effort 设置下差距扩大
➤ 在代理型知识工作上能力很强:在 AA-Briefcase 上,这是我们针对现实知识工作任务的私有评估,Haiku 5.5(max)达到 1578 Elo,领先于包括 Kimi K3 和 GLM-5.3 在内的模型,并与 Muse Spark 1.3(max)相当
➤ 终端使用方面的改进:在 Terminal-Bench 4.0 上得分 33%,高于 Haiku 4.5 的 0%。这与 GLM-5.3 Flash 持平,并领先 Gemini 3.8 Flash(20%)和 GPT-6 Luna(13%)
➤ 事实知识较低,但幻觉相对较低:正如对较小级别模型的预期,Haiku 5.5 的事实知识低于其同级模型。AA-Omniscience 准确率为 36%,而 Gemini 3.8 Flash 为 55%,GPT-6 Luna 为 44%,但这部分是因为它更愿意承认自己不知道——其幻觉率更低,为 40%,而两者分别为 55% 和 77%
➤ AutomationBench-AA 结果可能被低估:Haiku 5.5 得分 35%,而 GPT-6 Luna、Gemini 3.8 Flash 和 GLM-5.3 Flash 为 53–60%。在发布前测试中,一个安全拒答问题导致模型过度拒答。Anthropic 正在努力解决这个问题——我们将在修复后重新运行此评估,并预计该分数会上升
其他模型细节:
➤ 上下文窗口:1 million token,高于 Claude 4.5 Haiku 的 200k
➤ 定价:每 1M 输入/输出 token 在不超过 100k token 时为 $0.10/$0.50,超过后为 $0.50/$2.50。缓存读取 $0.01(超过 100k 为 $0.05),5 分钟缓存写入 $0.125(超过 100k 为 $0.625)
➤ 多模态:文本和图像输入,文本输出
来源:Artificial Analysis · x.com