爱游戏体育 AYX - 赛事数据分析与球队表现深度解读 - 比赛分析

Claude Haiku 5.5 杀入低价战场,国产模型性价比还稳吗? - AYX
  • 首页
  • 博客
  • 文章详情

AI领域的价格竞争,如今连小型模型都未能幸免。

Anthropic 推出了 Claude Haiku 5.5,其输入价格最低降至每百万 Token 0.1 美元。

与此同时,该模型在电脑操控、编程和知识处理方面的能力有了显著提升,部分测试成绩已能与一些定价更高的模型相抗衡。

过去谈及小型模型,人们通常认为它们价格低廉、响应迅速,但能力有限。遇到复杂任务时,仍需依赖旗舰模型。

在不到三周的时间里,Anthropic 相继更新了 Opus 5.5、Sonnet 5.5 和 Haiku 5.5,完成了所有产品线的换代。

根据 Anthropic 的规划,Opus 5.5 和 Sonnet 5.5 负责规划和任务分解,而 Haiku 5.5 则融入多 Agent 工作流,处理大量重复且标准明确的执行工作。

能力大幅提升,小型模型不再只是辅助角色

这次 Haiku 5.5 最显著的变化并非某项指标的微幅增长,而是从过去相对薄弱的执行能力,开始向真正能够完成任务的方向迈进。

在电脑操作基准 OSWorld 上,Haiku 5.5 的成绩从上一代 Haiku 4.5 的 15.7% 跃升至 72.4%。

这项测试评估模型能否像人类一样操作电脑,完成一系列实际任务。

相较于仅能回答问题的聊天模型,这种能力更接近 AI Agent 实际所需。

编程方面也有明显进步。在 Terminal-Bench 4.0 上,Haiku 5.5 从上一代的 0 分提升至 39.2%,而 GPT-6 Luna 的成绩为 16.4%。

知识工作基准 GDPval-AA v2.1 的成绩,也从 735 分提升至 1620 分。

当然,Haiku 5.5 尚不能完全替代旗舰模型。

以 Terminal-Bench 4.0 为例,其成绩仍明显低于 Sonnet 5.5 的 70.6%。面对复杂的多步编码、跨文件重构和长周期自主规划,能力差距依然存在。

开发者 Pawel Huryn 在两个代码库中测试模型寻找遗漏 Bug 的能力,也得到了类似结果:

Haiku 5.5 的成绩距离旗舰模型还有差距,但找到的 Bug 数量已大幅超越上一代,成本也低了不少。

另一个值得关注的升级是,Haiku 5.5 首次支持 Low、Medium、High、Xhigh、Max 五档思考程度设置,可根据任务需求调整推理投入。

以 OSWorld 为例,Low 档准确率为 42%,单次成本约 0.07 美元;Max 档准确率达到 72.4%,单次成本约 0.61 美元。

相比之下,上一代 Haiku 4.5 的 Max 档准确率仅为 15.7%,成本却达到 1.45 美元。

也就是说,新一代模型在低档位下,已经比上一代的最高档位更具效能,且更节省成本。

价格再次被压低

能力提升的同时,Haiku 5.5 的定价也相当激进。

10 万 Token 以内,输入每百万 Token 仅需 0.10 美元,输出为 0.50 美元。

根据 Anthropic 的估算,综合使用成本相比此前下降约 75%,短请求的标价降幅最高可达 90%,但长请求的降幅会收窄。

这个价格在过去确实难以想象。

但如今的问题是,AI 领域早已不缺廉价模型。

DeepSeek、GLM、Kimi、MiniMax 等都在比拼性价比,Haiku 5.5 凭什么争夺市场?

关键在于能力。

在 Artificial Analysis 的智能指数测试中,Haiku 5.5 获得 43 分,超过 DeepSeek V4.1 Flash 的 39 分和 GLM-5.3 Flash 的 42 分,与 Kimi K3 的 44 分也仅差 1 分。

而上一代 Haiku 4.5 的成绩仅为 17 分。

也就是说,它并非单纯压低价格,而是在低价位上,将模型能力提升到了更具竞争力的位置。

不过,单价低并不等同于实际使用成本最低。将 Haiku 5.5 与几款主打性价比的模型放在一起比较,竞争态势更为直观。

而不同模型的 Token 消耗和定价机制各不相同,最终账单也会有差异。

尤其是 Haiku 5.5 在超过 10 万 Token 后,输入单价会从 0.10 美元涨至 0.50 美元,长任务更需要精打细算。

可以说,Haiku 5.5 在低价位上展现了更具竞争力的能力,但并非所有场景都变成了最便宜的选择。

对于开发者而言,模型选型需要计算完成任务的总成本:调用次数、Token 消耗量、所需修正轮次,以及最终能否正确完成任务。

押注多 Agent 协作,更具性价比

Agent 工作流的成本,很大程度上取决于你让什么模型执行什么任务。

如果每个步骤都调用旗舰模型,成本自然难以降低。

Anthropic 的思路非常直接:Opus 5.5、Sonnet 5.5 负责规划,Haiku 5.5 作为 Subagent 批量执行。

大模型分解任务,小模型执行操作,无需每一步都花费旗舰模型的成本。

官方展示过一个实验:让模型设计鸡蛋从 32 米高处安全落地的方案。

Opus 5.5 单独执行,耗时 3 分 37 秒,尝试了 25 个方案,花费 0.47 美元。

换成 Opus 5.5 搭配 10 个 Haiku 5.5 Agent 后,耗时缩短至 58 秒,尝试的方案增加到 86 个,成本降至 0.14 美元。

时间更短、探索的方案更多,成本还下降了约 70%。

这就是多 Agent 协作的价值:将任务拆解并行处理,让昂贵模型不必包揽所有步骤。

开发者的实际测试,也提供了另一种观察角度。

有开发者分别用 Haiku 5.5 和 GPT-6 Luna 生成“鹈鹕骑自行车”的 SVG 动画,并制作成 H5 页面。

从分享的成品来看,Haiku 5.5 的动画效果更佳。

另一组斑马场景对比中,两个模型生成的斑马,重点比较身体条纹、四肢动作、远近景层次和草地融合。

分享者认为,Haiku 5.5 在细节上表现更好,对照模型在条纹、四肢和地面融合上问题较为明显。

另一位开发者岚叔则用 Haiku 5.5 制作了一支宣传片。

他表示,最终效果丝毫不逊于 Opus 5.5,模型吞吐速度达到每秒 200 Token,累计消耗 1.6 亿 Token,花费却只有 3 美元。

而工作流的总成本,恰好是中国模型厂商过去几年重点构建的优势。

DeepSeek、GLM、Kimi、MiniMax 等国产模型,凭借低价和开放权重吸引了大量开发者。

如今,Anthropic 不仅将 Haiku 5.5 的短请求输入价格压至每百万 Token 0.1 美元,还通过 Subagent 和多 Agent 协作,试图将低价模型融入更大规模的任务执行流程。

这意味着,中国模型厂商面临的压力,不再仅仅是 API 价格被追平。模型能否以更低成本完成真实任务,正在成为新的竞争焦点。

毕竟,开发者真正要计算的,不只是每百万 Token 花费多少钱,还包括完成一项任务需要消耗多少 Token、调用多少轮、耗时多久,以及最后是否需要人工返工。

标价再低,如果任务无法顺利完成,成本优势也无从谈起。

参考资料:claund 官网及公众号、X 等网络平台

本文来自微信公众号 “科技狐”(ID:kejihutv),作者:老狐,36氪经授权发布。

比赛分析
比赛分析
比赛分析
比赛分析
比赛分析
比赛分析
比赛分析
比赛分析
比赛分析
比赛分析

比赛分析专注整合多维赛事数据与球队近期战绩,生成直观的攻防趋势图表。,为用户提供专业可靠的体验。