模型变化 · 速度、效果与任务分工

Haiku 5.5:小任务便宜了,怎样与 Sonnet、Opus 分工?

从一只骑车的鹈鹕,到批量摘录与资料查询:把独立评分、不同推理档的结果和两档价格放在一起,看新 Haiku 适合接走哪些工作。

Anthropic 于 10 月 7 日发布 Haiku 5.5。这里整理官方说明、Artificial Analysis 测量和 Simon Willison 的公开测试;配图是作者的结果,本站没有另跑一轮模型测试。

本文目录目录5

EN

同一道绘图题,等待时间也会变

Simon Willison 用“骑自行车的鹈鹕”测试了五个推理档。他报告 low 用时 7 秒、费用不足 0.1 美分;Max 用时 5 分 9 秒,约 3.38 美分。配图让我们直观看到新旧结果,记录则提醒:更便宜的模型,也可能在高档位思考很久。

作者还发现 Max 的推理记录认出了这道常见题,因此另外换题作参照。我们把它当成可看的单题例子,不据此推断所有绘图或工作能力。接回 Sonnet 的早期测试看,模型和推理档都值得一起比较。

Haiku 4.5 · 作者旧测试Haiku 4.5 的旧结果:圆形鸟身在两个车轮和简化车架上方。
同一作者一年前的 Haiku 4.5 结果,当时没有可调推理档。两图保留完整画面,便于看鸟的形态和车架关系。 · 打开大图
Haiku 5.5 · Max白色长嘴鹈鹕骑在具有完整车架的自行车上。
Simon Willison 的 Haiku 5.5 Max 原图。作者记录这次等待 5 分 9 秒、费用约 3.38 美分;这是一个 SVG 绘图请求。 · 打开大图
来源与延伸阅读

EN

先找它的位置:把频繁的小任务接走

官方把 Haiku 5.5 放在摘要、分类、资料提取和子任务的位置:这些工作单次不大,却会反复发生。Sonnet、Opus 仍承接更复杂的编程与完整任务。对已有 Claude 用户,值得考虑的是哪些环节可以拆出来,而非整套工作都换模型。

10 月 8 日读取的 Artificial Analysis 模型页,Max 配置在 v4.3.2 智能指数得 43 分,输出速度约 243 token/秒。它也报告了较长的输出量。这里的速度是开始输出后的吞吐,并不等于多久能拿到完整答案;模型页按价格范围展示的名次,也不能读成全模型总排名。

来源与延伸阅读

EN

10 万 token,是两档价格的分界

官方文档给出的标准 API 价格如下。它支持 100 万 token 上下文,但容量和低价档是两回事;一次请求超过 10 万输入 token,就采用另一档价格。相比旧 Haiku,同一段文字的新分词数量还可能增加,官方文档估计约多三成,所以要看完整请求的账单。

美元 / 每百万 token;标准 API 单价,不含缓存和批处理优惠。10 月 8 日核对。
型号与条件输入输出
Haiku 4.5$1.00$5.00
Haiku 5.5 · 输入 ≤ 10 万$0.10$0.50
Haiku 5.5 · 输入 > 10 万$0.50$2.50
来源与延伸阅读

EN

大模型组织成果,小模型查一项材料

Anthropic 发布页转述 Rogo 的用法:较大的模型制作演示文稿,Haiku 子代理去企业年报里取出需要的分部收入。这是厂商收录的客户经验,尚不是本站复测;但它把分工说得很具体——让一项短查询服务于完整成果。

放回日常资料整理,可以先试着让 Haiku 按固定字段摘录,再把原文和摘录一起交给负责写作的模型。检查漏项和出处之后,才决定是否扩大使用。需要反复判断、统筹长任务的部分,则接着看 Opus 已有的创作和修改案例。这个做法是本站的用途建议。

来源与延伸阅读

EN

从已有工具里试,不必先换整套工作方式

已在用 Claude 的人可以先从原入口找:官方产品页列出 Free、Pro、Max、Team 和 Enterprise 均可在网页、iOS、Android 选择 Haiku 5.5,Claude Code 也已接入。先拿一份熟悉的短材料比较,看看速度和漏项,再决定哪些工作交给它。

GitHub 已宣布在 Copilot 中接入 Haiku 5.5,面向 Pro、Pro+、Max、Business 和 Enterprise 逐步开放,VS Code、CLI、网页与手机等入口可在模型选择器查找;组织设置也会影响是否可用。产品按实际用量计费,不能把本文 API 单价直接当成订阅总价。

仍在用 Sonnet 5.5 的人也有一项直接变化:官方把缓存读取单价从每百万 token 0.20 美元降到 0.10 美元。这只涉及缓存读取,实际省多少取决于请求构成;不需要为了这一项变化立即换模型。

来源与延伸阅读

把这些变化放在一起看