同任务比较 · 费用与等待
用 Haiku 写代码,费用和等待要一起看
Bito 把同一批代码工作交给五种 Claude 配置。看会话费用、耗时与实现检查怎样一起影响选择,再接回 Haiku 的长输入价格分界。
本文接续已发表的 Haiku 与日常模型费用文章,按 10 月 11 日读取的 Bito 10 月 9 日测试报告和官方价目整理。配图为本站根据作者数据制作的编辑图,本站没有重跑这些代码任务。
钱差不多,等多久却不同
在 Bito 的六项主代码任务中,Haiku medium 每会话约 $0.31、4.8 分钟,Sonnet medium 为 $0.64、3.7 分钟。把 Haiku 调到 high 后,费用升到 $0.62,耗时为 7.3 分钟;评分 79% 与 Sonnet medium 的 77% 相差两点,处于作者约三点的运行波动内。这个参照说明,少花调用费和更早拿到结果,是需要一起看的两个选择。
| 型号 / Claude Code 档位 | 评分 / 满分百分比 | USD / 会话 | 分钟 / 会话 |
|---|---|---|---|
| Opus 5.5 · medium(测试默认) | 85% | $2.71 | 8.5 |
| Sonnet 5.5 · high | 82% | $1.19 | 7.6 |
| Haiku 5.5 · high | 79% | $0.62 | 7.3 |
| Sonnet 5.5 · medium(测试默认) | 77% | $0.64 | 3.7 |
| Haiku 5.5 · medium(测试默认) | 76% | $0.31 | 4.8 |
来源与延伸阅读
- Bito · 五种 Claude 配置的代码任务比较测试作者报告 · 10 月 9 日自己的服务任务、评分与会话用量;Opus 5.5 同时参与测试和裁判。
查一个设置,和实施后再检查,要求不同
作者把工作分成短请求、短多轮与长会话。查代码行为、找设置这类一次请求里,Haiku high 接近 Opus medium;长会话走到实施修复与最后检查时,差距更明显。本文的编辑判断是,应该先看工作停在哪一步:找到线索可以是一份有用结果,交付可运行的修改还需要后续检查;一个综合百分比不能替读者决定哪种成果已足够。
来源与延伸阅读
- Bito · 五种 Claude 配置的代码任务比较测试作者报告 · 10 月 9 日自己的服务任务、评分与会话用量;Opus 5.5 同时参与测试和裁判。
会话变长,也可能跨过另一档价格
官方价目按每次请求判断:Haiku 输入不超过 100,000 token 时,每百万输入 / 输出为 $0.10 / $0.50;超过后为 $0.50 / $2.50。缓存读取与写入也计入这次请求的输入长度,命中缓存并不免除跨档判断。因此,长会话要看每次请求携带多少材料、调用多少次,再核总费用;表中数字是作者按用量与价目计算的测试会话成本,不能直接换算成 Claude 订阅套餐的价格。
来源与延伸阅读
- Bito · 五种 Claude 配置的代码任务比较测试作者报告 · 10 月 9 日自己的服务任务、评分与会话用量;Opus 5.5 同时参与测试和裁判。
- Anthropic · 官方 API 价格官方条件 · 10 月 11 日核对Haiku 的 100,000 输入 token 分界包含缓存读写,逐请求判断;与测试会话总费用分别看。
读任务比较,也读它的方法范围
Bito 使用自己服务中的固定提示、锁定的 Claude Code 版本与经代码核对的答案键,由 Opus 5.5 按五个维度评分;它同时也是参测模型。配套文章说通常每任务四次,但主表没有逐格运行数、实际工具版本号、完整提示与失败日志。medium 和 high 也不是相同计算预算。这足以提供选型参照,尚不足以独立复现每格结果;百分比不能混入本站 AA 文字指数或 Pi 通过率。
来源与延伸阅读
- Bito · 五种 Claude 配置的代码任务比较测试作者报告 · 10 月 9 日自己的服务任务、评分与会话用量;Opus 5.5 同时参与测试和裁判。
- Bito · 同日新旧 Haiku 配套比较同一作者测试方法的补充说明同一任务、裁判与答案键;通常每任务四次,旧 4.5 只跑两次,主表没有逐格运行数。
把省下的钱,接到需要的成果
这份比较接回旧文的日常费用问题:可以先让小模型处理范围清楚的查找与解释,再观察多轮修改是否反复、检查是否完整。若工作需要持续实施和审查,更贵的配置是否值得,要和省下的等待、返工及人的检查一起判断。下一次比较应围绕自己的同一份任务和交付标准,而不是沿用一次测试的精确名次。
来源与延伸阅读
- Bito · 五种 Claude 配置的代码任务比较测试作者报告 · 10 月 9 日自己的服务任务、评分与会话用量;Opus 5.5 同时参与测试和裁判。