持续专题 · 2026年9月25日整理
Opus 5.5:从更清楚的回答,到能继续使用的结果
看 Claude 新版的沟通变化、独立测评和同题作品,再比较长任务、使用入口与费用,找到与自己现有工具的联系。
继续跟进:哪些有公开成品的 Opus 5.5 项目,能展示从想法到作品的修改过程?

01这次更新
从一张能打开的图,认识这次 Claude 更新
Opus 5.5 于 9 月 22 日发布。这个专题把版本变化、独立测试、实际输出和使用入口放在一起:已经用 Claude 的人可以看升级差别,用其他模型的人也能找到参照。
首图是 Simon Willison 用 Opus 5.5 medium 生成的 SVG:鹈鹕骑着自行车。它由文字和图形代码形成,可以在浏览器里打开;这里展示的是作者留下的原始结果。一个小作品能让抽象能力变得可见,复杂任务的可靠性则要继续看下面的材料。
来源与补充
- Anthropic 发布说明 ↗官方发布 · 9 月 22 日版本与沟通改进。
- Simon 的 Claude 同题作品表 ↗作者原始输出 · 9 月 22 日模型、档位、图形与用量逐项对应。
02纵向看变化
回答更好读,为什么也是能力变化?
Anthropic 把沟通改进列为这次重点:先给重点、减少术语、更遵守写作要求。发布页提供同题回答对照,可直接检查解释是否更容易读懂。这是官方样本。
对我们而言,值得观察的是协作的下一步:它改了哪里,为什么这样改,什么还没完成,你能不能接着判断?无论整理活动资料、修改网页还是写一份说明,能看懂过程,才容易提出有用的修改意见。
- 看官方前后回答对照发布页 Communication 部分。
03能力与实际表现
综合分数领先,再看长任务怎样完成
9 月 25 日读取的 Artificial Analysis 模型卡中,Opus 5.5 max(默认回退机制)综合指数为 58,在该页面的 211 个同类模型中列第 1。这个位置说明它值得认真比较;它对应特定评测、推理档位和运行设置,不是每种用途的通用名次。
GitHub 的早期测试记录称,Opus 5.5 在任务解决表现接近 Opus 5 时,使用更少步骤和 token,并能从多步任务的错误中恢复。它已经接入 Copilot,所以模型变化开始进入开发者实际工作的工具。
长任务的阅读重点可以放在最终文件、修改记录和检查结果。一个项目跑了多久,只是过程;留下的东西能否打开、继续修改,才帮助我们理解完成了什么。后续优先补入有公开过程和成品的项目。
来源与补充
- Artificial Analysis 模型卡 ↗独立评测 · 9 月 25 日读取58 分;max、默认回退,页面同类范围内排名。
- GitHub Copilot 接入说明 ↗产品团队测试与接入 · 9 月 22 日长任务中的步骤、用量与错误恢复。
04看作品和档位
同一只鹈鹕:成品、用量和没有完成的尝试

首图的 Opus 5.5 medium 与这里的 Opus 5 medium 来自作者同题表。新版本画出了两条可辨认的腿,旧版这张图主要看到一条;两张图的造型也不同。这是对当前画面的观察,不能推成每次绘图都会如此。
作者同时公开了一次反例:Opus 5.5 的 max 档两次耗尽输出上限,仍没有交出 SVG。较高档位会投入更多推理,并不自动保证这道题更容易完成。可以从中等档位开始,遇到明确的问题再提高要求,并保存前后结果。
来源与补充
- Simon Willison 同题原作 ↗原始结果 · 9 月 22 日并排图均取 medium 档。
- Simon Willison 发布后体验 ↗作者使用记录 · 9 月 22 日最高档未输出 SVG 的两次尝试。
05用起来有什么变化
单价下降之后,还要看一件事花了多少

官方费用说明列出标准 API 每百万 token 的价格:新输入 4 美元、输出 20 美元、缓存读取 0.20 美元。相对 Opus 5,输入和输出单价下降 20%,缓存读取下降 60%。订阅额度与 API 账单是不同口径。
任务费用还受对话轮数、缓存命中、推理输出和重试影响。比较时保留同一份材料和完成要求,再看实际结果与账单;不能把 API 单价的降幅直接当成所有任务的节省比例。
已经使用 Copilot 的读者,可在支持的套餐和客户端里检查模型选择器;GitHub 说明正在逐步开放,企业入口还受管理员设置影响。Claude 用户则先查看自己账户里的模型和用量入口。
- 看费用说明和计算器区分示例计算与自己的真实用量。
- 查看 Copilot 支持范围套餐、客户端与组织设置。
来源与补充
- Claude:一项任务的费用 ↗官方费用说明 · 9 月 22 日单价、缓存、推理与重试。
- GitHub:使用入口 ↗官方接入 · 9 月 22 日逐步开放与套餐范围。
06接回自己的使用
继续用 Claude,还是和 Astra、其他模型搭配?
如果已经用 Opus 5,先拿一项熟悉的工作比较:同样的资料,是否少了追问和返工,最后的说明是否更容易判断?如果习惯 GPT、Grok 或 GLM,可以挑一件现有工具做得不顺的事试一次,比较完整结果。保留原来的工作方式,也能增加一个有用的选择。
Astra 专题可以继续看三维场景和真实网页;费用文章解释 Sol、Luna 与 Opus 的不同成本口径。这里的联系是认识不同创作与使用路线,不是根据一张鹈鹕图决定换订阅。接下来会持续补入 Opus 5.5 的实际项目、中文使用体验和同任务比较。
- 看 Astra 的实际作品从描述到可编辑的三维场景。
- 比较 Sol、Luna、Opus 的费用口径单价、任务费用与订阅分别看。
接下来还会关注
07继续关注
接下来还会关注
- 哪些有公开成品的 Opus 5.5 项目,能展示从想法到作品的修改过程?
- 中文长对话和写作中,相对 Opus 5 的沟通变化是否仍然成立?
- 同一任务与 Astra、Grok、GLM 比较,结果、返工和费用怎样?