OpenAI ↗
Astra 承接复杂工作,Sol 接续日常任务;沿同题结果比较代际变化。
01 / 源头
先看模型能力处在什么位置,再沿公司的迭代与具体评测,理解它改变了什么。
材料读取 · · v4.3
Intelligence Index · 各型号取来源页最高已测档位,保留回退设置;只按同一机构的分数排列。
13 个模型配置 · 筛选保留原榜名次
左右滑动查看分数与评测,模型名称会保留在左侧。
| 名次 | 模型 / 评测配置 | 公司 | 分数 | 进一步了解 |
|---|---|---|---|---|
| 1 | Claude Opus 5.5max · 含回退机制 | Anthropic | 58 | 看评测 → |
| 2 | Claude Sonnet 5.5max · 含回退机制 | Anthropic | 56 | 看评测 → |
| 3 | Claude Fable 5.1max · 含回退机制 | Anthropic | 53 | 看评测 → |
| 3 | GPT-6 Astramax | OpenAI | 53 | 看评测 → |
| 3 | Gemini 4 Argonhigh | Google DeepMind | 53 | 看评测 → |
| 6 | GPT-6.1 Solmax | OpenAI | 52 | 看评测 → |
| 7 | Muse Spark 1.3max | Meta | 48 | 看评测 → |
| 8 | Grok 4.7xhigh | SpaceXAI | 46 | 看评测 → |
| 9 | Qwen3.8 Max (0902)0902 快照 · 源表未单列推理档位 | Alibaba / Qwen | 45 | 看评测 → |
| 10 | Gemini 3.8 Flashhigh | Google DeepMind | 41 | 看评测 → |
| 11 | Qwen3.8-Flash-Next源表未单列推理档位 | Alibaba / Qwen | 40 | 看评测 → |
| 12 | DeepSeek V4.1 Flashmax | DeepSeek | 39 | 看评测 → |
| 13 | Qwen3.8 27Bxhigh | Alibaba / Qwen | 34 | 看评测 → |
已收录模型:13 个型号,各取来源页面最高已测推理档位;未标档位的保留原名。按同一来源的显示分数排序,不是全球前 13 名。同分只表示整数显示相同;各模型的档位与回退设置不同,不能当作相同计算预算的测试。
同一榜内按来源分数排序,相同显示分数并列,筛选不会重新编号。不同榜测量的对象不同,不合成一个总分。具体作品、速度、费用和使用条件仍需分别看。
阅读评测方法 ↗把发布放回前后变化中;每一步都保留原始说明。
Astra 承接复杂工作,Sol 接续日常任务;沿同题结果比较代际变化。
Claude 的旗舰与日常型号并行更新,评测之外也看创作、返工与沟通。
从 Gemini 3.8 Flash 到 Argon,比较长任务能力,也核对实际开放范围。
Muse Spark 是模型,Muse 是接入模型、电脑与服务的个人代理;两层分开看。
沿 Grok 的版本看代码与知识工作变化,区分标准版本和更快的服务档位。
托管 Max、Flash-Next 与可下载的 27B 各有位置,参数规模不能代替实测表现。
Flash 的视觉与工具能力持续接入现有产品;模型名称与 API 路由要一起核对。
V4 家族接入 API,Pro 与 Flash 分别提供能力与资源取舍;旧请求名称暂时映射到 Flash。
发布来源 ↗保留架构与规模,重新后训练并接入 Responses API;这次更新仅面向 Flash API,不能套到 Pro 或网页版本。
发布来源 ↗Pro 正式版进入 App、网页和 API,增加 Responses API 与更灵活的推理档位;调用名称保持不变。
发布来源 ↗新增实验性视觉模型入口,把图像理解加入 Flash;它是单独的实验型号,之后由 V4.1 Flash 接续。
发布来源 ↗正式发布原生多模态 Flash;旧 Flash API 名称暂时转接新模型,Pro 继续服务。
发布来源 ↗每个模型的来源、测试条件与相关作品,在同一个入口接着读。
Anthropic
从复杂工作能力到可修改的代码动画,同时看独立评测与真实制作取舍。
评测与演进 →Anthropic
日常任务的新搭档;分数、档位、输出量与整项任务费用需要放在一起看。
评测与演进 →Anthropic
保留为前代参照:同一份手写批注能比单一总分更具体地显示差异。
评测与演进 →OpenAI
把材料、代码和工具接成长任务;用画图、批注与家具装配建立具体参照。
评测与演进 →Google DeepMind
长任务能力的新参照,当前先向受邀测试者开放;按具体任务拆开总分。
评测与演进 →OpenAI
Sol 的后续升级;独立同表比较能帮助理解它与 Astra 的能力和费用位置。
评测与演进 →Meta
Muse 背后的能力模型;区分模型改进、产品接入与个人代理的实际体验。
评测与演进 →SpaceXAI
官方强调长时间编码、知识工作与自查;先分清版本变化和已验证结果。
评测与演进 →Alibaba / Qwen
托管 Max 的明确快照版本;官方强调代码、工具协作和视觉理解。本站尚无该版本的独立正文评测。
评测与演进 →Google DeepMind
作为 Argon 的前代参照,保留同一机构、同一榜单中的任务差异。
评测与演进 →Alibaba / Qwen
看清稀疏模型的总量与激活量,并把可下载权重和托管服务分开。
评测与演进 →DeepSeek
原生图像理解接上文件与工具;从官方推理曲线看多想一会儿的收益与代价。
评测与演进 →Alibaba / Qwen
较小规模的图文与视频理解模型;先核对思考模式、上下文和部署资料。
评测与演进 →