01 / 源头

模型

先看模型能力处在什么位置,再沿公司的迭代与具体评测,理解它改变了什么。

模型排行榜

Artificial Analysis 综合能力比较

材料读取 · · v4.3

原始榜单 ↗

Intelligence Index · 各型号取来源页最高已测档位,保留回退设置;只按同一机构的分数排列。

13 个模型配置 · 筛选保留原榜名次

左右滑动查看分数与评测,模型名称会保留在左侧。

Artificial Analysis 综合能力比较 · Intelligence Index
名次模型 / 评测配置公司分数进一步了解
1Claude Opus 5.5max · 含回退机制Anthropic58看评测 →
2Claude Sonnet 5.5max · 含回退机制Anthropic56看评测 →
3Claude Fable 5.1max · 含回退机制Anthropic53看评测 →
3GPT-6 AstramaxOpenAI53看评测 →
3Gemini 4 ArgonhighGoogle DeepMind53看评测 →
6GPT-6.1 SolmaxOpenAI52看评测 →
7Muse Spark 1.3maxMeta48看评测 →
8Grok 4.7xhighSpaceXAI46看评测 →
9Qwen3.8 Max (0902)0902 快照 · 源表未单列推理档位Alibaba / Qwen45看评测 →
10Gemini 3.8 FlashhighGoogle DeepMind41看评测 →
11Qwen3.8-Flash-Next源表未单列推理档位Alibaba / Qwen40看评测 →
12DeepSeek V4.1 FlashmaxDeepSeek39看评测 →
13Qwen3.8 27BxhighAlibaba / Qwen34看评测 →
这张榜怎样比较?

已收录模型:13 个型号,各取来源页面最高已测推理档位;未标档位的保留原名。按同一来源的显示分数排序,不是全球前 13 名。同分只表示整数显示相同;各模型的档位与回退设置不同,不能当作相同计算预算的测试。

同一榜内按来源分数排序,相同显示分数并列,筛选不会重新编号。不同榜测量的对象不同,不合成一个总分。具体作品、速度、费用和使用条件仍需分别看。

阅读评测方法 ↗

公司怎样走到这一代模型

把发布放回前后变化中;每一步都保留原始说明。

OpenAI ↗

Astra 承接复杂工作,Sol 接续日常任务;沿同题结果比较代际变化。

查看 3 次迭代
  1. GPT-6 Astra

    GPT-6 的复杂任务模型发布,接续材料理解、工具操作与文件交付。

    发布来源 ↗
  2. GPT-6 Sol / Luna

    Sol 与 Luna 加入 GPT-6 家族,提供不同能力与费用取舍。

    发布来源 ↗
  3. GPT-6 Sol → GPT-6.1 Sol

    Sol 更新到 6.1;官方强调代码、电脑操作和专业工作上的提升。

    发布来源 ↗

Anthropic ↗

Claude 的旗舰与日常型号并行更新,评测之外也看创作、返工与沟通。

查看 2 次迭代
  1. Opus 5 → Opus 5.5

    升级复杂工作与沟通表现;代码动画和同题游戏已有公开作品。

    发布来源 ↗
  2. Sonnet 5 → Sonnet 5.5

    第二个 5.5 家族型号发布;关注日常任务速度及不同推理档位的费用。

    发布来源 ↗

Google DeepMind ↗

从 Gemini 3.8 Flash 到 Argon,比较长任务能力,也核对实际开放范围。

查看 2 次迭代
  1. Gemini 3.7 Flash → 3.8 Flash

    在同一速度和价格定位上继续改进代码、多步推理与代理任务;Flash Cyber 是针对安全工作的另一变体。

    发布来源 ↗
  2. Gemini 4 Argon

    新一代模型公布,先向受邀测试者开放;较高评测分数不等于公众已经能用。

    发布来源 ↗

Meta ↗

Muse Spark 是模型,Muse 是接入模型、电脑与服务的个人代理;两层分开看。

查看 2 次迭代
  1. Muse Spark 1.1 → 1.2

    代码生成、复杂调试和代码库理解升级,并与 Muse Code 一起训练;模型和终端代理同时开放,但属于两层产品。

    发布来源 ↗
  2. Muse Spark 1.2 → 1.3

    官方强调长任务、工具使用与编程改进,max 档进入 Muse Code 和 Meta Model API。

    发布来源 ↗

SpaceXAI ↗

沿 Grok 的版本看代码与知识工作变化,区分标准版本和更快的服务档位。

查看 2 次迭代
  1. Grok 4.5 → 4.6

    继续训练后加强长任务、代码与交互作品,接入 Grok Build、Cursor 和 API;更快的服务档位另计费用。

    发布来源 ↗
  2. Grok 4.6 → 4.7

    采用更大的基础模型,强调长任务和自查;标准输入输出单价与 4.6 相同。

    发布来源 ↗

Alibaba / Qwen ↗

托管 Max、Flash-Next 与可下载的 27B 各有位置,参数规模不能代替实测表现。

查看 2 次迭代
  1. Qwen3.8 Max → Max 0902

    0902 快照升级代码、工具协作和视觉理解;官方保留旧版本与快照的区分。

    发布来源 ↗
  2. qwen3.8-max → Max 0902 (default)

    官方公告将默认 Max 入口切向 0902;这是入口映射调整,不是另一个新模型。

    发布来源 ↗

DeepSeek ↗

Flash 的视觉与工具能力持续接入现有产品;模型名称与 API 路由要一起核对。

查看 5 次迭代
  1. V4 Pro / V4 Flash

    V4 家族接入 API,Pro 与 Flash 分别提供能力与资源取舍;旧请求名称暂时映射到 Flash。

    发布来源 ↗
  2. V4 Flash Preview → Flash 0731

    保留架构与规模,重新后训练并接入 Responses API;这次更新仅面向 Flash API,不能套到 Pro 或网页版本。

    发布来源 ↗
  3. V4 Pro · GA

    Pro 正式版进入 App、网页和 API,增加 Responses API 与更灵活的推理档位;调用名称保持不变。

    发布来源 ↗
  4. V4 Flash → Flash Vision Exp

    新增实验性视觉模型入口,把图像理解加入 Flash;它是单独的实验型号,之后由 V4.1 Flash 接续。

    发布来源 ↗
  5. V4 Flash / Vision Exp → V4.1 Flash

    正式发布原生多模态 Flash;旧 Flash API 名称暂时转接新模型,Pro 继续服务。

    发布来源 ↗

从分数继续看评测

每个模型的来源、测试条件与相关作品,在同一个入口接着读。

Alibaba / Qwen

Qwen3.8 Max 0902

托管 Max 的明确快照版本;官方强调代码、工具协作和视觉理解。本站尚无该版本的独立正文评测。

评测与演进 →