新模型 · 长任务与实际表现
Gemini 4 Argon 来了:更长的思考,能把任务做得更完整吗?
Google 把输出上限提高到 100 万 token,独立测试也显示自动化任务的进步。先看它与熟悉模型的差别,再分清当前开放对象和促销价格。
Google 原公告发布于 9 月 30 日 20:00 UTC,即北京时间 10 月 1 日 04:00。本文核对至 10 月 1 日晚:目前先向受邀测试者开放,尚未普遍进入普通用户的 Gemini。
值得看的是任务能推进多远
Google 把 Argon 的重点放在持续多步的编程、知识工作与安全防御。一个内部例子是重做视频解码器 libgav1 的部分 Rust 代码:反复测性能、看编译结果,再修改;Google 报告其速度达到原 Rust 移植版的 2.7 倍,输出视频相同。这个数字比较的是该项目的两个版本,不是所有任务都快 2.7 倍。
输出上限从 Google 此前的 64K 提高到 1M token,给推理和生成留下更长空间。Artificial Analysis 实际测试了 Long Decode Continuation:长响应暂停后,通过后续调用接着生成。它不同于能装多少资料的输入窗口,也不能直接证明一篇超长作品从头到尾都正确、连贯。

来源与延伸阅读
- Google:Gemini 4 Argon 发布官方公告 · 9 月 30 日 UTC核对输出上限、Google 内部案例、分期开放与促销后的价格。案例结果属于 Google 的报告。
- Artificial Analysis:Argon 的独立评测评测机构 · 9 月 30 日发布,10 月 1 日回读综合位置、任务差异、Long Decode Continuation 与每项测试费用;不是本站重跑。
自动化进步明显,换一个任务位置也会变
同一独立评测体系里,Argon 的综合分数从 Gemini 3.8 Flash 的 41 提升到 53,与 Astra 的 53 相当。把综合分拆开看:跨应用执行任务是强项;终端编程则仍有别的模型在前面。表中的不同推理档已注明,不能当成每位用户的默认设置。
这些结果给选择提供参照,但还没有替你完成手头的报告、网页或修改。尤其不要把 Google 发布表里的 AutomationBench 51.3%,和这里的 AutomationBench-AA 78% 拼成一次前后提升:它们是不同的评测口径。
| 看什么 | Argon(high) | 参照 |
|---|---|---|
| 综合能力指数 | 53 | Gemini 3.8 Flash(high)41;Astra(max)53;GPT-6.1 Sol(max)52。 |
| 跨应用自动化任务 | AutomationBench-AA:78% | Gemini 3.8 Flash(high)60%;Sonnet 5.5(max,含回退)71%。 |
| 终端编程与操作 | Terminal-Bench 4:57% | Astra(max)59%;Opus 5.5、Sonnet 5.5(max,含回退)分别 60%、64%。 |
来源与延伸阅读
- Google:Gemini 4 Argon 发布官方公告 · 9 月 30 日 UTC核对输出上限、Google 内部案例、分期开放与促销后的价格。案例结果属于 Google 的报告。
- Artificial Analysis:Argon 的独立评测评测机构 · 9 月 30 日发布,10 月 1 日回读综合位置、任务差异、Long Decode Continuation 与每项测试费用;不是本站重跑。
- Artificial Analysis:与 Gemini 3.8 Flash 同表比较同一评测体系 · 10 月 1 日回读两款模型均为 high 推理档,保留现有 Gemini 用户的纵向参照。
什么时候能用,费用又怎样算
截至本轮核对,先开放的是 Fairwind 项目的受邀网络防御者与其他可信测试者。Google 说后续从付费 API 客户和 Google AI Ultra 订阅者开始扩大开放,未给具体日期。普通 Gemini 中没有入口,不代表你漏掉了设置。
公告中的 API 促销价是每百万 token 输入 2 美元、输出 10 美元;促销结束后为 4/20 美元,缓存输入费用降低 95%。官方未公布促销结束日期。API 单价也不是 Ultra 订阅费,更不是一份任务的总花费:推理长度、缓存、工具调用和返工都会影响实际账单。
来源与延伸阅读
- Google:Gemini 4 Argon 发布官方公告 · 9 月 30 日 UTC核对输出上限、Google 内部案例、分期开放与促销后的价格。案例结果属于 Google 的报告。
- Artificial Analysis:Argon 的独立评测评测机构 · 9 月 30 日发布,10 月 1 日回读综合位置、任务差异、Long Decode Continuation 与每项测试费用;不是本站重跑。
接回你已经在做的事情
如果你已经用 Gemini 整理资料或写作,Argon 提供的是一个新的能力参照。等常用产品真正接入,可把原来做到一半就需要你接手的任务拿来比较:有没有保留要求,文件能否继续修改,哪里还要人工判断。这是本站建议的比较方法,不是已完成的 Argon 用户实测。
已经用 Astra、Sol 或 Opus 的人,也可以先留住熟悉的流程,用这个新信号重新看同一任务的选择。此前的 Skills 文章讲怎样保留自己的写作要求与资料;那是使用方式的变化,不能据此认定 Skills 已由 Argon 驱动。模型、产品接入与最后的成品,要分开核对,再连接起来。
来源与延伸阅读
- Google:Gemini 4 Argon 发布官方公告 · 9 月 30 日 UTC核对输出上限、Google 内部案例、分期开放与促销后的价格。案例结果属于 Google 的报告。
- Artificial Analysis:Argon 的独立评测评测机构 · 9 月 30 日发布,10 月 1 日回读综合位置、任务差异、Long Decode Continuation 与每项测试费用;不是本站重跑。