新模型 · 长任务与实际表现

Gemini 4 Argon 来了:更长的思考,能把任务做得更完整吗?

Google 把输出上限提高到 100 万 token,独立测试也显示自动化任务的进步。先看它与熟悉模型的差别,再分清当前开放对象和促销价格。

Google 原公告发布于 9 月 30 日 20:00 UTC,即北京时间 10 月 1 日 04:00。本文核对至 10 月 1 日晚:目前先向受邀测试者开放,尚未普遍进入普通用户的 Gemini。

本文目录4 个章节

值得看的是任务能推进多远

Google 把 Argon 的重点放在持续多步的编程、知识工作与安全防御。一个内部例子是重做视频解码器 libgav1 的部分 Rust 代码:反复测性能、看编译结果,再修改;Google 报告其速度达到原 Rust 移植版的 2.7 倍,输出视频相同。这个数字比较的是该项目的两个版本,不是所有任务都快 2.7 倍。

输出上限从 Google 此前的 64K 提高到 1M token,给推理和生成留下更长空间。Artificial Analysis 实际测试了 Long Decode Continuation:长响应暂停后,通过后续调用接着生成。它不同于能装多少资料的输入窗口,也不能直接证明一篇超长作品从头到尾都正确、连贯。

Google 官方 Gemini 4 Argon 发布图,蓝色背景上显示模型名与数字 4。
Google 官方发布图,用于辨认这次模型更新。它不是成品展示或本站测试截图。 · 打开大图
来源与延伸阅读

自动化进步明显,换一个任务位置也会变

同一独立评测体系里,Argon 的综合分数从 Gemini 3.8 Flash 的 41 提升到 53,与 Astra 的 53 相当。把综合分拆开看:跨应用执行任务是强项;终端编程则仍有别的模型在前面。表中的不同推理档已注明,不能当成每位用户的默认设置。

这些结果给选择提供参照,但还没有替你完成手头的报告、网页或修改。尤其不要把 Google 发布表里的 AutomationBench 51.3%,和这里的 AutomationBench-AA 78% 拼成一次前后提升:它们是不同的评测口径。

Artificial Analysis · 10 月 1 日回读 · 综合分与任务成功率分开看
看什么Argon(high)参照
综合能力指数53Gemini 3.8 Flash(high)41;Astra(max)53;GPT-6.1 Sol(max)52。
跨应用自动化任务AutomationBench-AA:78%Gemini 3.8 Flash(high)60%;Sonnet 5.5(max,含回退)71%。
终端编程与操作Terminal-Bench 4:57%Astra(max)59%;Opus 5.5、Sonnet 5.5(max,含回退)分别 60%、64%。
来源与延伸阅读

什么时候能用,费用又怎样算

截至本轮核对,先开放的是 Fairwind 项目的受邀网络防御者与其他可信测试者。Google 说后续从付费 API 客户和 Google AI Ultra 订阅者开始扩大开放,未给具体日期。普通 Gemini 中没有入口,不代表你漏掉了设置。

公告中的 API 促销价是每百万 token 输入 2 美元、输出 10 美元;促销结束后为 4/20 美元,缓存输入费用降低 95%。官方未公布促销结束日期。API 单价也不是 Ultra 订阅费,更不是一份任务的总花费:推理长度、缓存、工具调用和返工都会影响实际账单。

来源与延伸阅读

接回你已经在做的事情

如果你已经用 Gemini 整理资料或写作,Argon 提供的是一个新的能力参照。等常用产品真正接入,可把原来做到一半就需要你接手的任务拿来比较:有没有保留要求,文件能否继续修改,哪里还要人工判断。这是本站建议的比较方法,不是已完成的 Argon 用户实测。

已经用 Astra、Sol 或 Opus 的人,也可以先留住熟悉的流程,用这个新信号重新看同一任务的选择。此前的 Skills 文章讲怎样保留自己的写作要求与资料;那是使用方式的变化,不能据此认定 Skills 已由 Argon 驱动。模型、产品接入与最后的成品,要分开核对,再连接起来。

来源与延伸阅读