Gemini 4 Argon 发布:主打编码、企业工作流与网络防御
Google DeepMind 推出了新的前沿模型 Gemini 4 Argon。这是其在 Gemini 3.x Flash 系列迭代之后,面向更高端模型竞争的一次重要更新。该模型被定位为面向复杂工作流,重点覆盖编码、企业知识工作和网络安全防御。
不过,普通开发者和消费者暂时还不能直接使用。当前访问范围仅限于 Fairwind Program 中的政府用户和受信任的网络防御人员。Google 表示会先完善安全护栏,再逐步开放给开发者、企业和消费者。
核心信息
1. 面向复杂任务的前沿模型
Gemini 4 Argon 被描述为适用于:
- 编码与软件工程任务
- 企业知识工作流
- 网络安全防御
- 多步骤、长上下文或长输出任务
从公开评价看,Argon 被放在 GPT-6 Astra、Claude Opus 5.5 等同类高端模型旁边比较。
2. 最高 100 万 token 输出能力
Argon 最受关注的一点是其长输出能力。Google 宣称其具备行业领先的 100 万 token 输出上限,相较此前 64K 输出限制有显著提升。
不过,不同评测机构对这一能力的记录略有差异:
- 有评测平台记录的最大输出为 262K token。
- Artificial Analysis 通过新的 Long Decode Continuation API 功能实现了 100 万 token 输出。
- 该机制会在长回复中暂停生成,并允许后续 API 调用继续完成输出。
这意味着“100 万 token 输出”更像是通过连续续写机制实现,而不是一次性单次响应完成。
3. 访问仍处于受限预览阶段
目前 Argon 不是面向所有用户开放的模型。其初始测试对象包括:
- 政府用户
- 可信网络防御人员
- Fairwind Program 内的测试者
Google 表示会在开放更广泛访问前,继续调整安全策略和防护机制。
价格信息
公开信息显示,Argon 的标准价格为:
- 输入:每 100 万 token 4 美元
- 输出:每 100 万 token 20 美元
同时还有一个未公布结束时间的 50% 早期折扣:
- 输入:每 100 万 token 2 美元
- 输出:每 100 万 token 10 美元
缓存输入可获得 95% 折扣。
从任务成本看,折扣价下 Argon 的单任务成本被测为约 1.99 美元;若按标准价格,则约为 3.98 美元。不过,它在部分测试中输出 token 使用量较高,节省主要来自价格,而不是生成效率。
公开评测表现
Google 公布的结果
Google 声称,Argon 在 19 个公开基准中的 13 个取得第一。部分对比包括:
- DeepSWE:Argon 77.9%
- Claude Opus 5.5:74.2%
- GPT-6 Astra:74.1%
Google 还提到内部部署案例,包括:
- Argon agent 释放了超过 300 TiB 的数据中心内存。
- 正在迁移超过 80 万行 C/C++ 内核代码到 Rust。
- 一个视频解码相关任务中,agent 将 3.2 万行 SIMD 代码替换为安全 Rust,并使既有 Rust 移植版本速度提升 2.7 倍,输出保持一致。
这些仍属于厂商披露信息,尚需更多外部复现和验证。
Artificial Analysis 评测
Artificial Analysis 给出的部分结果包括:
- Intelligence Index:53,与 GPT-6 Astra 持平,高于 GPT-6.1 Sol 的 52。
- AutomationBench-AA:77.5%,排名第一。
- Terminal Bench 4:57%,低于 Sonnet 5.5、Opus 5.5 和 Astra。
- AA-Omniscience 幻觉率:15%,低于 Astra 的 51%。
- 但准确率为 50%,低于 Astra 的 63%。
这显示 Argon 在减少幻觉方面表现突出,但在某些知识准确率指标上仍有取舍。
Vals 评测
Vals 给出的数据包括:
- Vals Index:68.9%,排名第一。
- 平均任务成本:15.68 美元。
- Vibe Code Bench:30 个应用全部正确完成。
- Terminal-Bench 4.0:从 19.0% 提升到 57.6%。
- CyberBench 概念验证任务:70%。
- IOI 2024–2026:100%。
在效率方面,Vals 表示 Argon 在 Vals Index 任务中使用的输出 token 约为 Sonnet 5.5 的四分之一。
Arena 与其他评价
其他公开评价包括:
- Text Arena:排名第一,分数 1525。
- Code Arena WebDev:排名第八,分数 1679。
- Agent Arena:初步 3000 场会话中,总体排名第八;可控性排名第一。
- PostTrainBench:45.3%,高于 Gemini 3.1 Pro 的 21.99%。
质疑与保留意见
并非所有观察者都完全接受这些评测结果。一些讨论集中在:
- 某些法律基准中,Argon 的得分低于其他模型。
- 是否存在针对偏好数据或常见评测集的优化问题。
- 个别基准,如 DeepSWE,是否能充分代表真实软件工程能力。
因此,Argon 的早期成绩虽然强劲,但仍需要更大范围的第三方测试和真实用户验证。
小结
Gemini 4 Argon 是 Google DeepMind 面向前沿模型竞争的一次重要更新。它的亮点包括长输出能力、编码表现、网络安全任务能力,以及多个公开基准中的高分。
但现阶段它仍处于受限预览阶段,普通开发者尚无法实际试用。对于社区而言,最值得继续关注的是:
- 100 万 token 输出在实际开发中的稳定性;
- 网络安全场景的安全边界;
- 开放后的真实价格与速率限制;
- 第三方评测能否复现厂商公布的领先结果。
