Gemini 4 Argon 发布:主打编码、企业工作流与网络防御

Latent Space3 天前

Google DeepMind 推出了新的前沿模型 Gemini 4 Argon。这是其在 Gemini 3.x Flash 系列迭代之后,面向更高端模型竞争的一次重要更新。该模型被定位为面向复杂工作流,重点覆盖编码、企业知识工作和网络安全防御。

不过,普通开发者和消费者暂时还不能直接使用。当前访问范围仅限于 Fairwind Program 中的政府用户和受信任的网络防御人员。Google 表示会先完善安全护栏,再逐步开放给开发者、企业和消费者。

核心信息

1. 面向复杂任务的前沿模型

Gemini 4 Argon 被描述为适用于:

  • 编码与软件工程任务
  • 企业知识工作流
  • 网络安全防御
  • 多步骤、长上下文或长输出任务

从公开评价看,Argon 被放在 GPT-6 Astra、Claude Opus 5.5 等同类高端模型旁边比较。

2. 最高 100 万 token 输出能力

Argon 最受关注的一点是其长输出能力。Google 宣称其具备行业领先的 100 万 token 输出上限,相较此前 64K 输出限制有显著提升。

不过,不同评测机构对这一能力的记录略有差异:

  • 有评测平台记录的最大输出为 262K token。
  • Artificial Analysis 通过新的 Long Decode Continuation API 功能实现了 100 万 token 输出。
  • 该机制会在长回复中暂停生成,并允许后续 API 调用继续完成输出。

这意味着“100 万 token 输出”更像是通过连续续写机制实现,而不是一次性单次响应完成。

3. 访问仍处于受限预览阶段

目前 Argon 不是面向所有用户开放的模型。其初始测试对象包括:

  • 政府用户
  • 可信网络防御人员
  • Fairwind Program 内的测试者

Google 表示会在开放更广泛访问前,继续调整安全策略和防护机制。

价格信息

公开信息显示,Argon 的标准价格为:

  • 输入:每 100 万 token 4 美元
  • 输出:每 100 万 token 20 美元

同时还有一个未公布结束时间的 50% 早期折扣:

  • 输入:每 100 万 token 2 美元
  • 输出:每 100 万 token 10 美元

缓存输入可获得 95% 折扣。

从任务成本看,折扣价下 Argon 的单任务成本被测为约 1.99 美元;若按标准价格,则约为 3.98 美元。不过,它在部分测试中输出 token 使用量较高,节省主要来自价格,而不是生成效率。

公开评测表现

Google 公布的结果

Google 声称,Argon 在 19 个公开基准中的 13 个取得第一。部分对比包括:

  • DeepSWE:Argon 77.9%
  • Claude Opus 5.5:74.2%
  • GPT-6 Astra:74.1%

Google 还提到内部部署案例,包括:

  • Argon agent 释放了超过 300 TiB 的数据中心内存。
  • 正在迁移超过 80 万行 C/C++ 内核代码到 Rust。
  • 一个视频解码相关任务中,agent 将 3.2 万行 SIMD 代码替换为安全 Rust,并使既有 Rust 移植版本速度提升 2.7 倍,输出保持一致。

这些仍属于厂商披露信息,尚需更多外部复现和验证。

Artificial Analysis 评测

Artificial Analysis 给出的部分结果包括:

  • Intelligence Index:53,与 GPT-6 Astra 持平,高于 GPT-6.1 Sol 的 52。
  • AutomationBench-AA:77.5%,排名第一。
  • Terminal Bench 4:57%,低于 Sonnet 5.5、Opus 5.5 和 Astra。
  • AA-Omniscience 幻觉率:15%,低于 Astra 的 51%。
  • 但准确率为 50%,低于 Astra 的 63%。

这显示 Argon 在减少幻觉方面表现突出,但在某些知识准确率指标上仍有取舍。

Vals 评测

Vals 给出的数据包括:

  • Vals Index:68.9%,排名第一。
  • 平均任务成本:15.68 美元。
  • Vibe Code Bench:30 个应用全部正确完成。
  • Terminal-Bench 4.0:从 19.0% 提升到 57.6%。
  • CyberBench 概念验证任务:70%。
  • IOI 2024–2026:100%。

在效率方面,Vals 表示 Argon 在 Vals Index 任务中使用的输出 token 约为 Sonnet 5.5 的四分之一。

Arena 与其他评价

其他公开评价包括:

  • Text Arena:排名第一,分数 1525。
  • Code Arena WebDev:排名第八,分数 1679。
  • Agent Arena:初步 3000 场会话中,总体排名第八;可控性排名第一。
  • PostTrainBench:45.3%,高于 Gemini 3.1 Pro 的 21.99%。

质疑与保留意见

并非所有观察者都完全接受这些评测结果。一些讨论集中在:

  • 某些法律基准中,Argon 的得分低于其他模型。
  • 是否存在针对偏好数据或常见评测集的优化问题。
  • 个别基准,如 DeepSWE,是否能充分代表真实软件工程能力。

因此,Argon 的早期成绩虽然强劲,但仍需要更大范围的第三方测试和真实用户验证。

小结

Gemini 4 Argon 是 Google DeepMind 面向前沿模型竞争的一次重要更新。它的亮点包括长输出能力、编码表现、网络安全任务能力,以及多个公开基准中的高分。

但现阶段它仍处于受限预览阶段,普通开发者尚无法实际试用。对于社区而言,最值得继续关注的是:

  • 100 万 token 输出在实际开发中的稳定性;
  • 网络安全场景的安全边界;
  • 开放后的真实价格与速率限制;
  • 第三方评测能否复现厂商公布的领先结果。
评论

请登录后发表观点

暂无数据