Gemini 4终于来了!首款模型Argon发布,18项评测领先12项,优先开放给网络安全团队
Gemini 4 终于来了,但是目前大多数用户还无法使用。 当地时间 9 月 30 日,Google 正式发布Gemini 4 Argon。这是 Gemini 4 系列推出的首款旗舰模型,也是 Google 经过长时间研发后,首次对外推出这一代模型。 Gemini 的上一代旗舰模型 Gemini 3 系列还要追溯到 2025 年 11 月。此后,Google 主要更新的是 Flash 系列,因此,这次 Argon 的发布也成为 Google 几个月来在旗舰模型上的一次明确回应。 不过,Argon 暂时没有进入普通用户的 Gemini 界面。Google 首先将它开放给一批受信任的网络安全防御机构,通过受控早期访问项目 Fairwind 进行测试和使用。按照 Google 的说法,只有在安全护栏进一步完善后,Argon 才会逐步向开发者、企业和普通消费者开放。 Google 将 Argon 定位为面向复杂、长流程工作流的旗舰模型,重点覆盖软件工程、法律和金融等企业知识工作,以及网络安全防御。 相比上一代模型,Argon 的单次输出上限从 6.4 万 token 提升至 100 万 token。这意味着模型可以在一次任务中持续生成更长的推理和执行轨迹,在更少依赖人工中途接管的情况下,处理跨越多个步骤的复杂问题。对于需要持续分析、反复验证和长链条执行的任务,这种更长的输出空间也给模型留下了更大的推理余量。 目前,Google 已经在内部大规模使用 Argon。数千名员工正在利用它完成专项编程、深度研究和写作等任务。 在量子计算团队的一项测试中,研究人员此前遇到了一类时空资源开销较高的子程序。Google 使用qubits与 gates 的乘积衡量相关计算成本,Argon 在数分钟内找到了一种新的优化方案,相比此前公开发表的基线结果提升了 40%。 另一组 Argon 智能体则被用于分析 Google 数据中心集群的性能遥测数据,并自动识别和执行内存优化操作。Google 表示,相关方案全部部署后,已经能够释放超过 300 TiB 内存,预计最终可节省 500 TiB 至 1 PiB。 Argon 还被用于 Google 内部的大规模 C/C++ 向 Rust 迁移工作,覆盖了 re2、libgav1 等核心开源库,以及Fuchsia Zircon内核,涉及超过 80 万行代码。 其中一个较为具体的案例是 Google 的开源视频解码器 libgav1。Argon 智能体接手了一个已经存在的 Rust 移植版本,通过多轮性能分析、实验以及对编译器输出的研究,使用安全 Rust 重写了约 3.2 万行 SIMD 代码。最终版本在保持视频输出完全一致的情况下,相比此前的 Rust 移植版本提速 2.7 倍,性能接近经过优化的 C++ 实现,同时获得了 Rust 带来的内存安全优势。 除了编码,Argon 在多项企业任务评测中也取得了较高成绩。 在衡量真实长流程软件工程任务的 DeepSWE v1.1 上,Argon 得分为 77.9%。在 Vals Index 上,它同样处于领先位置。该指数覆盖金融、编程、法律和税务等知识工作,并按照各领域对美国 GDP 的贡献进行加权。 在评估多步骤金融研究能力的 Vals Finance Agent v2 上,Argon 也保持领先。在 Harvey 的法律智能体基准中,Argon 得分为 19.6%,相比之下,GPT-6 Astra 为 5.4%,Claude Opus 5.5 为 3.8%。 在Zapier的 AutomationBench 上,Argon 得分为 51.3%,Claude Opus 5.5 为 42.5%,GPT-6 Astra 为 41.4%。这一基准主要衡量模型能否端到端完成核心业务流程。在长视频理解基准 LVBench 上,Argon 得分为 91.7%。 按照 Google 公布的对比结果,在 18 项评测中,Argon 单独领先 12 项,另有 1 项并列第一;GPT-6 Astra 单独领先 3 项、并列领先 1 项;Claude Opus 5.5 单独领先 2 项。 从领先项目数量来看,Argon 的覆盖面最广,但它并不是在所有任务上都占据优势。例如,在 FrontierSWE v2 和 Terminal-Bench Science 0.1 上,Argon 分别落后 GPT-6 Astra 10.5 个百分点;在 Terminal-Bench 4.0 上,则落后 Claude Opus 5.5 9 个百分点。 这也意味着,当前前沿模型之间的竞争仍然非常接近。Argon 更明显的特点,不是某一项能力形成绝对领先,而是在软件工程、企业知识工作、自动化和多模态理解等多个方