Google DeepMind 发布 Gemini 4 Argon,输出上限提至 1M tokens
原文标题:震撼,Gemini 4 发布,连 Opus 5.5 都被干掉了!
Google DeepMind 发布 Gemini 4 Argon,单次输出上限从 64K 提升到 1M tokens,主打长任务与多步骤推理。
汇总了 Gemini 4 Argon 的官方评测数据与 Google 内部落地案例,可对照各家旗舰模型的能力差异。
昨天我还在某知名社交平台说有一些朋友用 Antigravity 中的 Gemini-3.8 Flash 大概率被路由到 Gemini 4 的消息,果不其然今天就来了。
而我,刚刚在群里跟大家说要囤 Gemini 和把 Antigravity 下回来。
就在刚刚, Google DeepMind 宣布了 Gemini 4 Argon 来了。
几个重点的数据:单次输出上限从 64K 拉到 1M tokens,推理能力大大增强,适合解决长任务、多步骤问题。这里的 1M,官方说的是输出上线。
而且看测评数据,Gemini 4 Argon 基本上是把所有模型都干掉了。
下面来看一下详细的测评数据。
图源:Google DeepMind 官方测评表。
在知识性工作这块。Vals Index 把金融、编程、法律和税务任务按经济权重汇总,Argon 拿到 68.9%,Opus 5.5 是 67.0%,GPT-6 Astra 是 63.1%。Argon 排在第一。
金融任务的差距更明显。Vals Finance Agent v2 测的是多步骤金融研究,Argon 65.4%,Astra 53.5%,Opus 5.5 是 58.6%。法律任务里,Harvey 的测试分别是 19.6%、5.4% 和 3.8%。这两项,Argon 都把两家旗舰超过了。
长上下文这一项,我感觉更有冲击力。 GraphWalks 在 256K 到 1M tokens 这一档,Argon 是 84.2%,Astra 是 71.8%,Opus 5.5 是 66.8%。分别高了 12.4 和 17.4 个百分点。
写代码也有亮点。DeepSWE v1.1 测的是长任务的软件工程能力,Argon 77.9%,Astra 74.1%,Opus 5.5 是 74.2%。Vibe Code Bench 则拿到了 91.9%,也超过了表里另外三个模型。多模态里的长视频理解 LVBench,Argon 同样领先,91.7%,Astra 87.5%,Opus 5.5 是 83.7%。
同样是编程,FrontierSWE v2 里,Argon 55.0%,Astra 65.5%,Opus 5.5 是 62.3%;Terminal-Bench 4.0 里,Opus 5.5 拿到 66.4%,Argon 是 57.4%。电脑操作的 OSWorld-2.0 离线子集,Astra 72.6%,也高于 Argon 的 69.2%。
再来看一下这张图,这张图是面向代码安全与漏洞修复能力的 CWE-bench v1 榜单:
在这个榜单里,Gemini 4 Argon 直接拿到了 68% 的 Pass@1 成绩,与 Grok 4.7、GPT-6 Astra 并列榜首,小幅领先 Claude Opus 5.5(67%),并且大幅甩开 Claude Fable 5.1(58%)和 GPT-6 Sol(52%)。
注意看这里 Gemini 4 跑测试用的 harness 正是 Antigravity。配合专属 Agent 架构,Argon 在复杂软件工程与代码漏洞修补上的综合能力稳居第一梯队。
除了代码评测,还有一张关于安全防御能力的图——Gray Swan IPI(间接提示词注入攻击防御测试,得分越低代表越安全、越难被攻破):
在经历 15 轮攻防尝试(k=15)下,Gemini 4 Argon 的攻击被攻破率仅为 0.7%,全场最低,稳居第一!
作为对比,Claude Opus 5.5 和 Fable 5.1 是 1.0%,上一代 Gemini 3.8 Flash 是 5.5%,而 GPT-6 Astra 和 GPT-6 Sol 的被攻破率分别达到了 8.5% 和 10.1%,开源和其它模型甚至到了 30% ~ 50% 以上。面对复杂的间接注入攻击,Gemini 4 Argon 这个防御表现可以说是断层领先。
而且官方这次披露了 Gemini 4 Argon 在 Google 内部的真实落地案例。目前它已经深入到数千名 Googler 的日常内部工作流中,而且官方直接列举了三个相当硬核的实际工程场景:
1. 量子算法优化: Argon 帮助 Google 的量子计算研究人员优化子程序的时空开销(qubits × gates,量子比特 × 量子门操作),直接攻坚关键瓶颈。在其中一个案例里,仅用了几分钟就将已发表的学术 baseline 性能提升了 40%。
2. 数据中心集群内存优化: 由 Argon 组成的智能体团队,自主分析了 Google 全机房范围的 Profiling 遥测数据,自动识别出内存优化点并实施。一经推行就直接为数据中心释放了 超过 300 TiB 的内存,预计最终能省下 500 TiB 到 1 PiB 的内存资源。
3. 超大规模代码库向 Rust 迁移与优化: Argon 智能体正在挑起把 Google 内部海量 C/C++ 代码迁移到 Rust 的重任。
• 迁移规模从小到数万行的核心基础库,一直拓展到 Fuchsia 操作系统的 Zircon 微内核(整整 80 万+ 行代码)!为了确保极端严苛的系统可靠性,这些迁移方案都经过了自动化审计、人工审核与仿真模拟测试。
• 官方特别提到了开源视频解码库 libgav1 的例子:Argon agents 接手了原有的 Rust 移植版,通过多轮基于 Profile 的实验与编译输出分析,成功替换了 3.2 万行手写的 SIMD 向量化汇编,重写出能被编译器自动向量化的高效 Safe Rust 代码。最终让内存安全的 Rust 解码器运行速度提升了 2.7 倍,输出画面像素级一致,性能极大逼近了极致优化的 C++。
不再是只在排行榜上刷个跑分,而是能直接下场去帮机房省上百 TiB 内存、迁移 80 万行的操作系统微内核,这种工业级的 Agent 落地能力才是真正的核弹。
不过官宣之后还没有向普通用户全面开放,目前先通过 Fairwind Program 给一批受信任的网络安全防御团队使用。
难道像之前 Fable 5 和 Astra 6 一样?因为能力太强不受控,所以先给一部分安全团队来使用?
来源:cxuanAI · mp.weixin.qq.com