谷歌 Gemini 4 Argon 在人工智能分析指数(Artificial Analysis Intelligence Index)中获得 53 分,已追平 OpenAI GPT-6 Astra,而且当前每项测试任务的运行成本还更低。
谷歌 DeepMind 于 9 月 30 日正式发布该模型。目前,仅有一小批受信任的网络安全专家能够率先体验。
Argon 助推谷歌重返全球三大 AI 实验室行列
独立评测机构 Artificial Analysis 指出,该成绩令谷歌重返全球顶尖三大 AI 实验室之列。Argon 评分还比 OpenAI 的 GPT-6.1 Sol(52 分)高出 1 分。
该模型的得分比上一代非 Flash 版本的 Gemini 3.1 Pro Preview 高出 23 分。此前 9 月,谷歌发布了 Gemini 3.8 Flash 以及针对网络安全场景的定制版。作对比,SpaceXAI 的 Grok 4.7 在同一指数上得分为 46。
Artificial Analysis 表示,Argon 能取得优异表现,主要得益于更少的幻觉现象以及更强的“智能体”(agentic)能力。在 AA-Omniscience 幻觉测试中,Argon 的幻觉率为 15%,而 Astra 高达 51%。不过 Argon 在相关问题的正确率为 50%,仍比 Astra 低 13 个百分点。
在智能体自动化能力方面,Argon 在 AutomationBench-AA 测试中取得 77.5% 的成绩,高于 Anthropic 的 Claude Sonnet 5.5(71.3%)。但在 Terminal Bench 4 指标上,Argon 仍落后于 Sonnet 5.5、Claude Opus 5.5 及 Astra。
Argon 上线享受限时优惠,测试成本更低
谷歌为 Argon 设定了首发优惠价:每 100 万输入 Token 收费 2 美元,每 100 万输出 Token 收费 10 美元。优惠期结束后,费用将分别涨至 4 美元和 20 美元。
按照折扣价计算,Artificial Analysis 测得 Argon 每次索引任务成本为 1.99 美元,而 Astra 为 3.26 美元。不过,在标准定价下,该数值上升至 3.98 美元,约为 Astra 的 1.2 倍。
成本降低主要得益于更低价的代币,因为 Argon 的代币消耗量更高。Argon 平均每项任务使用 62,000 个输出代币,而 Astra 平均为 27,000 个。此外,该模型的输出上限现已提升至 1,000,000 代币。
“为支持 Gemini 4 Argon 在更长、更复杂场景中的能力,我们大幅提升了模型的输出代币上限,从此前的 64,000 提升至业内领先的 1,000,000 代币。”团队表示。
网络安全防御者率先体验 Gemini 4 Argon
谷歌 CEO 桑达尔·皮查伊(Sundar Pichai)透露,谷歌内部各团队已在广泛使用 Argon,涵盖从代码开发到量子计算等多个领域。
“值得注意的是,Argon 拥有前沿级安全防护,我们正在负责任地推进部署——今天它已与美国政府合作,并通过我们的 Fairwind 计划优先交付给一批值得信赖的网络安全防御者。”他指出。
谷歌在发布公告中称,Argon 能够自主发现、验证并修复严重软件漏洞。因此,可信赖的安全团队与谷歌内部团队将获得无网络防护措施的完整版本。
在进一步开放后,付费 API 客户及 Google AI Ultra 订阅用户将获得优先体验。谷歌尚未披露届时是否仍有启动阶段的优惠价。
谷歌还表示,正在参与美国政府推动的自愿预发布访问流程。
欢迎订阅我们的 YouTube 频道,获取业界领袖与资深记者的深度解读
来源:BeInCrypto 中文 · 原文深度报道
