谷歌正式推出新一代旗舰模型 Gemini 4 Argon。
在官方跑分表里,谷歌把 Argon 与 OpenAI 的 GPT-6 Astra、Anthropic 的 Claude Fable 5.1 和 Claude Opus 5.5 放在一起比较,但定价只落在 GPT-6.1 Sol 与 Opus 5.5 那一档。
普通用户和开发者眼下还用不到它。第一批拿到访问权限的,是谷歌 Fairwind 计划中的网络安全防御人员。
谷歌表示会分阶段放开,并参与美国政府的模型发布前自愿审查流程——即正式发布之前先让政府接触模型。此后的开放顺序是先给付费 API 客户与 Google AI Ultra 订阅用户,再轮到普通消费者,具体日期尚未公布。
首发优惠价为每百万输入 token 2 美元、每百万输出 token 10 美元,与 GPT-6.1 Sol 完全一致。优惠期结束后调整为 4 美元和 20 美元,与 Claude Opus 5.5 相同。
GPT-6 Astra 与 Claude Fable 5.1 的定价均为 10 美元和 50 美元。也就是说,即便按恢复后的原价计算,Argon 的成本也只有这两者的五分之一。命中缓存的输入按原价的 5% 计费,这一项同样与 Sol、Opus 5.5 持平。token 是模型计量文字量的单位,一百万 token 大致相当于 75 万个英文单词。
规格层面变化最大的是输出上限:单次最多可输出 100 万 token,而上一代只有 6.4 万。
GPT-6 Astra、GPT-6.1 Sol、Claude Fable 5.1 和 Opus 5.5 目前均为 12.8 万,Argon 接近它们的 8 倍。
按照谷歌的说法,该模型可以在一次任务中连续思考、生成几十万 token,难题不必再拆成很多轮处理。
谷歌称已有数千名员工在日常工作中使用它,并给出几个内部案例:
- 量子计算团队用它优化量子算法的资源消耗(量子比特数乘以门操作数),其中一个例子在几分钟内就比已发表的基准方案好 40%。
- 一组 Argon 智能体分析谷歌数据中心的内存使用数据,自动定位并应用优化,已释放超过 300 TiB 内存;谷歌估算总共可省下 500 TiB 到 1 PiB。
- Argon 智能体正在把谷歌的 C/C++ 代码迁移到 Rust。Rust 是一种从语言层面规避大部分内存安全漏洞的编程语言。迁移规模从几万行的基础库到 80 多万行的 Fuchsia 系统 Zircon 内核不等,上线前均需通过自动与人工审核、测试。在视频解码库 libgav1 的 Rust 版本中,智能体把 3.2 万行手写的底层加速代码替换为编译器可自动优化的安全 Rust 代码,速度达到原 Rust 版的 2.7 倍,解码画面完全一致。
谷歌的对比表共 19 项测试,Argon 拿下 13 项第一、1 项与 Astra 并列第一,另有 5 项落后。以下分数均由谷歌公布,顺序为 Argon、Astra、Fable 5.1、Opus 5.5。
领先幅度最明显的是专业工作。Harvey 的法律智能体测试考察法律检索与文书起草,Argon 为 19.6%,其余三家分别是 5.4%、6.7%、3.8%。金融研究测试 Vals Finance Agent v2 中,Argon 为 65.4%,对手为 53.5%、58.9%、58.6%。Zapier 的 AutomationBench 考察从头到尾完成企业业务流程,Argon 为 51.3%,对手为 41.4%、31.4%、42.5%。在按美国 GDP 加权、覆盖金融编程法律税务的综合榜 Vals Index 上差距收窄,为 68.9% 对 63.1%、65.8%、67.0%。
超长材料同样是强项。GraphWalks 测量模型在长文本中追踪信息之间关系的能力,当材料长度在 25.6 万至 100 万 token 区间时,Argon 为 84.2%,其他三家为 71.8%、65.0%、66.8%。长视频理解 LVBench 上 Argon 为 91.7%,对手为 87.5%、79.7%、83.7%。
编程方面有输有赢。考察长流程真实软件工程任务的 DeepSWE v1.1 上,Argon 为 77.9%,对手为 74.1%、67.4%、74.2%。但另一项软件工程测试 FrontierSWE v2 中,Argon 仅 55.0%,在四家中垫底,Astra 以 65.5% 居首。考察命令行操作的 Terminal-bench 4.0 上,Argon 为 57.4%,同样四家最低,Opus 5.5 以 66.4% 领先。
另外三项落后的测试:机器学习工程 PostTrainBench 由 Opus 5.5 领先(49.3% 对 Argon 45.3%);科学计算 Terminal-Bench Science 由 Astra 领先(68.1% 对 57.6%);操作电脑的 OSWorld-2.0 也是 Astra 第一(72.6% 对 69.2%),该表中未列出 Claude 的分数。
网络安全是本次发布的重点。谷歌专门针对安全防御训练 Argon:自动发现漏洞、验证漏洞、修补漏洞。提供给受信任防御人员与谷歌内部团队的版本不设网络安全方面的限制,可以调用全部能力。
安全公司 Wiz 已在旗下免费公益项目 Scan for Good 中使用 Argon。据谷歌介绍,Argon 在一款全球医院使用的医疗软件中发现了一个严重漏洞,该漏洞可能泄露敏感个人信息,而此前的前沿模型均未发现。在测试漏洞修复能力的 CWE-bench v1 上,Argon 与 GPT-6 Astra 同为 68%,并列第一,Opus 5.5 为 67%,Fable 5.1 为 58%。谷歌称,其漏洞发现能力较上一代安全专用模型 3.8 Flash Cyber 有明显提升。
在大范围开放之前,谷歌列出了四项安全措施:
- 拒绝协助网络攻击以及化学、生物、放射性、核武器方面的有害请求,并通过监测模型内部的激活状态来识别滥用。
- 防提示词注入,即有人在网页或文件中藏入恶意指令以劫持模型。谷歌称 Argon 在 Gray Swan 的间接提示词注入测试中处于领先。
- 监控模型的思考过程与实际操作,一旦发现其做出超出用户意图的事就中止执行。训练阶段也有同类监控,谷歌称并未把监控结果回用于训练,以免模型学会规避监控。
- 在高风险训练与测试开始前,把运行模型的沙箱环境隔离封闭。
官方博客:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/?utm_source=tw&utm_medium=social&utm_campaign=og
评论 共 0 条
正在加载…
还没有评论,来说两句吧。
先起个昵称
昵称只保存在你自己的浏览器里,用来显示你的评论与留言,不需要注册。
昵称需要 2 - 20 个字符。