在OpenAI和Anthropic持续推出新一代前沿模型之际,Google正式发布全新旗舰级人工智能模型Gemini 4 Argon,希望凭借更强的长程推理能力和更具竞争力的价格重新参与高端模型市场竞争。

Google将Gemini 4 Argon定位为面向复杂长期任务的前沿模型,重点覆盖软件开发、企业知识工作以及网络安全防御等领域。不过,该模型目前尚未向公众全面开放,而是优先提供给参与GoogleFairwind计划的部分网络安全防御组织进行测试,同时继续开展额外的安全评估工作。
与此前的Gemini系列相比,Argon最重要的升级之一是输出能力的大幅提升。Google将单次最大输出长度从此前的6.4万个Token提升至100万个Token。这意味着模型能够在单轮任务中完成更长时间的推理过程,执行复杂的软件工程项目、研究任务以及大规模工作流处理,而无需频繁中断并重新启动任务。
在性能方面,Google公布的多项基准测试结果显示,Gemini 4 Argon在多个关键领域超过了OpenAI的GPT-6 Astra以及Anthropic的Claude Opus 5.5。其中,在衡量长周期软件工程能力的DeepSWE v1.1测试中,Argon取得77.9%的成绩;在Zapier AutomationBench自动化任务基准测试中得分51.3%;在长视频理解能力测试LVBench中获得91.7%的成绩。

Google还表示,Argon在评估金融、法律、税务以及软件开发等实际经济活动能力的Vals Index测试中同样位居领先位置。根据官方公布的数据,该模型在多项重要AI基准测试中的表现优于GPT-6 Astra和Claude Opus 5.5。
除了外部测试成绩之外,Google透露Argon已经在公司内部投入实际使用。数千名员工正在利用该模型完成编程、研究和文档撰写等工作。Google列举的应用案例包括量子算法优化、数据中心内存资源优化以及将大型C和C++代码库迁移至Rust语言等工程项目。

网络安全是Argon重点强化的方向之一。Google表示,该模型能够自主识别、验证并修复软件漏洞。Google旗下Wiz安全团队已经通过“Scan for Good”计划使用Argon执行安全研究任务。在用于评估漏洞修复能力的CWE-bench v1测试中,Argon取得68%的成绩,与行业最佳水平并列。
为了增强市场竞争力,Google此次采取了明显更激进的定价策略。Gemini 4 Argon的初始价格为每100万个输入Token收费2美元,每100万个输出Token收费10美元。对于缓存输入内容,Google还提供95%的折扣优惠。相比之下,该定价明显低于目前部分高端竞争模型的收费水平。
尽管性能和价格均展现出较强竞争力,但Google此次选择谨慎推进部署节奏。公司表示,在完成更多安全测试和验证之前,Gemini 4 Argon将继续以有限范围方式提供服务,后续更广泛开放的时间表尚未公布。