Gemini 4新模型曝光!内部口碑直逼Opus 5.5,谷歌已实现RSI?

来源:凤凰网 #Google# #Argon# #Carbon#
1322

就在 Argon 还未向大多数人打开门的时候,Business Insider 的记者已经找到了更新的东西。

据报道,Google 内部员工正在通过 Jetski(内部编程平台 Antigravity 的另一个称呼)测试一个名为 Carbon 的 Gemini 4 新检查点(checkpoint),消息来源包括多份内部文件与截图。

内部员工在测试后的感受是:Carbon 的编程体验「感觉像是 Opus 5.5」。

Claude Opus 5.5 是目前第一梯队的编程模型,尤其擅长大型项目开发、复杂代码修改、Bug 排查和长时间自主编程,某些测试甚至超过了 Fable 5.1。

同时 Antigravity 近期还披露了一个此前代号为「Concierge」的功能,如今更名为「Chief of Staff」,一个具有自主任务委派能力的 agent 系统。

上一代还没用上,新一代已经进入视野

十天前,Google 发布 Argon,希望它处理持续时间更长、步骤更复杂的工作,包括软件工程、法律与金融领域的知识任务,以及网络安全防御。

它已经通过 Fairwind Program 向经过筛选的安全合作伙伴开放。面向更广泛开发者和消费者的发布则采取分阶段方式,Google 表示,付费 API 客户和 Google AI Ultra 订阅者会是后续开放的优先人群,但没有给出确切日期。

Google 对外解释了这个节奏的原因。具备较强漏洞发现、验证和修复能力的模型,也可能增加滥用风险;公司需要在安全测试、外部评估和防护机制之间留出时间。

不过,现在看来,Argon 的开放时间可能就在这几天。

长期跟踪应用更新的 TestingCatalog 发现,Antigravity 的测试版本中出现了 Gemini 4 Argon 的选择入口,以及 256K、512K、900K 等上下文配置。后两档被标注为消耗更多使用额度,约为普通配置的 1.3 倍和 1.8 倍。

10 月 9 日前后,《Business Insider》记者 Hugh Langley 报道,Google 员工近来在名为 Jetski 的内部编程环境中试用新的 Gemini 4 检查点。内部文件出现了 Argon、Barium、Carbon 等多个代号,其中被选作公开版 Argon 的,实际是一个叫作 Barium-B 的内部版本。

Carbon 可能成为 Argon 的后续更新,也可能在 Gemini 4 家族里以另一种身份出现,甚至有可能始终留在内部。

报道中有内部员工说,Carbon 的编程表现让他想起 Opus 5.5。早期 Argon 虽然总体受到内部欢迎,仍有测试者觉得它在某些编码任务上落后于 Claude Opus 5。

据官方基准数据,Argon 在综合智能指数与知识工作榜单中名列前茅,幻觉率大幅降低,在部分网络安全与推理测试上超越了主要竞争对手,但也在 FrontierSWE v2、Terminal-bench 等几个编程评测项目上落后于领先者。

随着 Carbon 的曝光,我们也隐约参透了 Google 命名新模型的规律。

Argon 是元素周期表中的第 18 号元素,一种无色无味的惰性气体,化学上几乎不与任何物质反应。Barium 是第 56 号碱土金属,Carbon 是第 6 号、几乎一切有机生命的基础。

据此推断,下一个检查点的代号很可能是 Dysprosium,元素符号 Dy,原子序数 66,一种镧系金属,名字来源于希腊语中「难以得到」的意思——发现者当年花了 30 次尝试,才最终将它从混合矿物中分离出来。

Google 正在用自己的模型来设计和调试下一代模型?

Argon 9 月底刚刚公布,十月上旬又有内部新版本的消息。我们还无法判断这些检查点之间相隔多少训练周期,更无法推断 Carbon 必然采用了全新架构。

即便如此,Google 同时准备公开发布与内部升级的状态,仍让我们想知道:模型进步正如何反过来改变模型自身的开发方式?

路透社 8 月谈及 Google 人事与研发调整时提到,联合创始人 Sergey Brin 对递归自我改进抱有浓厚兴趣,并推动资源向相关方向倾斜。

到了 9 月,Google 研究人员公开了《RRSI:Regularized Recursive Self-Improvement of Agent Harnesses》。

论文的核心论点是,递归自我改进不必发生在基础模型训练层面,而可以在 Agent 系统层面实现——在冻结基础模型的前提下,通过迭代优化 prompt 设计、控制流、工具选用、记忆机制和上下文管理策略,系统可以持续提升在具体任务上的表现。

有人猜测,Google 正在用自己的模型来设计和调试下一代模型。如果 Google 的模型真的已经在某种程度上开始加速自身迭代,那就能解释为何从 Argon 宣布到 Carbon 内测泄露,前后不过十天。

说回 Carbon 的下一步,Google 可能选择在 Argon 公测后悄然替换内部检查点,让用户感受到持续改善;也可能把它整理成更明确的 Gemini 4 版本,单独发布性能、价格与安全说明。如果公开测试发现它的收益不足以抵消推理成本或风险,它也可能停留在实验阶段。

对于 Google 而言,Carbon 即使最终没有成为商品,也可能是一个有价值的中间结果。

Gemini 3 的推出让 Google 一度追赶上了前沿,但结构性问题的惯性很快让进展放缓,这个起伏在过去一两年里重复了不止一次。

前沿模型的竞争,越来越难由单次发布来概括。

「最强」这个定语,在这个行业里的保鲜期,也已经越来越短。

责编: 集小微
来源:凤凰网 #Google# #Argon# #Carbon#
THE END
关闭
加载

PDF 加载中...