Google 内部对 Gemini 4 信心不足:基准分数亮眼,真实编码任务吃力
“Google Grapples With Employee Skepticism About New Gemini 4”
Google开始向少数安全合作伙伴推送旗舰模型Gemini 4 Argon,称其在多项基准测试中领先,包括在安全技能测试上超过OpenAI的Astra,后续将先向付费订阅者开放。但多名能直接接触该项目的内部人士称,基准分数没有反映真实使用表现:Gemini 4在实际编码任务中表现不稳定,尤其不擅长前端设计,而前端能力直接决定应用和网站的观感,这恰是Google在AI编码工具市场一直难以突破的领域。模型体量也很大,意味着推理成本高,可能挤压利润率。Google否认编码等方向表现不佳,DeepMind负责人Koray Kavukcuoglu表示对团队有充分信任,并称公司会始终处于前沿。内部意见并不统一:一部分员工认为Anthropic的Fable和OpenAI的Astra进步更快,Gemini 4即便发挥最好也会在某些领域落后;另一部分人认为新版本已经追平领先实验室。此前Google在5月I/O大会宣布Gemini 3.5 Pro并承诺6月发布,最终放弃,据Bloomberg Intelligence分析师Mandeep Singh估算,这类模型的单次训练成本可高达4亿美元。专家把问题归因于「benchmaxxing」——工程师为拿高分而优化,而非做出好用的产品。Gemini 4的优势在于处理视频元数据等非文本输入,以及安全、网络安全和表达自然度。Google称该模型面向软件工程、金融、法律和网络安全的长复杂任务,单次可输出最多100万token(约75万词)。
- Gemini 4在公开基准测试上领先,但内部人士称其真实编码任务表现不稳定。
- Google放弃了原定6月发布的Gemini 3.5 Pro,单次训练成本可达4亿美元。
- Gemini 4不擅长前端设计,而这是Google在AI编码工具市场追赶对手的关键短板。
- 模型体量过大导致推理成本高,可能对Google利润率形成压力。
- 专家将问题归因于benchmaxxing:实验室为分数优化,而非为可用产品优化。
- 文章未提供第三方独立评测数据,无法判断内部人士说法与Google官方否认哪一方更接近事实。
- 未讨论Gemini 4在Google自有产品(Search、Maps、Gmail、Chrome)中的实际部署效果与用户反馈。
- 未评估OpenAI与Anthropic在编码agent上的产品化进展对Google分发优势的实际侵蚀速度。
- 评估模型能力时,应把公开benchmark与真实工作流表现分开看,benchmaxxing意味着排行榜领先不等于工程可用,选型时要跑自己的任务集。
- Google的案例说明,拥有十亿级用户的分发优势并不能自动转化为模型竞争力,产品团队需要判断底层模型能力是否足以支撑功能承诺。
- 训练成本4亿美元、模型体量推高推理成本这类数字,是判断大模型商业模式可持续性和定价空间的关键输入,值得纳入对AI公司长期盈利能力的分析。