Google Omni:任意输入到任意输出的AI模型实测
“Google’s new anything-to-anything AI model is wild”
1248 字
预计 5 分钟
中文摘要
Google发布Omni Flash模型,号称能实现任意输入到任意输出(照片、视频、文本互转),目前先聚焦视频生成。作者用孩子的毛绒玩具Buddy和自己做深度伪造测试。Omni相比Veo 3有改进:支持上传视频作为输入、角色一致性更好、文本编辑指令更有效。但结果参差不齐:部分视频很逼真,但仍有AI跳吓(如物体突然变形)、角色不一致(如Buddy时而有角时而没有)、编辑指令有时适得其反。作者用自拍视频生成自己吃意面、坐飞机、在埃菲尔铁塔前吃法棍的假视频,效果惊人——丈夫看了吃意面视频后完全没认出是AI,仅因碗不熟悉起疑。其他假视频足以在社交媒体上骗人。但成本不低:20美元/月的AI Pro计划含1000积分,生成一个视频15-40积分,一次编辑40积分,作者生成约20个视频后只剩145积分。作者感叹AI视频生成进步迅速,但离“电影级杰作”还有距离,目前处于恐怖谷深处。
核心论点
- Omni Flash模型支持视频+文本作为输入,生成更一致的角色和场景。
- AI视频生成工具进步显著,但仍有明显缺陷,如物体变形、角色不一致。
- 深度伪造视频逼真度极高,足以欺骗熟悉的人,引发对虚假信息传播的担忧。
- 使用成本较高,20美元/月的订阅计划仅能生成约20个视频,限制实际应用。
- AI视频生成仍处于恐怖谷阶段,离Google宣传的“电影级”效果有差距。
反方视角 / 盲点
- 文章未讨论Omni模型在开发者工具或API层面的可用性,对技术团队集成AI视频功能缺乏参考。
- 未涉及Google的AI安全措施或内容审核机制,深度伪造风险仅点到为止。
- 未与其他AI视频工具(如Runway、Pika)进行横向对比,难以评估Omni的相对优势。
对科技从业者的启示
- 对SaaS产品启发:AI视频生成成本高(20美元/月仅20个视频),意味着面向个人用户的订阅制可能难盈利,但面向企业的按需付费或积分制有空间
- 对浏览器扩展启发:可以考虑开发浏览器内AI视频编辑插件,利用Omni API(如果开放)提供快速生成短视频的功能,瞄准社交媒体内容创作者
- 对桌面应用启发:本地+云端混合方案,将AI视频生成作为增值功能,但需注意成本控制和用户体验(避免多次编辑消耗积分)