
谷歌的 Veo 3 视频生成模型现已通过 Gemini API 开放使用,其定价使其跻身 AI 视频领域较高端选项之列。
Gemini API 集成主要面向希望在自有应用中引入高级视频生成功能或构建生产就绪原型的开发者。目前该 API 仅支持文本生成视频,但已在 Gemini 应用中实现的图像生成视频功能即将推出。Veo 3 是谷歌首个能通过单一文本提示生成高清视频并同步音频的模型,可一次性创建画面、对话、音乐和音效。
为帮助开发者快速上手,Google AI Studio 提供了 SDK 模板和入门应用用于快速原型开发。使用需关联已启用结算功能的 Google Cloud 项目。 谷歌表示 Veo 3 模型已在 Gemini 应用、Flow 和 Vertex AI 平台被调用数百万次。
含音频视频每秒钟0.75美元
通过 Gemini API 使用 Veo 3 仅限于 Google Cloud 付费层级。16:9 格式的 720p/24fps 含音频视频定价为每秒 0.75 美元—— 比无声版的 Veo 2 贵 25 美分 。谷歌还宣布了速度更快、价格更低的”Veo 3 快速模式 “,但该模式暂未开放 API 接入。
按当前费率计算,8秒视频需6美元,5分钟视频则需225美元。由于生成理想效果通常需要多次尝试,成本可能急剧攀升。例如若需生成10倍素材量才能获得5分钟可用视频,总成本可能高达2250美元。不过谷歌可能认为,对于某些使用场景而言,这仍比传统视频制作方式更经济。
现实应用案例
谷歌表示 Cartwheel 项目利用 Veo 3 技术将 2D 视频转化为逼真的 3D 角色动画,通过将生成的动作映射到骨骼绑定模型上来完成客户项目。