Copied


xAI扩展Grok Imagine Video 1.5,支持文本、图像和语音输入

realtime news   Aug 01, 2026 01:00 1 Min Read


xAI宣布对其Grok Imagine Video 1.5模型进行重大升级,引入了对文本、图像和语音参考的支持,以及原生1080p视频生成功能。这些功能旨在巩固xAI在日益竞争激烈的AI视频市场中的地位。该模型已经凭借其先进的运动连贯性、音频同步能力和快速生成速度处于领先地位。

新增的多模态功能允许用户通过结合文本提示、图像和语音样本等元素来创建视频。例如,用户可以上传一个角色的照片和语音,确保在场景之间保持相同的面孔和声音。一项多参考支持功能允许用户锁定多达七个元素(如面孔、地点或物体),提供更精细的创意控制。这些更新已在grok.com/imagine、xAI的iOS和Android应用程序以及xAI API中上线。

文本生成视频和原生1080p

此次升级的一个亮点是文本生成视频功能,用户可以通过描述一个场景直接从提示生成视频,而无需初始图像。结合原生1080p分辨率,该功能将Grok Imagine Video 1.5定位为电影制作者、营销人员和开发者寻求高质量输出的工具。这两项功能现已在各个平台上全面提供。

竞争市场地位

自2026年5月31日推出以来,Grok Imagine Video 1.5对xAI来说是一个重要的进步。该模型在发布后即登上了Image-to-Video Arena排行榜的榜首,以1473的Elo得分超越了Google Veo和其他竞争对手。其生成同步音频、提升运动逼真性以及更快的生产速度的能力,已经使其成为创意专业人士的首选。

这些进步是在AI视频生成领域竞争日益激烈的背景下取得的,Google、OpenAI等公司正在争夺市场份额。然而,xAI策略性地将其API访问定价低于同类产品,为需要可扩展工具的开发者提供了一个有吸引力的选项。

语音一致性和API可用性

全新的语音参考功能确保角色在场景之间保持一致的语音,为真实感增添了新的层次。虽然该功能目前仅供API用户按需使用,但文本生成视频和图像参考功能已集成至xAI API中。这些更新使Grok Imagine Video 1.5成为一个引人注目的生产就绪解决方案,特别适合需要详细内容定制的行业。

通过这些增强功能,xAI继续推动AI生成视频的边界,旨在占据快速增长市场中更大的份额。多参考和语音一致性等高级功能的早期访问可能会吸引企业客户和寻求高质量、灵活解决方案的个人创作者。

感兴趣的用户可以在xAI的网络和移动平台上体验升级后的模型,更广泛的发布预计将在未来几天内完成。


Read More