xAI 发布 Grok Imagine 1.5:图像转视频生成,支持 720p 分辨率
xAI 推出 grok-imagine-video-1.5-preview,可将静态图片和文本提示转化为 720p 电影级视频,并支持多片段拼接。了解该功能对中文用户的使用门槛、国产替代方案及实际应用场景。
一句话看懂
xAI 发布 Grok Imagine 1.5 图像转视频模型,支持 720p 输出,可拼接多片段生成更长视频。
详细发生了什么
xAI 于 2026 年 6 月 4 日发布了 “grok-imagine-video-1.5-preview”,这是一个图像到视频的生成模型。用户只需提供一张静态图片和一段文本提示,模型就能生成最高 720p 分辨率的电影风格视频。此外,该模型支持将多个视频片段拼接在一起,形成更长的连续场景。
这一更新是 Grok Imagine 系列的重大升级,此前版本主要专注于图像生成。新模型在视频生成领域直接对标 OpenAI 的 Sora 和 Runway Gen-3,但强调从图像出发的创作路径。目前该模型以预览形式提供,具体定价和 API 访问细节尚未完全公开。
中文圈视角
对于中文用户,Grok Imagine 1.5 的使用门槛较高:需要访问 xAI 平台,通常需要网络工具。不过,国内已有类似产品,例如字节跳动的 Dreamina 和腾讯的混元视频生成模型,均支持图像转视频功能,且无需额外网络配置。
在应用场景上,该功能对短视频创作者、广告设计师和游戏原画师尤为实用——可以将概念图快速转化为动态预览。但需注意,生成内容可能涉及版权问题,尤其是使用他人图片作为输入时。
目前中文社区对此讨论较少,一个盲点是:xAI 模型在中文语义理解上的表现可能不如国产模型,因为训练数据中中文占比有限。如果用于生成中文文字或特定文化场景,效果可能打折扣。
几条值得记住的细节
- 模型名称:grok-imagine-video-1.5-preview,目前为预览版。
- 输出分辨率最高 720p,支持文本引导的视频风格控制。
- 支持多片段拼接,可制作更长视频,但具体时长限制未公布。
- 与 Grok 聊天机器人集成,用户可通过对话方式生成视频。
- 定价尚未明确,但 xAI 通常提供免费额度与付费订阅选项。
一句话总结
如果你需要将静态创意快速转化为视频,Grok Imagine 1.5 值得尝试,但国内用户可优先考虑国产平替方案。