🎯 情报来源:量子位
字节跳动商业化技术团队在NeurIPS’25上提出的InfinityStar方法,首次以自回归模型在VBench上超越扩散模型,实现了视频生成速度与质量的突破。该方法在单张GPU上生成5秒720p视频仅需不到1分钟,比主流DiT方法快10倍,同时支持文生图、文生视频、图生视频及交互式长视频生成等多样化任务。
InfinityStar通过时空金字塔建模和优化的时空自回归Transformer架构,实现了静态外观与动态信息的解耦,显著提升了生成效率。实验数据显示,其在文生图和文生视频任务中均超越现有基于DiT的方法,并在人类偏好评估中展现出指令遵循优势。
💡 核心要点
- 单GPU生成5秒720p视频仅需1分钟,比DiT快10倍
- 首个在VBench超越扩散模型的自回归视频生成器
- 支持文生图、文生视频、图生视频及交互式长视频生成
- 在人类偏好评估中优于HunyuanVideo-13B
- 论文、代码及体验已全面开源
📌 情报分析
技术价值:极高 – 时空金字塔建模和优化的自回归Transformer架构解决了视频生成中的效率瓶颈,实现了数量级的速度提升。
商业价值:高 – 低硬件要求和多样化任务支持使其在短视频、广告制作等领域具有广泛应用潜力。
趋势预测:高 – 自回归模型在视频生成领域的突破可能引发新一轮技术路线竞争,推动行业向更高效的生成方式转变。
