字节InfinityStar突破视频生成瓶颈:单GPU一分钟生成5秒720p视频,比DiT快10倍

🎯 情报来源:量子位

字节跳动商业化技术团队在NeurIPS’25上提出的InfinityStar方法,首次以自回归模型在VBench上超越扩散模型,实现了视频生成速度与质量的突破。该方法在单张GPU上生成5秒720p视频仅需不到1分钟,比主流DiT方法快10倍,同时支持文生图、文生视频、图生视频及交互式长视频生成等多样化任务。

InfinityStar通过时空金字塔建模和优化的时空自回归Transformer架构,实现了静态外观与动态信息的解耦,显著提升了生成效率。实验数据显示,其在文生图和文生视频任务中均超越现有基于DiT的方法,并在人类偏好评估中展现出指令遵循优势。

💡 核心要点

  • 单GPU生成5秒720p视频仅需1分钟,比DiT快10倍
  • 首个在VBench超越扩散模型的自回归视频生成器
  • 支持文生图、文生视频、图生视频及交互式长视频生成
  • 在人类偏好评估中优于HunyuanVideo-13B
  • 论文、代码及体验已全面开源

📌 情报分析

技术价值:极高 – 时空金字塔建模和优化的自回归Transformer架构解决了视频生成中的效率瓶颈,实现了数量级的速度提升。

商业价值:高 – 低硬件要求和多样化任务支持使其在短视频、广告制作等领域具有广泛应用潜力。

趋势预测:高 – 自回归模型在视频生成领域的突破可能引发新一轮技术路线竞争,推动行业向更高效的生成方式转变。

原文连接

0 条回复 A文章作者 M管理员
    暂无讨论,说说你的看法吧
个人中心
今日签到
有新私信 私信列表
搜索