导语
本期《十字路口》邀请到了生数科技的张金涛,他是Vidu S1实时交互视频生成模型的核心负责人。Vidu S1允许用户上传一张图片并选择声音,即可像视频通话一样与该角色进行无限时长的实时语音交互,模型会根据语音指令实时生成角色的表情、动作和肢体语言。张金涛在访谈中深入浅出地剖析了实现这一效果背后的技术挑战,从底层的推理加速算子到上层的模型与集群优化,揭示了如何让视频生成“快到世界能实时生成”。他还分享了对中美视频生成技术差异的观察、AI创业的思考,以及作为团队负责人的管理哲学。
本期访谈中,生数科技张金涛分享了其团队最新发布的Vidu S1实时交互视频生成模型。该模型通过全链路优化,实现了540P/25帧的实时生成与无限长交互,用户可通过语音实时控制虚拟角色。张金涛详细阐述了从底层算子加速(CelerAttention)到模型复杂度压缩(Turbo Diffusion),再到集群调度优化的技术路径,并探讨了推理加速的未来方向、中国视频生成领域的数据优势,以及AI创业与团队管理的心得。

本期《十字路口》邀请到了生数科技的张金涛,他是Vidu S1实时交互视频生成模型的核心负责人。Vidu S1允许用户上传一张图片并选择声音,即可像视频通话一样与该角色进行无限时长的实时语音交互,模型会根据语音指令实时生成角色的表情、动作和肢体语言。张金涛在访谈中深入浅出地剖析了实现这一效果背后的技术挑战,从底层的推理加速算子到上层的模型与集群优化,揭示了如何让视频生成“快到世界能实时生成”。他还分享了对中美视频生成技术差异的观察、AI创业的思考,以及作为团队负责人的管理哲学。
展开「深读」看每一段讨论的问题与论据。
讨论的问题:Vidu S1模型是什么?它有什么核心功能?
论据 / 案例:Vidu S1是实时交互视频生成模型,支持540P分辨率与25帧实时生成,支持长时间流畅对话交互。
讨论的问题:从CAttention到Vidu S1,推理加速技术经历了哪些关键阶段?
论据 / 案例:CAttention成为NVIDIA、AMD、华为昇腾等硬件厂商及多模态公司的事实标准;TurboDiffusion获得3600+GitHub Star。
讨论的问题:实现高质量流式视频生成的核心技术挑战与Trade-off是什么?
论据 / 案例:目前基础模型最长只能生成30秒视频,而Vidu S1可实现无限长生成。
讨论的问题:实时交互视频生成的未来应用场景和市场需求有多大?
论据 / 案例:用户案例:上传宠物照片与AI小狗聊天;右侧1/4屏幕显示二次元角色陪玩游戏。
讨论的问题:推理加速技术的未来发展方向和核心突破点在哪里?
论据 / 案例:提及硬件定制思路:根据模型是Memory-bound还是Compute-bound,调整芯片架构。
讨论的问题:为什么中国在AI视频生成领域形成了显著优势?
论据 / 案例:类比:好的数据像优秀的科学讲解,10分钟顶看差博客3小时。
讨论的问题:如何看待当前教授/PhD的AI创业热潮?如何管理团队追求卓越?
论据 / 案例:引用朱军老师观点:把每个环节都做到极致就能实现世界领先。
讨论的问题:个人成长经历中,哪些因素塑造了当前的研究与管理风格?
论据 / 案例:CAttention实现后,替换一行代码即让视频生成推理速度直接快一倍多。