标签:多模态模型
共 2 篇相关访谈。
P
语音识别远未解决:Mistral音频研究负责人谈技术前沿
Mistral音频研究负责人Pavan Muddireddy分享了公司全栈AI战略下的音频模型开发。他探讨了从音频理解到语音生成的端到端方法,解释了流式与批处理模型的权衡,介绍了基于连续潜变量和流匹配的TTS架构创新,并深入分析了说话人分离、抗噪性及消除模型幻觉等关键挑战。
PPavan Muddireddy音频研究负责人

生数科技张金涛:Vidu S1如何实现无限长实时交互视频生成
本期访谈中,生数科技张金涛分享了其团队最新发布的Vidu S1实时交互视频生成模型。该模型通过全链路优化,实现了540P/25帧的实时生成与无限长交互,用户可通过语音实时控制虚拟角色。张金涛详细阐述了从底层算子加速(CelerAttention)到模型复杂度压缩(Turbo Diffusion),再到集群调度优化的技术路径,并探讨了推理加速的未来方向、中国视频生成领域的数据优势,以及AI创业与团队管理的心得。
J张金涛生数科技流式视频生成与推理部署负责人