图像生成需要超越更大模型的新思路

高通技术副总裁Fatih Porikli在TWIML AI Podcast中指出,当前文本生成图像模型在追求逼真度的同时,仍面临可控性、正确性及边缘设备高效部署等核心挑战。他介绍了其团队在CVPR 2026上提出的多种解决方案,包括改进训练目标、分离场景规划与渲染、在边缘设备高效生成高分辨率图像以及消除AI图像编辑中的可见伪影等,为图像生成技术的下一阶段发展指明了方向。

导语

尽管文本生成图像模型在创造逼真图像方面已取得显著进步,但“逼真”并不意味着“正确”。当用户要求生成多个不同的人物、遵循特定构图,或是在本地设备上生成高分辨率图像时,当前的模型仍会暴露出令人意外的局限性。在本期TWIML AI播客中,高通技术副总裁Fatih Porikli深入探讨了图像生成领域尚未解决的核心问题,并分享了其团队在CVPR 2026上提出的多项创新解决方案,旨在推动图像生成技术超越单纯“模型变大”的范式。

大纲与深读 8 章

展开「深读」看每一段讨论的问题与论据。

01

引言:真实与正确之别

  • 当前文本到图像模型在生成逼真图像方面已非常出色,但真实感并不等同于正确性。
  • 模型在要求生成多个不同人物、特定构图或高分辨率本地图像时,仍会遇到出人意料的问题。
  • 本期节目讨论了在图像生成领域尚未解决的挑战以及应对方法。
深读这一段

讨论的问题:图像生成领域当前的核心挑战是什么?

02

嘉宾与研究主题

00:30
  • 嘉宾是高通公司技术副总裁Fatih Porikli。
  • 他将在CVPR上展示多项研究,旨在解决上述图像生成的挑战。
  • 讨论将涵盖更好的训练目标、将场景规划与渲染分离、在边缘设备上高效生成高分辨率图像等方法。
深读这一段

讨论的问题:高通研究团队将提出哪些新的研究方向?

03

训练目标与可控性

01:00
  • 探索了强化学习在图像生成中的应用。
  • 讨论了基于智能体的图像生成流程。
  • 研究了如何通过改进训练目标来提高图像生成的可控性。
深读这一段

讨论的问题:如何通过改进训练目标来提升图像生成的可控性?

04

场景规划与渲染分离

01:30
  • 提出将场景规划与渲染过程分离的思路。
  • 这种方法可能带来更可靠、更符合预期的图像生成。
  • 是解决当前模型在复杂场景下表现不佳的一个潜在途径。
深读这一段

讨论的问题:分离场景规划与渲染如何提升生成可靠性?

05

边缘设备高分辨率生成

02:00
  • 专注于在设备端高效生成16百万像素的高分辨率图像。
  • 这是实现本地化、隐私保护型AI应用的关键。
  • 相关研究包括像素级别的快速生成技术(如PixelRush)。
深读这一段

讨论的问题:如何在资源受限的边缘设备上实现高分辨率图像生成?

论据 / 案例:具体研究案例:PixelRush,一种通过一步扩散实现无需训练的超高分辨率图像生成技术。

06

消除图像编辑伪影

02:30
  • 致力于消除AI驱动图像编辑中常见的可见伪影。
  • 相关研究提出了新的修复方法(如InvertFill)。
  • 目标是让AI编辑的结果更加自然和无缝。
深读这一段

讨论的问题:新方法如何消除AI图像编辑中的人工痕迹?

论据 / 案例:具体研究案例:InvertFill,一种用于增强少步扩散修复的一步反转技术。

07

身份与多人生成挑战

03:00
  • 探讨了文本到图像生成中的“身份危机”,即模型难以准确保持多个角色的身份一致性。
  • 提出了名为“Ar2Can”的架构和艺术家方法,利用画布来解决多人生成问题。
  • 这些是CVPR 2026上的具体研究成果。
深读这一段

讨论的问题:如何解决文本到图像模型生成多人时的身份混淆问题?

论据 / 案例:具体研究案例:论文《Resolving the Identity Crisis in Text-to-Image Generation》和《Ar2Can: An Architect and an Artist Leveraging a Canvas for Multi-Human Generation》,均为CVPR 2026论文。

08

总结与展望

03:30
  • 总结了生成视觉系统下一阶段进展可能的样子。
  • 再次强调了端侧AI和高效推理的重要性。
  • 讨论了视频扩散模型的优化等前沿方向。
深读这一段

讨论的问题:生成式视觉系统的未来发展路径是什么?

论据 / 案例:提及了视频扩散模型优化研究案例:ReHyAtt(循环混合注意力)和Attention Surgery(线性化视频扩散Transformer)。

金句

  • "" —— 逼真度不等于正确性。模型在生成多个不同人物、特定构图或在本地生成高分辨率图像时,仍会以令人惊讶的方式出错。
  • "" —— 通过将场景规划与渲染过程分离,我们或许能实现更可靠、更可控的图像生成。
  • "" —— 我们的目标是在边缘设备上实现高效、高质量的图像生成,而不仅仅是云端的大模型。

原文链接

查看完整访谈

完整内容见原文:TWIML AI Podcast · 图像生成需要超越更大模型的新思路