清华段岳圻团队论文:从调参数到做控制,文生图迎来一次方法论升级丨CVPR2026
机器学习算法与自然语言处理
2026-04-27 08:45
文章摘要
背景:当前文生图模型在使用高 guidance scale 时,常出现语义对齐与图像质量相冲突的问题,即模型越努力贴近文本描述,画面质量越容易下降,导致用户需要大量尝试才能获得满意结果。研究目的:清华大学段岳圻团队提出 CFG-Ctrl 方法,从控制理论角度重新审视 classifier-free guidance(CFG)机制,将生成过程视为动态系统,把语义偏差视为需要控制的误差,通过引入滑模控制(SMC)实现非线性反馈,旨在打破语义准确性与图像质量之间的此消彼长关系,提升生成过程的稳定性和可控性。结论:实验表明,CFG-Ctrl 在 FID、CLIP 及人类偏好指标上均实现全面且稳定的提升,尤其在高 guidance scale 和复杂 prompt 场景下,能够有效维持图像质量并增强语义对齐。该方法在 SD3.5、Flux 和 Qwen-Image 等多种模型上均有显著效果,验证了其跨模型通用性。该研究将 CFG 从经验性调参转变为系统性控制问题,推动了文生图模型从偶尔成功走向稳定可靠。
本站注明稿件来源为其他媒体的文/图等稿件均为转载稿,本站转载出于非商业性的教育和科研之目的,并不意味着赞同其观点或证实其内容的真实性。如转载稿涉及版权等问题,请作者速来电或来函联系。