人工智能的快速发展推动AI生成能力不断刷新认知,但AI在视觉领域的进化,离不开视觉理解、空间建模、时序一致性、美学表达等多个方向的持续突破,这更考验长期的视觉技术积累。
作为AI影像领域的“长期玩家”,美图影像研究院(MT Lab)围绕高频创作场景的真实痛点,持续展开研究。2026年以来,共有11篇论文被ICLR、CVPR、ICML、ECCV、ACM MM等国际顶会接收,覆盖视频编辑、人像编辑、智能交互、视觉理解等多个方向,并将研究成果不断通过产品落地,转化为服务美图用户的AI影像能力。
在围绕模型的编辑能力方面,美图影像研究院(MT Lab)提出参考帧引导视频编辑统一框架MiVE,实现包括改变发型、变换服装、妆容造型、重新打光、更换背景、天气变换、局部优化等在内的通用视频编辑能力;一致特征传输重打光新方案CFT实现人物一致性的丰富打光效果,目前已研发上线超过50种复杂光效;基于随机桥模型的新框架BridgeRemoval显著提升AI视频消除的精准度及时序一致性,并实现视频身材美型保护能力;基于Self-Prompting的图像文本编辑方法,实现在繁体中文、泰语、日语甚至是特殊符号等复杂文字场景中的“无痕改字”。面向原生2K多服饰试衣的新框架实现了端到端的多服饰生成,并且在2K高分辨率下,依旧能够保持羊毛、棉麻、粗针织等等服饰材质的真实质感。此外,提出了All-in-One Slider的统一多属性控制框架,为更灵活的组合、调度编辑能力奠定了基础。
在围绕“真实意图理解”方面,美图影像研究院(MT Lab)提出基于双向语义流的条件分割方法FlowSeg,精准对齐画面对象与语言指令,准确判断编辑目标。
在前沿能力建设方面,美图影像研究院(MT Lab)提出了基于DiT的3D位置编码框架PE-Field、动态毛发渲染框架ControlHair、协同式图像编辑框架SI-Edit分别被深度学习领域顶级会议ICLR 2026、计算机视觉领域三大顶会之一的ECCV 2026、国际多媒体领域顶级会议ACM MM2026收录。
随着生成能力进化为更通用的基础能力,AI影像真正的较量也开始深入真实创作场景,美图影像研究院(MT Lab)将前沿研究、专业数据、模型评测、工程落地环环紧扣,为美图形成真正可落地的产品力,而长期深耕AI影像的价值,也在这些细节中显现,在持续抬高模型能力上限的同时,让AI更懂真实创作需求,推动AI产品从“用户可用”走向“用户爱用”。

雷科技





































