游乐游手机版
首页/AI热点日报/热点详情

北大开源首个美学照片重构模型 废片变大片

类型:热点整理2026-07-20
北京大学彭宇新团队提出美学照片重构任务,从教学视频中挖掘9071对“原片→成片”数据构建AesRecon数据集,并发布AesFormer模型,采用美学规划与编辑两阶段策略,从构图、视角、姿态层面重构画面,相关成果被ICML2026接收。

一张照片之所以不够出色,问题往往不在于后期处理,而在于按下快门那一瞬间的决策。

虽然你可以调整亮度、添加滤镜、进行磨皮美颜,但照片的“底子”——比如构图是否平衡、视角是否恰当、人物姿态是否自然——这些“结构性”缺陷,现有的工具几乎无法解决。说白了,照片的美感很大程度上取决于拍摄时是否一次到位。如果拍歪了就是拍歪了,后期再怎么修也难以补救。

直到最近,北京大学彭宇新团队为这一难题开辟了新方向。他们定义了一个新任务——美学照片重构,目标是让AI不再是仅仅调整颜色、美化皮肤这种表层修饰,而是能够真正对画面进行重构:调整构图、修正视角、优化人物姿态。简单来说,就是让“废片”有机会变成“大片”。

团队从互联网上的拍照教学视频里自动挖掘美学语料,构建了首个美学照片重构数据集AesRecon,包含9071对同一人物、同一场景下的“普通原片→出彩成片”样本。在此基础上,他们发布了模型AesFormer,采用“美学规划+美学编辑”两阶段策略。该成果已被ICML 2026接收,代码也已开源。

废片也能变大片!北大开源首个「美学照片重构」模型

从“表层修饰”到“画面重构”

拍照对于专业摄影师来说是系统训练与长期实践的结果;而对于大多数普通人而言,更多是凭感觉快速按下快门。结果就是,构图偏移、视角失衡、姿态僵硬——这些结构性毛病,几乎每张照片里都能找到。

为了补救,大家会去使用各种图像美化工具。现有的主要分为两类:一类是调色调光的,比如自动修图、Photoshop、Lightroom,主要负责调整曝光、对比度等基础参数;另一类是美容工具,如磨皮、美白、瘦脸,这些功能在美图秀秀和醒图中已经非常普及。

但问题在于,这些方法只能改善色彩、光影和人物外观,对于构图、视角、姿态这些结构性问题,几乎无能为力。你不可能靠一个滤镜把拍歪的楼拉正,也不可能靠磨皮把僵硬的表情变自然。

研究人员把这个新任务称为美学照片重构——在保持人物身份和场景内容基本一致的前提下,重新组织构图、视角和人物姿态,从画面结构层面提升整体美感。如图1所示。

废片也能变大片!北大开源首个「美学照片重构」模型

图1. 美学照片重构任务示意图

要实现这个目标,主要面临两大挑战:

一是高质量美学语料稀缺。市面上没有现成的“同一人物、同一场景、由差到优”的成对照片数据集。如果没有数据,模型自然无从学起。

二是模型缺乏美学审美能力。现有的图像编辑模型虽然能听懂“把脸P瘦”这种指令,但如果让它理解“你这张照片左下角太空了,人物应该往右移两步”,它根本不明白你在说什么。

技术方案

针对数据稀缺的问题,团队想到了一个巧妙的突破口——利用互联网上的拍照教学视频。这类视频通常由专业摄影师和模特配合,完整记录了从效果普通的原片到出彩成片的逐步优化过程。

基于这个观察,他们提出了基于拍照教学视频的美学语料挖掘方法(VCMP)。从视频平台检索摄影教程、姿势指导、构图技巧等相关内容,然后分四阶段完成语料挖掘:

(1)出彩成片定位:在视频中定位作为最终展示结果的高质量成片;

(2)普通原片匹配:为已定位的成片匹配语义一致但效果欠佳的原片;

(3)照片去干扰:去除视频帧里的字幕、图标、辅助构图线、操作弹窗等遮挡元素;

(4)拍摄事件对齐:验证每对照片是否来自同一拍摄事件,过滤不满足条件的样本。

最终得到的数据集AesRecon,包含9071对严格对齐的人像照片样本。

废片也能变大片!北大开源首个「美学照片重构」模型

图2. 基于拍照教学视频的美学语料挖掘方法(VCMP)框架图

数据问题解决后,下一步就是让模型具备美学理解能力。研究团队提出的AesFormer采用“美学规划+美学编辑”两阶段方案。

废片也能变大片!北大开源首个「美学照片重构」模型

图3. 美学照片重构模型(AesFormer)框架图

阶段I:美学规划

针对AesRecon中每组照片对,研究人员先提炼摄影师在拍摄过程中围绕构图、视角、姿态等因素所做的调整,形成从原片到成片的优化方案。然后,对多模态大模型进行冷启动监督微调,把优化方案建模成符合摄影逻辑的有序决策序列,引导模型沿七个递进的摄影维度分析照片问题。

不过,监督微调存在一个缺陷:容易让模型“死记硬背”。对于美学照片重构,同一张照片并没有唯一的“正确改法”,构图、视角、姿态的不同调整组合,都可能显得自然且好看。因此,团队又引入了美学引导的组相对策略优化,通过格式奖励、语义对齐奖励和美学创意奖励,鼓励模型探索更丰富、更合理的优化路径。最终训练得到的美学规划模型名为AesThinker

阶段II:美学编辑

接下来的任务,是把抽象的美学优化方案转化为像素级的修改。团队通过以美学优化方案为条件的流匹配训练,使图像编辑模型能够根据方案进行精准重构。基于Qwen-Image-Edit-2511训练得到的模型叫AesEditor

推理时,流程是串联的:先由AesThinker生成优化方案,AesEditor再结合输入照片与方案,生成最终的重构结果。

实验结果

在AesRecon评测基准上,AesFormer的表现超越了所有开源模型,与Google闭源商业模型Nano Banana Pro表现相当,多数指标上甚至更优。

研究团队还专门验证了一个问题:能否直接用通用模型“生成指令+执行编辑”来完成美学照片重构?他们把Qwen3-VL-8B和GPT-4o当作Thinker,用其他编辑模型执行重构,结果并不理想,甚至有时性能更差。这说明,通用模型既缺乏美学理解能力,也缺乏美学执行能力——而这两点,正是AesFormer的核心竞争力所在。

废片也能变大片!北大开源首个「美学照片重构」模型

表1. AesFormer在AesRecon评测基准上的美学照片重构结果

图4的案例对比也很直观:开源图像编辑模型通常无法完成结构性编辑,构图偏了还是偏,姿态僵了还是僵。而AesFormer通过将规划与编辑解耦,能够稳定提升照片的美感。

废片也能变大片!北大开源首个「美学照片重构」模型

图4. 美学照片重构模型(AesFormer)案例展示

项目价值

总体而言,这项研究解决了两个关键难题:高质量美学语料的稀缺,以及模型美学能力的不足。通过从互联网拍照教学视频中自动挖掘数据,他们构建了AesRecon数据集;通过两阶段规划与编辑,训练了AesFormer模型。

更重要的是,它将图像美化从过去那种仅仅调色、美颜的“表层修饰”,提升到了能够优化构图、视角与人物姿态的“画面重构”阶段。这为AI理解与生成高质量摄影作品,提供了一个全新的研究视角和技术路径。

来源:https://www.aitntnews.com/newDetail.html?newId=25952

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。