首页 游戏 软件 资讯 排行榜 专题
首页
AI
苹果全能视觉AI模型UniGen 1.5发布,看图修图绘图三合一

苹果全能视觉AI模型UniGen 1.5发布,看图修图绘图三合一

热心网友
47
转载
2025-12-19

12月19日消息,据科技媒体9to5Mac昨日(12月18日)发布的博文报道,苹果研究团队近期发布了多模态AI模型UniGen 1.5,成功在单一系统中集成了图像理解、生成与编辑三大核心功能。

不同于主要依赖不同模型分别处理任务的传统方案,UniGen 1.5最大的突破在于构建了一个统一的框架,仅凭一个模型即可同时完成图像理解、图像生成以及图像编辑任务。研究人员认为,这种统一架构能让模型利用强大的图像理解能力反哺生成效果,从而实现更精准的视觉输出。

在图像编辑领域,模型往往难以精准捕捉用户微妙或复杂的修改指令。为解决这一难题,苹果团队首创引入了名为“编辑指令对齐”的后训练阶段。

该技术并不直接让模型修改图片,而是要求模型先根据原图和指令,预测出目标图像的详细文本描述。这种“先想后画”的中间步骤,迫使模型在生成最终图像前,必须深度内化用户的编辑意图,从而大幅提升了修改的准确度。

苹果全能视觉 AI 模型 UniGen 1.5 亮相,看图、修图、绘图三合一

苹果全能视觉 AI 模型 UniGen 1.5 亮相,看图、修图、绘图三合一

这一中间步骤有助于模型在生成最终图像之前更好地理解预期的编辑内容。

除了指令对齐,UniGen 1.5的另一大贡献在于强化学习层面的创新。研究团队成功设计了一套统一的奖励系统,能够同时应用于图像生成和图像编辑的训练过程。

此前,由于编辑任务涉及从微调到重构的巨大跨度,统一奖励机制极难实现,而这一突破让模型在处理不同类型的视觉任务时,能够遵循一致的质量标准,显著增强了系统的“抗干扰”性。

苹果全能视觉 AI 模型 UniGen 1.5 亮相,看图、修图、绘图三合一

UniGen-1.5 的文本转图像生成和图像编辑功能的一些示例

苹果全能视觉 AI 模型 UniGen 1.5 亮相,看图、修图、绘图三合一

UniGen-1.5 的文本转图像生成和图像编辑功能的一些示例

在多项行业标准基准测试中,UniGen 1.5展现了强劲的竞争力。数据显示,该模型在GenEval和DPG-Bench测试中分别获得0.89和86.83的高分,显著优于BAGEL和BLIP3o等近期热门方法。

在图像编辑专项测试ImgEdit中,其4.31的综合得分不仅超越了OminiGen2等开源模型,更与GPT-Image-1等专有闭源模型表现持平。

尽管整体表现优异,UniGen 1.5目前仍存在一定局限性。研究人员在论文中坦诚,由于离散去标记器(discrete detokenizer)在控制细粒度结构方面存在不足,模型在生成图片内的文字时容易出错。

苹果全能视觉 AI 模型 UniGen 1.5 亮相,看图、修图、绘图三合一

图 A 展示了 UniGen-1.5 在文本转图像生成和图像编辑任务中的失败案例。以上图源:苹果论文

此外,在部分编辑场景下,模型偶尔会出现主体特征漂移的问题,例如猫的毛发纹理改变或鸟的羽毛颜色偏差,这些问题将是团队未来的优化重点。

附上参考地址

UniGen-1.5: Enhancing Image Generation and Editing through Reward Unification in Reinforcement Learning

来源:https://www.ithome.com/0/906/155.htm
免责声明: 游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。

相关攻略

苹果新CEO上任前遭遇核心人才流失挑战
AI
苹果新CEO上任前遭遇核心人才流失挑战

4月22日,彭博社的一则深度报道,将焦点对准了苹果公司即将上任的新任CEO约翰・特纳斯(John Ternus)。报道指出,他将于今年9月正式接棒,而摆在他面前的首要且紧迫的挑战,便是在公司面临罕见的人才流动高峰时,如何有效稳定核心团队——这不仅涉及高管层,也深刻影响着众多资深工程师的去留。 这场关

热心网友
05.18
苹果新CEO特纳斯风格神似乔布斯 曾反对Vision Pro
AI
苹果新CEO特纳斯风格神似乔布斯 曾反对Vision Pro

为什么是约翰·特纳斯? 4月21日凌晨,苹果公司的一则官宣震动业界:现任硬件工程高级副总裁约翰·特纳斯将接替蒂姆·库克,成为这家科技巨头的下一任首席执行官。消息一出,在感慨库克时代落幕之余,一个核心问题浮出水面——为何是特纳斯?或许,彭博社资深科技记者马克·古尔曼的深度剖析,能为我们提供一些关键线索

热心网友
05.18
折叠屏iPhone试产遇阻 屏幕折痕并非主要技术难题
科技数码
折叠屏iPhone试产遇阻 屏幕折痕并非主要技术难题

苹果折叠屏iPhone试产遇阻,核心问题在于铰链可靠性未达内部严苛标准,长期开合后出现异响。屏幕折痕问题则已基本解决。若铰链问题无法攻克,产品发布可能推迟。此外,该产品初期产能规划不高,续航与拍照能力或存不足,定价预计较高。

热心网友
05.18
iPad Pro 10.5寸忘记密码解锁与系统恢复格式化方法
手机教程
iPad Pro 10.5寸忘记密码解锁与系统恢复格式化方法

针对无法开机的iPadPro(10 5),若不愿刷机,可使用iOS修复大师进行强制格式化以解决问题。操作会清除全部数据,适用于忘记密码、面容ID失效或系统内存不足导致的故障。步骤包括下载工具、登录账户、连接设备并进入DFU模式,随后软件识别设备并执行格式化,完成后设备将重启恢复使用。

热心网友
05.18
苹果A2152解锁教程:无需刷机用iOS修复大师一键格式化
手机教程
苹果A2152解锁教程:无需刷机用iOS修复大师一键格式化

苹果A2152若无法开机且不愿刷机,可尝试强制格式化以解决密码遗忘、面容ID失效或内存不足等问题。此操作将清空所有数据,需借助“iOS修复大师”工具。步骤包括下载软件、登录账户、连接手机进入DFU模式,待软件识别后开始格式化,过程中保持连接稳定,完成后设备重启即可重新设置使用。

热心网友
05.18

最新APP

宝宝过生日
宝宝过生日
应用辅助 04-07
台球世界
台球世界
体育竞技 04-07
解绳子
解绳子
休闲益智 04-07
骑兵冲突
骑兵冲突
棋牌策略 04-07
三国真龙传
三国真龙传
角色扮演 04-07

热门推荐

2026年新手Vlog相机选购指南 五大机型满足旅行美妆日常拍摄
业界动态
2026年新手Vlog相机选购指南 五大机型满足旅行美妆日常拍摄

刚接触Vlog创作,挑选设备是不是比拍摄本身更让人头疼?既渴望手机般的轻便易携,又向往相机的卓越画质;期待操作简单、直出好看,还要求性能稳定、避免画面模糊——这些心声,你是否也感同身受? 别担心,今天我们抛开复杂的参数,从最实用的角度切入——综合考量画质表现、防抖性能、对焦速度以及人像直出效果这些核

热心网友
05.19
维信诺投资50亿扩产穿戴显示屏全球份额占四分之一
业界动态
维信诺投资50亿扩产穿戴显示屏全球份额占四分之一

2026年4月28日,显示技术领域迎来重要进展:维信诺总投资额高达50亿元的昆山全球新型显示产业创新中心,顺利完成主厂房封顶。这一项目不仅是维信诺“2+3+X”发展战略的核心组成部分,更是其布局下一代显示技术、构筑长期竞争优势的关键举措。 该项目于2025年正式签约落地,此次主体结构封顶标志着项目建

热心网友
05.19
影石创新2026年Q1财报:营收24.81亿元同比增长83%
业界动态
影石创新2026年Q1财报:营收24.81亿元同比增长83%

4月28日,影石创新(Insta360)发布了2025年度及2026年第一季度财报,业绩表现极为亮眼,实现强势开门红。数据显示,公司2025年全年营收高达97 41亿元,同比大幅增长74 76%;2026年第一季度营收延续高增长态势,达到24 81亿元,同比增长83 11%。纵观近三年发展,影石创新

热心网友
05.19
一加Ace 6至尊版正式发布 首发价格3499元起
业界动态
一加Ace 6至尊版正式发布 首发价格3499元起

备受期待的一加 Ace 6 至尊版于今日正式发布。这款性能旗舰不仅搭载了顶级的天玑 9500 处理器,更创新性地推出了可搭配使用的“枪神游戏手柄”专属外设,为移动游戏体验带来全新可能。新机起售价为 3499 元,极具市场竞争力。 一加 Ace 6 至尊版提供了“王牌觉醒”与“金属风暴”两款潮流配色。

热心网友
05.19
一加Ace 6至尊版GPU性能解析 手机游戏体验媲美主机
业界动态
一加Ace 6至尊版GPU性能解析 手机游戏体验媲美主机

备受期待的一加Ace 6至尊版于今晚正式发布。这款性能旗舰的核心亮点,无疑是搭载了联发科当前顶级的旗舰处理器——天玑9500。该芯片在制程工艺与能效表现上的全面升级,为手机的整体流畅体验奠定了坚实的硬件基础。 天玑9500率先采用了台积电先进的第三代3纳米制程,并创新性地采用了全大核CPU架构设计。

热心网友
05.19