首页 游戏 软件 资讯 排行榜 专题
首页
科技数码
苹果全能视觉AI 1.5亮相:看图、修图、绘图一键搞定

苹果全能视觉AI 1.5亮相:看图、修图、绘图一键搞定

热心网友
28
转载
2025-12-19

12月19日,IT之家消息,科技媒体9to5Mac于18日发布博文披露,苹果研究团队近日发布了多模态AI模型UniGen 1.5,成功在一个统一系统中集成了图像理解、生成与编辑三大核心功能。

免费影视、动漫、音乐、游戏、小说资源长期稳定更新! 👉 点此立即查看 👈

与传统方案依赖不同模型分别处理各项任务不同,UniGen 1.5最大的突破在于构建了一个统一的框架,仅凭一个模型即可同时完成图像理解、图像生成以及图像编辑任务。研究人员认为,这种统一架构能让模型利用其强大的图像理解能力反哺生成效果,从而实现更精准的视觉输出。

在图像编辑领域,模型常常难以精准捕捉用户微妙或复杂的修改指令。苹果团队为解决这一难题,首创性地引入了名为“编辑指令对齐”的后训练阶段。

该技术并非直接让模型修改图片,而是要求模型先根据原图和指令,预测出目标图像的详细文本描述。这种“先想后画”的中间步骤,迫使模型在生成最终图像前,必须深度内化用户的编辑意图,从而大幅提升了修改的准确性。



这一中间步骤有助于模型在生成最终图像之前,更好地理解预期的编辑内容。

除了指令对齐,UniGen 1.5的另一大贡献在于强化学习层面的创新。研究团队成功设计了一套统一的奖励系统,能够同时应用于图像生成和图像编辑的训练过程。

此前,由于编辑任务涉及从微调到重构的巨大跨度,统一奖励机制极难实现,而这一突破让模型在处理不同类型视觉任务时,能够遵循一致的质量标准,显著增强了系统的“抗干扰”性。


UniGen-1.5 的文本转图像生成和图像编辑功能的一些示例


UniGen-1.5 的文本转图像生成和图像编辑功能的一些示例

在多项行业标准基准测试中,UniGen 1.5展现了强劲的竞争力。数据显示,该模型在GenEval和DPG-Bench测试中分别获得0.89和86.83的高分,显著优于BAGEL和BLIP3o等近期热门方法。

在图像编辑专项测试ImgEdit中,其4.31的综合得分不仅超越了OminiGen2等开源模型,更与GPT-Image-1等专有闭源模型表现持平。

尽管整体表现优异,UniGen 1.5目前仍存在一定局限性。研究人员在论文中坦承,由于离散去标记器在控制细粒度结构方面存在不足,模型在生成图片内的文字时容易出错。


图 A 展示了 UniGen-1.5 在文本转图像生成和图像编辑任务中的失败案例。以上图源:苹果论文

此外,在部分编辑场景下,模型偶尔会出现主体特征漂移的问题,例如猫的毛发纹理改变或鸟的羽毛颜色偏差,这些问题将是团队未来的优化重点。

IT之家附上参考地址

来源:https://www.163.com/dy/article/KH4H7ENU0511B8LM.html
免责声明: 游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。

相关攻略

AI看图能力真伪探秘:它是否真是编出来的?
科技数码
AI看图能力真伪探秘:它是否真是编出来的?

一个学生忽视了一行代码,结果发现了一件很不对劲的事:在一个多模态医学AI项目中,这行代码原本负责让模型读取图像数据。但因为这次疏忽,模型实际上完全没有看到任何图片。按理说系统应该报错,或者至少拒绝回

热心网友
04.01
首创数字申明元数据专利:提升元平台运行性能与体验
科技数码
首创数字申明元数据专利:提升元平台运行性能与体验

国家知识产权局信息显示,江西开创数码科技有限公司申请一项名为“元宇宙数据分析方法、装置、设备及存储介质”的专利,公开号CN121764613A,申请日期为2025年12月。专利摘要显示,本发明涉及元

热心网友
03.31
石溪大学新研究:状态空间模型能否挑战Transformer的视觉语言主导地位?
科技数码
石溪大学新研究:状态空间模型能否挑战Transformer的视觉语言主导地位?

这项由Stony Brook大学研究团队开展的前沿研究发表于2026年3月,论文编号为arXiv:2603 19209v1,为我们重新审视视觉语言模型的设计理念提供了全新视角。当我们谈到让计算机同时

热心网友
03.31
古尔曼披露:苹果Apple Intelligence在中国意外上线后下线
礼仪与书信
古尔曼披露:苹果Apple Intelligence在中国意外上线后下线

3月31日,苹果于今日凌晨开始分批推送国行Apple Intelligence Beta版,需升级至iOS 26 4及以上系统方可体验。彭博社记者马克·古尔曼今日发文称Apple Intellig

热心网友
03.31
揭秘AI大模型如何从数字“卷”入物理世界
科技数码
揭秘AI大模型如何从数字“卷”入物理世界

  博鳌亚洲论坛2026年年会,vivo第五年以战略合作伙伴身份亮相。  2026年的春天,人工智能的浪潮依然在以一种令人目眩的速度狂飙。前有机器人在春晚舞台上翻转腾挪,后有OpenClaw引发全球

热心网友
03.31

最新APP

火柴人传奇
火柴人传奇
动作冒险 04-01
街球艺术
街球艺术
体育竞技 04-01
飞行员模拟
飞行员模拟
休闲益智 04-01
史莱姆农场
史莱姆农场
休闲益智 04-01
绝区零
绝区零
角色扮演 04-01

热门推荐

《三国:天下归心》香香连击队成员推荐
游戏攻略
《三国:天下归心》香香连击队成员推荐

《三国:天下归心》香香连击队全面解析:后期最强阵容搭配攻略 在策略手游《三国:天下归心》中,如何打造一支能够主宰战局的后期王牌队伍?本篇将为您深入剖析以孙尚香为核心的“香香连击队”终极搭配方案。该阵容由孙尚香、蔡文姬、貂蝉三位核心武将构成,其独特之处在于通过蔡文姬与貂蝉的完美辅助联动,极大化触发孙尚

热心网友
04.03
爱奇艺极速版如何查看营业执照
手机教程
爱奇艺极速版如何查看营业执照

爱奇艺极速版营业执照信息查询全攻略 在使用爱奇艺极速版应用时,无论是出于消费保障、商务合作考量,还是日常维权需要,核实其背后的实际运营主体与工商信息都是十分必要的环节。查询其营业执照信息有着明确且可靠的操作路径,可以帮助用户清晰了解服务提供方的合法资质。 官方权威途径:国家企业信用信息公示系统查询

热心网友
04.03
红色沙漠堕落之神任务闪电柱解谜答案一览
游戏攻略
红色沙漠堕落之神任务闪电柱解谜答案一览

在《红色沙漠》的“堕落之神”任务中,古代闪电装置的解谜环节是挑战巨化泰坦BOSS前的核心难点。整个电塔谜题由五座塔构成,其核心在于正确的激活与连接顺序。为了让各位冒险家能快速通关,本篇攻略将详细解析闪电塔的正确操作步骤。咱们这就开始,一步步点亮所有的电塔。 《红色沙漠》堕落之神任务:闪电塔解谜全流程

热心网友
04.03
洛克王国世界炽心勇狮图鉴
游戏攻略
洛克王国世界炽心勇狮图鉴

洛克王国炽心勇狮全面解析:技能、获得方法与实战指南 在《洛克王国》的众多宠物中,炽心勇狮以其传奇守护者的身份和强大的火焰力量而备受瞩目。作为火系宠物的代表之一,它的核心特征在于那颗永不熄灭的火焰心脏,这不仅是它力量的象征,更是其所有强大技能的能量源泉。由炽心勇狮喷发出的烈焰,拥有随着战斗进程而不断增

热心网友
04.03
洛克王国世界公平鸽图鉴
游戏攻略
洛克王国世界公平鸽图鉴

洛克王国公平鸽图鉴详解:裁判型宠物的属性技能与获取攻略 在洛克王国的众多宠物当中,公平鸽以其鲜明的裁判官形象与独特的对战定位,成为了许多玩家关注的对象。这只严格恪守自身准则的宠物,完美诠释了何为“公正严明”。它的行事守则堪称一套独特的生存哲学:执着于介入每一场争执,绝不因任何原因延误“出庭”,坚持做

热心网友
04.03