游乐游手机版
首页/科技数码/文章详情

Google DeepMind提出视觉提示工程新范式比文本指令更有效

时间:2026-07-31 15:21
GoogleDeepMind提出视觉提示工程(VIPE),将提示工程方法论扩展至视觉模态。通过将抽象草图转换为照片级真实场景,显著提升视频模型推理能力,效果优于文本提示工程。该方法可自动化,并与测试时扩展结合,进一步降低错误率。

提示工程,本质上是通过优化输入来提升模型输出质量的方法,如今已成为语言模型领域的基础能力。业界普遍认为,只要模型的输入空间足够丰富,就能通过调整输入内容来改善下游任务的表现。

那么,这种思路能否跨界应用到视觉领域呢?

Google DeepMind 的最新研究给出了令人瞩目的答案——他们提出了“视觉提示工程”(Visual Prompt Engineering,VIPE),成功将提示工程的方法论扩展到了视觉模态。


论文链接:https://arxiv.org/abs/2607.25537

实验表明,视觉提示工程方法能够在多个任务中显著增强视频模型的推理能力。更值得注意的是,对于视频模型而言,视觉提示工程有时比传统的文本提示工程或测试时扩展(test-time scaling)更为有效。

正如文本提示工程能够系统性地提升语言模型性能一样,视觉提示工程提供了一种简单且计算高效的方法,用于激发视频模型的视觉推理潜力。论文作者指出,这标志着一个新范式的出现:视觉提示本身也可以像文本提示一样被优化。随着前沿视频模型能够处理越来越丰富的多模态上下文,视觉提示工程很可能从单张图像编辑扩展到多张参考图像甚至视频。

视觉提示工程:在新的视觉场景中解决相同问题

所谓视觉提示工程,是针对视频模型视觉输入的一种提示工程方法。其核心思想是:在不改变任务逻辑的前提下,将原始图像转化为模型更易于理解和推理的视觉形式——让模型在全新的视觉场景中处理同一个问题。例如,一个抽象的球体与斜坡示意图,可以替换为写实的台球与木板场景,但关键的空间关系必须保持一致。


图|视觉提示工程从一个视觉提示开始,例如一张球体与斜坡的草图图像,以及“球沿着……滚下,最后落入其中一个桶里”这样的文本提示。

具体流程分为三个步骤:

1. 构想器:负责规划图像的修改方式。它根据任务样本和约束条件,生成一段自然语言编辑指令。指令中明确哪些任务相关元素必须保留,例如物体数量、位置、朝向及其相对关系。

2. 编辑器:根据指令修改原图,生成一个或多个候选图像。该步骤可由图像编辑模型完成,也可由人工编辑执行。

3. 筛选器:这是一个可选步骤。当编辑器生成多个候选图像时,筛选器从中挑选出最合适的版本——优先选择图像质量更高且保留了原图关键任务信息的那一个。

比文本指令更有效

研究团队在 VPCT 物理推理任务上进行了测试,并验证了自动化视觉提示工程的效果。总体来看,视觉提示工程能够提升视频模型的视觉推理表现,而且优化视觉上下文通常比优化文本指令更为有效。以下几个关键发现值得关注。

1. 性能提升的真正驱动力是视觉真实感

采用视觉提示工程后,Veo 3.1 的准确率从 41.3% 提升至 59.3%,Omni Flash 从 56.3% 提升至 67.5%。视频模型系统性地偏好照片级真实的上下文,而不是抽象输入。


图|视觉提示工程提升了 VPCT 上的物理推理能力。

2. 既可自动化,也可作为有效的测试时扩展策略

视觉提示工程的自动化流程由视觉-语言模型(VLM)生成改写指令,图像编辑模型生成候选图像,自动评分器负责筛选或提供反馈迭代。研究团队比较了自由形式构想和原子概念编辑(ACE)两种路线,结果表明两种方法都能自动生成更好的改写图像。自由形式视觉提示工程在部分任务中将错误率降低了超过 75%。ACE 在 Sort 3 Numbers 任务上,如果按样本选择最佳视觉版本,错误率甚至可降至 0。


图|自动化视觉提示工程在多种任务上均能提升性能。

在小球滚落物理推理任务中,未使用视觉提示工程时,Veo 3.1 通过多次采样从 41.3% 提升至 50.0%;加入视觉提示工程后,单次采样准确率即达到 59.3%。在视觉提示工程改写后的提示上继续多次采样,准确率可达 68.0%。


图|视觉提示工程还可与测试时扩展结合,进一步提升性能。

3. 优化视觉上下文通常比优化文本指令更有效

以 Sort 3 Numbers 为例,最优文本提示和最优图像提示的准确率分别为 86% 和 76%。


图|对于视频模型而言,视觉提示工程可能比文本提示工程更有效。

4. 未系统性提升原生图像生成模型的推理表现

研究团队测试了 Nano BananaPro、Nano Banana 2 等模型,结果显示,将输入替换为照片级真实图像后,图像模型的推理性能并未稳定提升。这可能是因为原生图像生成模型覆盖了更多视觉风格,对抽象草图和真实图像都更为熟悉。


图|原生图像生成模型在 VPCT 上的结果,报告每种配置下的最佳提示结果。

5. 有效的图像改写通常具备三类特征:场景更真实、目标更突出、语义更直接

这类改写能够将抽象草图转化为更接近真实世界的视觉场景,从而缩小抽象输入与视频模型熟悉视觉表征之间的差距。例如在 VPCT 任务上,将草图改写为照片级真实场景后,Veo 3.1 的准确率提升至 59.3%。因此,当同一任务可以转换为更真实的视觉场景时,应优先使用真实场景版本。


图|向真实感迈出的每一步都会提升生成一致性。

局限性

当然,视觉提示工程目前也存在明显的短板。例如,它依赖图像编辑模型的质量——如果编辑器改变了任务信息或引入了伪影,下游视频模型可能无法解决原始任务。未来,如果图像编辑模型能更稳定地保留任务信息,额外的筛选和质量控制可能就不再需要。

此外,视觉提示工程会带来额外成本。不过,图像编辑通常比视频生成便宜得多,因此这项成本在实践中也可能转化为优势——一次低成本的图像编辑调用,可以降低一次昂贵视频生成失败的概率。

来源:https://www.163.com/dy/article/L33RJF8D0531E3NX.html
上一篇宜鼎发布第二代DDR5 MRDIMM内存,速率达12800MT/s 下一篇SK海力士与三星高管接连访问光州半导体用地
本站内容用于信息整理与展示,如有侵权或内容问题请及时联系处理。

相关推荐

补充同频道和同主题内容,方便继续浏览更多相关内容。

同类最新

继续查看同栏目最近更新的文章。

更多
2026中国航空产业大会10月底南昌启幕:首次与航博会同期举办,聚焦低空经济新路径
科技数码 · 2026-08-31

2026中国航空产业大会10月底南昌启幕:首次与航博会同期举办,聚焦低空经济新路径

2026中国航空产业大会与南昌航空产业博览会将于10月31日至11月4日在南昌国际博览城首次同期举办。大会聚焦低空经济,设置主旨报告、行业专家报告及低空产业洽谈会等主题活动,旨在探讨航空产业新路径,推动低空物流、城市巡检等新业态集聚,打造中部领先、全国知名的航空产业交流高地。

联想来酷Air 16酷睿5 315版开售:国补后3739元,16英寸轻薄本选购指南
科技数码 · 2026-08-28

联想来酷Air 16酷睿5 315版开售:国补后3739元,16英寸轻薄本选购指南

联想来酷Air 16酷睿5 315版于8月27日正式开售,搭载6核处理器与12GB内存,配备16英寸16:10屏幕。叠加国家补贴后预估到手价仅3739 15元,主打长续航与静音办公。本文详细解析其硬件配置、接口布局及购买建议,助您快速决策。

牛来AirPods保护套海外走红:萌趣硅胶设计引发关注
科技数码 · 2026-08-28

牛来AirPods保护套海外走红:萌趣硅胶设计引发关注

一款名为“牛来”的AirPods硅胶保护套在日本市场引发关注,售价约1726日元。其独特的搞怪萌趣造型、兼容多代机型的硅胶材质以及专属挂饰设计,使其在社交平台上迅速走红,成为近期备受瞩目的国产原创数码周边产品。

行李箱选购全攻略:材质、轮子与尺寸避坑指南
科技数码 · 2026-08-28

行李箱选购全攻略:材质、轮子与尺寸避坑指南

选购行李箱时,材质、轮子和尺寸是核心决策点。PP材质抗冲击且轻便,适合频繁托运;万向轮决定推行顺滑度;尺寸需匹配航空限重。本文拆解关键参数,结合具体产品案例,助您选出耐用且实用的行李箱。

《湮灭之潮》成都试玩会:技嘉RTX 5080风魔显卡实测体验
科技数码 · 2026-08-28

《湮灭之潮》成都试玩会:技嘉RTX 5080风魔显卡实测体验

2026年8月《湮灭之潮》成都试玩会圆满举行,千名玩家现场体验西方奇幻大作。文章重点解析技嘉RTX 5080风魔显卡在虚幻5引擎下的表现,涵盖Blackwell架构、DLSS 4 5技术及16GB GDDR7显存对高画质流畅运行的支撑作用。