当AI能够“看图写代码”,真正的挑战才刚刚开始
一张截图,AI便能自动生成代码——这如今已并非新鲜事。真正让这个领域充满挑战的,是如何确保生成的结果能够经得起实际执行与交互的检验。
以往的“文生代码”模式,主要依靠将需求以文字形式描述出来。但不可否认,文字在表达空间层次与复杂结构时,往往显得不够精准。一张图片所承载的信息,常常需要大段文字才能说清。特别是对于前端界面、数据可视化图表、CAD图形等任务,视觉输入显然更为直观和完整。随着多模态大语言模型(MLLM)的日益成熟,能够理解图像、界面与图表的“多模态代码智能”,自然成为了研究的新热点。
近期,美团、香港大学、香港中文大学的研究团队联合发布了一篇综述,系统梳理了该领域的主要任务与关键瓶颈,并指出了四个值得长期关注的研究方向。

论文链接:https://arxiv.org/abs/2606.15932
值得关注的是,以IWR-Bench基准为例,当前模型在视觉保真度上虽能达到64.25%,但交互功能正确率仅有24.39%。这表明,仅仅依赖视觉相似性远远不够,评估必须深入到语义理解、结构正确性、执行效果与交互功能层面。相关项目已在GitHub上开源。

当前研究进展
研究团队将多模态代码智能的任务划分为两大类:一类是“多模态代码合成”,其核心在于视觉信息的引导下生成、编辑与优化代码;另一类是“代码中心的推理与行动”,即将代码不仅视为最终产物,更作为推理、工具调用及Agent执行任务的中间接口。
基于这一框架,现有研究可归纳为四个主要方向:

图|多模态代码智能领域概览。
GUI方向
网页代码生成的验证闭环较为清晰,但现有评测仍侧重于静态视觉相似度。IWR-Bench上64.25%的视觉保真度与24.39%的交互正确率之间的显著差距,便是最典型的例证。相比之下,移动端因缺乏统一的执行与交互环境,评测标准化面临更大挑战。

图|网页和移动应用中的GUI代码生成任务示例。
科学可视化
核心要求已超越代码运行本身——生成的代码必须准确传达数据语义、文档结构或科学过程。仅渲染正确远远不够,背后的机制必须准确无误。

图|科学可视化代码生成任务示例,包括图表、文档、演示文稿和示范内容。
结构化图形
核心在于从像素相似性转向结构正确性。例如,SVG需保持易于编辑的特性,流程图需保留逻辑拓扑结构与关系类型,CAD则需恢复参数化的构造逻辑、约束条件与特征依赖。视觉上再相似,结构错误便是本质错误。

图|结构化图形生成任务示例。
前沿任务
此类任务将代码的定位从“最终产物”扩展为“推理与执行接口”,涵盖了程序化视觉操作、视频代码生成、具身控制、视觉驱动的编程,以及统一的多模态代码生成框架。

图|前沿任务与框架部分的任务,包括程序化视觉操作、视频代码生成、具身控制、视觉驱动的编程以及统一框架。
未来发展方向
随着前沿任务将代码推向交互、执行与控制,现有评估体系的局限性也愈发明显。基于此,研究团队提出了四个值得关注的方向。
1. 多信号验证
单一指标显然无法全面评估问题——视觉相似度高未必代表结构正确,参考代码相似度高也不意味着程序可执行,主观偏好评估往往只能反映局部属性。未来的评估不应只给出一个总分,而应形成一份细化的“诊断报告”,分别汇报视觉保真度、执行成功率、文本正确性、数据/语义保真度、结构有效性、可编辑性及交互正确性。同时,评估设计需明确系统究竟在优化什么、使用了哪些验证器,并区分训练阶段的奖励信号与最终的可靠性检查。
2. 多状态验证
涉及状态变化的视觉-代码任务,不能局限于孤立的静态结果。GUI领域最能说明问题:一个页面或许在视觉上还原了截图,但点击、路由跳转、窗口缩放或状态更新时可能全面失效。这一挑战在其他场景中同样存在:科学演示代码能运行却传达了错误机制,视频脚本关键帧正确却丢失了事件时序,具身程序最终目标完成却在接触或遮挡下失效。未来的基准测试必须覆盖完整的执行链条——初始状态、生成的代码/动作、中间观测、预期状态转换、验证器输出以及恢复案例。
3. 跨任务迁移测试
评估统一模型时,不能仅关注其是否支持更多任务格式,关键在于其学到的能力能否跨任务迁移。重点并非覆盖面,而在于模型是否真正获得了可复用的视觉-代码能力,例如布局推理、符号关系建模与交互理解,而非仅在几个单项任务上分别提升。需要设计专门的迁移测试协议,对比基础模型、源任务增强模型及面向目标任务单独优化的对照模型,同时报告正向迁移与负向迁移。
4. 可验证的Agent轨迹
对于面向Agent的视觉-代码系统,未来需要保留更完整的过程证据,将视觉依据、工具调用、代码修改与最终结果串联成一条可追溯的链条。仅凭任务是否最终成功,远远不够。研究团队提出建立“Agent证据日志”——每条记录应包括:所依据的观测数据、引用的视觉区域或工具输出、修改过的代码或动作、预期会改进的验证器结果、回放结果,以及在证据不足时触发的回退决策。这样的日志能使失败能够定位到更具体的环节,使Agent驱动的多模态代码系统不再是仅依赖最终成功率的黑盒。
现存问题
综上所述,当前多模态代码智能的关键瓶颈,不限于生成能力本身,更在于缺乏足够可靠的验证机制。现有评测大多依赖单一视觉信号,难以覆盖交互、状态变化、结构约束与时间序列过程:
- 网页任务中,单张截图难以判断点击、路由与状态切换是否正确;
- 图表任务中,渲染相似并不等同于数据恢复准确;
- SVG、流程图与CAD任务中,视觉接近也可能掩盖结构、逻辑或参数约束的错误;
- 视频与机器人任务中,任务完成也不意味着时序过程或物理行为真实可靠。
与此同时,现有研究在数据集选择、评估指标与任务设定上缺乏统一标准,不同方法的结果难以直接进行横向比较;数据泄露、基准饱和以及评估敏感性等问题,进一步削弱了结论的鲁棒性与可靠性。
最后需要提醒的是:多模态代码智能虽有望降低视觉编程门槛,但若验证不足,可能带来网页交互失效、图表数据错误、结构信息丢失、科学机制表达失真以及物理动作不安全等现实风险。此外,截图与设计文件可能包含私有信息,生成的代码也可能在专有环境中泄露或被误用——这些风险并非技术本身能够自动解决。
