当前生成模型在单次任务中表现优异,但在持续数小时、跨媒介的长程创作中常面临上下文丢失与状态不可控的问题。JarvisHub 通过画布原生架构将项目状态显式化,结合协议约束与反馈修复机制,为多模态创作 Agent 提供可观察、可协作、可恢复的运行底座。
画布原生项目状态:把创作过程变成可编辑图谱
JarvisHub 将项目表示为一张「有类型的多模态资产图」。节点保存图片、视频、音频、UI、文本等内容,并携带位置、可编辑输入、生成输出、来源信息、执行诊断和运行状态;节点之间的边描述参考关系、版本关系、生成依赖、分组关系或流程延续。
这种设计带来三个关键特性:
- 可寻址:Agent 可以明确指向「第三版网页预览」或「已被用户选中的第二个镜头」,不再依赖模糊的对话指代。
- 可复用:参考素材、草稿、被否决的候选或中间结果,都能在后续生成与编辑步骤中再次成为输入。
- 可检查:用户和 Agent 可以追溯某个结果受到哪些材料影响、沿用了哪个版本,以及哪些下游内容会受一次修改波及。
与传统聊天式 Agent 或节点式工作流相比,JarvisHub 的核心差异在于统一且可持续更新的项目状态,使创作过程从黑盒变为可编辑、可追踪的图谱。
三层核心架构与协议约束机制
JarvisHub 的核心由三层组成:
- Canvas State:保存素材、版本、依赖与用户选择。
- Protocol Bridge:负责权限、能力清单、动作校验和写入控制。
- Agent Runtime:负责观察画布、规划动作、编排工具,并把可验证的结果重新合并进画布。
其下方的轨迹记录、评估器、人类编辑与检查点,为反馈、恢复和后续分析提供证据。
协议约束的画布操作
长流程创作要可靠,关键不只是让 Agent 会调用更多工具,还要让每次修改显式、合法并可恢复。JarvisHub 为每一轮提供 Capability Manifest,列出当前可用的节点类型、变更操作、工具与资产句柄,限定本轮允许执行的动作。只有能被编码为受检工具调用、画布变更、评估请求、澄清请求或用户回复的行为,才会真正落到项目里。
这意味着画布变化不再隐藏在模型内部:Agent 新建了什么、更新了什么、调用了哪个工具、得到什么观察、为何进入下一步,都能通过协议桥写入轨迹。权限与状态边界也因此更加清楚。
反馈驱动的局部修复
反馈可以来自用户与评估子 Agent。用户可以选择候选、否决版本、修改提示词、调整风格或指出局部缺陷;系统完成创作时,也可以调用子 Agent 检查一致性、缺失证据、视觉质量与任务约束。
反馈的作用不是给中间结果简单打分,而是决定下一次状态转移:沿用已接受节点继续、局部修复失败节点、向用户澄清,或在证据不足时停止。这种机制将「重做一遍」转变为「只修坏掉的节点」,显著提升长程创作的效率与可控性。
交互循环与五类工具覆盖
一轮交互如何发生
每一轮从用户请求开始。运行时先读取共享画布,理解当前素材、依赖、版本和状态;随后在能力清单与执行授权范围内选择动作,调用相应能力并获得工具观察;协议桥验证后,将结果、状态与证据写回画布;用户再在同一画布中检查、选择、编辑或反馈,进入下一轮。
五类工具覆盖创作与恢复
- Canvas Tools:读取、创建、更新、连接、分组、选择和分支节点,并维护资产句柄与运行状态。
- Generation Tools:负责图像、视频、音频和组合媒体生成。
- Native Tools:连接浏览器、文件、代码、搜索、文档和演示文稿等外部执行环境,并返回可检查的产物。
- Recovery Tools:提供结构化反馈、验证、检查点和局部修复。
- MCP Tools:让外部服务在同一套 Manifest 与 Grant 约束下接入。
Skills、Memory 与 Subagents
工具决定「能做什么」,Skills、Memory 和 Subagents 则帮助运行时决定「怎样把事情做完」。
- Skills 封装故事板、参考图引导生成、设计还原网页、视频提示词或演示文稿构建等可复用流程。
- Memory 保留用户偏好、既有选择与跨轮次知识。
- Subagents 在工作流可分支时并行处理相对独立的子任务,再由主 Agent 选择结果并合并回项目图。
轨迹清晰可见
JarvisHub 记录的不只是最终作品,还包括每轮用户请求、执行前画布、可用能力、授权范围、选定动作、工具观察、反馈、修复决策与更新后的画布。由此,研究者可以看到 Agent 是否忽略参考、丢失用户已经接受的选择、覆盖有用版本,或在本应局部修复时错误地进行全局重生成。
实验案例:叙事媒体、网页开发与演示文稿
叙事媒体生成
系统接到「制作一部关于牛仔机器人僵尸拾荒者的短剧」后,在画布中外化任务简报、故事规划、视觉参考、镜头候选、依赖关系和生成进度。最终关键帧保持了反复出现的机器人牛仔、海边场景与叙事动作线索,展示了长流程中角色身份、风格与跨镜头连续性的管理方式。
交互式网页开发
网页任务要求创建一个轻盈、Awwwards 风格、带丰富动画的个人摄影网站。画布同时跟踪设计参考、布局草案、实现产物、页面预览与修订状态,让 Agent 不必在「视觉方向」和「代码进度」之间反复丢失上下文。最终页面在排版、图片摆放、页面结构和整体视觉方向上保持一致。
演示文稿生成
第三个任务是制作一份「斯坦福课程风格」的机器学习决策树 PPT。画布记录课程内容、生成图示、幻灯片草稿、依赖关系、PowerPoint 预览和修改进度。最终结果在主题组织、图示风格、强调色与跨页布局上保持一致,说明系统能够把内容筛选、叙事编排、视觉合成和页面级检查串成长流程。
三个案例共同验证了:开放目标可以被拆成可观察的项目状态,参考与候选可以被持续复用,工具执行能返回可检查证据,用户反馈能决定下一次局部更新,而最终作品与生产过程可以同时保留下来。
研究价值与现实边界
从「评成品」走向「评过程」
开放 Harness 为未来创作 Agent 研究提供了三条更具体的路径:
- 构建 Project-State Benchmark:任务不只给一个提示词和目标答案,还提供初始画布、参考材料、可用工具、约束、反馈事件和预期检查点。
- 把最终质量与过程指标结合起来,评估上下文保持、工具选择、依赖正确性、反馈遵循与修复成功率。
- 每次运行都能沉淀结构化的状态、动作、观察、反馈与修复数据,为训练后续 Agent 形成数据飞轮。
生成式 AI 的下一阶段,是能否在一个不断变化的项目中持续工作:理解现有状态、接住用户选择、调度合适工具、保留过程证据,并在错误发生后恢复。JarvisHub 把这一问题落到一张人和 Agent 都能读写的画布上。
当提示词、参考、候选、版本、依赖、反馈和检查点都成为可寻址的项目对象,创作 Agent 才真正有机会从「一次性生成器」走向可协作、可观察、可纠偏的长期创作伙伴。对于研究者而言,它也提供了一个开放入口:不只研究最终作品好不好,更研究 Agent 是如何一步步把作品做出来的。
项目主页:https://www.jarvishub.site/
GitHub:https://github.com/LYL1015/JarvisHub
论文全文:JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents
作者团队:JarvisX Team;核心贡献者 Yunlong Lin、Zixu Lin、Zhaohu Xing;学术顾问 Tianyu Pang、Xiangyu Yue。
