2025年6月22日,京东正式开源了JoyAI-VL-Interaction实时视频视觉语言交互模型,这是全球首个全栈开源的视觉交互模型,同时发布了完整的部署系统。
该模型最大的创新在于突破了传统大模型“一问一答”的被动交互模式。过去的图文或视频大模型依赖用户提问才能响应,面对实时监控或动态场景时,无法自主观察与反馈。这种模式在安防监控、动态实景等应用中显得力不从心。

新模型原生适配vLLM-Omni,实现了持续观看实时画面、自主判断与主动响应的能力,模型自身具备观察与反应的智能,无需人工触发任何指令。
三大核心创新
具体来看,本次革新体现在三个层面:
第一,主动自主判断。模型可持续读取摄像头、监控、直播等实时视频流,自动识别关键事件(如火情、老人摔倒)并主动预警,无异常时保持静默,全程无需人工指令。
第二,低延迟实时响应。模型处理的是“正在发生”的画面,无需等待完整视频上传后再分析,对安防监控、实时翻译、直播讲解等时效性极强的场景意义重大。
第三,前台观测与后台分工协作。遇到复杂推理、代码生成或工具调用等“重任务”时,模型可委托后台Agent处理,前台模型继续不间断观测画面,任务完成后无缝接续交互,确保既不会忽略现场,也不会因复杂推理而卡顿。
开源并非仅限模型权重
京东此次开源内容丰富,涵盖模型权重、专属交互数据集、完整训练方案及可部署工程框架,支持灵活替换语音模块、可视化界面、第三方Agent与业务接口,展现了实质性的开放诚意,而非仅提供权重文件。
实际应用中,模型兼容摄像头、监控流、直播流等多路视频输入,具备长期记忆、语音收发、vLLM快速部署能力。搭建居家老人儿童看护、安防自动预警、直播实时解说、电商导购、智能眼镜无障碍辅助、工业操作指导等实景AI工具的门槛大幅降低。

实测数据验证性能优势
在58组真人盲测案例(覆盖监控预警、实时计数、实时翻译、直播解说等场景)中,对比豆包视频交互助手整体胜率77.6%,对比Gemini视频交互助手整体胜率87.9%。尤其在安防预警场景下,对两款竞品均达成100%胜率。这种压倒性优势源于模型内置的自主交互性,而非外部触发器,使AI真正具备“眼睛”和“脑子”。
