1月8日,在阿里云通义智能硬件展上,阿里云发布了多模态交互开发套件。该套件集成了通义千问、万相、百聆三大基础大模型,并预置了数十款覆盖生活休闲与工作效率提升等场景的Agent和MCP工具。它不仅具备“听懂”与“看懂”的能力,更能进行思考并与物理世界互动,可广泛应用于AI眼镜、学习机、陪伴玩具、智能机器人等各类硬件设备。

随着多模态大模型技术的演进,大模型已逐渐具备理解、感知乃至与物理世界交互的能力。越来越多的硬件与终端设备厂商开始通过接入大模型来升级用户体验。然而,仅凭基础大模型本身,往往难以同时满足硬件设备对低成本、低延迟、功能丰富及高质量效果的多元需求。
阿里云多模态交互开发套件为硬件企业及解决方案提供商打造了一个低开发门槛、响应速度快、场景覆盖广的平台。在芯片层面,该套件适配了三十余款主流的ARM、RISC-V和MIPS架构终端芯片平台,能够满足市面上绝大多数硬件设备的快速接入需求。未来,通义大模型还将与玄铁RISC-V实现软硬全链路的协同优化,实现通义大模型家族在RISC-V架构上的极致高效部署与推理性能。
在模型优化层面,除了通义模型家族外,阿里云还针对海量多模态交互场景进行了深入分析,推出了专为AI硬件交互优化的专属模型。该模型全面支持全双工语音、视频、图文等多种交互方式,端到端语音交互时延可低至1秒,视频交互时延则能控制在1.5秒以内。
此外,该套件预置了十余款MCP工具与Agent,覆盖生活、工作、娱乐、教育等多个场景。例如,基于预置的出行规划Agent,用户可以直接调用路线规划、旅行攻略、吃喝玩乐探索等能力。该套件还接入了阿里云百炼平台生态,用户不仅可以添加其他开发者提供的MCP和Agent模板,还能通过A2A协议兼容第三方Agent,极大地扩展了应用的能力边界,帮助企业灵活搭建业务场景。

展会现场,阿里云还展示了面向智能穿戴设备、陪伴机器人、具身智能等领域的解决方案。以AI眼镜领域为例,基于千问VL、百聆CosyVoice等模型,阿里云打造了涵盖感知层、规划层、执行层以及长期记忆的完整交互链路,可一站式实现同声传译、拍照翻译、多模态备忘记录、录音转写等功能,有效解决了交互不自然、回答准确率低的难题。面向家庭陪伴机器人场景,基于千问模型和多模态交互套件,阿里云推出的解决方案不仅能实时监测异常状况并及时推送报警信息,用户还能基于关键词查找、定位视频,与机器人进行对话交互和设备控制等。
根据国际权威市场研究机构Gartner发布的GenAI(生成式AI)技术创新指南系列报告,阿里云在GenAI云基础设施、GenAI工程、GenAI模型及AI知识管理应用四大维度均位于新兴领导者象限,是入选全部四项新兴领导者象限的唯一亚太厂商,比肩谷歌、OpenAI。
