阿里云发布全新多模态交互开发套件 可应用于AI眼镜、机器人等
产品发布与核心功能 - 阿里云全新发布集成通义千问、万相、百聆三款基础大模型的多模态交互开发套件 [1] - 该套件能听、会看、能思考并与物理世界交互,可应用于AI眼镜、学习机、陪伴玩具、智能机器人等硬件设备 [1] - 套件预置了十多款覆盖生活休闲、工作效率等领域的Agent和MCP工具 [1] 技术适配与性能优化 - 套件在芯片层面适配了30多款主流ARM、RISC-V和MIPS架构终端芯片平台,满足绝大多数硬件设备的快速接入需求 [1] - 未来通义大模型将与玄铁RISC-V实现软硬全链路协同优化,以实现大模型在RISC-V架构上的极致高效部署和推理性能 [1] - 阿里云针对多模态交互场景推出专有模型,全面支持全双工语音、视频、图文交互,端到端语音交互时延低至1秒,视频交互时延低至1.5秒 [1] 应用场景与解决方案 - 套件预置的MCP工具和Agent覆盖生活、工作、娱乐、教育等多个场景,例如出行规划Agent可调用路线规划、旅行攻略等能力 [1] - 在AI眼镜领域,基于千问VL、百聆CosyVoice等模型打造了完整交互链路,可实现同声传译、拍照翻译、多模态备忘录、录音转写功能 [2] - 面向家庭陪伴机器人场景,解决方案可实时监测异常状况并告警,支持用户基于关键词查找视频、与机器人对话及控制设备 [2] 生态扩展与平台能力 - 该套件接入了阿里云百炼平台生态,用户可添加其他开发者提供的MCP和Agent模板 [2] - 套件通过A2A协议兼容三方Agent,极大程度扩展了应用能力边界,帮助企业灵活搭建业务场景 [2]