成果介绍
在具身机器人应用领域,传统动作预测技术面临 “多模态信息融合不充分”“动作预测准确率低”“场景适应性弱” 等核心痛点:多数机器人仅依赖单一模态(如文本指令或图像)进行动作预测,忽略文本与视觉信息的关联性,导致复杂场景下(如 “根据零件图像调整抓取角度”)动作预测误差率超 20%;图像特征处理多停留在单帧分析,未形成序列化特征,无法捕捉环境动态变化(如零件位置偏移),进一步降低预测精度;同时,文本指令与视觉特征的融合方式简单(如直接拼接),模态间语义鸿沟大,导致 “指令 - 动作” 映射不精准,机械臂抓取失败率、操作偏差率居高不下。据统计,工业场景中因动作预测不准导致的机器人作业返工率超 15%,严重制约具身机器人的规模化应用。
史河机器人(合肥)有限公司研发的 “基于多模态流匹配的具身机器人动作预测方法及装置”(专利号:CN202511259401.3),通过 “多模态深度融合 + 序列化特征处理” 突破上述瓶颈。该方法核心流程包括:其一,多源信息采集与预处理 —— 同步获取用户指令文本(如 “抓取红色圆柱零件”)。
成果亮点
当前具身机器人动作预测技术存在三大短板:一是多模态融合程度浅,文本与视觉信息多为 “简单叠加”,未解决模态间语义不一致问题,融合特征利用率不足 60%;二是视觉特征处理缺乏序列化思维,单帧图像无法反映环境动态变化,导致机器人对移动目标、位置偏移的预测滞后;三是动作预测模型泛化能力弱,针对不同场景(如工业抓取、医疗操作)需重新训练,适配成本高、周期长。
本专利技术的亮点在于 “多模态深度流匹配 + 序列化特征优化 + 高泛化适配” 的三重创新:其一,多模态流匹配融合技术,国内首创基于注意力机制的跨模态关联模型 —— 通过动态权重分配(文本语义关键信息权重占比 40%-60%,视觉空间特征权重占比 40%-60%),精准捕捉 “指令文本语义 - 视觉空间特征” 的对应关系(如 “红色” 对应图像 RGB 特征,“圆柱” 对应深度图像轮廓特征),模态融合效率较传统拼接方式提升 80%,动作预测准确率提升 20 个百分点;其二,序列化视觉特征处理,突破单帧图像局限,通过时序卷积网络(TCN)对多帧图像特征进行拼接与精炼,提取 “环境动态变化趋势”(如零件移动速度、角度偏移)。
团队介绍
1. 胡懋成:本专利第一发明人,史河机器人(合肥)有限公司首席技术官,拥有 15 年智能机器人研发经验,主持安徽省重点研发计划项目 3 项,在多模态融合、机器人动作控制领域发表 SCI 论文 12 篇,获授权发明专利 8 项,负责本技术的整体架构设计,主导多模态流匹配算法与动作预测模型的核心研发;
2. 孙吴强:本专利核心发明人,公司算法研发部经理,专注计算机视觉与跨模态融合技术,主导本技术中 “图像序列特征处理 + 深度图像融合” 模块开发,通过时序卷积网络与空间对齐算法,将视觉特征利用率提升至 90%,曾获合肥市人工智能优秀工程师称号;
3. 刘鬯:本专利发明人,公司自然语言处理专家,负责指令文本语义特征提取与模态流匹配注意力机制设计,基于预训练语言模型(如 BERT)优化文本特征精度,使 “指令 - 视觉” 语义关联度提升 70%;
4. 石乾:本专利发明人,公司硬件集成工程师,负责动作预测装置与机器人机械臂的对接调试,开发兼容 6 轴、7 轴机械臂的控制接口,解决 “预测特征 - 机械臂执行” 的参数映射问题,确保预测动作精准落地;
成果资料
产业化落地方案