当前全球具身智能产业发展已不再满足于单点任务的实验室演示,而是对高保真仿真训练、复杂环境泛化、双臂高效协作、自然的交互、精密的作业等系统级能力提出了前所未有的迫切需求。北京人形机器人创新中心(以下简称“北京人形”)锚定底层前沿技术突破,聚焦攻克产业共性问题、推进产业落地应用,2026年开年,北京人形相继在深度学习领域顶级会议ICLR及机器人领域顶级会议ICRA连续发表五篇重磅论文,为具身智能技术的多重要分支领域带来了新的方法论与技术范式。
国际学习表征会议(ICLR)由图灵奖得主Yoshua Bengio和Yann LeCun于2013年创办,是国际公认的深度学习领域国际顶级会议之一,其中ICLR 2026投稿量高达约19000篇,录取率压缩至28%;国际机器人与自动化会议(ICRA)是机器人与自动化领域的权威盛会,由IEEE主办,汇聚全球顶尖学者,涵盖前沿技术与创新应用,ICRA 2026投稿量近5000篇,录取率仅为38%。在如此严苛的筛选机制下,北京人形的五项工作凭借扎实的理论创新与显著的工程价值脱颖而出,不仅填补了相关领域的技术空白,更为机器人在非结构化环境中的高效部署贡献了兼具理论价值与工程可行性的新思路。
论文标题:ArtVIP: Articulated Digital Assets of Visual Realism, Modular Interaction, and Physical Fidelity for Robot Learning
arXiv地址:https://arxiv.org/abs/2506.04941
数据集地址:https://huggingface.co/datasets/x-humanoid-robomind/ArtVIP
收录于:International Conference on Learning Representations (ICLR) 2026
ArtVIP致力于为全球研究者与开发者提供一套高质量、标准化、可复用的铰接物体数字资产库以及一套成熟的生产建模服务,通过低成本、高拟真的仿真资产,提升具身智能模型训练效果。去年10月,ArtVIP被英伟达Isaac Sim最新发布的5.1版本率先引用,受到开发者的一致好评。如今论文被ICLR接收,标志着ArtVIP同时获得工业界与学术界的双重认可。
ArtVIP聚焦复杂铰链物品的物理准确性和视觉真实性,构建了全球最精细的复杂铰接物体库,实现了对高复杂度铰接物品的高精度仿真,在还原物品视觉外观的同时,以高保真度复现了物品物理特性。ArtVIP开源环境中的所有物体,涵盖开关、小型家电、毛绒玩具、笔记本电脑、书籍、调味罐、甚至像挂钟一样的装饰品都支持精确的物理交互,仿真环境中的所有物件都可以像现实中一样使用,例如操作墙面上的开关来控制灯光、开启冰箱门、将物品放置于架上,或通过蹲身开启灶台下方抽屉来挑战运动能力,甚至连灯光色温、光线投射角度等细节都能细腻还原。
论文标题:PD2GS: Part-Level Decoupling and Continuous Deformation of Articulated Objects via Gaussian Splatting
arXiv地址:https://arxiv.org/abs/2506.09663
收录于:International Conference on Learning Representations (ICLR) 2026
为系统性解决具身智能在仿真训练时,数字孪生资产获取难、成本高的问题,北京人形联合安徽大学汪浩文团队等提出PD2GS用更低门槛的多视角图像采集,自动把真实世界里的“可活动对象”(抽屉、门、台灯、折叠支架等)重建成可分部件、可连续控制、还能做运动学标定的仿真资产。该方法不再把每个开合状态各自建模后两两对齐(容易造成部件粘连、漂移、过渡不连续),而是先学习一个共享的“规范形态”3D高斯场,再用状态潜变量驱动的形变网络把它连续变形到任意交互状态;随后依据多状态下的运动轨迹把高斯自动聚成不同刚体部件,并借助视觉语言模型估计“动了几个部件”,再用SAM细化边界与分割,保证部件互斥、边界清晰、整体一致。
为验证真实落地,团队发布RS-Art真实RGB-D数据集:覆盖6类物体、每类3个实例,每个实例采集7个关节状态、400+宽基线观测,并提供反向建模得到的高精度多部件网格与关节轴/限位标注,最终以URDF资产形式开放,可直接接入物理仿真与机器人任务。实验显示PD2GS相比SOTA方法,在几何与运动学精度、以及连续控制一致性上更强: 关节轴角误差降低87%,零部件运动误差降低83%。在RS-Art真实物体上关节与部件运动误差显著降低,重建更稳定、少穿模,更接近“可用的数字孪生资产”。
论文标题:RoboPARA: Dual-Arm Robot Planning with Parallel Allocation and Recomposition Across Tasks
arXiv地址:https://arxiv.org/abs/2506.06683
收录于:International Conference on Learning Representations (ICLR) 2026
为系统解决大模型在复杂规划中的固有缺陷,北京人形技术团队联合北京航空航天大学范肇心团队等等提出了一种名为RoboPARA的双机械臂任务规划框架,创新性地设计了两阶段规划处理流程,实现了对传统规划范式的突破性改进。在第一阶段的依赖图规划候选生成中,系统通过构建有向无环图精确建模任务间的拓扑关系,智能识别并消除冗余操作节点。在第二阶段的图重遍历优化中,算法通过对DAG的智能遍历,在确保任务逻辑完整性的前提下,实现双臂操作并行度的最大化。这种“双重优化”机制显著提升了机械臂的协作效率。
为了验证RoboPARA的有效性,技术团队设计了首个专门设计用于评估双臂任务并行性的数据集X-DAPT(Cross-Scenario Dual-Arm Parallel Task)数据集。包含1000余个任务模块,覆盖了从厨房烹饪到农业温室管理、从办公室服务到工厂组装等10类核心场景,每个场景又细分为不同难度等级。大量实验表明,RoboPARA在各项指标上均显著优于现有方法。在复杂任务组合中,它实现了更高的效率和可靠性。与传统方法相比,RoboPARA的平均并行协作步骤超过4.5倍,执行时间减少30%至50%。在具有挑战性的任务中,其成功率比其他方法的平均水平高出34%,展现出高稳定性和适应性。
论文标题:MLA: A Multisensory Language–Action Model for Multimodal Understanding and Forecasting in Robotic Manipulation
arXiv地址:https://arxiv.org/abs/2509.26642
收录于:IEEE International Conference on Robotics and Automation (ICRA) 2026
聚焦机器人操作领域的核心痛点——现有视觉-语言-动作(VLA)模型对物理世界的感知与动态建模能力不足,北京人形技术团队联合北京大学仉尚航团队等提出了多感官语言-动作(MLA,Multisensory Language–Action)模型,通过融合多模态感知与未来状态预测,显著提升复杂接触类操作任务的性能与泛化性。MLA能够协同处理包括图像、3D点云和触觉信号在内的多种感官信息,核心思路是“无编码器多模态对齐+未来多感官生成”,通过三阶段训练逐步赋予模型感知-理解-动作生成能力。具体来讲,MLA核心创新在于:1)将大语言模型本身作为一个感知模块,直接解读这些多模态信号;2)通过一种训练策略,让模型能够预测未来的多感官状态,从而更好地理解物理动态。
通过真实世界与仿真实验,从性能、消融、泛化三方面实验证明,MLA模型在复杂、接触丰富的真实任务中,性能显著超越现有方法,并展现出更好的泛化能力。其中,在6个真实世界的接触密集型任务(单臂4个:按压印章、擦拭白板等;双臂2个:舀爆米花、开盖取玉米)实验中,MLA均稳定超越2D与3D VLA SOTA模型,尤其在“擦拭白板”等强依赖触觉的任务中优势尤为显著,能通过触觉信号调节末端执行器力度与运动轨迹。综上,MLA更适配真实世界的不确定性,提供了多感官融合的机器人基础模型新范式,为机器人操作向更复杂、更通用的场景落地提供了重要技术支撑。
论文标题:CRAFT: Adapting VLA Models to Contact-rich Manipulation via Force-aware Curriculum Fine-tuning
arXiv地址:http://arxiv.org/abs/2602.12532
收录于:IEEE International Conference on Robotics and Automation (ICRA) 2026
针对当前主流视觉-语言-动作(VLA)模型在精细接触操作任务中“眼高手低”——即视觉语义理解强但物理交互感知弱的痛点,北京人形联合湖南大学王耀南院士团队等提出了一种通用的力感知课程微调框架CRAFT。该研究揭示了多模态学习中的一个根本性挑战:高熵的视觉/语言信息往往会掩盖低熵但对任务至关重要的力觉信号,导致机器人在插拔、擦拭等富接触任务中过度依赖视觉而忽视物理反馈。
为了解决这一模态失衡问题,CRAFT创新性地引入了基于变分信息瓶颈的课程学习机制。该机制采用“先抑后扬”的策略:在训练初期,通过强力压缩视觉与语言的高熵信息流,强制策略网络“专注”于关节力矩等本体感知信号,从而建立稳健的力控表征;随后,随着训练推进逐步释放视觉与语言信息,最终实现多模态信息的有机融合。此外,团队还设计了一套低成本的同构主从遥操作采集系统,可通过关节力矩获取高保真的力交互数据。
CRAFT展现了极强的通用性与落地潜力,作为即插即用的模块,它能无缝适配Pi0、RDT等多种主流VLA架构。在USB插拔、白板擦拭、橡皮泥滚圆等 5 类典型富接触任务的真机实验中,搭载CRAFT的模型任务成功率平均提升约 30%,在擦拭等强力觉依赖任务中更是实现了翻倍的性能增长。更重要的是,CRAFT赋予了模型在面对物体颜色变化、位置偏移等非结构化场景时卓越的泛化能力,为具身智能从“非接触式交互”向“精准力控作业”的跨越提供了关键技术支撑。
从ArtVIP为仿真训练铸造高保真资产底座,到PD2GS赋予机器人“看一眼就懂”的铰接物体感知能力;从RoboPARA让双臂协同从串行等待走向并行高效,到MLA构建眼耳触并用的多模态交互智能,再到CRAFT为通用大模型装上力觉神经——北京人形机器人创新中心技术团队的这五篇顶会成果,在具身智能领域实现了从数据根基、感知建模、任务规划、多模态交互到大模型适应的全链条关键性突破。这些工作不仅为高保真数字资产构建、铰接物体部分级解耦、双臂协同规划、多感官语言-动作理解、力控大模型微调等核心难题提供了原创性解法,更以开源共享的姿态,为全球具身智能社区贡献了可复现、可延展的理论工具与实践范式。
具身智能的进化绝非单点技术的孤军深入,而是全产业链协同创新的系统工程。 面向未来,北京人形将持续深耕具身智能底层前沿领域,以“更开放”的姿态携手全球顶尖高校、科研院所及产业链领军企业,聚焦关键共性技术攻关及产品落地,携手打造“更好用”的具身智能机器人,助力具身智能迈入生产生活的方方面面。
京公网安备11011202100775号