0

0

让机器人感知你的「Here you are」,清华团队使用百万场景打造通用人机交接

WBOY

WBOY

发布时间:2024-01-12 08:57:13

|

1429人浏览过

|

来源于51CTO.COM

转载

清华大学交叉信息研究院的研究者提出了名为"GenH2R"的框架,该框架旨在让机器人学习通用的基于视觉的人机交接策略。这种策略使得机器人能够更可靠地接住各种形状多样、运动轨迹复杂的物体,为人机交互带来了新的可能性。这项研究为人工智能领域的发展提供了重要的突破,为机器人在现实场景中的应用带来了更大的灵活性和适应性。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

让机器人感知你的「Here you are」,清华团队使用百万场景打造通用人机交接

随着具身智能(Embodied AI)时代的来临,我们期待智能体能主动与环境进行交互。在这个过程中,让机器人融入人类生活环境、与人类进行交互(Human Robot Interaction)变得至关重要。我们需要思考如何理解人类的行为和意图,以最符合人类期望的方式满足其需求,将人类放在具身智能的中心(Human-Centered Embodied AI)。其中一个关键的技能是可泛化的人机交接(Generalizable Human-to-Robot Handover),它使机器人能够更好地与人类合作,完成各种日常通用任务,如烹饪、居室整理和家具组装等。

大模型的火爆发展预示着海量高质量数据+大规模学习是走向通用智能的一种可能方式,那么能否通过海量机器人数据与大规模策略模仿获取通用人机交接技能?然而,若考虑在现实世界中让机器人与人类进行大规模交互学习是危险且昂贵的,机器很有可能会伤害到人类:

让机器人感知你的「Here you are」,清华团队使用百万场景打造通用人机交接

在仿真环境中进行训练,并利用人物仿真和动态抓取运动规划来自动化提供大量多样的机器人学习数据,然后将这些数据应用到真实机器人上,这种基于学习的方法被称为"Sim-to-Real Transfer",它能够显著提升机器人与人类之间的协作交互能力,并且具有更高的可靠性。

让机器人感知你的「Here you are」,清华团队使用百万场景打造通用人机交接

因此,「GenH2R」框架被提出,分别从仿真(Simulation),示例(Demonstration),模仿(Imitation)三个角度出发,让机器人第一次基于端到端的方式学习对任意抓取方式、任意交接轨迹、任意物体几何的通用交接:1)在「GenH2R-Sim」环境中提供了百万级别的易于生成的各种复杂仿真交接场景,2)引入一套自动化的基于视觉 - 动作协同的专家示例(Expert Demonstrations)生成流程,3)使用基于 4D 信息和预测辅助(点云 + 时间)的模仿学习(Imitation Learning)方法。

与SOTA方法(CVPR2023 Highlight)相比,GenH2R的方法在各种测试集上的平均成功率提高了14%,时间缩短了13%,并且在真机实验中表现更加稳健。

让机器人感知你的「Here you are」,清华团队使用百万场景打造通用人机交接


  • 论文地址:https://arxiv.org/abs/2401.00929
  • 论文主页:https://GenH2R.github.io
  • 论文视频:https://youtu.be/BbphK5QlS1Y

方法介绍

为了帮助尚未通关的玩家,让我们一起了解一下“仿真环境(GenH2R-Sim)”的具体解谜方法吧。

为了生成高质量、大规模的人手 - 物体数据集,GenH2R-Sim 环境从抓取姿势和运动轨迹两方面对场景建模。

在抓取姿势方面,GenH2R-Sim 从 ShapeNet 中引入了丰富的 3D 物体模型,从中挑选出 3266 个适合交接的日常物体,使用灵巧抓取的生成方法(DexGraspNet),总共生成了 100 万个人手抓住物体的场景。在运动轨迹方面,GenH2R-Sim 使用若干控制点生成多段光滑的 Bézier 曲线,并引入人手和物体的旋转,模拟出手递物体的各种复杂运动轨迹。

让机器人感知你的「Here you are」,清华团队使用百万场景打造通用人机交接

GenH2R-Sim 的 100 万场景中,不仅在运动轨迹(1 千 vs 100 万)、物体数量(20 vs 3266)两方面远超之前最新工作,此外,还引入了接近真实情境的互动信息(如机械臂足够靠近物体时,人会配合停止运动,等待完成交接),而非简单的轨迹播放。尽管仿真生成的数据不能完全逼真,但实验结果表明,相比小规模的真实数据,大规模的仿真数据更有助于学习。

B. 大规模生成利于蒸馏的专家示例

基于大规模的人手和物体运动轨迹数据,GenH2R 自动化地生成了大量专家示例。GenH2R 寻求的 “专家” 是经过改进后的 Motion Planner(如 OMG Planner),这些方法是非学习、基于控制优化的,不依赖于视觉的点云,往往需要一些场景状态(比如物体的目标抓取位置)。为了确保后续的视觉策略网络能够蒸馏出有益于学习的信息,关键在于确保 “专家” 提供的示例具有视觉 - 动作相关性(Vision-action correlation)。规划时如果知道最后落点,那么机械臂可以忽略视觉而直接规划到最终位置 “守株待兔”,这样可能会导致机器人的相机无法看到物体,这种示例对于下游的视觉策略网络并没有任何帮助;而如果频繁地根据物体位置进行重新规划,可能会导致机械臂动作不连续,出现奇怪的形态,无法完成合理的抓取。

让机器人感知你的「Here you are」,清华团队使用百万场景打造通用人机交接

为了生成出利于蒸馏(Distillation-friendly)的专家示例,GenH2R 引入了 Landmark Planning。人手的运动轨迹会按照轨迹光滑程度和距离被分成多段,以 Landmark 作为分割标记。在每一段中,人手轨迹是光滑的,专家方法会朝着 Landmark 点进行规划。这种方法可以同时保证视觉 - 动作相关性和动作连续性。

让机器人感知你的「Here you are」,清华团队使用百万场景打造通用人机交接

C. 以预测为辅助的 4D 模仿学习网络

基于大规模专家示例,GenH2R 使用模仿学习的方法,构建 4D 策略网络,对观察到的时序点云信息进行几何和运动的分解。对于每一帧点云,通过迭代最近点算法(Iterative Closest Point)计算和上一帧点云之间的位姿变换,以估计出每个点的流(flow)信息,使得每一帧点云都具有运动特征。接着,使用 PointNet++ 对每一帧点云编码,最后不仅解码出最终需要的 6D egocentric 动作,还会额外输出一个物体未来位姿的预测,增强策略网络对未来手和物体运动的预测能力。

让机器人感知你的「Here you are」,清华团队使用百万场景打造通用人机交接

不同于更加复杂的 4D Backbone(例如 Transformer-based),这种网络架构的推理速度很快,更适用于交接物体这种需要低延时的人机交互场景,同时它也能有效地利用时序信息,做到了简单性和有效性的平衡。

实验

A. 仿真环境实验

GenH2R 和 SOTA 方法进行了各种设定下的比较,相比于使用小规模真实数据训练的方法,在 GenH2R-Sim 中使用大规模仿真数据进行训练的方法,可以取得显著的优势(在各种测试集上成功率平均提升 14%,时间上缩短 13%)。

在真实数据测试集 s0 中,GenH2R 的方法可以成功交接更复杂的物体,并且能够提前调整姿势,避免在夹爪靠近物体时再频繁进行姿势调整:

让机器人感知你的「Here you are」,清华团队使用百万场景打造通用人机交接

在仿真数据测试集 t0(GenH2R-sim 引入)中,GenH2R 的方法可以能够预测物体的未来姿势,以实现更加合理的接近轨迹:

让机器人感知你的「Here you are」,清华团队使用百万场景打造通用人机交接

在真实数据测试集 t1(GenH2R-sim 从 HOI4D 引入,比之前工作的 s0 测试集增大约 7 倍)中,GenH2R 的方法可以泛化到没有见过的、具有不同几何形状的真实世界物体。

B. 真机实验

GenH2R 同时将学到的策略部署到现实世界中的机械臂上,完成 “sim-to-real“的跳跃。

对于更复杂的运动轨迹(例如旋转),GenH2R 的策略展示出更强的适应能力;对于更复杂的几何,GenH2R 的方法更可以展现出更强的泛化性:

让机器人感知你的「Here you are」,清华团队使用百万场景打造通用人机交接

GenH2R 完成了对于各种交接物体的真机测试以及用户调研,展示出很强的鲁棒性。

让机器人感知你的「Here you are」,清华团队使用百万场景打造通用人机交接

了解更多实验、方法内容,请参考论文主页。

团队介绍

该论文来自清华大学 3DVICI Lab、上海人工智能实验室和上海期智研究院,论文的作者为清华大学学生汪子凡(共同一作)、陈峻宇(共同一作)、陈梓青和谢鹏威,指导老师是弋力和陈睿。

清华大学三维视觉计算与机器智能实验室(简称 3DVICI Lab),是清华大学交叉信息研究院下的人工智能实验室,由弋力教授组建和指导。3DVICI Lab 瞄准人工智能最前沿的通用三维视觉与智能机器人交互问题,研究方向涵盖具身感知、交互规划与生成、人机协作等,与机器人、虚拟现实、自动驾驶等应用领域密切联系。团队研究目标是使智能体具备理解并与三维世界交互的能力,成果发表于各大顶级计算机会议、期刊上。

相关专题

更多
页面置换算法
页面置换算法

页面置换算法是操作系统中用来决定在内存中哪些页面应该被换出以便为新的页面提供空间的算法。本专题为大家提供页面置换算法的相关文章,大家可以免费体验。

389

2023.08.14

人工智能在生活中的应用
人工智能在生活中的应用

人工智能在生活中的应用有语音助手、无人驾驶、金融服务、医疗诊断、智能家居、智能推荐、自然语言处理和游戏设计等。本专题为大家提供人工智能相关的文章、下载、课程内容,供大家免费下载体验。

405

2023.08.17

人工智能的基本概念是什么
人工智能的基本概念是什么

人工智能的英文缩写为AI,是研究、开发用于模拟、延伸和扩展人的智能的理论、方法、技术及应用系统的一门新的技术科学;该领域的研究包括机器人、语言识别、图像识别、自然语言处理和专家系统等。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

291

2024.01.09

人工智能不能取代人类的原因是什么
人工智能不能取代人类的原因是什么

人工智能不能取代人类的原因包括情感与意识、创造力与想象力、伦理与道德、社会交往与沟通能力、灵活性与适应性、持续学习和自我提升等。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

621

2024.09.10

Python 人工智能
Python 人工智能

本专题聚焦 Python 在人工智能与机器学习领域的核心应用,系统讲解数据预处理、特征工程、监督与无监督学习、模型训练与评估、超参数调优等关键知识。通过实战案例(如房价预测、图像分类、文本情感分析),帮助学习者全面掌握 Python 机器学习模型的构建与实战能力。

32

2025.10.21

http与https有哪些区别
http与https有哪些区别

http与https的区别:1、协议安全性;2、连接方式;3、证书管理;4、连接状态;5、端口号;6、资源消耗;7、兼容性。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

1734

2024.08.16

PHP 命令行脚本与自动化任务开发
PHP 命令行脚本与自动化任务开发

本专题系统讲解 PHP 在命令行环境(CLI)下的开发与应用,内容涵盖 PHP CLI 基础、参数解析、文件与目录操作、日志输出、异常处理,以及与 Linux 定时任务(Cron)的结合使用。通过实战示例,帮助开发者掌握使用 PHP 构建 自动化脚本、批处理工具与后台任务程序 的能力。

21

2025.12.13

php源码安装教程大全
php源码安装教程大全

本专题整合了php源码安装教程,阅读专题下面的文章了解更多详细内容。

65

2025.12.31

php网站源码教程大全
php网站源码教程大全

本专题整合了php网站源码相关教程,阅读专题下面的文章了解更多详细内容。

44

2025.12.31

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
Django 教程
Django 教程

共28课时 | 2.7万人学习

Go 教程
Go 教程

共32课时 | 3.2万人学习

TypeScript 教程
TypeScript 教程

共19课时 | 1.9万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号