社区学习工具库休闲

简体中文

首页 > 科技周边 > 人工智能 > 正文

北大具身智能新成果：无需训练，听指令就能灵活走位

PHPz

发布： 2023-11-06 14:29:11

转载

756 人浏览过

北京大学董豪团队具身导航最新成果来了：

无需额外建图和训练，只需说出导航指令，如：

Walk forward across the room and walk through the panty followed by the kitchen. Stand at the end of the kitchen

我们就能控制机器人灵活移动。

北大具身智能新成果：无需训练，听指令就能灵活走位

在此，机器人靠的是主动与大模型构成的“专家团队”沟通完成指令分析、视觉感知、完成估计和决策测试等一系列视觉语言导航关键任务。

北大具身智能新成果：无需训练，听指令就能灵活走位

目前项目主页和论文都已上线，代码即将推出：

北大具身智能新成果：无需训练，听指令就能灵活走位

机器人如何根据人类指令导航？

视觉语言导航涉及到一系列子任务，包括指令分析，视觉感知，完成估计和决策测试。

这些关键任务需要不同领域知识，它们环环相扣决定机器人的导航能力。

受到现实中专家讨论行为的启发，北大董豪团队提出DiscussNav导航系统。

作者首先以提示方式赋予LLM（大语言模型）和MLM（多模态大模型）专家角色和特定任务，激活它们的领域知识和能力，由此构建具备不同特长的视觉导航专家团队。

北大具身智能新成果：无需训练，听指令就能灵活走位

然后，作者设计了讨论问题语料库和讨论机制，遵循该机制，由LLM驱动的导航机器人可以主动发起一系列与视觉导航专家的讨论。

北大具身智能新成果：无需训练，听指令就能灵活走位

在每一步移动前，导航机器人都会与专家讨论来理解人类指令中要求的动作和提及的物体标志。

进而依据这些物体标志的类型有倾向性地对周围环境进行感知，指令完成情况估计，由此做出初步的移动决策。

北大具身智能新成果：无需训练，听指令就能灵活走位

在决策过程中，导航机器人会根据Chain-of-Thought（思维链）同时生成N个独立的预测结果，当这些预测结果之间不一致时，机器人会向决策测试专家求助，筛选出最终的移动决策。

从这个过程我们可以看到，相比传统方法需要进行额外的预训练，这个方法通过与大模型专家交互指导机器人根据人类指令移动，直接解决了机器人导航训练数据稀缺的问题。

更进一步，正是由于这个特点，它也实现了零样本能力，只要遵循以上讨论流程，就能follow多样的导航指令。

以下是DiscussNav在经典的视觉语言导航数据集Room2Room上的表现。

北大具身智能新成果：无需训练，听指令就能灵活走位

可以看到，它显著高于所有零样本方法，甚至超过两个经过训练的方法。

作者进一步在Turtlebot4移动机器人上开展真实室内场景导航实验。

凭借专家角色扮演和讨论激发出的大模型强大的语言和视觉泛化能力，DiscussNav在真实世界的表现明显优于之前最优的零样本方法和经过预训练微调的方法，展现出良好的sim-to-real迁移能力。

北大具身智能新成果：无需训练，听指令就能灵活走位

通过实验，作者进一步发现，DiscussNav产生了4个强大的能力：

1、识别开放世界物体，比如“白色桌子上的机械手臂”，“椅子上的泰迪熊”。

2、识别细粒度的导航标志物体，比如“厨房柜台上的植物”，“桌上的纸箱”。

3、纠正其它专家在讨论中回复的错误信息，比如标志提取专家在从导航动作序列提取导航标志前会检查并纠正被错误分解的动作序列。

4、排除不一致的移动决策，比如决策测试专家们可以根据当前环境信息从DiscussNav预测的多个不一致的移动决策中选择最合理的一个作为最终移动决定。

“仿真和大模型先验是Free Lunch”

通讯作者董豪在之前的报告中提出，深入探索如何有效利用仿真数据和大模型从海量数据中学习到的先验知识是未来具身智能研究的发展方向。

目前受限于数据规模和探索真实环境的高昂成本，具身智能研究仍将重点关注仿真平台实验和仿真数据训练。

近期大模型的进展为具身智能提供新方向，合理发掘和利用大模型中存在的语言常识和物理世界先验将推动具身智能发展。

北大具身智能新成果：无需训练，听指令就能灵活走位

论文地址： https://arxiv.org/abs/2309.11382

以上是北大具身智能新成果：无需训练，听指令就能灵活走位的详细内容。更多信息请关注PHP中文网其他相关文章！

相关标签：

机器人视觉

来源：51cto.com

上一篇：联发科天玑9300 AI得分公布：2109分，位居第一下一篇：国内最大开源模型发布，无条件免费商用！参数650亿，基于2.6万亿token训练

本站声明

本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn

作者最新文章

编码的关键：为初学者释放 C 的力量

2024-10-13 11:44:01
使用 PHP 和 MySQL 将您的网站连接到数据库

2024-10-13 09:56:31
使用 Python 解决问题：作为初学者，解锁强大的解决方案

2024-10-11 20:58:41
Python 的力量，简单：一种适合初学者的编程方法

2024-10-11 16:53:11
PHP 和社交媒体：将您的网站与世界融为一体

2024-10-11 11:54:51
使用 PHP 的动态图像画廊：在线展示您的作品

2024-10-10 16:21:01
使用 PHP 构建 API 和 Web 服务

2024-10-10 15:18:02
揭秘 Java：为新程序员提供一条清晰、简单的道路

2024-10-10 13:34:01
使用 C 创建游戏和图形：有趣且实用的介绍

2024-10-10 13:26:26
王者荣耀程咬金怎么玩？

2024-10-10 11:38:42

最新问题

google 浏览器手机版显示的怎么实现老师您好，google 浏览器怎么变成手机版样式的？

来自于 2024-04-23 00:22:19

0

9

1588

数独检查器无法工作？谁能帮我识别错误？我尝试了在线编辑器上的所有方法，但仍然收到错误。但当我在我的机器上的VSCode上执行此操作时，它工作正常。我很困惑，在没有发现错误的情况下无法提交代码。我不知道该去哪里寻找了。我...

来自于 2024-04-06 21:21:07

0

1

474

使用SCSS生成默认值和CSS变量我正在实现网站样式。出于遗留支持的原因，我需要支持IE11，至少一段时间。出于工作流程和我的理智原因，我想尽可能使用css变量。我已经研究过这个解决方案，它会生成一些有效的东西，但...

来自于 2024-04-06 17:46:54

0

1

355

如何配置apache加载index.html和index.php？这是我的疑问，我有以下结构：root/index.html根/api/index.php我已经使用内置的php服务器进行了编码，因此当我运行php-Slocalhost:3000时...

来自于 2024-04-05 09:27:53

0

1

3505

在网站页面中使用本地安装的库是否可以在现代浏览器中使用为Windows操作系统编写并在system32中注册的库（.dll、.ocx），将站点工作和计算的部分逻辑从服务器转移到服务器的权力本地机器？例如，如果...

来自于 2024-04-05 00:15:49

0

1

3563

相关专题

更多>

热门推荐

热门教程

更多>

相关教程

热门推荐

最新课程

最新ThinkPHP 5.1全球首发视频教程(60天成就PHP大牛线上培训班课)

1418680
php入门教程之一周学会PHP

4260224
JAVA 初级入门视频教程

2495767
小甲鱼零基础入门学习Python视频教程

504747
PHP 零基础入门教程

859737

最新下载

更多>

网站特效

网站源码

网站素材

前端模板