看一次就学会:GEN-1.5如何让机器人摆脱"重复训练"的枷锁

机器人学习一项新任务,曾经意味着数以千次的重复训练与大量数据标注。

但美国机器人初创公司Generalist AI最新发布的模型GEN-1.5,正在挑战这一根深蒂固的假设。这套系统只需观看一次长达3到12秒的人类演示,便能尝试完成从未见过的物理任务,整个过程无需梯度更新,也无需任何针对性的微调。

在覆盖十项具体任务的测试中,GEN-1.5仅凭一次示范就取得了平均59%的成功率。若额外提供五分钟的任务特定数据并进行10次梯度更新,成功率则进一步提升至83%。

这些测试任务贴近日常生活场景,包括拧开玻璃罐盖、从钱包中取出纸币、叠放杯子、清扫垃圾、翻开书本、拉开笔袋拉链以及取下吸尘器滤芯。

"物理提示":一种全新的机器人编程方式

GEN-1.5的核心创新在于一种被称为"物理提示"的机制。

这是一个融合视频、传感器数据、语言指令与本体感觉信息的大型多模态模型,能够在其上下文窗口中保留长达30秒的信息,并以每秒100次的频率生成动作轨迹。

一次演示,无论是由人类操作手持夹爪完成,还是由机器人自身执行,都可以作为"物理提示"直接输入模型的上下文窗口。

一旦该示例被载入,机器人便可立即尝试执行任务,跳过了传统机器学习流程中反复训练与参数调整的环节。

Generalist AI特别强调,他们并未针对上下文学习能力对GEN-1.5进行专门训练。

公司也没有为促使模型具备这种"即学即用"能力,添加任何架构改动、元学习循环或额外的优化目标,这种能力似乎是模型规模与训练方式共同催生的自然结果。

这与传统机器人训练方式形成了鲜明对比。

在常规流程中,教会机器人完成一项新任务往往需要海量的任务专属数据,以及反复的优化迭代过程,而GEN-1.5试图从根本上绕开这一负担。

更值得关注的是,该模型展现出了将多个物理提示组合使用的能力。

研究人员先后向模型展示了"拉开笔袋拉链"与"从笔袋中取出钱币"这两个独立动作的演示,GEN-1.5随即将两者衔接成一段连续的动作序列。

在衔接过程中,模型自主生成了两段演示中都不存在的过渡动作,包括重新定位手部与应对操作失误的恢复动作,这意味着它并非简单复制,而是理解了任务之间的逻辑关系。

从模拟到现实,从工具到创造性应变

GEN-1.5的泛化能力还体现在跨越仿真与现实的鸿沟上。

研究团队用一段在模拟环境中录制的演示,成功提示了一台真实机器人完成任务,而这一模型的预训练数据中并不包含任何模拟场景。

由此产生的行为还能适应不同的机械手形态,以及物体位置与尺寸的变化,显示出较强的环境适应能力。

在另一项测试中,一名操作者在机器人摄像头前用自己的双手演示动作,机器人随后用它自身的机械手复现了这一操作,完成了从人类肢体到机械结构的动作迁移。

这种跨形态学习能力,恰恰是通用机器人技术长期追求却难以突破的方向。

真正令人印象深刻的,是模型在面对工具缺失时表现出的创造性应变。

在学会用刷子将方块扫入碗中后,当研究人员给它一根香蕉,它随即将香蕉当作临时刷子完成了同样的清扫动作。

而当研究人员改用一把畚箕时,模型并未生硬模仿此前的扫刷动作,而是发展出截然不同的操作策略,用畚箕直接铲起方块并倾倒入碗中。

Generalist AI认为,这些行为共同指向机器人编程方式的一次深层转变。

未来的用户或许不再需要为每一项新任务编写详尽的操作指令,只需演示一次期望达成的结果,剩下的物理执行细节将交由机器人自行推演完成。

如果这一技术路径能够持续扩展并保持稳定,机器人从"专用工具"迈向"通用助手"的进程,可能比外界预期的更快到来。

展开阅读全文

更新时间:2026-08-22

标签:科技   枷锁   机器人   模型   动作   演示   物理   能力   提示   操作   数据   畚箕

1 2 3 4 5

上滑加载更多 ↓
推荐阅读:
友情链接:
更多:

本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828  

© CopyRight All Rights Reserved.
Powered By 71396.com 闽ICP备11008920号
闽公网安备35020302034903号

Top