会聚双眼的机器:新算法让人形机器人拥有类人立体视觉

多年来,人形机器人的视觉系统一直依赖于一种略显生硬的方式感知深度——两个摄像头保持平行排列,通过计算左右画面的水平差异来估算距离。这种方法虽然行之有效,却与人类真实的视觉工作机制相去甚远。人类的双眼在观察近处物体时会自然向内会聚,同时综合利用水平与垂直方向的视觉差异来构建立体感知,而这一特性,恰恰是传统机器人立体视觉长期缺失的一环。

如今,由加拿大约克大学团队领导的研究者,开发出一种名为"会聚双眼立体视觉"(Convergent Binocular Stereo,简称CBS)的新算法,专门为可自主转动、双眼能够共同聚焦同一目标的机器人头部设计。这项成果发表于《科学·机器人学》期刊,为人形机器人的视觉感知带来了更贴近生物本能的解决方案。

从水平差异到多维融合:CBS的运作原理

与仅计算水平视差的传统立体视觉系统不同,CBS同时考虑了摄像头会聚时产生的水平与垂直双重视差,将摄像头本身的运动状态也纳入了深度感知的计算过程之中。算法首先让双摄像头共同锁定同一个三维目标点,进而推算出两幅图像之间的几何关系。

随后,系统会构建一个五级高斯金字塔结构,从多个分辨率层级对图像展开分析。在较粗糙的分辨率层级上,算法运用SIFT特征检测与匹配技术,并借助对极几何约束来初步估算水平与垂直视差;而在细化阶段,Gabor滤波器则被用来分析不同方向与尺度下的纹理与边缘信息,帮助确定两幅图像中对应像素点的精确位置。

这种由粗到细、逐层收窄搜索范围的处理方式,最终能够生成精确的水平与垂直视差图,并进一步转化为完整的三维深度信息。研究团队表示,该算法还能捕捉物体表面倾斜角度、姿态朝向,以及深度与尺寸的感知缩放关系,这些能力共同构成了一套更接近人类视觉处理逻辑的技术框架。

实测表现:重复图案场景中的显著优势

为了验证CBS的实际效果,研究团队专门构建了一套名为CBS-BM的基准测试数据集,涵盖49个测试场景,其中既包括常见的桌面环境,也涵盖了具有重复图案、无明显特征表面以及高度自遮挡物体的复杂场景。每个场景都配有平行摄像图像,以及五到十二组不同的会聚注视图像对。

测试结果显示,CBS在整体表现上与现有主流立体视觉方法及多种深度学习系统相比具备较强竞争力,在整个数据集范围内,其平均水平视差与深度误差均低于所测试的平行摄像方法。该算法的优势在处理重复图案场景时尤为突出,而这类场景恰恰是传统系统最容易出现匹配错误的难点——当画面中存在大量视觉相似的特征时,系统往往难以判断哪些特征彼此对应。

在这一细分场景中,CBS的平均深度误差比次优方法低约0.8米,水平视差误差也低了约100个像素。这一数据差距在机器人视觉领域颇具分量,意味着该算法在应对现实世界中大量存在重复纹理的复杂环境时,具备明显的可靠性优势。

不过,研究团队也坦承了当前方法存在的局限。CBS对远距离目标的识别精度会随距离增加而下降,同时该系统高度依赖精确的摄像头校准与电机定位控制,任何微小的机械误差都可能影响最终的深度计算结果。此外,目前的算法实现在AMD Ryzen 7 7700X处理器上运行一次大约需要69秒,运算效率方面仍有相当大的优化空间。

研究人员也明确指出,CBS并非旨在取代那些不需要类人视觉能力的应用场景中的传统平行立体视觉系统。相反,这项技术的真正价值在于,为那些需要将物理眼球运动与视觉处理系统协同工作的人形机器人,提供了一套全新的技术基础,让机器人的深度感知能力,朝着人类主动、会聚式视觉的方向更进一步。

随着人形机器人日益走向复杂多变的现实应用场景——从工业焊接到网球运动的动态互动,视觉系统能否像人眼一样灵活会聚、精准判断距离,正在成为决定其自主行动能力的关键变量之一。CBS算法的出现,或许标志着机器人视觉技术正在从"看得见"向"看得懂、看得准"迈出关键一步。

展开阅读全文

更新时间:2026-08-28

标签:科技   人形   机器人   算法   双眼   视觉   机器   视差   深度   系统   水平   场景   误差

1 2 3 4 5

上滑加载更多 ↓
推荐阅读:
友情链接:
更多:

本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828  

© CopyRight All Rights Reserved.
Powered By 71396.com 闽ICP备11008920号
闽公网安备35020302034903号

Top