笔记

机器人视觉 / 6D Pose / 约 8 分钟

从 FoundationPose 到深度几何:目标支撑物六维位姿方法的工程选择

FoundationPose → Depth Geometry

记录目标支撑物位姿路线从通用配准回到分割、深度与几何先验的判断过程。

2026公开笔记

问题

目标支撑物的位姿不是一个只要“检测到物体”就结束的问题。下游需要的是定义明确、方向稳定的 T_camera_target:坐标原点在哪里,轴向如何解释,连续帧之间是否会突然翻转,都要能够复核。

这条链路使用 RealSense D435i 的对齐 RGB-D 数据。YOLO segmentation 先给出目标区域,深度再提供三维观测。最初也评估了 FoundationPose,希望通过模型配准直接得到 6D Pose;但在目标支撑物上,通用全局配准曾选择上下颠倒的姿态分支。渲染轮廓可能仍然接近,任务坐标系却已经不再可靠。

为什么原方案不够

问题不等于“FoundationPose 不可用”。同一套工程资料中,无人机路线仍保留分割与 FoundationPose。差异来自对象和任务约束:目标支撑物外形简单、存在对称性,实际深度又主要观察到顶部承载面。只依赖全局模型注册,会让本来可以显式使用的几何先验变成隐含假设。

对这个对象,更重要的不是恢复完整网格,而是稳定回答三个问题:顶部平面在哪里,承载区域中心在哪里,平面内方向怎样定义。旧的“完整支撑物网格必须通过投影门限”也不再适合作为硬失败条件,因为当前方法有意只使用可见顶部几何。

观察

RGB 与 depth 对齐后,分割掩膜可以约束深度取样范围。顶部区域的有效点给出局部平面;平面中心和长短边给出原点与平面内轴向;法向给出剩余方向。这样,位姿的每个部分都能追溯到一项可查看的观测,而不是只得到一个配准分数。

对象的几何对称性仍然存在,因此平面内 yaw 只能按 180° 等价类理解。这不是通过增加滤波就能消失的问题,而是坐标定义必须承认的边界。

工程决策

目标支撑物的主位姿方法最终冻结为 YOLO_V2_PLUS_TOP_DEPTH_GEOMETRY

  1. 使用 YOLO segmentation 隔离目标区域;
  2. 读取与彩色图对齐的深度点;
  3. 从顶部有效区域估计平面、中心与尺度;
  4. 构造并检查合法的 SE(3) 变换;
  5. 输出相机坐标系下的 T_camera_target

FoundationPose 只从目标支撑物的主路线中移除,并没有被笼统否定。无人机的 FoundationPose 路线仍可保留,因为对象几何和使用目标不同。

验证

验证不是只挑一张结果图。工程记录包含单帧几何检查、5 帧连续工程测试和 23 帧人工复核:5 帧测试均被判定为可用状态;23 帧中 21 帧为 GOOD、2 帧为 USABLE,没有真实失败帧。另一组静态稳定性记录中未出现上下翻转或无效 SE(3)。这些结果支持“观察、求解、冻结一次位姿”的使用方式,而不是高帧率连续追踪。

实时链路的处理延迟约为 1.7 秒,因此当前方法更接近任务前的稳定测量。把它描述成实时追踪会超出已有证据。

还没有解决什么

相机坐标系位姿还不等于机器人基坐标系下的可执行目标。手眼标定链路在这批交接资料中尚未冻结,机器人、夹爪和真实抓取也不属于该视觉包的验证范围。下一步应先确认坐标变换与时间同步,再讨论闭环操作,而不是把一张坐标轴叠加图当作系统已经完成。