具身导航周报(2026-09-09 ~ 2026-09-17)

一、本期结论

  • VLM 在具身几何约束下的航点决策几乎不可用,而系统级工作流能把成绩拉到 52%。 这是本期最值得注意的一组对照。EgoPathBench 逐项测九个 VLM 的第一人称航点决策,最高 EgoPath Score 仅 28.3;在点代理几何下 Point Path 尚有 35.9% 成功率,一旦加上具身几何约束,Embodied Path 掉到 2.9%、Intent Path 4.0%。而 GPT-6-Astra 在 R2R-CE 上跑出 52.0% SR,靠的是观测—决策—执行的完整工作流加上下文管理。本报告判断:当前零样本导航的成绩主要由系统结构贡献,而非基础模型的空间能力;把 VLM 直接当航点规划器用,是在它最弱的能力上下注。
  • R2R-CE 仍是主战场,但评测协议碎裂到无法横向对比。 5 篇报 R2R-CE 却用了四套评测集:完整 val-unseen(GroundingVLN)、OpenNav 的 100 episode 协议(C2Nav)、该协议的前 50 条(GPT-6-Astra)、自定 550 条子集(LG-VLN)。把 GroundingVLN 的 69.9% SR 与 C2Nav 的 31.0% SR 并排解读会严重误导——前者是训练式方法在全量集上的结果,后者是零样本方法在百条子集上的。做对比前必须先对齐 episode 集合。
  • 「让 VLM 做比较而不是让它报数」正在成为一条可复用的设计原则。 C2Nav 的角色反转消融是本期方法论质量最高的实验:仅把提问形式从比较式换成基数/绝对式,SR 在空间、转移、终止三个决策位分别从 31.0% 掉到 12.0%、28.0%、21.0%。AnchorVLN 用 MCP 工具 schema 强制「VLM 提语义、几何定度量」(无工具接受米/弧度参数),得到同向证据——直接让模型估坐标时 45 题 0 题过阈值,几何锚定后过 10 题。GroundingVLN 的像素目标 + 几何规划器是同一思想在训练式路线上的实现。
  • 具身 Agent 运行时开始出现可部署的完整系统,不再只是框架图。 Harness Robotic OS 把机器人运行时、自主技能、认知 agent 运行时、交互与运维四个平面组织起来,并在住宅社区巡检真机上给出闭环数据:航点可达性 100%、室外定位误差 <10 cm、局部避障响应 <200 ms、危险检测 85–95%、告警投递与结构化报告 99%。配合 Finder(agentic 闭环物体查找,Habitat/HM3D 上 1 m 成功率 +15.75 点)与 AeroWeaver(无人机集群 agent harness),本期首次能看出「agent harness 用于具身」这条线的轮廓。
  • 空间记忆分化出三条路线,且本期三条都有新工作。 ① 保留几何基础模型的注意力 KV 并按相关性裁剪(AdaGeoVLN);② 彻底放弃坐标,用视觉地点拓扑或持久时空图(Navi-Agent、HarnessVLN);③ 在全局时空记忆上训练潜在世界模型来预测未来地图与航点(GLAM),或把记忆压缩成段级计划再执行(Memory as Plans)。三条路线都声称在各自设定下达到 SOTA,彼此之间没有直接比较。
  • 本期覆盖口径已修正,与上期数字不可直接比较。 抓取配置在 2026-09-19 做了两处修复:补齐此前完全漏收的导航表述(robot / social / terrain / legged / egocentric navigation、waypoint),并新增具身 Agent / AgentOS 源。同一时间窗下,本期共入库 162 条,其中主池(导航 + 具身Agent)41 条——而修复前同窗口只抓到 70 条、真正相关的仅 14 条。本报告只对主池做分析,VLA·操作等次池见 5.4 速览。公众号源本期入库 0 条(Docker 未运行,且微信对该号长期频控),自 2026-09-05 起持续如此。

二、优先阅读清单

  • A1 · GroundingVLN · R2R-CE / RxR-CE(连续环境)
    • 贡献:以视觉 grounding 作为推理与动作的共享接口;预测进度对齐的像素目标交给几何规划器。
    • 证据:R2R-CE 69.9% SR、RxR-CE 75.1% SR;仅用最强基线 0.9% 训练数据;仅用 R2R 训练时 RxR-CE 达 59.9% SR,较最强基线 +20.1%。
    • 理由:本期唯一在完整 R2R-CE 上报 SOTA 且样本效率有量级差的训练式方法。
  • A2 · EgoPathBench · 第一人称航点决策评测
    • 贡献:五任务基准,按候选可行性、相邻边合法性、目标到达三项评判,区分点代理与具身几何。
    • 证据:九个 VLM 最高 EgoPath Score 28.3;Point Path 35.9% vs Embodied Path 2.9%、Intent Path 4.0%;31,852 训练 + 1,111 基准题;微调 Qwen 3.5 4B 使其分数由 3.9 升至 38.9。
    • 理由:给出「基础模型空间能力」与「导航系统成绩」之间的落差刻度,是选型必读。
  • A3 · C2Nav · 零样本 VLN-CE
    • 贡献:训练无关;VLM 只在控制器构造的候选间做序数比较,几何/阈值/动作幅度留在机器人侧。
    • 证据:OpenNav R2R-CE 100 协议:Qwen3-VL-8B-Instruct 41.0% OSR / 31.0% SR / 16.7% SPL;换 GPT-5.5 达 54.0% / 44.0% / 29.0%;角色反转消融见结论三。
    • 理由:接口设计的因果证据比性能数字更有价值,可直接迁移到自有 pipeline。
  • A4 · Harness Robotic OS · 具身 Agent 运行时(四足巡检)
    • 贡献:机器人运行时 / 自主技能 / 认知 agent 运行时 / 交互运维四平面;分层工作、情景、语义记忆;安全门控的自演化回路。
    • 证据:住宅社区真机:航点可达性 100%、室外定位误差 <10 cm、局部避障响应 <200 ms、危险检测 85–95%、告警与报告 99%。
    • 理由:本期唯一给出完整真机闭环数据的具身 Agent 运行时,AgentOS 方向的参考实现。
  • A5 · GLAM · ObjectNav(HM3D / Habitat)
    • 贡献:在全局时空记忆上训练目标条件潜在世界模型,联合预测未来地图表征与机器人中心航点隐变量;JEPA 式潜在预测,不做 RGB 重建。
    • 证据:在受控的 HM3D-ObjectNav 子集复现设定下,SR 与 SPL 均优于复现的 BSC-Nav 基线;摘要未给具体数值。
    • 理由:空间记忆第三条路线的代表作,与 AdaGeoVLN / Navi-Agent 形成三方对照。
  • A6 · Finder · 开放词表具身物体检索(Habitat/HM3D)
    • 贡献:agentic 闭环查找原语:带类型的循环状态串起查询条件规划、限定范围取证、候选验证与 accept/continue/abort 控制。
    • 证据:Habitat/HM3D 与真实 RGB-D 场景上,平均 1 m 成功率较强基线 +15.75 点;同一原语可迁移到序列物体接地与具身物体中心问答。
    • 理由:把 ObjectNav 从「静态检索」改造成「闭环取证」,机制清晰可移植。
  • A7 · HarnessVLN · 离散 R2R / RxR / ObjectNav(HM3D)
    • 贡献:训练无关 Agent Harness 统一指令跟随与目标物导航;分发前校验证据支持、几何可行性与子目标一致性。
    • 证据:R2R 60.8%、RxR 53.9%、HM3D-v2 76.0%、HM3D-OVON 59.3% SR,称优于此前训练无关 SOTA;含人形机器人真机部署。
    • 理由:注意是离散 R2R,不可与上述 R2R-CE 数字并列比较。
  • A8 · AdaGeoVLN · R2R-CE / RxR-CE,单目 RGB 流式
    • 贡献:GFM 分层特征按表征深度耦合策略各阶段;按指令相关性/几何置信/转移新颖度在有界预算内保留 VGGT 全局注意力 KV。
    • 证据:摘要仅称「strong performance」,未提供可核验数字;消融结论为多深度耦合显著优于终端特征重复注入。
    • 理由:机制层面对现有 GFM 用法构成反例;数字需等正式版核验。
  • A9 · Navi-Agent · 零样本 VLN-CE,无定位单目
    • 贡献:无坐标导航拓扑(节点=视觉地点、边=运动转移),支持近似自定位、进度校验与重访恢复。
    • 证据:称在零样本 VLN-CE 基准与真机上达几何受限方法中的 SOTA,摘要未给具体数值。
    • 理由:与 AdaGeoVLN 形成「要不要坐标」的路线对照。
  • A10 · UNI · 轮式机器人导航数据采集
    • 贡献:四轮助行器 + 手机采集受物理约束的人类演示,天然偏向轮式可通行路线。
    • 证据:37.2 km 真实数据;留出 UNI 演示上轨迹预测误差降低 17.4–24.8%;闭环迁移到电动轮椅(路缘/楼梯/坡道口)。
    • 理由:低成本绕开平台专属遥操作的数据路径,对地面平台直接可用。

三、重点工作分析

1. EgoPathBench 与 GPT-6-Astra 对读:基础模型的空间能力,和导航系统的成绩,是两件事

这两篇单独看都容易读偏,放在一起才见全貌,故合并分析。

问题。 同一个问题的两端。EgoPathBench 问:VLM 自身能不能从第一人称观测中选出可行且到达目标的航点序列。GPT-6-Astra 问:把一个通用大模型放进完整导航工作流、不做任何导航微调,系统整体能到什么水平。

方法。 EgoPathBench 给出五任务基准,每题含第一人称 RGB、自然语言目标和编号的可见航点,模型返回可通行候选或有序路线;评判分候选可行性、相邻边合法性、目标到达三项,并区分点代理几何与具身几何。GPT-6-Astra 用标准观测—决策—执行工作流直接调 API,每次请求带入选定观测、执行反馈与保留的进度记录,评估对象是含上下文管理与动作控制的完整系统。

证据。 EgoPathBench:九个 VLM 中最高 EgoPath Score 仅 28.3;排名第一的模型 Point Path 成功率 35.9%,但 Embodied Path 仅 2.9%、Intent Path 仅 4.0%。数据集含 31,852 训练题、1,345 验证题、1,111 基准题,每道路线题至少保留一条几何验证过的参考路线。用释出的训练集微调 Qwen 3.5 4B,其 EgoPath Score 由 3.9 升至 38.9,并在三个外部空间基准上普涨 1.4–9.6 点。GPT-6-Astra:Open-Nav 所用 100 条 R2R-CE val-unseen 中的前 50 条上,52.0% SR、48.9% SPL、70.8% nDTW;终止构成拆为 36.0% 工作流接受 STOP 而成功 + 16.0% 步数上限时满足距离判据。

价值。 两组数字相差一个数量级,指向同一结论:当前零样本导航的成绩主要由系统结构贡献——候选构造、几何校验、上下文管理、执行反馈——而不是基础模型本身的空间智能。本报告判断这对技术选型有直接含义:把预算投在系统结构上的回报,目前显著高于换更强的 VLM。EgoPathBench 释出训练集这一点尤其实用,微调带来的 3.9→38.9 说明这项能力是可训的,只是没人训过。

局限。 两者评测口径不同,不能相减:EgoPathBench 测的是单步/短程航点决策题,GPT-6-Astra 测的是完整 episode 的任务成功率;前者九模型、后者单模型 50 条 episode(1 条即 2 个百分点)。GPT-6-Astra 依赖闭源 API,成本与可复现性受制于供应商。

建议。 EgoPathBench 高优先级精读并复现微调实验——它是本期唯一给出「这项能力可训」证据的工作。GPT-6-Astra 作为基线跟踪即可,但其终止构成的报告方式值得照搬。

2. GroundingVLN:把 grounding 当接口而非中间产物,样本效率出现量级差

问题。 论文称存在两个耦合缺口:中间推理未显式锚定到视觉证据;高层决策缺少精确空间目标来指导底层运动。

方法。 两段式使用 grounding:先「带 grounding 推理」,在结构化推理全过程把任务相关视觉证据锚到精确图像位置;再「经 grounding 行动」,预测与任务进度对齐的像素目标,由几何规划器翻译为基元动作。配套构建时序对齐的 grounded 推理轨迹数据集 GroundingCOTVLN-188K,并用 GEAR(Grounded and Execution-Aware RL)把 grounded 推理与空间决策对齐到下游执行。

证据。 R2R-CE 69.9% SR、RxR-CE 75.1% SR,称为 SOTA;训练数据量为最强基线的 0.9%;跨数据集泛化上,仅用 R2R 训练时 RxR-CE 达 59.9% SR,较最强基线提升 20.1%。摘要未给出 SPL、nDTW 或基线方法名。

价值。 像素目标 + 几何规划器的分工,与 C2Nav、AnchorVLN 的「语义归模型、度量归几何」是同一思想在训练式路线上的实现。0.9% 数据量若成立,意味着 grounded 监督的信息密度远高于纯轨迹监督——这与 EgoPathBench 的微调结论互相印证:航点/接地类监督的效率被长期低估。

局限。 摘要未说明基线身份与评测 split 的完整设定,SOTA 声明暂无法独立核验;188K 数据集构造成本未披露;未见真机结果。

建议。 高优先级精读。重点核验两件事:69.9% 对应的 val-unseen 是否为完整集;GEAR 的执行对齐奖励如何定义——这是「推理-执行脱节」的候选答案。

3. C2Nav:把 VLM 的回答形式从「报数」改成「比较」,本身就是性能来源

问题。 现有零样本 VLN-CE 系统普遍向 VLM 索要基数型输出——路径点、像素、朝向、进度值或绝对到达判定,这把生成式回答直接耦合到几何量级或不可逆承诺上。

方法。 训练无关框架,三个协同能力:Seeing 在物理上已校验的候选视角间做序数式 Gaze Election;Remembering 维护紧凑路线草图并比较相邻指令段假设;Arriving 组合犹豫阶梯、回看比较和可撤销走回来实现可靠停止。几何、阈值、动作幅度与执行全部留在机器人侧。

证据。 OpenNav R2R-CE 100 协议:Qwen3-VL-8B-Instruct 得 41.0% OSR / 31.0% SR / 16.7% SPL;同一接口换标准 GPT-5.5 得 54.0% / 44.0% / 29.0%。整能力消融:去掉 Seeing 后 SR 降至 14.0%,去掉 Remembering 降至 25.0%,去掉 Arriving 降至 29.0%。匹配的角色反转实验——只把比较式回答形式换成基数/绝对式提问——在空间、转移、终止三个决策位分别把 SR 压到 12.0%、28.0%、21.0%。论文结论是受约束的决策接口与更强的 VLM 推理二者互补而非可互相替代。

价值。 角色反转把「接口形式」与「模型能力」两个混杂变量分开了,这在本期是独一份。结合 EgoPathBench 的 2.9% 看,这条结论更有分量:既然 VLM 在具身几何约束下的绝对判断如此之差,把它限制在序数比较上就不只是工程技巧,而是扬长避短的必然选择。

局限。 100 episode 样本量小,单条 episode 权重 1%,消融间的百分点差异需谨慎解读;绝对 SR(31.0%/44.0%)距实用仍远;未见真机。

建议。 精读并复现角色反转实验。在自有系统上先改 Arriving 一处(停止判定),代价最小。

4. Harness Robotic OS:具身 Agent 运行时第一次给出完整真机闭环数据

问题。 可部署的自主巡检系统需要的不只是稳健导航,还要在一个可追溯的运行闭环里连接异构传感、可复用自主能力、多模态场景理解、人机交互与企业侧响应。现有四足巡检系统多用任务专用接口把这些功能拼起来,导致上下文协调、知识复用和受控适配都很困难。

方法。 HROS 把系统划为机器人运行时、具身自主技能、认知 agent 运行时、交互与运维四个平面。共享上下文把物理状态与 agent 推理连起来;流式 ASR/TTS 支持语音任务交互;分层的工作记忆、情景记忆、语义记忆保存运行知识;安全门控的自演化回路把执行轨迹转成带版本的候选更新,不允许无约束的在线修改。Argos 原型集成 Vbot 四足、Fast-LIO2 定位建图、Hobot-Stereo 深度感知、PCT-Planner 全局规划、EGO-Planner 局部运动生成,以及 OpenClaw 编排的 Qwen3-VL 巡检分析。

证据。 住宅物业环境实验:航点可达性 100%、室外定位误差低于 10 cm、局部避障响应延迟低于 200 ms、代表性危险检测率 85–95%、告警投递与结构化报告生成成功率 99%。

价值。 这是本期唯一把「agent 架构」落到可测真机指标上的工作,也是用户关注的 AgentOS 方向的直接样本。三层记忆(工作/情景/语义)与安全门控自演化两个设计,对地面导航系统的长期运行有直接参考价值——尤其是「执行轨迹转成带版本的候选更新,不允许无约束在线修改」这条,它把持续学习的风险控制住了。

局限。 场景为结构化的住宅社区巡检,任务是预定义巡检路线而非开放指令跟随,与 VLN 的任务分布差异大;报告的是系统集成指标(可达性、延迟、检测率),没有与其他 agent 架构的对照实验,无法判断各设计的独立贡献;未报告导航成功率这类可与 VLN 横向比较的指标。

建议。 精读架构部分,重点是三层记忆的划分依据与自演化回路的安全门设计。不必复现整套系统——它的价值在架构组织方式,不在具体数字。

5. GLAM 与 Memory as Plans:空间记忆的第三条路线

问题。 主动探索与语义导航要求智能体从局部观测建立记忆,预测已观测空间记忆的演化如何支撑未来运动,并把预测转成可执行计划。既有做法要么保留几何特征的原始形态(内存代价高),要么退化成无预测能力的拓扑图。

方法。 GLAM 是目标条件的潜在世界模型,训练在全局时空记忆之上:给定历史地图 token、导航目标与当前位姿,联合预测未来地图表征与机器人中心的航点隐变量,使未来空间上下文与导航意图落在同一表示空间。它采用 JEPA 式潜在预测范式,直接作用于地图级潜在 token 而非 RGB 重建,并用预训练的航点编解码器在 GLAM NAV 中监督与解码导航计划。Memory as Plans(MaP-WAM)走另一条路:把记忆表示为含语言指令与稀疏视觉上下文的已完成段记录,转成紧凑计划(下一段级语言计划 + 对应视觉引导),由 World-Action-Progress 模型执行,联合预测动作块与执行进度。

证据。 GLAM:训练数据由在 Habitat/HM3D v0.2 上回放 ObjectNav 专家轨迹、切成多时间尺度预测样本得到;在受控的 HM3D-ObjectNav 子集复现设定下,SR 与 SPL 均优于复现的 BSC-Nav 基线,摘要未给具体数值。MaP-WAM:RMBench 83.3% 成功率(称 SOTA),真机任务 78.0%,且执行器上下文长度固定、推理延迟随任务历史增长近似恒定。

价值。 两者共同点是不把历史观测直接喂给执行器:GLAM 压进潜在地图 token 并预测其演化,MaP-WAM 压成段级计划。这对长程导航的意义是延迟不随 episode 增长——MaP-WAM 明确报告了这一点。GLAM 的「地图级潜在 token 而非 RGB 重建」与 AdaGeoVLN 的「保留 GFM 注意力 KV」构成有意思的对立:一个认为该在地图层抽象,一个认为该在特征层保真。

局限。 GLAM 无公开数值,且基线是自行复现的 BSC-Nav,SOTA 与否无从判断;评测限于 HM3D-ObjectNav 的受控子集。MaP-WAM 的证据全部来自操作任务(RMBench + 真机操作),导航上未验证,其「段级计划」是否适配连续导航的细粒度决策存疑。

建议。 GLAM 跟踪正式版与数值。MaP-WAM 的固定上下文长度 + KV 缓存设计可单独借鉴到导航执行器,这一步不依赖其任务设定。

四、可迁移方法

只收录迁移路径能说清楚的次池工作。

  • VLA 推理效率:VLA-ULAP
    • 机制:云端大模型调用与本地超轻量动作预测器交替;ULAP 约 7.4M 参数(含冻结视觉编码器),独立训练,不需 VLA 隐状态、在线验证或服务器往返。
    • 接入位置:导航决策层:远端 VLM 只在关键决策点调用,直行/微调航向由本地预测器接管。
    • 前提与风险:数字全部来自操作任务,48.8–76.7% 的调用跳过率在导航长程依赖下能否维持未经验证。
  • VLA 架构:DEM(解耦)
    • 机制:分离的视觉/语言编码器条件化一个紧凑动作头,替代每步跑数十亿参数 VLM 骨干;MeanFlow 头单次前向出动作块。
    • 接入位置:语言条件化的导航策略主干,尤其算力受限的车载平台。
    • 前提与风险:结论限定在「已训练任务」范围内;RoboCasa 18 任务与导航的任务分布差异大。
  • VLA 推理效率:rMuscle
    • 机制:跨执行相似性的双阶段缓存:Context Cache 复用视觉 token 输出降计算,Action Cache 复用神经元激活模式降权重访问。
    • 接入位置:固定巡逻路线、重复往返等结构化导航场景的推理加速。
    • 前提与风险:前提是任务重复性高;开放环境导航的观测相似度远低于工厂工位。
  • VLA 架构:What Makes an Efficient VLA
    • 机制:动作头性能主要由初始化而非解码器架构决定;把语言骨干最后若干 transformer 层拷入动作头是最大杠杆,且零延迟代价。
    • 接入位置:任何自建 VLA 式导航策略的动作头初始化。
    • 前提与风险:论文自述这是最能组织其测量结果的解释而非已证因果。
  • 评测方法论:LIBERO-CTRL
    • 机制:配对式复合鲁棒性评测:对同一初始状态配对单轴与同时扰动条件,区分「涌现失败」与「补偿成功」。
    • 接入位置:导航鲁棒性评测:光照×布局×动态障碍等多轴同时扰动。
    • 前提与风险:核心发现是两类转移在聚合统计中相互抵消——最多 29.0%(最严重条件 34.5%)的配对初始状态结果翻转却不体现在总成功率上,必须按实例配对记录。
  • 安全性:Beyond Patch Removal
    • 机制:状态恢复协议:在匹配的动作块边界移除对抗补丁,在相同剩余步数预算下测量可恢复性。
    • 接入位置:导航策略的对抗鲁棒性评估与恢复适配器设计。
    • 前提与风险:证据来自 LIBERO-Long:OpenVLA-OFT 遭 EDPA 攻击后仅 36.2% episode 在五个 chunk 后可恢复(对照组 89.9% / 87.0%);恢复适配器在一个 chunk 延迟下把恢复率从 7.7% 提到 47.4%,延迟增大后收益明显下降。
  • 综述:World-Action Models 综述
    • 机制:耦合未来世界预测与可执行动作生成的统一分类法,覆盖表征、转移建模、动作接口、训练流程与扩展策略,并单列导航应用。
    • 接入位置:WAM 路线进入导航的入口文献。
    • 前提与风险:综述性质,无自有实验;项目页 https://rcl-robotics.github.io/Awesome-World-Action-Models。

五、分类速览

5.1 地面 VLN / ObjectNav / 语义导航

  • GroundingVLN(R2R-CE / RxR-CE):见重点分析。原文
  • C2Nav(零样本 VLN-CE):见重点分析。原文
  • AdaGeoVLN(R2R-CE / RxR-CE):GFM 分层特征按表征深度耦合策略各阶段 + 有界 KV 保留。原文
  • GPT-6-Astra 工作流(零样本 VLN-CE):见重点分析。原文
  • GLAM(ObjectNav(HM3D)):见重点分析。原文
  • HarnessVLN(离散 R2R/RxR + ObjectNav):Agent Harness 分发前校验证据、几何可行性与子目标一致性,统一两类导航任务。原文
  • Navi-Agent(零样本 VLN-CE):无坐标视觉地点拓扑替代几何定位,支持进度校验与重访恢复。原文
  • LG-VLN(零样本 VLN-CE,单目):共享 CleanDIFT 稠密特征打通几何与语义,LangGraph 组织为有向状态图;自定 550 episode R2R-CE val-unseen 子集上 21.3% SR、12.1% SPL。原文
  • AnchorVLN(开放词表 VLN):MCP 工具 schema 强制「VLM 提语义、几何定度量」;CMU VLN Challenge 2026 指令跟随 64.4%,去掉控制器建模降 13.3 点;物体指代 45 题中几何锚定过阈 10 题、直接估坐标 0 题。原文
  • TADreamer(陆空双模态零样本导航):用生成视频想象导航,再经两阶段标定恢复度量一致的 3D 航点与运动模式。原文
  • CueNav(通用机器人导航):BEV 地图传全局任务上下文、保留部分机体暴露具身上下文,引导视频规划;IDM 把稠密光流转成动作。原文
  • RoboFind(个性化物体搜索(无障碍)):手机教目标、四足执行搜索;教学 agent 产出语义目标画像与多视角参考库,供后续任务复用。原文
  • LEAP(四足导航 + 主动感知):不改任务目标、不加覆盖率/好奇心代理奖励,仅靠地形课程的任务压力使注视控制自发涌现。原文

5.2 具身 Agent / AgentOS(本期新覆盖方向)

本方向此前未纳入抓取,本期首次系统收录,故单列一节。除上文已分析的 Harness Robotic OS、Finder、GLAM、Memory as Plans 外:

  • AeroWeaver(无人机集群 agent harness)
    • 贡献:把语义决策连到受治理的技能;角色条件化的本地 agent 做分布式协调;用角色索引的状态-动作-奖励经验在线精化技能选择。
    • 证据:称在测试条件下保持有效技能执行,支持无中央 agent 的机体本地多机操作;奖励引导的在线更新提供免训练的适配路径。未给量化指标。
    • 与地面导航的关系:「受治理技能 + 在线经验精化」的组织方式可迁移;但集群与单机地面导航的协调需求差异大。
  • DeliveryGym(长程具身 agent 规划环境)
    • 贡献:面向长程具身规划的 RL 环境。
    • 证据:未在摘要中给出基线成绩。
    • 与地面导航的关系:长程任务分解的训练环境,与导航的长程性质相关。
  • Embodied-BenchForge(具身基准自动构建)
    • 贡献:闭环基准合成:前向工件合成 + 反向验证修复;技能编排的工件合成配合工件依赖图,防止局部缺陷向下游传播。
    • 证据:未在摘要中给出量化结果。
    • 与地面导航的关系:若要自建导航评测集,其「逐工件验证而非端到端交付」的思路值得借鉴。
  • EmbodiedMind(数据筛选与 RL)
    • 贡献:自适应数据筛选 + 前缀树强化学习。
    • 证据:摘要未提供可核验数字。
    • 与地面导航的关系:训练侧方法,与导航任务无直接绑定。
  • STAGE(具身执行的语义迁移诊断)
    • 贡献:诊断语义在接地执行处的迁移情况。
    • 证据:基准为 LIBERO(操作)。
    • 与地面导航的关系:诊断方法可参考,证据来自操作任务。
  • SIMLIFE(长程人机协作)
    • 贡献:长程人-agent 协作中的模式理解。
    • 证据:摘要未提供可核验数字。
    • 与地面导航的关系:人机协作场景,与社会导航有弱关联。
  • ReactHuman(物理接地基准)
    • 贡献:类人反应式决策的物理接地基准。
    • 证据:摘要未提供可核验数字。
    • 与地面导航的关系:反应式决策评测,与动态避障弱相关。
  • Autonomy, Social Norms, and Alignment(理论框架)
    • 贡献:自主性、社会规范与对齐的发展性框架。
    • 证据:理论工作,无实验。
    • 与地面导航的关系:偏理论,仅作领域观察。
  • Exploring 2D backbone effects(室内语义占据预测)
    • 贡献:考察 2D 骨干网络对室内语义占据预测的影响。
    • 证据:摘要未提供可核验数字。
    • 与地面导航的关系:语义地图的上游感知模块。

5.3 记忆、地图、规划与评测

  • EgoPathBench(航点决策评测):见重点分析。原文
  • ENCP(VLN 不确定性):Episode 归一化共形预测,为变长依赖导航序列恢复逐步覆盖保证。原文
  • UDAV(越野航点规划不确定性):多次随机采样取 medoid 作自洽标称路线,用空间离散度估不确定性,超阈值才触发重议;400 条留出查询上平均 ADE 由 147.4 降至 110.4 像素(-25.1%)。原文
  • UNI(导航数据采集):助行器 + 手机的无机器人采集,物理约束天然筛出轮式可行路线。原文
  • Feeling Terrain Before Crossing(越野导航世界模型):过地形前先「感受」,用世界模型预判可通过性。原文
  • TRACER(多机器人社会导航):双向滚动时域,分离单机器人效应与非可加成对交互,按身份维持对响应模式的持久信念;SocialGym2 上提升无碰撞完成率。原文
  • PRISM(社会导航):交互风格与运动的预测性表征。原文
  • Mobile Multi-Robot Navigation(多机器人导航):用 Koopman 算子处理运行时不确定性。原文
  • Learning Safe Humanoid Navigation(人形导航):从降阶模型学习安全导航。原文
  • Tuning ROS 2 for Energy-Efficient Navigation(系统调优):ROS 2 导航栈的能效调参实证。原文
  • Task-Oriented Active Learning of Residual Dynamics(MPC):面向任务的残差动力学主动学习。原文
  • Steering with Lexicographic Preferences(部署期偏好):字典序偏好引导生成式策略,策略权重不变;论文称在一个导航基准上验证有效。原文
  • OHRID-Retail(数据集):零售环境人类活动的开放多模态数据集。原文
  • SwarmNxt(集群平台):开源软硬件集群平台。原文
  • Custom PX4 firmware(陆空两栖):面向自主陆空混合任务的 PX4 固件定制。原文
  • UAVs Meet Embodied Intelligence(无人机具身智能):用物理-数字 AI 智能体桥接人类意图与飞行动力学。原文

5.4 次池速览(VLA·操作 / 自动驾驶 / 其他)

本期窗口共 162 条,主池 41 条已在上文覆盖;其余 121 条按「领域」字段归入次池,不做深度分析。分布为:VLA·操作 65 条、其他 50 条、自动驾驶 6 条。

VLA·操作池中与导航有潜在迁移价值的,已在第四节「可迁移方法」列出。其余为机械臂、力控、灵巧手、遥操作、水下双臂、实验室自动化等纯操作工作,以及动作分词、RL 微调、联邦训练等训练侧方法,本期均无导航侧验证,不逐条展开。完整清单见 index.md 中「领域」列。

六、趋势判断与行动建议

趋势

  • 系统结构而非模型能力,是当前零样本导航成绩的主要来源。 EgoPathBench 的 2.9%(具身几何下的航点决策)与 GPT-6-Astra 的 52.0%(完整工作流下的 episode 成功率)相差一个数量级;C2Nav 的角色反转进一步显示,同一模型换回基数式提问会掉 19 个百分点,而同一接口换更强模型只涨 13 个百分点。三者共同支持同一判断。
  • 空间记忆从「存什么」转向「预测什么」。 本期三条路线中,GLAM 直接预测未来地图表征与航点隐变量,Memory as Plans 把记忆转成段级计划,二者都不再把历史观测喂给执行器;AdaGeoVLN 的有界 KV 保留与 Navi-Agent 的无坐标拓扑则仍属「存什么」的优化。预测式记忆的一个可测好处是延迟不随 episode 增长,MaP-WAM 明确报告了这一点。
  • agent harness 正在从通用 LLM 领域外溢到具身系统。 本期出现 HarnessVLN(导航)、Harness Robotic OS(四足巡检运行时)、AeroWeaver(无人机集群)三个独立的 harness 工作,共同模式是:在分发动作前做一层校验(证据支持、几何可行性、子目标一致性、受治理技能),并维护跨步骤的共享状态与分层记忆。Harness Robotic OS 的安全门控自演化回路是其中唯一处理了「持续更新的风险控制」的。
  • 评测方法论本身成为独立研究对象。 EgoPathBench 指出现有空间智能基准只测孤立判断、测不出整合的导航能力;ENCP 指出标准共形预测在变长依赖 episode 上的覆盖保证失效;GPT-6-Astra 把成功率拆成主动停止与触底判定;Embodied-BenchForge 则直接把基准构建本身 agent 化并加逐工件验证。

研究空白

  • R2R-CE 的零样本评测缺少公认协议。 本期四种子集并存,且无一篇报告与其他子集的换算或重叠关系,使得「零样本 VLN-CE 当前到了什么水平」在文献层面无法回答。
  • 停止判定仍是最薄弱的单一环节,且缺少专门指标。 GPT-6-Astra 的 16.0% 触底成功、C2Nav 去掉 Arriving 后 SR 从 31.0% 降到 29.0% 都指向这里,但除这两篇外本期无人单独报告停止相关指标。
  • 具身 Agent 的架构设计缺少对照实验。 本期三个 harness 工作都只报系统整体指标,没有一个做过「去掉某一层校验/某一类记忆」的消融,因此无法判断各设计的独立贡献——这与 C2Nav 在导航侧的做法形成鲜明对比。
  • 效率工作与导航任务之间存在验证断层。 次池中的推理效率工作全部在 LIBERO 类操作基准上验证,无一在 VLN-CE 上测过。

建议动作

高优先级

  • 精读并复现:EgoPathBench 的微调实验(Qwen 3.5 4B 由 3.9 升至 38.9)——本期唯一证明「具身航点决策可训」的工作。
  • 精读:GroundingVLN:核验 69.9% SR 对应的 split 完整性与基线身份;拆解 GEAR 的执行对齐奖励设计。
  • 精读并局部复现:C2Nav 的角色反转实验;优先在自有系统的停止判定环节改用比较式提问。
  • 建立跟踪表:为 R2R-CE 结果建立「评测子集 + episode 数 + 是否零样本」三列登记表,杜绝跨协议数字直接比较。

中优先级

  • 精读架构:Harness Robotic OS 的三层记忆划分与安全门控自演化回路;不必复现整套系统。
  • 最小验证:AdaGeoVLN 的多深度 GFM 耦合:把单点终端特征注入改为早/中/晚三点耦合,不依赖其代码。
  • 指标改造:在自有评测中固定拆分「主动 STOP 成功」与「步数上限触底成功」,参照 GPT-6-Astra。
  • 跟踪:GLAM 与 Finder 的正式版数值与代码释出;二者分别代表预测式记忆与闭环取证两条路线。
  • 跟踪:UNI 的助行器采集范式,评估是否适用于自有轮式平台的数据补充。

低优先级

  • 暂缓:次池全部 VLA 推理效率工作——机制可借鉴,但在 VLN-CE 上的有效性未经任何验证。

原文作者:Tingde Liu · 原文链接 · 原创文字许可:CC BY 4.0

由 GaryLee1210 维护学习镜像。正文保持原样;调整了站点配置、站内链接和反馈入口,并补充来源说明。 论文配图及第三方引用材料的权利归原作者或出版方,沿用正文中的出处标注。

反馈