具身导航周报与技术随笔,按最近更新排序。
具身导航周报6 期
第 6 期:2026-09-24
R2R-CE 零样本出现 79.0% SR 的新声明(GPT-6-Astra,Codex harness + ultra 推理),但评测集、推理成本与停止口径均未在摘要中给出;一周前同一模型在直接工作流下为 52.0%,核验前不宜与训练式方法横向比较。同一基准上的数字越来越多地出自不同信息条件:SparseNav...
第 5 期:2026-09-17
本期最值得注意的是一组对照:EgoPathBench 测九个 VLM 的第一人称航点决策,点代理几何下 Point Path 尚有 35.9% 成功率,加上具身几何约束后 Embodied Path 只剩 2.9%;而 GPT-6-Astra 靠完整工作流在 R2R-CE 上跑出 52.0% SR。当前零样本导航...
第 4 期:2026-09-10
本期 46 条新增全部来自 arXiv,公众号源因微信公众平台频控缺席,两个订阅号采集均为 0 条。46 篇中仅 1 篇报 R2R-CE:O2C-Nav 把零样本 VLN-CE 的每决策步大模型调用压缩到一次,但摘要只称超过现有零样本方法、未给可核验数值。证据质量最高的导航结果来自 OmniNav(真机 pick...
第 3 期:2026-09-03
本期 45 条新增全部来自 arXiv,公众号源因上游中转随 Deno Deploy Classic 下线而永久失效缺席。45 篇中仅 2 篇报告 R2R-CE:LookStep 给出可核验的 Val-Unseen 成功率 49.7% 且已开源,Revisiting Topological Graphs 把 VL...
第 2 期:2026-08-29
本期 53 条新增中仅 1 项报告连续环境数字,且是指令生成侧的 VTInstructor(R2R-CE / RxR-CE Val Unseen CIDEr +0.357 / +0.109),跟随器侧空白;基准重心明显偏离导航,50 项独立工作中 15 项以 LIBERO 为主基准。RTNav 把推理延迟计入任务...
第 1 期:2026-08-20
本期 46 篇新增工作中导航为主仅 5 篇,R2R/RxR 榜单供给持续变稀:Embodied-Navigator 是唯一给出 R2R-CE 数字的工作(66.2% SR);CondVLN 用条件分支指令揭示 SR/SPL 评测口径对指令理解能力的高估;RP1、Remember Smarter 等可插拔的记忆压缩...
技术随笔7 篇
Jev:System One 模型与具身导航
Jev 将自由生成替换为类型化判断,但其速度、校准与泛化需要分开检验。本文先厘清接口和证据边界,再比较候选读出、任务训练、视觉共享与外挂感知等开源路线;最后围绕具身导航的行动决策、记忆管理与 Agent 内部协作,提出研究问题及可归因的实验方案。
RoboTTT:用 Fast Weights 压缩长时程历史
详细剖析 NVIDIA 发布的 RoboTTT 架构。深入探讨测试时训练(Test-Time Training, TTT)如何通过在测试阶段运行梯度下降将多步交互历史(History)动态压缩进快权重(Fast Weights)的参数空间,克服传统 KV Cache 的显存爆炸与线性 RNN 的容量瓶颈,实现 8...
Graph Engineering:智能体图编排
Graph Engineering(图智能体工程)是继 Loop Engineering 之后,在 2026 年中后期迅速崛起的高阶多智能体编排范式。它主张将复杂的智能体交互与控制逻辑建模为显式的有向状态图(State Graph),以节点、边与全局状态等核心原语,实现非确定性 LLM 认知与确定性工程逻辑的结合...
Loop Engineering:Agent 闭环范式
Loop Engineering(循环工程)是 2026 年 AI 智能体开发的最核心演进。它将开发者的角色从“亲自 Prompt 的打字员”转变为“设计 Agent 闭环系统的架构师”。本文结合最新行业实践,深度拆解 Loop Engineering 的四种核心循环模式、五大基础原语、外部化状态机制,以及应对“...
Mixture-of-Transformers (MoT) 架构详解
深入剖析 Meta AI、NVIDIA 等机构提出的 Mixture-of-Transformers (MoT) 稀疏架构。从密集模型的模态竞争难题出发,详解 MoT 核心的「模态特定参数解耦 + 全局自注意力」机制、确定性模态路由,并重点剖析 NVIDIA Cosmos 3 物理世界模型在此架构上的前沿工程落地...
树状注意力:VLN 训练 Token 压缩 22×
聚焦 Robostral Navigate 的前缀树监督训练:为什么观测构成共享主干、动作必须成为叶节点,以及 tree attention 如何在阻止 ground-truth action 泄漏的同时将训练 Token 压缩 22×。
Harness Engineering
Harness Engineering(Agent工程化)是2026年最重要的AI工程新范式:通过上下文工程、架构约束与熵管理三大支柱,为AI Agent构建可靠的生产级基础设施。OpenAI用此方法在5个月内零手写代码生成超100万行生产代码;LangChain仅修改Harness配置就将编程Agent的基准得...