Jev:System One 模型与具身导航

1. 引言:导航中的每一次判断都需要生成吗

具身导航既需要理解指令、整合历史和重新规划,也包含大量较短的判断:哪个候选路点更合适、当前地标是否匹配、哪条记忆与任务相关、是否需要再看一眼。这些环节是否都需要逐步生成文本?能否将有界判断与开放式推理分开,让不同计算承担不同职责?

这不是预设某一种导航范式必然更优。端到端动作模型、分层规划和候选比较各有适用条件;本文关注其中一条可检验的路线:在机器人已经提供证据、候选与执行约束时,用专门的决策模型处理部分选择与验证。

TypeSafe AI 于 2026-09-15 发布的 Jev 提供了这种接口:输入文本状态与预先定义的问题,返回类型化结果和概率,而非自由生成的回答。官方将其称为“System One 模型”,强调快速、聚焦的判断。官方发布文

Jev 是否适合导航,不能只看调用速度。其原生输入只有文本,内部训练细节未完整公开;社区替代实现虽然扩展到视觉,也需要区分接口、训练与执行优化各自带来的收益。本文因此按以下顺序展开:

  1. 第 2 章:接口与证据。 Jev 返回什么,速度与校准主张如何理解,已知局限是什么。
  2. 第 3 章:技术路线。 从候选读出、决策头训练到视觉适配,开源方法分别改变了什么。
  3. 第 4 章:导航研究机会。 沿行动决策、记忆管理与 Agent 内部协作展开,区分已有结果与迁移设想。
  4. 第 5 章:验证方法。 用可归因的对照实验检验质量、延迟、成本与执行风险。

全文将厂商声明、论文 / 项目自报结果和本文提出的方案分别标明。核心目标是找到值得研究的机制,而不是把产品宣传或单个演示外推成通用导航能力。

2. Jev 是什么:接口、机制与证据边界

Jev 是面向程序的决策模型:给它信息和预先定义的问题,它返回可直接使用的判断结果及概率。

先看一个客服工单分类的例子。用户发来消息:“订单显示已经送达,但我没有收到包裹。”系统需要判断这条消息属于哪一类:物流问题、退款申请、商品咨询。

程序把用户消息和三个类别交给 Jev,询问:“这条消息的主要诉求属于哪一类?”Jev 返回选中的类别及各类别概率,程序据此将工单转交相应客服。下面用一组构造的数值说明这个过程,并非实际调用结果。

一个例子看懂 Jev:判断客服工单属于哪一类 用户消息为:订单显示已经送达,但我没有收到包裹。程序提供物流问题、退款申请、商品咨询三个类别。Jev 返回物流问题,示例概率分别为 0.85、0.05、0.10。程序据此将工单转交物流客服。所有概率均为示意,非实测结果。 一个例子看懂 Jev:这条工单分到哪一类? 用户消息 + 预设类别 → Jev 判断 → 程序分流 ① 输入用户消息与预设类别 “订单显示已经送达, 但我没有收到包裹。” A 物流问题 B 退款申请 C 商品咨询 问题:这条消息主要属于哪一类? Jev ② 判断类别 ③ 返回类别及各类别概率 选中:A · 物流问题 A 物流问题 0.85 B 退款申请 0.05 C 商品咨询 0.10 示意结果,非实测;非完整 API 响应 ④ 程序按类别分流 将工单转交物流客服 程序提供消息和可选类别, Jev 返回判断,程序据此分配工单。
图 1 用户消息与预设类别输入 Jev,返回的分类结果供程序分流。概率为构造示意。

在这个例子中,Jev 负责判断工单类别,程序负责分配工单。 分类只是其中一种用法:Jev 还支持按预设等级评分、判断命题是否成立,分别对应下面的 Choice、Score 与 Noul。第 4 章再讨论这些判断如何用于导航。

2.1 从生成回答到返回有界决策

“System One”借用了快思考 / 慢思考的比喻。在这里,它首先描述一种软件接口和任务分工,不应理解为已经证实的认知机制,也不意味着所有生成式 LLM 都只能做慢推理。

调用 Jev 时,应用提供 state,并通过问题定义可能的答案。模型返回结果,代码再决定如何使用。其三种原语如下:

原语 问题形式 主要返回值 客服场景中的示意用途
Choice 在给定选项中选一个,最多 255 项 选中项、完整概率分布、confidence 判断工单类别
Score 按有序、带文字描述的等级评分,最多 10 级 等级位置的概率加权均值、各级概率、confidence 按预定义等级评估处理紧急程度
Noul 判断一个命题 命题为真的概率;无独立 confidence 字段 判断用户是否明确提出退款

Score 可以位于两个等级之间。例如等级位置为 0、1、2,概率为 0、0.6、0.4,则 score = 1.4,而非必须选中整数等级 1 或 2。这是模型在等级上的分布摘要,不是物理测量值。Choice;Score;Noul

同一个工单分类场景,按官方字段组织成请求如下。它与图 1 对应,用于说明接口,未实际调用。

{
  "model": "jev-1.13.0",
  "state": "用户消息:订单显示已经送达,但我没有收到包裹。",
  "questions": {
    "ticket_category": {
      "type": "choice",
      "instructions": "根据用户明确表达的主要诉求,将工单归入最匹配的类别。",
      "criteria": {
        "logistics": "物流问题:配送进度、送达状态或包裹未收到",
        "refund": "退款申请:用户明确要求退还款项",
        "product": "商品咨询:商品规格、功能或使用方式"
      }
    }
  }
}

同一 state 上的问题可合并请求并分别求值;这里的“独立”指不需要依赖其他问题的返回结果,不表示它们在统计上互不相关。需要先读取上一步结果或获取新观测的问题,应分步处理。类型约束减少自由文本解析问题,但不免除请求失败处理、结果校验和执行条件检查。

2.2 为什么可能更快:接口事实与内部架构要分开

普通生成式调用读入上下文后,再逐 token 输出回答;如果需要长推理或解释,这部分串行计算会增加延迟。Jev 的公开接口不返回生成式解释,官方描述其通过并行采样在同一请求中给出多个类型化结果。发布文

“一次请求返回全部结果”不等于已经公开证明“内部只有一次前向传播”。 目前本文核查的材料未完整披露 Jev 的网络结构和执行路径。因此可以讨论省去自由文本解码与多问题并行的意义,却不能把社区编码器、决策头或 logits 读出的实现直接当作 Jev 的真实内部结构。

生成式调用与类型化决策:比较的是输出路径生成式调用与类型化决策:比较的是输出路径生成式调用读入上下文→逐 token 输出答案是否有长推理取决于设置→解析与任务校验Jev 接口状态 + 多个问题→类型化结果并行返回不披露内部前向次数→结构读取与任务校验输入处理、通信、排队与结果验证仍可能占用时间公平对照:短答案生成 / 候选读出 / 分类器;统一任务与计时范围
图 2 两种输出路径的对照。任务校验与端到端开销应纳入比较。

官方发布时报告端到端响应 70–500 ms,并给出针对其 System One 任务的加速对比。这些数字依赖输入、问题数量、网络与对照模型设置;不能拿长推理模型的耗时,推导 Jev 对所有短答案基线都具有相同倍数优势。官方速度说明

后文开源方法可以直接检查是否单次读出、是否多次去偏、是否共享前缀。公平评测应分别记录输入编码、模型计算、通信与后处理,并包含短答案生成、候选读出和分类器基线。无需生成长解释,不代表完全不需要理解输入,也不意味着模型一定更准确。

2.3 概率、confidence 与校准不是一回事

先区分三个概念,否则后文的阈值和调度容易混淆:

概念 表示什么 不能直接推导什么
候选 / 命题概率 模型在给定状态与问题下对答案的支持程度 真实环境中的碰撞概率或任务必然成功
API 的 confidence 由 Choice / Score 的概率分布计算的集中程度摘要 该数值就是所选项概率,或就是实际正确率
校准 在一组预测中,预测概率与实际结果频率是否匹配 每个高概率答案都正确,或换场景后仍然校准

官方明确说明 confidence 由已返回的分布计算;Noul 不另外携带这一字段。实际系统可以读取完整分布,并评估何种不确定性统计量适合本任务。Confidence 文档

以多分类的 top-label 校准为例,用每个样本最高的候选概率分桶,比较桶内平均概率与准确率:

\[\mathrm{ECE}=\sum_{m=1}^{M}\frac{|B_m|}{n} \left|\mathrm{acc}(B_m)-\overline{p}_{\max}(B_m)\right|\]

这里的 $\overline{p}_{\max}$ 是所选项概率的平均值,不是未经定义转换的 API confidence。对二元命题,也可用预测为真的概率 $p_i$ 和标签 $y_i\in{0,1}$ 计算:

\[\mathrm{Brier}=\frac{1}{n}\sum_{i=1}^{n}(p_i-y_i)^2\]

ECE 依赖分桶方式和样本量;Brier 衡量概率预测误差,也受区分能力影响,不是只测校准。多分类与二元任务的定义应明确,不能跨论文直接排列数值大小。

可靠性图:什么叫“校准”(示意) 00.20.40.60.81.0 00.20.40.60.81.0 所选项的预测概率 该桶的实际正确率 理想校准:说 70% 就对 70% 过度自信:预测概率高于 实际正确率(示意) 校准良好:贴着对角线 (不代表 Jev 实测结果) 红色虚线长度按样本数 加权平均 ≈ ECE 对机器人意味着什么 阈值需用目标任务数据检验 概率不能代替执行安全检查; 换任务就要重新画这张图
图 3 所选项概率与实际正确率的关系示意。曲线不代表某种训练方法或 Jev 的实测结果。

对导航而言,“更集中”与“更可靠”需要用目标任务数据建立联系。选路、到达和恢复的错误代价不同,不能共用一个未经检验的阈值;校准良好也不能替代对地图、障碍与命令有效性的检查。

2.4 RLCD:训练目标已说明,完整配方仍未知

TypeSafe 将其训练方法称为 RLCD(Reinforcement Learning for Calibrated Decisions),公开强调输出决策与概率,并使概率对应实际结果。相较于 RLHF 的偏好目标,这体现了不同的优化重点;但不能把 RLHF 简化成必然过度自信,也不能因为采用 RLCD 名称就断言输出已经可靠。官方 AI primer

在本文核查的公开材料中,尚无法重建 Jev 的完整训练配方:基座、数据组成、奖励细节和优化过程都缺乏足够信息。“新架构 + 新训练方法”应作为厂商主张呈现,不能借社区实现反向补全。

对数损失与 Brier 损失属于严格恰当评分规则:在相应统计条件下,其期望最优预测对应真实分布。这提供了概率学习的理论动机,不保证有限数据、有限模型和分布迁移后的实际校准。Laya 提供了可检查的概率训练与温度校准实现,属于独立路线,不是 TypeSafe 配方的复现证据。Laya

2.5 如何阅读评测:速度、准确率、校准与稳定性

Jev 的公开评测来自不同任务、不同标签来源和不同运行环境。本文不据此给它一个统一“模型档位”,而是分别检查四个问题:

维度 应比较什么 常见混淆
速度与成本 同输入、同输出任务的延迟分布、调用数和价格 服务端耗时与网络端到端耗时混用;以长推理作为唯一基线
准确率 同一测试集、同一候选空间与参考标签下的结果 教师模型一致率当成人类真值;领域适配与零样本混比
校准与选择性预测 固定定义下的概率误差,以及拒绝部分样本后的风险 / 覆盖率 分布尖锐当作校准;不同任务 ECE 直接比较
稳定性与鲁棒性 选项换序、改名、重复调用、语言和状态长度变化 格式始终合法被当作语义判断始终可靠

官方 workflow eval 使用外部强模型的参考预测评估业务流程;厂商也说明宣传中的高倍数收益处于预期收益的较高端。这有助于理解其目标使用方式,但不等同于人类标注基准或导航闭环实验。发布文中的评测说明

第三方材料也应带着协议阅读:

  • Convex Decision Evals 使用 108 道领域四选一题,并采用匹配的选项排列。它测领域决策知识,作者明确区分这与编写或调试真实应用的能力。评测仓库
  • Anthus 的 Jev / Laya 对照在相同 600 条留出样本上报告原始 ECE 分别为 0.151 和 0.107,但作者没有把这个差值单独当作 Laya 胜出;其 Brier 比较反而有利于 Jev。这说明准确率、校准与概率预测质量应一起解释。实验报告
  • Laya 的项目对照有领域适配、温度拟合以及候选数量设置差异,适合研究训练收益和限制,不是统一条件下的通用排名,详见 3.3。项目结果

这些证据支持继续测试 Jev 的有界决策用途,但不足以推出“普遍达到某档 LLM”“所有任务都需要相同校准方法”或“某种错误绝不会发生”。可复现比较需要保存模型版本、问题文本、候选集合、标注来源和运行环境。

2.6 能力边界与使用条件

“无类型错误”是输出契约上的主张,与事实正确、逻辑一致或行动安全不同。官方列出的弱项包括数值精度、多层间接推理、无关信息过多的长状态、对抗内容与矛盾条件。Jev 1.13 局限

这对导航产生几条直接约束:精确坐标与碰撞计算留给几何模块;历史应按问题检索与裁剪;需要新计划或解释时保留生成式模块。代码拥有否决权能阻止部分错误执行,但增加判断层也可能带来误拒绝、延迟和任务停滞,不能称为“最坏等同没有它”。

下表为 2026-09-26 核查的官方配置快照;别名、价格与限流可能变化。Models

项目 官方配置
模型 jev-1.13.0;当时 jev-latest、jev-preview 均指向该版本
输入 仅文本;支持字符串、JSON 对象或文本数组
上下文 每请求总计 64k;state 加最长问题不超过 32k
计费 输入 $0.042 / 百万 token,输出免费
限流 250k tokens/s、1,200 requests/min;官方提示可能动态调整

价格是服务计费政策,不能仅由“没有生成文本”推导。做研究时应固定版本并记录实际返回的模型 ID;输入语言与场景变化也应单独评测。

2.7 从单次判断到 Agent:已有应用提供的线索

已有论文展示了 Jev 可以怎样嵌入系统。本节只保留角色与证据边界,记忆机制和导航迁移在第 4 章展开。

工作 Jev 承担的角色 对后文的启发与限制
Jev-Mem 记忆组织、检索路由、候选评分与停止判断 支持研究“查什么证据”;实验是长期对话记忆,详见 4.3
REFLEX 有界行动选择,不确定或需要生成时升级 在其 100 任务基准中报告 95% 成功率、强模型调用减少 72.7%;相对廉价生成式级联的优势有限
渗透测试 Harness 对确认、分级和流程控制做判断 提供约束决策层的系统例子;不能据此证明机器人安全或反推 Jev 的训练配方

这些工作的共同线索是判断模块与生成 / 执行模块分工,而不是用 Jev 包办整个 Agent。REFLEX 的有限优势尤其提醒:后续导航实验需要与规则、小模型和廉价级联比较,而不只与“每一步都调用最强模型”比较。

3. 从 Jev 接口到开源实现:四类技术路线

托管 Jev 只收文本,但“有限候选 → 类型化结果”并不限定某一种骨干。社区方法可以改变读出方式、训练部分参数、复用共享计算,也可以接入视觉与音频。相似接口不代表相同模型,更不代表已经复现 TypeSafe 的训练与能力。

本章按技术路线组织项目,而不把它们排成一张性能榜。以下结果均来自论文或项目作者报告,本文未独立复现;不同硬件、数据与训练条件下的延迟和准确率不能直接比较。

3.1 路线总览:改变读出、训练能力、共享计算或接入感知

开源实现的四个可组合维度(不是性能排名)开源实现的四个可组合维度(不是性能排名)改变读出AnyJev / PixelJev 冻结模式生成短答案 → 候选条件分布引入任务训练minojev / Laya / Open-Jev小头、LoRA 或更广泛参数适配复用共享计算Visual Jev 等同一视觉前缀 → 多问题执行接入模态证据视觉模型 / 外挂感知 / 音频编码器直接读模态特征,或先转结构化状态分别测量:质量、校准、延迟、计算量、显存与迁移;不能由训练程度推断速度
图 4 项目可同时使用多种机制;候选读出、领域训练、执行复用和新增模态应分别消融。
技术路线 代表实现 主要改变 对研究最有价值的比较
冻结骨干、候选读出与去偏 AnyJev raw / L0 / L1、PixelJev 冻结模式 输出限制到合法候选;可加排列去偏与校准 同一模型生成短答案 vs 直接读出
决策头或任务适配 minojev、Laya、Open-Jev、AnyJev L2 学习任务相关表征 / 读出,训练范围各不相同 冻结读出 vs 小头 vs 适配骨干
视觉决策与共享上下文 Visual Jev、PixelJev、Laya Vision、PlayJev 使用视觉证据;部分方法复用视觉前缀 视觉适配、读出方式、共享执行分别消融
外挂感知或其他模态 jev-vision、Prosodia 等 图像 / 音频先转换为状态,或直接从模态编码器读出 信息保留程度与整个流程成本

这些路线可以组合,不是由上到下越来越先进的阶梯。AnyJev 同时包含无标签与拟合读出头的模式;Visual Jev 同时包含任务适配与执行共享。因此,“是否训练”“是否生成”“是否多模态”和“是否复用前缀”应作为独立维度记录。

3.2 不训练骨干:候选读出能带来什么

生成式 LLM 原本会在词表上预测下一个 token。如果把答案限制为少量标签,就可以只读取这些标签的 logits,再归一化为候选分布。通常需要先把候选映射到可直接读出的标签 token;若标签跨多个 token,则需另行定义序列评分或读出方式。这样避免生成解释,也减少答案格式不合法的问题,但候选条件分布不自动等于经过目标任务校准的概率。

AnyJev 提供了几个可分开考察的层次:raw 直接读出;L0 使用选项循环移位与标签先验修正;L1 再拟合温度;L2 则从隐状态拟合读出头,已不属于完全无标注的方法。在作者的 BANKING77 20-way、300 测试项设置中,raw 到 L1 的准确率由 0.747 变为 0.807,ECE 由 0.240 变为 0.095;不能把它写成完整 77 类任务的通用结果。AnyJev

这里有两个容易遗漏的代价。第一,L0 的排列去偏涉及多个输入排列,单个读出不生成文本,并不意味着完成整次去偏只需一次模型计算。第二,温度和读出头需要数据,其拟合与测试应分离。即使服务端将这些计算批处理,也应报告总计算量与端到端延迟。

这条路线最适合作为接口收益的基线:如果不训练就能明显减少格式错误与生成成本,便可以先研究读出;若准确率仍受限,再研究训练。它不能凭空补上模型缺失的视觉知识、长程规划或正确候选。选项顺序与标签偏差也应单独检查,相关问题早于 Jev 已被研究。PriDe

3.3 引入训练:小决策头与骨干适配解决不同问题

冻结骨干、训练小头保留大部分预训练表示,只学习怎样将这些表示转成任务答案。minojev 采用冻结 Qwen3-1.7B 与小型决策头,其作者报告领域内收益,同时公开未见领域准确率 31.7%、低于生成式基线 40.0% 的结果。它说明任务专精和跨域泛化必须分别测,不能由少量领域内结果推断通用能力。minojev

训练编码器决策模型允许更广泛地适配表示。Laya 基于 ModernBERT 等预训练编码器构建决策模型,不宜称为从随机初始化“从头训练”。在其 2,000 个 typed-decisions 上,领域适配 checkpoint 报告准确率 0.766,基础英文 checkpoint 为 0.362,Jev 对照为 0.727。这里最直接的证据是同一项目适配前后的变化;其其他对比还涉及温度拟合、输入预算和候选数量差异,不能统一解释为超过 Jev 的通用能力。Laya

微调已有 LLM 的候选读出则保留语言骨干结构,通过 LoRA 等方式适配任务。Open-Jev 在合成诈骗通话的 41 个留出场景、577 次逐轮判断上报告 AUROC 0.974,单次决策 64.5 ms,比同骨干生成式微调低 4.9 倍延迟;作者同时指出,微调 ModernBERT 并未显著更差,配方选择接触过测试集。这是一项有具体应用和局限的研究,不支持“专用读出必然提高准确率”。Open-Jev

训练选择 可能得到什么 主要代价或风险
仅拟合温度 调整概率尖锐程度 通常不改变 argmax,不能修复错误表征或遗漏候选
冻结骨干、拟合小头 较低训练成本下获得任务专精 表征不足与跨域退化仍可能存在
LoRA / 更广泛参数适配 让表征更适合目标任务 数据成本、遗忘与过拟合,需要保留独立测试集
单独训练领域分类器 简单任务上较低成本的基线 泛化与可配置性需与通用模型公平比较

所以,训练是否必要取决于任务,不能总结成“准确率只来自微调”。接口约束可能改善合法输出,标签设计和候选集合也会影响结果;训练的贡献需要在匹配条件下测出来。

3.4 接入视觉:图像信息、任务适配与执行复用要分别分析

3.4.1 视觉证据不应被误算成接口收益

PixelJev 将图像、指令和动态候选集接到开源多模态骨干,并分别测试冻结推理、少样本适配和校准。在 Pets 上,其 2B 模型从 60.13% 提升至 92.40%;匹配对照将主要收益归因于适配。作者同时报告专用 DINOv2 探针仍更强,部分任务上冻结 4B 优于适配 2B,准确率提升也不保证迁移后的概率校准。PixelJev

对导航的启发是:从“感知摘要 + 文本模型”切换到“图像 + VLM”,同时改变了输入证据与模型能力。要证明有界接口的作用,应在同一视觉骨干、同一候选集下比较生成与读出,另行测量视觉信息相对文本摘要的收益。

3.4.2 同一图像上的多道题,可以共享部分计算

Visual Jev 将图像与公共上下文编码一次,再批量执行隔离的问题后缀,从现有 LM 头读取候选概率。作者在每图 32 个问题的设置中报告暖态摊销时间相对独立串行快 8.9 倍、相对重复前缀的批处理快 3.4 倍;代价是更高峰值显存。匹配的类型化头对照没有显示一致准确率优势。Visual Jev

它支持的是共享输入下的执行优化,不是每一步机器人控制都能获得同样加速。每张新图是否可以复用、问题是否相互依赖、批次能否及时凑齐,都会影响实际收益。摊销每题时间也不能直接当作一次完整决策的响应时间。

这使“在哪一层共享”成为独立研究变量:多个问题共享图像,多个候选共享状态,或者多个模块共享提取出的证据。共享减少重复计算,但不改变证据本身是否正确。

3.4.3 从视觉问答到动作策略,还需要闭环数据

Laya Vision 基于 SmolVLM-256M 进行视觉决策训练,报告 L4 上约 34 ms 的中位延迟,同时观察到游戏能力和视觉推理之间的训练取舍。PlayJev 使用 Qwen3.5-0.8B,通过行为克隆与 DAgger 学习游戏动作选择,训练还打乱动作顺序以降低位置捷径。Laya Vision;PlayJev

二者说明视觉输入可以接入有限动作决策,也提示离线问答准确率不足以描述行动能力:策略会进入自己选择造成的新状态,错误会累积。游戏结果不能直接外推为真实机器人导航性能,设备上的短延迟也不等于机载功耗、显存与可靠性均满足要求。

工程上,Jev Visual展示了共享图像与候选打分;jev_navigation将 decider-2b-vision 接入 ROS 2 路径选择。它们有助于研究接口,但“能看图并选择”与“已验证的导航策略”之间仍有距离,具体证据见 4.5。

3.5 外挂感知与其他模态:保留了什么,又丢失了什么

对于托管 Jev,图像或语音需要先转换为文本或结构化字段。例如 jev-vision用检测结果与场景上下文做消歧;typesafe-computer-use使用 OCR;jev-canvas结合转写与位置选择操作。这条路线的优点是职责明确,但未提取出的视觉细节不会因为后面接了 Jev 而恢复。

另一种做法是直接从模态编码器读出决策。Prosodia以冻结 Whisper 编码器处理语音属性,避免先转写再判断。它说明生成文本不是所有模态任务的必要中间步骤,但具体任务需要的信息可能不同:声学属性与语言内容并不等价。

因此,多模态扩展不能概括为“换一个编码器即可”。还需要任务数据、模态对齐、候选定义、概率评估和部署验证。图像压缩成语义状态有信息损失,直接看图则有视觉计算开销,取舍应通过目标任务测量。

3.6 综合判断:性能究竟来自哪里

前述工作可以归纳为四类来源,但每一类都需要自己的消融:

来源 可以合理期待的作用 还需要验证什么
有界接口与候选读出 限制输出、减少文本解码和解析开销 是否保持判断质量,能否识别候选不足
任务数据与参数适配 改善目标任务表征和读出 未见场景、未见标签与长期闭环泛化
共享前缀与批处理 减少重复编码,提高特定负载下吞吐 单请求延迟、显存、异步状态时效
校准与选择性决策 使概率更适合门控或拒绝 留出数据、分布漂移与风险 / 覆盖率

现有研究不要求所有方法都使用专门决策头,也不支持“只要不生成就一定更快、更准、更可信”。比较时应固定能固定的变量,明确优化的是延迟、准确率还是概率质量,且单独核对代码与权重许可。

对具身导航而言,本地视觉决策模型是一条可研究的实现路线,而不是已经成立的“机载 Jev”。下一章将这些机制放到具体职责中:行动比较能否减少无效生成,记忆控制能否找到更有用的证据,模块调度能否把有限计算用在更需要的时刻。

4. Jev 与具身导航:从行动决策到 Agent 协作的研究机会

Jev 对具身导航的价值,不能只用“每次调用快了多少”来衡量。更值得追问的是:导航系统中哪些环节需要生成和推理,哪些环节只需要在已有证据上做判断?如果将两者分开,能否在保留任务能力的同时,减少不必要的计算与错误?

本章围绕三类问题展开:行动决策、记忆管理、Agent 内部协作。前两者分别决定“怎么走”和“查什么”,第三者指单个导航 Agent 对感知、记忆、规划与推理模块的调度,决定“现在应该行动、回忆、补看,还是深度推理”,不涉及多 Agent 通信与协商。贯穿例子是“回到刚才看见杯子的房间,在门口停下”,用它说明三类能力如何共同完成长期导航。

需要先划清证据边界:导航论文为接口设计提供依据,Jev-Mem 提供通用 Agent 记忆实验,社区项目展示部分机器人接入。下文将这些工作迁移到导航的方案属于研究设想,尚不是 Jev 已验证的导航能力。

4.1 为什么导航值得引入 System One 决策模型

4.1.1 一次长程导航包含许多不同难度的判断

理解“穿过厨房,再到客厅窗边”可能需要指令解析和场景推理;但当机器人已处于通往客厅的走廊时,每一步未必都需要重新生成一段完整计划。它可能只需比较两个路点、判断地标是否匹配,或确认当前子目标是否已完成。

采用逐步生成式决策的导航系统,会在这些难度不同的问题上反复付出读上下文、生成和解析的成本。VerNav 与 AdaNav 分别从“用验证替代常规生成”和“按不确定性触发推理”切入,说明研究重点已经从单纯增强推理,转向把推理用在有收益的时刻。VerNav;AdaNav

Jev 为这一方向提供了一种具体的决策接口:给定状态和有限答案空间,直接返回判断与概率。研究中要同时记录调用耗时与判断错误引起的走错路、回退和重复调用。

4.1.2 长期任务的成本不只来自动作选择

“回到刚才看见杯子的房间”至少包含三类不确定性:

不确定性 机器人需要解决的问题 潜在的 System One 职责
行动不确定性 目标已知,当前几个方向哪个更合适? 候选比较、进展验证、到达判断
记忆不确定性 哪次观测中的杯子、哪个房间才是指令所指? 记忆相关性、证据筛选、检索停止
过程不确定性 当前信息不够,下一步应查历史还是换个视角? 模块选择、计算预算分配、升级判断

这三类问题不能全部压成“选一个动作”。目标房间不确定时,立即选路可能放大记忆错误;目标明确但被遮挡时,继续检索历史未必有用;路径暂时受阻时,也不一定需要重新理解整条指令。

因此,一个有意义的研究目标是:用低开销的有界判断,减少导航过程中的无效行动、无效检索和无效推理。 除调用延迟外,还应关注绕路、重复探索、错误停止与总任务耗时。

4.1.3 区分 Jev、System One 接口与导航模型能力

本文使用“Jev”时,指 TypeSafe 的托管文本决策模型;“视觉 System One”则指第 3 章的视觉派生或同类方法。原生 Jev 需要上游先把视觉观测转成语义状态,本地视觉模型可以直接处理图像,两者可用的信息与部署成本不同。

研究中至少要分开三个变量:接口是否从生成改成判断,模型是否经过导航训练,以及输入是否增加了视觉证据。 如果同时更换这三者,实验即使变好,也无法知道收益从何而来。“System One”本身不会自动提供空间理解、导航记忆或领域校准。

4.2 行动决策:从生成动作到比较与验证

4.2.1 候选比较改变的是模型与机器人的分工

一种做法是让大模型直接描述下一步动作,甚至输出坐标;另一种做法是由机器人先构造可执行候选,再让模型比较。后者把度量计算、动作幅度和执行约束留给机器人,把语义判断交给模型。

C²Nav 对此进行了直接研究:空间选择、指令阶段转换和终止判断都采用比较式接口。在 OpenNav R2R-CE 100 协议上,Qwen3-VL-8B-Instruct 版本的 SR 为 31.0%;将三个决策位置分别改回数值式 / 绝对式问法后,SR 降至 12.0%、28.0%、21.0%。结果支持“问题形式会影响导航表现”,但并不证明模型能力可以被接口替代。C²Nav

对 Jev 而言,这类任务可以自然表达为 Choice:在“前往左侧门口”“继续走廊”“停下补看”中选择。但候选必须来自地图、感知或规划器。候选集中没有正确行动,模型选得再准也无法完成任务。

O2C-Nav 则提供视觉候选的参照:将带历史信息的候选路点投影到 RGB 图像,由 MLLM 选点,低层 FMM 规划器执行;候选不足时还可生成备用目标框。若迁移到闭集视觉决策模型,需要保留或重做这个备用分支,不能只替换选点模块就假定整个方法等价。O2C-Nav

由此形成第一个研究问题:在相同感知和候选集下,非生成式选择能否保留生成式模型的导航质量? 难点不仅在平均准确率,还在困难场景中是否能识别“这些候选都不足以解决问题”。

4.2.2 比较哪个更好,与验证能否接受,可以分开

候选比较回答“哪一个相对更好”;动作验证回答“它是否值得执行”。当所有候选都不好时,最高概率选项依然存在,因此还需要拒绝或补证据机制。

VerNav 用批量动作验证替代常规逐步生成,在不确定时再由生成器提供紧凑证据。其 verifier-only 路径在离散 R2R 上实现超过 10 倍的平均单步决策阶段 LLM 延迟降低;同时,验证器经过偏好对齐和逐步强化训练。这支持验证优先的路线,不能直接推导出零样本 Jev 替换后的效果。 VerNav

对 Jev 的迁移可以研究两种分工:直接从候选中选择,或先对候选做有界验证,再由程序决定接受、重选或升级。后一种分工有利于暴露“拒绝行动”的条件,但也可能增加调用成本。值得验证的是,在相同预算下,多一次验证能否减少更昂贵的执行错误。

4.2.3 进展和到达判断,比普通选路更容易积累错误

导航不是独立选择题的集合。一次错误转向可能通过后续观测纠正;一次错误到达判断却可能直接结束任务。C²Nav 将进展与终止判断也纳入比较式设计,提示它们需要单独建模,而不是附在选路问题之后。C²Nav

决策 杯子房间例子中的问题 可研究的接口 必须观察的失败
局部选择 哪个观察点更有助于接近目标门口? 有限候选比较 正确候选缺失、被相似地标误导
阶段转换 仍在找房间,还是已进入门口复核阶段? 相邻任务阶段比较 提前跳过尚未满足的子目标
到达复核 当前门口是否对应目标地点,且停在要求的位置? 条件判断 + 必要的补看 错误停止、反复犹豫、过度接近
异常判断 杯子暂时不可见,还是此前的目标关联有误? 遮挡 / 歧义 / 信息不足判断 把暂时遮挡当作目标不存在

这里的“停止”要区分安全停车、等待信息与任务完成。它们可能都产生零速度,但只有最后一种意味着任务结束;到达复核因此需要同时核对当前观测、目标条件和位置证据。

这一方向的创新可以落在决策粒度与验证时机上:哪些判断共享状态即可一起完成,哪些必须等待行动后的新证据;到达错误的代价更高时,是否值得采用不同于普通选路的复核策略。

4.2.4 什么情况下值得引入 Jev

若任务只是比较距离、检查障碍或判断是否落入固定区域,几何计算与规则已经给出了明确依据。若场景和标签长期固定、标注数据充足,小型分类器也应是直接的对照。Jev 更值得检验的情形是:候选随环境变化,而选择标准来自当前指令,需要把语义条件与候选证据对应起来。

例如,同样面对两个门口,“去有杯子的房间”和“回到刚才见过杯子的房间”要求使用不同的证据。这里可以测试有界接口能否在调整问题与候选描述后继续工作,以及这种适配是否比重新训练分类器更省成本。对于小 LLM,则要在相同输入和候选下比较决策质量、延迟与拒绝能力。

因而,研究对象应是具有变化语义条件的有限选择。候选质量不足时应改进上游;任务需要创造新方案时应保留规划或生成。只有在这些职责明确后,才能判断 Jev 是否增加了有效能力。

4.3 记忆管理:从保存历史到检索与更新证据

4.3.1 Jev-Mem 提供了什么新的分工

长期 Agent 不仅要保存历史,还要决定如何组织历史、检索哪些证据,以及何时停止查找。Jev-Mem 将这些高频有界判断交给 System One,再由 System Two 综合证据回答问题。其共享记忆保留原始观测,并组织语义、时间、因果与实体关系;控制器参与查询路由、预算分配、候选评分与停止。Jev-Mem

作者在 LoCoMo 上使用 GPT-4o-mini 作为回答模型,报告总体 LLM-as-a-Judge 得分 0.777(MAGMA 为 0.700)、构建耗时 158 s(Nemori 为 1,044 s)、平均查询延迟 0.93 s(MAGMA 为 1.47 s)。查询延迟包含检索与答案生成,不同指标对应不同基线。这验证的是对话记忆系统,尚不是导航实验。 作者结果表

对导航的启发在于:记忆不必只是每一步固定附加的历史摘要;它可以成为一个根据当前任务调整检索范围和深度的过程。是否值得查更多历史,本身也是一个决策。

4.3.2 导航记忆比对话记忆多了空间落地与环境变化

“曾看见杯子”只有与地点、时间和来源关联,才能支持“返回那个房间”。文本相关性高的记录,未必对应同一个空间位置;过去可通行的路线,也未必现在仍可通行。

导航记忆的特点 只做文本相似检索可能出现的问题 值得研究的扩展
地点与物体会重复 多个房间都有杯子,召回内容相关但地点错误 结合地点 ID、轨迹上下文与原始观测
环境会变化 把旧的开门状态当作当前可通行条件 区分稳定地点知识与短期环境状态
观测受视角影响 没看见被理解成不存在,相似外观被认为同一地点 保留观测条件与不确定性,必要时请求新视角
行动会产生新证据 检索结果不随失败反馈更新,重复走同一条无效路线 将执行结果作为后续检索和重规划的上下文

这里应明确边界:Jev 可以帮助判断某条记忆与任务是否相关,地点匹配、坐标一致性和可通行关系仍需要定位与地图依据。语义关系不能自动变成拓扑连通边,推断的失败原因也不能未经验证就被当作事实长期保存。

因此,从 Jev-Mem 迁移到导航,研究贡献不应只是“把聊天记录换成导航日志”,而应处理记忆的空间关联、时间有效性与行动反馈。

4.3.3 从被动召回,走向任务驱动的证据选择

以杯子房间为例,固定 top-k 可能找出若干包含“杯子”的记录;任务驱动检索还要回答:哪条符合“刚才”?两条记录是否属于同一地点?当前信息能否支持返回目标,还是需要回查图像或相邻轨迹?

一个待验证的流程是:

  1. 用向量、关键词、时间和地点信息找到有限候选;
  2. 由 Jev 筛选支持当前任务的记录,并判断是否存在歧义;
  3. 证据不足时扩大检索或回查来源,而不是立即选路;
  4. 确定目标后交给规划模块,同时保留证据来源;
  5. 行动产生新观测后,再检查旧判断是否需要更新。

停止检索不等于证据充分。 Jev-Mem 的停止也可能来自继续查找收益低或预算限制;导航系统需要保留这个区别,避免把“没必要再查”误写成“目标已经确定”。方法说明

这一方向有两个不同的收益目标:一是用更少计算找到同等质量的证据;二是通过更准确的证据选择减少错误返回、重复探索和绕路。两者应分别测量。即使检索速度更快,只要漏掉关键地点记录,闭环导航仍可能更慢。

4.3.4 新观测如何更新记忆:保留事实,修正关联

主动检索还需要回答一个反向问题:行动之后,新证据怎样改变可供下一轮检索的记忆?以下是本文提出的导航扩展,区别于前面介绍的 Jev-Mem 原始实验。

新事件 应保留的观测事实 待更新或复核的关联
在另一门口又看到杯子 两次观测各自的时间、位置估计、视角与图像来源 是否同一房间或同一物体,不能仅凭语义相似合并
原先打开的门现在关闭 过去打开、当前关闭的两条观测 当前通行状态应更新;房间身份与稳定地标不随之删除
到达候选房间后未找到目标 本次访问路径、可见范围和未检出的结果 是遮挡、目标移动,还是此前地点关联有误,需要进一步证据
某条返回路线执行失败 失败时间、位置及执行模块报告 降低该路线当前可用性的判断;一次失败不等于永久不可达

这里可以把记忆分成观测记录、关联假设和当前状态。观测记录保存来源;关联假设允许被修正;当前状态按时效更新,并能追溯依据。Jev 可作为判断“相关、冲突、需要复核”的候选模块,定位、几何一致性与数据库写入规则则负责约束更新。模型推测的原因应留在假设层,直到有新观测支持。

杯子房间案例中,一次错误返回不应让系统直接删除原始杯子记录。更有价值的处理是记录此次访问结果,重新检查“这条记录属于哪个房间”的关联,并在后续检索中区分已核实地点与待复核地点。这样,行动反馈才能改变下一次选择,而不是被追加成无人使用的日志。

4.3.5 何时需要语义记忆控制

若指令明确给出地点 ID 和时间区间,结构化查询或规则过滤就可能足够。值得引入 Jev 的问题是:多个候选都符合表面关键词,但需要结合任务关系、观测来源和冲突证据判定哪条有用,例如区分“刚才经过的房间”与“更早看过、外观相似的房间”。

这种判断应放在有限候选上检验。若正确记录根本没有被检索出来,就应先改善索引和召回;若相关证据需要跨多条记录重新解释,也应允许生成式模块参与。记忆控制的潜在价值在于减少无效查询和错误关联,其代价包括额外调用、提前停止和错误更新。检索与更新应分别消融,避免把更好的记忆库误归因为更好的查询控制。

4.4 Agent 内部协作:何时行动、回忆、观察与推理

4.4.1 不确定时,调用更强模型只是一个选项

在长程任务中,困难可能来自不同原因:场景没看清、目标记错了、路线失效了,或者指令本身有歧义。只根据一个低置信信号升级到强模型,可能花费更多计算,却没有补齐真正缺失的信息。

AdaNav 通过不确定性相关信号学习何时触发显式推理,为按需计算提供了导航中的依据。但“是否推理”之外,还有更宽的选择空间:继续行动、检索记忆、主动观察、重新规划或请求澄清。将这些操作视为有限候选,是本文提出的 Jev Agent 调度方向,尚待验证。AdaNav

当前问题 更可能有价值的下一步 为什么不能一律升级模型
候选明确,证据一致 执行已验证的局部行动 更多推理可能只增加等待
两个历史房间都符合“见过杯子” 回查时间、轨迹或图像记录 更强模型也不能凭空消除来源歧义
目标门口被视角遮挡 移到安全观察点,获取新观测 旧输入中没有所需视觉信息
目标明确,但途中通路失效 调用规划器寻找替代路线 问题是可达性,不是语言理解
新证据与任务解释冲突 交给 LLM / VLM 重审计划,必要时澄清 需要综合多个条件或生成新方案

表中的对应关系只是启发式起点,不是已知最优调度规则。真正的研究问题是:Jev 能否根据状态与有限反馈,选择比固定流程更有价值的下一次计算或观察?

4.4.2 把三类决策放进同一个 Agent

图 5 给出研究层面的分工。任务规划器维护目标,感知和记忆提供证据,Jev 式决策层决定下一步操作,执行结果再成为新证据。感知、地图与检索器仍由各自模块实现;“控制检索”不意味着 Jev 自身存储或读取数据库。

行动、记忆与模块调度组成的导航 Agent 研究框架 任务规划、当前观测和历史证据进入有界决策层。决策层选择行动、检索、补充观察或深度推理;新观测与执行结果用于更新任务状态和复核记忆关联,再成为下一轮证据。所有运动经过本地规划和安全检查。 研究设想:让有界判断协调行动、证据与计算 当前观测与地图 感知、定位、可行候选 任务目标与计划 任务程序 / LLM / VLM 历史记忆与来源 地点、时间、观测与执行记录 Jev 式有界决策层 比较候选 · 评估证据 · 选择下一步操作 行动与验证 本地规划、安全检查、执行 检索与回查 外部记忆库与原始证据 补充观察 先验证观察动作,再获取信息 推理与重规划 强模型 / 规划器 / 人工澄清 新观测 / 执行结果 → 复核记忆关联、更新状态 三类职责分别验证,再研究组合;模型判断不直接成为运动命令
图 5 导航 Agent 的研究框架。反馈同时支持任务状态更新与记忆关联复核;三类职责先独立检验,再研究组合。

下面用一段构造的任务过程说明三类判断如何衔接。它用于解释研究问题,不是实验轨迹或模型实测输出。

当前证据 尚未解决的问题 选择的操作 新证据怎样改变下一步
历史中两个房间都出现过杯子 “刚才”对应哪次观测? 检索时间与相邻轨迹 若一条记录明确对应最近经过的房间,则形成暂定目标;否则保留歧义
已确定暂定目标,地图提供多个可达路点 哪条候选更符合返回目标? 比较候选并交由规划、执行模块处理 到达目标附近后,使用新观测复核地点,不能沿用出发时的判断直接宣布完成
两个门口外观相似,关键地标被遮挡 当前门口是否就是目标地点? 前往可行观察点补看 旧图像缺少区分线索时,重复推理无法增加视觉证据;新视角可能提供区分依据
补看后仍无法确认,当前线索与历史关联冲突 错在地点关联,还是任务解释? 回查原始记录,必要时由强模型重审关联与计划 若来源证据支持另一目标,则修正关联并重规划;不能靠更强模型把缺失事实补出来
来源记录也无法消除歧义,剩余预算有限 继续搜索是否仍可能有用? 按预设规则澄清或结束本次尝试,并记录未完成 保留待复核状态,避免检索、补看与推理无限循环
另一路径中,新观测确认了目标门口 是否满足“在门口停下”的完成条件? 单独复核地点与停止位置 条件满足才结束任务,并把本次观测与核实结果写回记忆

这段过程中的规则可以作为初始基线。研究调度器时,需要比较它在何处作出不同选择,以及这种差异是否减少了错误返回、无效调用或任务耗时。调度器的价值在于选择有用的下一步;调用更强模型本身不构成成功。

ABot-N1 的慢 VLM 与快动作专家说明任务推理和运动生成可以分工,但其中快系统输出连续路点,职责不同于 Jev 的类型化判断。因此,本文的协作设想是拆出适合比较或验证的环节,而不是用 Jev 替代整个动作专家。ABot-N1

4.4.3 调度要同时考虑收益、代价与时间

是否值得再查一轮记忆、再拍一个视角或再调用强模型,取决于它可能减少多少不确定性,以及为此付出多少时间和行动成本。作为研究目标,可以写成:

\[m_t^{*}=\arg\max_{m\in\mathcal{M}_t} \left[ \mathbb{E}(\Delta Q_{\mathrm{task}}\mid S_t,m) -\lambda T_m-\mu C_m \right]\]

这里,$m$ 是当前允许的操作,$\Delta Q_{\mathrm{task}}$ 表示对任务结果的预期改善,$T_m$ 和 $C_m$ 分别表示时间与其他成本。这是用于界定问题的目标表达,并不是 Jev 已具备的价值估计器;如何获取收益标签、如何处理未知模块耗时,都是研究的一部分。涉及运动的操作还须先满足独立的可行性约束。

时间也会改变证据价值。Slow Brain, Fast Planner 通过几何相似度与时间衰减,将迟到的 VLM 选择融合进实时规划,说明“如何使用晚到结果”与“让模型更快”同样重要。Jev 即使降低调用延迟,仍需研究旧观测、旧候选和新状态之间的关系,不能默认异步结果一直有效。Slow Brain, Fast Planner

从概率判断到操作收益,还需要目标任务上的验证。VLA 校准研究与VLM 口头置信度研究研究的是不同信号;KnowNo的统计保证也有其校准与分布假设。对 Jev 的具体问题是:这些概率能否帮助判断“何时继续、何时拒绝、何时求助”,以及在场景变化后是否仍有效。

4.4.4 调度模型应该处理哪些规则难以覆盖的状态

超时、预算耗尽、命令无效等条件具有明确边界,适合由程序直接处理。对于“已找到目标但暂时受阻”,固定调用规划器也可能足够。模型调度更值得检验的状态,是同一种失败表象可能对应不同的信息缺口:没有找到杯子,既可能需要换视角,也可能需要回查地点,或重新解释指令。

调度输入因此不能只有一个置信度数值,还应包含已有证据、未满足的任务条件、近期操作与结果、可用模块及剩余预算。Jev 是否能利用这些信息选择下一步,是与规则、轻量路由器和小 LLM 比较的核心;输出格式相同并不意味着路由能力相同。

难点在于“最有价值的下一步”通常不是现成标签。离线可以根据标注的信息缺口检查选择是否合理,闭环则要考察一次操作是否实际带来进展。若模型只是更频繁地调用全部模块,成功率提高也必须连同额外时间和观察成本解释。

4.5 已有工作与证据边界

围绕以上三条路线,已有材料可以分为三类。它们回答的问题不同,不能把指标放在一起当作同一种能力。

证据类型 代表工作 已支持的判断 尚未支持的判断
导航方法研究 C²Nav、VerNav、O2C-Nav、AdaNav、Slow Brain, Fast Planner、ABot-N1 比较、验证、按需推理与分层执行值得研究 换成 Jev 后保留原方法性能
通用 Agent 的 Jev 应用 Jev-Mem;第 2.7 节的 REFLEX Jev 已被用于记忆控制与选择性调用 这些收益自动迁移到空间记忆和导航闭环
社区具身实现 ROS 2 导航监督、视觉路径选择、驾驶与无人机项目 某些接口能够接通,存在可借鉴的实现 标准 VLN 泛化能力、真机可靠性或普遍性能优势

社区项目中,与本章关系最直接的实现如下。结果为作者报告,本文未独立复现;仓库仍在更新。

项目 研究上的参考价值 结果与局限
JEV_SMARTROBOTCONTROL 让 Jev 监督 Nav2,选择恢复与重规划,保留独立控制权和障碍过滤 ROS 2 + Gazebo 仿真;相似房间中仍会错误定位。127 项测试通过、2 项跳过不是导航成功率
jev_navigation 本地 decider-2b-vision 从 5 条弧线、停止、到达共 7 项中选择 有异步与过期处理,但缺少独立激光避障和足迹碰撞检查,不能等同于完整安全导航
jev_fsd 规则与 Jev 共用候选生成和前向模拟,较适合研究选择模块的贡献 已提供自建驾驶仿真 benchmark;不能等同标准 VLN 或真实驾驶验证
jev-drone 将低频战术判断与高频几何控制分离 成功课程为单次运行,中位调用延迟约 0.11 s;早期三种子对比未显示优势
Embodied Jev 分层子目标与局部操作选择,可观察决策粒度的影响 Meta-World 三项任务、各两个种子中,Jev 与 GPT-6 Astra 均为 5/6;这是小样本操作结果
JevPilot 展示驾驶仿真中的候选路径与速度选择 演示不能单独证明通用导航收益

尤其需要检查对照策略的能力是否一致。例如,jev-drone 成功示例中的规则基线无法表达越障机动,收益就不能全部归因于 Jev 判断更准。作者结果与限制

目前最明确的缺口是:在固定感知、候选、记忆与执行模块后,分别检验 Jev 的行动判断、记忆控制和模块调度,观察收益是否延续到导航任务结果。 这也是下一节提出研究问题的依据。

4.6 值得开展的研究问题:从模块替换走向机制验证

前面的分析指向三个可以独立研究的贡献。它们都是待验证的方向,不意味着已有方法未研究过类似问题;相关工作提供的依据与局限统一见 4.5。

方向 本文关注的缺口 可能形成的贡献 核心难点
候选验证与拒绝 相对最优选项仍可能不值得执行;普通选路与终止判断的错误代价不同 按任务阶段组织接受、拒绝与复核,并识别候选不足 拒绝错误行动的同时,避免过度保守导致停滞
空间与时间约束下的记忆 语义相关记录未必属于正确地点,旧状态与错误关联会影响后续任务 以来源可追溯的证据选择和关联更新支持返回与长期任务 区分新事实、暂时不可见与原有假设出错,避免错误写入被反复强化
感知、记忆与推理的预算分配 低置信只能提示困难,不能直接说明缺少哪类信息 根据证据缺口选择下一次观察、检索、规划或推理 缺少操作收益标签,且调度本身会增加延迟并改变后续状态

行动路线适合作为起点:接口与错误类型较容易界定。记忆路线值得进一步深入:它将 Jev-Mem 的启发落到导航特有的地点、时间与行动反馈上。模块调度适合在模块能力明确后展开:只有知道每个模块能解决什么,才能评价调用是否有价值。这是本文对研究顺序的建议,而非效果排名。

三条路线可逐步组合,但单模块有效不保证组合有效。例如,检索控制提前停止会影响后续行动;调度器增加补看也可能改变记忆质量。第 5 章先设计独立实验,再讨论这些交互。

5. 如何验证:三个最小实验与联合评测

5.1 共同协议:先定义什么结果算有收益

三个实验分别只改变行动判断、记忆控制和模块调度。它们共用一套记录原则,但不把所有模型、输入和接口组合成全因子实验。

先分清两种比较。 托管 Jev 与规则、分类器或小 LLM 的比较,衡量同输入条件下的系统收益;由于骨干和训练未知,不能将差异归因为某种内部架构。研究“生成改为候选读出”的机制,则另选可检查的开源骨干,固定权重与输入做配对比较。原生 Jev 的文本状态构建成本必须计入,原始 RGB 只用于单独的视觉实验。

质量和效率分别判定。 对强调提速的实验,在验证集上预先确定任务质量允许下降的范围,并在测试前锁定阈值、预算和评价规则。若质量损失超出范围,即使更快也不支持“保留能力的提速”;若质量合格但端到端耗时没有改善,则不支持效率主张。若质量提高但更慢,应报告为质量与时间的取舍。

采用配对任务与完整成本。 各方法使用同一组场景、指令和随机种子,报告样本数、失败样本与置信区间。数据按场景或轨迹划分训练、校准和测试,避免把同一段历史拆入两侧。计时覆盖状态构建、模型调用、通信、检索及回退;同时报告总任务耗时,不能只看一次成功 API 调用的平均值。未完成和超时任务按预设规则计入,并单列其耗时,防止提前失败看起来更快。

需要训练的分类器或路由器,应报告可用标注量与适配成本;提示词调整和阈值选择也限定在训练、验证数据上。这样才能区分固定任务表现与迁移到新任务的成本。

下列指标按实验需要选择,不要求每个实验全部测量:

层次 指标及用途
导航任务 成功率 SR;按路径效率加权的成功率 SPL;终点到目标距离 NE;错误停止与碰撞率
系统效率 P50 / P95 端到端延迟、每回合调用数与成本、总任务耗时、超时与过期结果比例
决策可靠性 接受率、接受后的错误率及风险—覆盖率曲线;AURC 为该曲线下的面积;ECE 与 Brier 的定义见 2.3
记忆与调度 证据召回、地点识别、错误关联;模块调用数、补看次数、无进展轮数与预算耗尽比例

5.2 实验一:到达判断与拒绝

研究问题: 在相同目标与观测证据下,有界判断能否减少决策耗时,同时避免更多错误停止?先选“是否完成任务”这一个决策位置,能够把终止错误与选路错误分开。

项目 最小设置
任务材料 从 R2R-CE 回放中提取接近目标、相似地点与证据不足的片段;分别标注客观完成状态与给定输入下的证据充分性
固定项 指令、当前语义状态、历史窗口、状态生成器;闭环阶段固定选路策略与控制器
改变项 规则、小型分类器、小 LLM、Jev 的判断模块;统一使用“完成 / 未完成 / 证据不足”的输出契约
拒绝后的处理 证据不足统一进入预设复核流程;仍不能确认时继续原策略,超过预算记为未完成,不由各模型自由增加工具
主要观察 错误停止率、到达后漏判与额外步数、复核率、端到端延迟;闭环再测 SR / SPL 和总耗时
不支持主张的情形 错误停止超过预设容忍范围;频繁复核导致无法完成;或额外状态构建与调用抵消提速

客观完成状态由任务条件与环境真值确定,真值仅供评价,不进入模型输入。证据充分性由独立标注者按预定义依据判定,不使用待测模型自标。即使机器人实际上已经到达,给定图像或语义状态也可能不足以确认;这类样本用于检查拒绝是否合理,不能只按“未输出完成”统计为普通分类错误。闭环中则仍需统计拒绝造成的延误与未完成。

Jev 可以用包含“证据不足”的 Choice 表达这一契约。若另测 Noul 加阈值的版本,应作为独立接口消融,在验证集上选阈值;不能把 Choice 的最大概率和 Noul 概率直接套用同一阈值。

先在回放中检查错误类型,再用同一组闭环任务检验是否改变最终结果。下一步才扩展到候选路点比较:固定 3–8 个经几何过滤的候选,比较选择与拒绝。不要在首个实验中同时改变终止判断、候选生成和选路模型。

5.3 实验二:固定记忆库上的目标证据检索

研究问题: 对“回到刚才见过杯子的房间”这类指令,Jev 控制检索能否在保持证据质量的同时减少查询开销,或减少目标地点关联错误?

项目 最小设置
任务材料 带地点、时间、视角与来源的固定导航历史;包含相似房间、重复物体、过期状态和无答案查询
固定项 观测库、索引、检索工具、最大访问预算及相同查询的返回结果;首轮候选一致,后续允许在同一工具与预算内自适应查询
改变项 固定 top-k、时间 / 地点规则流程、小 LLM 与 Jev 的查询选择、证据筛选和继续检索判断
参考标注 目标地点、支持记录、冲突记录与是否有足够答案;无答案项单独统计
主要观察 证据召回、目标地点识别、无答案误判、查询次数与端到端成本;后续闭环测错误返回与任务耗时
分层判定 关键证据遗漏导致质量越过容忍范围,不支持保持质量;查询开销未降低,不支持提效;只有检索改进而没有目标识别或返回收益,只能支持检索层结论

结果应区分两层:找到支持记录是检索收益,正确返回才是导航收益。闭环阶段固定行动模块,并把所有查询的开销计入任务总成本。记忆构建成本与查询成本分别记录,长期任务再按实际使用次数汇总。

记忆更新作为后续独立实验。 首轮冻结记忆库,是为了先识别检索控制的贡献。更新实验固定检索与动作策略,重放同一批新观测,比较规则更新与模型辅助关联更新;检查错误合并、过期状态引用、证据来源保留,以及下一轮检索表现。再进行闭环测试,避免用不同机器人轨迹产生的记忆库直接比较更新能力。

5.4 实验三:固定模块下的下一步操作选择

研究问题: 当前信息不足时,根据证据缺口选择下一操作,能否比固定流程和单一置信度门控更有效?

项目 最小设置
起始任务 从导航回放构造视觉遮挡、历史地点歧义、通路失效与指令冲突片段;保留近期操作与结果
固定项 行动、检索、补看、重规划 / 深度推理模块及其实现;相同可用证据、超时规则与总预算
改变项 固定流程、规则门控、轻量学习型路由器、小 LLM 与 Jev 调度
控制权限 调度器只选允许的下一操作;不能临时增加工具或更换更强执行模块
主要观察 闭环成功率与总耗时、各模块调用数、无进展轮数、预算耗尽比例
不支持主张的情形 收益只在增加预算或工具后出现;调度调用抵消节省;或循环检索、推理导致停滞

离线标注可说明某种信息缺口适合哪些操作,但不应强行指定唯一最优下一步。例如,地点歧义可能通过回查图像或获得新视角解决;是否有效还取决于代价与实际观测。离线结果用于筛查明显错误,最终以相同预算下的闭环结果判断。

预算既包括调用与 token,也包括观察动作和运动耗时。补看能获得新信息,但并非免费;同样的工具调用次数也未必代表相同成本。主实验先固定一组预算,再在扩展实验中绘制质量随预算变化的曲线。

5.5 扩展实验:压力测试与模块组合

三个最小实验中,已经暴露的失败可以用对应压力测试定位,不必一开始就覆盖所有组合。

适用方向 扰动或扩展 需要解释的问题
共同 候选换序、保持语义的标签改名、中英文、否定指令、无关历史与 OCR 注入 判断依赖有效证据,还是位置、措辞与无关内容?
行动 删除关键观测、相似目标、跨场景阈值迁移 模型能否识别证据不足,拒绝是否导致过度停滞?
记忆 门状态变化、物体移动、相似房间、矛盾来源 是召回失败、错误关联,还是使用了过期状态?
调度 连续无进展、模块失败、不同预算 能否改变无效策略,并在预算耗尽时按协议退出?
系统 网络抖动、断网、版本变化与重复调用 回退与过期结果处理是否改变任务质量和总延迟?

异步轨迹融合、原始 RGB 与语义状态的对照、导航数据适配,以及不同机载设备上的部署,应在基础结果明确后分别开展。复现 4.5 的社区项目可帮助检查接口与执行实现,但不作为完成三个最小实验的前置条件。

最后再组合模块。若某个单模块有效,先加入下一个模块,并保留“仅行动判断”“仅记忆控制”等对照;只有需要解释交互时,再扩大组合消融。重点检查收益是否依赖额外证据、调用或预算,以及错误记忆是否经调度和行动反复放大。

6. 结论

最适合先验证的是边界明确的行动判断。 从到达与拒绝开始,固定证据和执行模块,才能检验 Jev 是否在保留任务质量时减少开销。有界接口便于程序使用,但实际收益取决于判断质量、状态构建和复核成本。

值得进一步深入的是带空间、时间与来源约束的记忆控制。 Jev-Mem 提供了通用 Agent 的先例;导航中的关键扩展是正确关联地点、区分历史与当前状态,并让行动反馈修正后续检索。研究贡献需要体现在证据质量与返回任务上,而不止于更快地检索文本。

完整 Agent 最难的是判断下一次操作是否值得。 感知、记忆、规划与推理应提供互补证据;调度器需要在预算内促成进展,并处理错误传播和无效循环。本文因此建议按行动、记忆、调度逐步验证,再研究组合,而不是由接口演示直接推断完整导航能力。

持续跟踪

  • TypeSafe 的架构、RLCD、模型版本与多模态进展,以及独立的校准和鲁棒性证据。
  • 固定协议下的导航实验与社区复现,尤其是状态构建、通信和回退计入后的端到端结果。
  • 空间记忆更新与模块调度在长期任务中的效果,以及单模块收益能否延续到组合系统。

参考资料

官方资料与入门解读

  1. TypeSafe AI. Introducing System One Models and Jev. typesafe.ai/blog
  2. TypeSafe AI. 官网与 workflow eval:typesafe.ai;evals.typesafe.ai
  3. TypeSafe Docs:Introduction、Models、Primitives、State、System One、Jaggedness: jev-1.13
  4. 第三方入门解读:MindStudio. Jev Explained. mindstudio.ai

派生模型

  1. Laya. NandhaKishorM/laya
  2. AnyJev. nokia-applied-research/AnyJev
  3. minojev. zeredy879/minojev
  4. Laya Vision. r33drichards/laya-vision
  5. PlayJev. OmniJev/PlayJev
  6. Jev Visual. hr98w/jev-visual
  7. Prosodia. alperiox/audio-jevlike
  8. jev-vision. JeremyEltho/jev-vision
  9. 项目汇总:cobanov/awesome-jev;AbdelStark/awesome-typesafe-jev

  10. Nokia AnyJev 报道. MarkTechPost
  11. decider-2b-vision 与 ROS 2 集成. NOPLAB/jev_navigation

派生模型论文(arXiv)

  1. Ren et al. Open-Jev Judgments on CallScreenBench: Calibrated One-Pass Scam Screening with a Small Language Model. arXiv:2609.23959
  2. Yu, Yao. Visual Jev: Accurate and Efficient Decisions from Shared Visual Context. arXiv:2609.25845
  3. Zhou, Yang, Zhao. From Text Decisions to Pixels: A Study of Jev-Style Visual Choice Model. arXiv:2609.29283
  4. Piskorz, Kobalczyk, van der Schaar. Eliciting Numerical Predictive Distributions of LLMs Without Autoregression. ICLR 2026. arXiv:2603.02913

Jev 应用论文(arXiv)

  1. Jiang, Li, Li. Jev-Mem: System-One-Controlled Agentic Memory for Efficient AI Agents. arXiv:2609.23986
  2. Wu, Lim. REFLEX with Jev for Efficient Selective Control in LLM Agents. arXiv:2609.26532
  3. dos Santos. Calibrated Decision Models for Autonomous Penetration-Testing Harnesses: JEV and Laya as System One Decision Layers. arXiv:2609.28940

独立评测与资料汇总

  1. 多来源评测综述(非单项实验):Jev After Eight Days of Independent Tests
  2. Convex Decision Evals
  3. Jev vs Laya: Same Labels, Same Questions
  4. Nautilus 校准研究
  5. jev-orderby-bench
  6. Jev Does Not Play Dice

导航与校准研究(arXiv)

  1. C²Nav. arXiv:2609.15142
  2. VerNav: Verifier-First Low-Latency Vision-and-Language Navigation. arXiv:2609.00920
  3. O2C-Nav. arXiv:2609.06476
  4. Peng et al. Slow Brain, Fast Planner: Latency-Resilient VLM-Augmented Urban Navigation. arXiv:2606.20458
  5. Ding et al. AdaNav: Adaptive Reasoning with Uncertainty for Vision-Language Navigation. arXiv:2509.24387
  6. Gong et al. ABot-N1: Toward a General Visual Language Navigation Foundation Model. arXiv:2607.10383
  7. Zollo, Zemel. Confidence Calibration in Vision-Language-Action Models. arXiv:2507.17383
  8. Yang et al. The Mirage of Calibrated Confidence: Trajectory-Independence of Verbalized Confidence in Vision-Language Models. EMNLP 2026. arXiv:2609.18453
  9. Ren et al. Robots That Ask For Help: Uncertainty Alignment for Large Language Model Planners (KnowNo). CoRL 2023. arXiv:2307.01928
  10. Zheng et al. Large Language Models Are Not Robust Multiple Choice Selectors (PriDe). ICLR 2024. arXiv:2309.03882

具身 demo

  1. JEV_SMARTROBOTCONTROL;jev_navigation;jev_fsd;jev-drone;Embodied Jev;JevPilot

原文作者:Tingde Liu · 原文链接 · 原创文字许可:CC BY 4.0

由 GaryLee1210 维护学习镜像。正文保持原样;调整了站点配置、站内链接和反馈入口,并补充来源说明。 论文配图及第三方引用材料的权利归原作者或出版方,沿用正文中的出处标注。

反馈