g* ~ p_psi(g* | o_t, l_hat_t, m)
读法:未来视觉子目标不是唯一图片,而是当前观测、子任务和元数据条件下的一整个分布;重新采样可能得到不同但合理的目标状态。
g*_t = [G*_(1,t), ..., G*_(n,t)]
多视角:基座相机更容易约束对象与环境,腕部相机更容易约束夹爪姿态和接触关系。
论文事实:视觉子目标只加入约 25% 的训练样本;其作用是把动作预测转化为更接近逆动力学的问题。
1片段末帧作为监督目标:g* = o_(t_end)
2采样图像噪声:epsilon ~ N(0, I)
3建立插值:x_tau = (1-tau) epsilon + tau g*
4路径速度:u_tau = g* - epsilon
L_CFM(psi) = E ||v_psi(x_tau, tau, o_t, l_hat_t, m) - (g* - epsilon)||^2
读法:给网络一个带噪中间状态,让它预测从噪声走向真实未来图像的速度方向。平方损失的最优解是条件平均速度。
d x_tau / d tau = v_psi(x_tau, tau, o_t, l_hat_t, m)
推理:从新噪声出发积分 ODE,最终得到一份条件视觉子目标样本。
C_t = (l_t, l_hat_t, g*_t, m_t, c_t)
上下文:总任务、当前子任务、视觉子目标、质量/速度元数据和控制模式共同构成 Prompt。
pi_theta(a_(t:t+H) | o_(t-T:t), C_t)
读法:Action Expert 根据近期视频历史与完整 Prompt,生成未来动作块的条件分布。
current image + desired image -> action chunk
逆动力学视角:视觉子目标明确了“要到达什么状态”,低层策略主要推断从当前状态到目标状态需要执行哪些动作。
论文实现:Action Expert 处理固定 50 个动作 token,并在训练中模拟 0–12 步延迟以支持平滑的实时动作分块。