LH Long-Horizon Brief

Research brief2026.08.25

Agentic
Long-Horizon
Tasks

从 AutoResearch × RSI 到具身长程行为:一份面向 20 分钟组会的研究地图、证据审计与讲述蓝图。

The long-horizon loop
01Goal完成标准
02Plan分层 / 滚动
03Act工具 / 技能
04Verify进展 / 失败
STATE memory · evidence

Long-context 只是容量;长程能力来自可验证、可恢复的闭环。

20′目标时长
4.5′AutoResearch × RSI
12.5′具身智能主体
14建议页数

00 / Thesis

长程智能不是让模型
“一次想得更久”,
而是让系统持续维护状态、验证进展,并在失败后恢复。

数字研究 Agent 与机器人面对相同的系统问题;机器人还要承受连续控制、实时性、物理不可逆性和安全成本。

因此,AutoResearch 是一个干净的入口,具身智能才是本报告的主体。

01 / Why hard

单步能力不会自动组合成长期成功

先把三个经常混用的“长”拆开。

A

Long-context

一次推理可以读多少 token。它缓解遗忘,但不能保证计划正确或完成条件可验证。

B

Long-term memory

能否跨步骤、跨 context 保存有用状态。错误记忆也会持久放大错误。

C

Long-horizon

许多相互依赖的决策;早期行动改变后续环境,失败必须被检测和恢复。

pH
0.9520 ≈ 36%

即使每个关键阶段有 95% 成功率,20 个阶段全部成功也只剩约 36%。真实错误还会相关并改变环境。

1 5 10 15 20

02 / AutoResearch × RSI

先问清楚:到底“谁”在改进“谁”?

一个现代 Agent 可以看成 Foundation Model + Scaffold。RSI 的争论常常来自更新对象没有说清。

θFoundation modelweights · data · training
+
SOperational scaffoldprompt · memory · tools · control
=
AAgentacts · observes · updates
L0

重试 / 反思

只改变当前轨迹或临时 context。

非持久
L1

积累经验

持久更新 memory、skills 或 prompt。

弱改进
L2

改写 Agent

更新 tools、workflow 或 agent code。

Scaffold RSI
L3

自动化 AI R&D

改变训练代码、数据、模型或算法。

目标不同
L4

改进“改进器”

模型、scaffold 与更新算法共同演化。

尚未广泛验证
RResearch agent SResearch process MResearch object

Karpathy AutoResearch:R 基本固定、S 由 program.md 固定,主要修改训练代码与目标模型 M。它是优秀的可验证研究闭环,但不是研究 Agent 自身的 RSI。

2023 · TMLR

STOP

Improver program 改写自身,但基础 LM 不变。证明 scaffold recursion 可行,不是完整 RSI。

Paper ↗

2025 · arXiv

Darwin Gödel Machine

开放式 archive 保存 Agent 谱系,经验验证 scaffold 改动;SWE-bench 20 → 50。

Paper ↗

2025 · DeepMind

AlphaEvolve

LLM 生成算法、自动 evaluator 筛选并进化。更准确的定位是 evaluator-driven discovery。

Project ↗

2026 · Nature

The AI Scientist

贯穿 idea → code → experiment → paper → review;完整生命周期自动化,但 scaffold 主要由人设计。

Paper ↗
One-slide case · 60 sec

Qiushi Engine · 2026

求是引擎只回答一个问题:

科研闭环如何进入真实物理环境?
4Core agents
5Support agents
METAStructured trace
REALOptical platform

它能说明

  • 长轨迹需要角色隔离与结构化交接
  • 代码、测量、证据审查可以串成闭环
  • 物理反馈比纯 LLM judge 更接近 verifier

它不能说明

  • 调用量和 token 数不等于科研质量
  • 科学 novelty 仍主要是作者主张
  • 单团队、单平台,缺独立复现与充分 ablation
Qiushi Engine paper ↗

03 / Embodied ecosystem

机器人把相同的闭环变成了物理问题

“长程动作生成”不只是输出更长的 action sequence,而是让多个时间尺度在不断变化的环境中保持一致。

01User goal语义 / 完成条件
02Task plan子目标 / 依赖
03Skill / VLAaction chunk
04Controller连续控制
05World物理反馈

Classical

TAMP + Skills

符号和几何约束清晰;开放感知、技能覆盖与建模成本高。

2022 →

LLM Planner

SayCan、Inner Monologue:语义组合交给 LLM,物理可行性由技能支撑。

2023 →

End-to-end VLA

ACT、Diffusion Policy、RT-2、OpenVLA、π0:规模化视觉语言动作学习。

2025 → NOW

Hybrid Agentic Robot

高层慢推理 + 低层快控制,再加入世界模型、记忆、RL 与恢复。

Action generation:没有一种表示覆盖所有时间尺度

表示代表强项长程代价
Single-stepBC / control反应及时逐步误差累积
Action chunkACT稳定、适合示范反应性与长度权衡
Diffusion / flowDP / π0平滑、多模态推理成本、chunk 接缝
Discrete tokensRT-2 / FAST复用 LLM 训练栈量化精度、延迟
Skill / subgoalSayCan / TAMP可解释、可组合技能覆盖、完成检测

04 / Benchmarks & SOTA

没有一个“统一 SOTA”

每个 benchmark 只覆盖长程问题的一部分。点击筛选,查看它们真正测什么。

SIM · LEGACY

CALVIN

5-task chain

固定桌面、连续控制。历史标准,但场景固定且已被大量调参。

Project ↗

SIM · LEGACY

LIBERO

130 tasks

VLA 最常用;LIBERO-Long 测多步任务,但接近饱和并存在捷径与方差。

Project ↗

SIM · ICLR 2026

RoboCasa365

365 tasks · 2,500 scenes

重点检查 unseen composition、lifelong 阶段与厨房任务多样性。

Project ↗

SIM · ICCV 2025

VLABench

40 composite tasks

世界知识、隐式指令、长程推理,并拆分 VLM 规划和 VLA 执行。

Project ↗

SIM · HOUSEHOLD

BEHAVIOR-1K

1,000 activities

人类需求驱动的家庭活动,强调 mobile manipulation 与状态变化。

Project ↗

SIM / REAL · BIMANUAL

RoboTwin 2.0

50 tasks · 5 robots

双臂、多 embodiment、强随机化与自动数据生成。

Project ↗

REAL · CONTACT-RICH

FurnitureBench

≈ 230 sec / 2,300 steps

真实家具组装,少数可复现实机长程 benchmark 之一。

Project ↗

SIM / REAL · MOBILE

HomeRobot OVMM

Navigate → grasp → place

开放词汇物体的系统级 mobile manipulation,早期 real baseline 很低。

Paper ↗

The gap that matters

80.2 32.1

RoboCasa365 官方榜单领先结果:Atomic-Seen 80.2%,Composite-Unseen 32.1%。规模化动作基础明显进步,但组合泛化仍断层。

Official leaderboard · 2026-08-21 ↗
Atomic · Seen80.2
Composite · Seen57.1
Composite · Unseen32.1
Success rate (%) · different task regimes, same official leaderboard
Benchmark audit

2026 年审计指出 shortcut solvability、统计不显著、creeping overfitting 和 data-source dependence;只有 19.8% 的 LIBERO “SOTA” claim 可证明统计显著。

Read the audit ↗

05 / Frontier 2025–2026

三条路线正在汇合

S1

S2

Route A

快慢双系统

高层 VLM/Agent 做语义分解、交互和恢复;低层 VLA 做连续动作。

  • Hi Robot · ICML 2025
  • Gemini Robotics 1.5

谁判断 subtask 完成?失败如何上报?

t

t+1

Route B

世界模型

生成候选未来、预测 value,或同时预测 future frame 与 action。

  • Reflective Planning · CoRL 2025
  • Cosmos Policy · ICLR 2026
  • LingBot-VA · RSS 2026

逼真未来是否等于正确反事实?

τ
+
r

Route C

记忆与经验学习

短期历史 + 长期事件记忆;从 rollout、纠正和 outcome 中继续训练。

  • π0.6-MEM
  • π*0.6 / RECAP
  • Xiaomi-Robotics-1

错误记忆和奖励投机如何控制?

System-2 planner+Foundation VLA+Predictive model+Memory+Outcome learning
01

Verifier

系统是否知道做到了、失败了,还是只看起来像在进展?

02

Recovery

成功示范很多;off-nominal state、撤销、重抓和求助数据很少。

03

Compositional state

Skill A 的 exit state 是否真正满足 Skill B 的 entry condition?

下一步不只是 scale action prediction
而是 scale closed-loop evidence.

06 / Talk blueprint

20 分钟 · 14 页

AutoResearch/RSI 约 4.5 分钟;求是 1 页;具身部分约 12.5 分钟。

开场 AutoResearch × RSI 具身智能 结尾
  1. 01

    Agentic Long-Horizon Tasks

    会做一步不等于能做完。

    0:30
  2. 02

    p^H:错误如何复利

    Long-horizon ≠ long-context。

    1:00
  3. 03

    RSI 的四级梯子

    先问“谁在更新谁”。

    1:30
  4. 04

    AutoResearch → DGM

    Verifier 决定改进能否复利。

    2:00
  5. 05

    求是引擎

    真实物理闭环;证据边界清楚。

    1:00
  6. 06

    数字 Agent ↔ 机器人

    二者共享同一闭环。

    1:00
  7. 07

    具身范式演化

    TAMP → VLA → 混合式 Agent。

    1:30
  8. 08

    Action generation 生态

    长程需要多时间尺度表示。

    1:30
  9. 09

    Benchmark 地图

    不同 benchmark 测不同的“长”。

    1:30
  10. 10

    SOTA 断层

    Atomic-Seen 80.2 → Composite-Unseen 32.1。

    1:30
  11. 11

    快慢双系统

    高层规划与低层控制重新分工。

    1:30
  12. 12

    世界模型 + 记忆 + RL

    从预测动作到利用经验。

    2:00
  13. 13

    三个瓶颈

    Verifier、recovery、compositional state。

    2:00
  14. 14

    Takeaways

    Scale closed-loop evidence。

    1:30
已复制