Long-context
一次推理可以读多少 token。它缓解遗忘,但不能保证计划正确或完成条件可验证。
Research brief2026.08.25
从 AutoResearch × RSI 到具身长程行为:一份面向 20 分钟组会的研究地图、证据审计与讲述蓝图。
Long-context 只是容量;长程能力来自可验证、可恢复的闭环。
00 / Thesis
长程智能不是让模型
“一次想得更久”,
而是让系统持续维护状态、验证进展,并在失败后恢复。
数字研究 Agent 与机器人面对相同的系统问题;机器人还要承受连续控制、实时性、物理不可逆性和安全成本。
因此,AutoResearch 是一个干净的入口,具身智能才是本报告的主体。
01 / Why hard
先把三个经常混用的“长”拆开。
一次推理可以读多少 token。它缓解遗忘,但不能保证计划正确或完成条件可验证。
能否跨步骤、跨 context 保存有用状态。错误记忆也会持久放大错误。
许多相互依赖的决策;早期行动改变后续环境,失败必须被检测和恢复。
即使每个关键阶段有 95% 成功率,20 个阶段全部成功也只剩约 36%。真实错误还会相关并改变环境。
02 / AutoResearch × RSI
一个现代 Agent 可以看成 Foundation Model + Scaffold。RSI 的争论常常来自更新对象没有说清。
只改变当前轨迹或临时 context。
持久更新 memory、skills 或 prompt。
更新 tools、workflow 或 agent code。
改变训练代码、数据、模型或算法。
模型、scaffold 与更新算法共同演化。
Karpathy AutoResearch:R 基本固定、S 由 program.md 固定,主要修改训练代码与目标模型 M。它是优秀的可验证研究闭环,但不是研究 Agent 自身的 RSI。
2023 · TMLR
Improver program 改写自身,但基础 LM 不变。证明 scaffold recursion 可行,不是完整 RSI。
Paper ↗2025 · arXiv
开放式 archive 保存 Agent 谱系,经验验证 scaffold 改动;SWE-bench 20 → 50。
Paper ↗2025 · DeepMind
LLM 生成算法、自动 evaluator 筛选并进化。更准确的定位是 evaluator-driven discovery。
Project ↗2026 · Nature
贯穿 idea → code → experiment → paper → review;完整生命周期自动化,但 scaffold 主要由人设计。
Paper ↗Qiushi Engine · 2026
03 / Embodied ecosystem
“长程动作生成”不只是输出更长的 action sequence,而是让多个时间尺度在不断变化的环境中保持一致。
Classical
符号和几何约束清晰;开放感知、技能覆盖与建模成本高。
2022 →
SayCan、Inner Monologue:语义组合交给 LLM,物理可行性由技能支撑。
2023 →
ACT、Diffusion Policy、RT-2、OpenVLA、π0:规模化视觉语言动作学习。
2025 → NOW
高层慢推理 + 低层快控制,再加入世界模型、记忆、RL 与恢复。
04 / Benchmarks & SOTA
每个 benchmark 只覆盖长程问题的一部分。点击筛选,查看它们真正测什么。
固定桌面、连续控制。历史标准,但场景固定且已被大量调参。
Project ↗VLA 最常用;LIBERO-Long 测多步任务,但接近饱和并存在捷径与方差。
Project ↗重点检查 unseen composition、lifelong 阶段与厨房任务多样性。
Project ↗世界知识、隐式指令、长程推理,并拆分 VLM 规划和 VLA 执行。
Project ↗人类需求驱动的家庭活动,强调 mobile manipulation 与状态变化。
Project ↗双臂、多 embodiment、强随机化与自动数据生成。
Project ↗真实家具组装,少数可复现实机长程 benchmark 之一。
Project ↗开放词汇物体的系统级 mobile manipulation,早期 real baseline 很低。
Paper ↗The gap that matters
RoboCasa365 官方榜单领先结果:Atomic-Seen 80.2%,Composite-Unseen 32.1%。规模化动作基础明显进步,但组合泛化仍断层。
Official leaderboard · 2026-08-21 ↗2026 年审计指出 shortcut solvability、统计不显著、creeping overfitting 和 data-source dependence;只有 19.8% 的 LIBERO “SOTA” claim 可证明统计显著。
Read the audit ↗05 / Frontier 2025–2026
Route A
高层 VLM/Agent 做语义分解、交互和恢复;低层 VLA 做连续动作。
谁判断 subtask 完成?失败如何上报?
Route B
生成候选未来、预测 value,或同时预测 future frame 与 action。
逼真未来是否等于正确反事实?
Route C
短期历史 + 长期事件记忆;从 rollout、纠正和 outcome 中继续训练。
错误记忆和奖励投机如何控制?
系统是否知道做到了、失败了,还是只看起来像在进展?
成功示范很多;off-nominal state、撤销、重抓和求助数据很少。
Skill A 的 exit state 是否真正满足 Skill B 的 entry condition?
下一步不只是scale action prediction
而是 scale closed-loop evidence.
06 / Talk blueprint
AutoResearch/RSI 约 4.5 分钟;求是 1 页;具身部分约 12.5 分钟。
07 / Reading list
STOP、Gödel Agent、AlphaEvolve、Karpathy AutoResearch、Qiushi Engine、OpenVLA、Octo、π0 / FAST、PRoC3S、SPIRE、LingBot-VA、π0.6-MEM、π*0.6、VLABench、BEHAVIOR-1K、RoboTwin 2.0、FurnitureBench。