8.21 日报
2026-08-21任务一:读论文第三、四章任务二:Codex 源码
任务一 · 读论文《Towards Long-Horizon Agents》第三、四章
第三章 · 提示技术与行动权限
- Self-Consistency:对多条推理链采样,多数投票聚合,以多路径分布替代单一脆弱路径;
- Least-to-Most Prompting:依次解决有序子问题,把任务分解显式化;
- Plan-and-Solve Prompting:把"显式规划"与"执行"拆开,形成清晰的"先计划、后行动"模板,后来大量智能体循环都继承了这一结构。
智能体到底被允许做什么?——hooks、middleware、pre-action gates、sandboxes、policy layers。接触较少
第四章 · Harness 实现原理待补充
需要补充 Loop & Workflow、Orchestration、Hooks & Middleware 的实现原理。代表工作:
- Loop & Workflow:ReAct、Self-Refine、ReWOO、Arbor、Tree-of-Thoughts、LATS;
- Orchestration:MetaGPT、CAMEL、Magentic-One、LangGraph、GPTSwarm、A2A;
- Hooks & Middleware:AEGIS、IsolateGPT、AgentSpec、ShieldAgent、AdaptiveGuard、AGrail。
Internalizing the loop:通过训练,把运行时的外部 harness 经验蒸馏到模型权重中。
- 线性工作流:ReAct(最常见);
- 分支工作流实现未接触:在一旦出错提交就可能使整个任务受阻时非常有用(maker-checker)。
上下文与记忆:上下文是当前的,记忆是永久的。管理动作三分:discard、compress、select。
- context rot(上下文腐蚀)如何解决待查;
- trajectory consolidation(轨迹整理)如何实现待查;
- 上下文选择(Context Selection)的实现新接触;
- experiential memory 在工程上一般存放在哪个文件待查。
任务二 · Codex 源码
完成 codex-main 源码逆向解析:39 章文档 + 形式化技术报告,已建成站点。详见 → Codex 技术报告