资源介绍
REVIEWED · 2026.08.17Tailin Zhou 于 2026 年 8 月提交的论文提出 Hierarchical Self-Improvement(HSI),让每类任务维护可热替换的专属 Harness。单个冻结模型分别承担任务执行、Harness 改写和进化策略改写三个层级,并用 thinking on/off 设计隔离执行推理与自我修改的贡献。以 DeepSeek-V4-Flash-Preview 为冻结骨干,在 BALROG 的 BabyAI、Crafter、TextWorld 和 MiniHack 中取得显著进步,在 BabaIsAI 留出子集上也表现出较强泛化。论文同时给出两条清晰边界:反馈信号必须足够可靠,Harness 进化也无法突破骨干模型自身能力上限;NLE 实验没有改善。
适合:Agent 研究者、评测工程师、自我改进系统开发者和关注任务专属 Harness 的技术团队