arxiv.org · VERIFIED WEBSITE

分层自我改进:可演化任务专属 Agent Harness

研究任务专属 Harness 持续进化的 HSI 框架:固定模型执行任务,由 evolver 改写 Harness,再由 meta-evolver 改写进化策略。

访问网站
9.1编辑综合评分
访问正常技术访问状态
英文界面语言支持
免费使用付费模式
暂无真实页面截图,访问目标网站可查看当前页面

资源介绍

REVIEWED · 2026.08.17

Tailin Zhou 于 2026 年 8 月提交的论文提出 Hierarchical Self-Improvement(HSI),让每类任务维护可热替换的专属 Harness。单个冻结模型分别承担任务执行、Harness 改写和进化策略改写三个层级,并用 thinking on/off 设计隔离执行推理与自我修改的贡献。以 DeepSeek-V4-Flash-Preview 为冻结骨干,在 BALROG 的 BabyAI、Crafter、TextWorld 和 MiniHack 中取得显著进步,在 BabaIsAI 留出子集上也表现出较强泛化。论文同时给出两条清晰边界:反馈信号必须足够可靠,Harness 进化也无法突破骨干模型自身能力上限;NLE 实验没有改善。

适合:Agent 研究者、评测工程师、自我改进系统开发者和关注任务专属 Harness 的技术团队

使用场景

BEST FIT
  1. 研究任务专属 Harness 演化研究任务专属 Harness 持续进化的 HSI 框架:固定模型执行任务,由 evolver 改写 Harness,再由 meta-evolver 改写进化策略。
  2. 设计 Trace 到 Harness Patch 流程研究任务专属 Harness 持续进化的 HSI 框架:固定模型执行任务,由 evolver 改写 Harness,再由 meta-evolver 改写进化策略。
  3. 比较自我改进评测结果研究任务专属 Harness 持续进化的 HSI 框架:固定模型执行任务,由 evolver 改写 Harness,再由 meta-evolver 改写进化策略。
  4. 分析反馈质量与模型能力边界研究任务专属 Harness 持续进化的 HSI 框架:固定模型执行任务,由 evolver 改写 Harness,再由 meta-evolver 改写进化策略。

极简评分

EDITORIAL SIGNALS
01 / SCORE

编辑评分 9.1

综合功能、上手成本、实际价值与长期可用性。

02 / USABILITY

易用性 7.7

从首次打开到完成核心任务的学习成本。

03 / FEATURES

功能度 9.2

核心能力与真实工作场景的覆盖程度。

04 / VALUE

价值度 9.1

价格模式、免费范围与长期使用价值。