anthropic.com · VERIFIED WEBSITE

Anthropic 长时间应用开发 Harness 设计

Anthropic 的长任务 Harness 实践,介绍 Planner、Generator、Evaluator、多会话交接、上下文重置、Sprint Contract 和浏览器评测。

访问网站
9.3编辑综合评分
访问正常技术访问状态
英文界面语言支持
免费使用付费模式
暂无真实页面截图,访问目标网站可查看当前页面

资源介绍

REVIEWED · 2026.08.17

Anthropic Labs 以多小时自主应用开发为场景,给出 Planner、Generator、Evaluator 三智能体架构。Planner 将简短目标扩展成产品规格,Generator 按阶段实现,Evaluator 使用 Playwright MCP 实际操作应用并依据产品深度、功能、视觉和代码质量评分。文章特别区分上下文压缩与 context reset:长任务中通过结构化交接文件保留状态,再启动干净会话,可缓解上下文焦虑与连贯性下降。实验也展示了成本与收益边界,并说明模型升级后应逐项移除已失去作用的 Sprint 或评测环节。

适合:长任务 Agent 架构师、自动化应用开发团队、前端生成系统和评测工程师

使用场景

BEST FIT
  1. 设计多小时 Agent 任务Anthropic 的长任务 Harness 实践,介绍 Planner、Generator、Evaluator、多会话交接、上下文重置、Sprint Contract 和浏览器评测。
  2. 拆分 Planner、Generator 与 EvaluatorAnthropic 的长任务 Harness 实践,介绍 Planner、Generator、Evaluator、多会话交接、上下文重置、Sprint Contract 和浏览器评测。
  3. 建立跨会话交接文件Anthropic 的长任务 Harness 实践,介绍 Planner、Generator、Evaluator、多会话交接、上下文重置、Sprint Contract 和浏览器评测。
  4. 用浏览器执行独立评测Anthropic 的长任务 Harness 实践,介绍 Planner、Generator、Evaluator、多会话交接、上下文重置、Sprint Contract 和浏览器评测。
  5. 复核 Harness 组件成本Anthropic 的长任务 Harness 实践,介绍 Planner、Generator、Evaluator、多会话交接、上下文重置、Sprint Contract 和浏览器评测。

极简评分

EDITORIAL SIGNALS
01 / SCORE

编辑评分 9.3

综合功能、上手成本、实际价值与长期可用性。

02 / USABILITY

易用性 8.6

从首次打开到完成核心任务的学习成本。

03 / FEATURES

功能度 9.3

核心能力与真实工作场景的覆盖程度。

04 / VALUE

价值度 9.2

价格模式、免费范围与长期使用价值。