资源介绍
REVIEWED · 2026.08.17Anthropic Labs 以多小时自主应用开发为场景,给出 Planner、Generator、Evaluator 三智能体架构。Planner 将简短目标扩展成产品规格,Generator 按阶段实现,Evaluator 使用 Playwright MCP 实际操作应用并依据产品深度、功能、视觉和代码质量评分。文章特别区分上下文压缩与 context reset:长任务中通过结构化交接文件保留状态,再启动干净会话,可缓解上下文焦虑与连贯性下降。实验也展示了成本与收益边界,并说明模型升级后应逐项移除已失去作用的 Sprint 或评测环节。
适合:长任务 Agent 架构师、自动化应用开发团队、前端生成系统和评测工程师