第 1 周:能力图谱与 Harness 基础

Day 05 · 任务编排、成功标准和退出条件

核心指数 可靠性 5/5

关键逻辑释义

Harness 要把模糊需求转成可验证任务,并先完成编排:确定 orchestrator 负责什么、worker/tool 做什么、何时验收、何时停止。没有成功标准、权限边界和终止条件,Agent 会过度探索、重复执行或沉默失败。

今日关键术语释义

每个当天会被提问或用于练习的术语,先给通俗释义,再给专业释义,避免题目超出当天知识点。

Orchestration / 编排

通俗释义:编排就是安排谁在什么时候做哪一步、拿什么输入、交什么结果、由谁验收。

专业释义:orchestrator 对 workflow step、tool、worker/subagent、queue job 和 human gate 进行任务分解、调度、状态跟踪、合并、验证与失败恢复;它关注控制流和责任边界,不等于让一个模型自由发挥。

当天检查:能把一个真实任务拆成 orchestrator 职责、worker 任务卡、合并验收和失败恢复。

参考脉络:Anthropic Building effective agents / OpenAI agent guide / production workflow orchestration

Subagent / Multi-Agent

通俗释义:把复杂工作拆给多个相对独立的小助手,并行做、再合并。

专业释义:orchestrator 将任务卡分发给 worker/subagent,通过隔离上下文、并行执行、独立评审和 merge protocol 处理复杂任务。

当天检查:能说明什么时候多 Agent 值得,什么时候只是增加复杂度。

参考脉络:Anthropic multi-agent patterns / OpenAI agent guide

Workflow

通俗释义:固定流程自动化,像流水线;不需要模型每一步自由决定。

专业释义:预定义 DAG/状态机驱动的自动化流程,适合稳定、可枚举、低不确定任务。

当天检查:能区分一个步骤应该是 workflow 还是 agent loop。

参考脉络:Anthropic Building effective agents

质量保证

通俗释义:把“质量保证”先理解成今天要掌握的一种工程判断:它帮助你决定系统该如何稳定完成任务。

专业释义:质量保证 是 Agent Harness 课程中的专项能力点,需要从定义、输入输出、工程边界、失败模式、指标与验证方式六个角度掌握。

当天检查:能用自己的话解释 质量保证,并把它映射到 AI Digest / Hermes / 学习平台中的一个真实环节。

参考脉络:课程内置知识点;当天需结合 AI Digest 或真实系统案例验证

Product Judgment

通俗释义:先判断该不该做、怎么做才稳,而不是堆名词。

专业释义:围绕用户任务、稳定性、DX、权限、成本和可维护性进行架构取舍,决定 workflow、agent、human review 的边界。

当天检查:能指出至少 3 个不该 Agent 化的环节。

参考脉络:Anthropic effective agents / product engineering

验收标准要能被工具或人审验证

通俗释义:把“验收标准要能被工具或人审验证”先理解成今天要掌握的一种工程判断:它帮助你决定系统该如何稳定完成任务。

专业释义:验收标准要能被工具或人审验证 是 Agent Harness 课程中的专项能力点,需要从定义、输入输出、工程边界、失败模式、指标与验证方式六个角度掌握。

当天检查:能用自己的话解释 验收标准要能被工具或人审验证,并把它映射到 AI Digest / Hermes / 学习平台中的一个真实环节。

参考脉络:课程内置知识点;当天需结合 AI Digest 或真实系统案例验证

退出条件比计划更重要

通俗释义:把“退出条件比计划更重要”先理解成今天要掌握的一种工程判断:它帮助你决定系统该如何稳定完成任务。

专业释义:退出条件比计划更重要 是 Agent Harness 课程中的专项能力点,需要从定义、输入输出、工程边界、失败模式、指标与验证方式六个角度掌握。

当天检查:能用自己的话解释 退出条件比计划更重要,并把它映射到 AI Digest / Hermes / 学习平台中的一个真实环节。

参考脉络:课程内置知识点;当天需结合 AI Digest 或真实系统案例验证

核心知识展开

1. 是什么

Harness 要把模糊需求转成可验证任务,并先完成编排:确定 orchestrator 负责什么、worker/tool 做什么、何时验收、何时停止。没有成功标准、权限边界和终止条件,Agent 会过度探索、重复执行或沉默失败。

2. 工程位置

它在 Agent Harness 中连接“目标/约束、上下文、工具、状态、验证、运营指标”这些层。学习时要问:这一层负责限制什么风险?它把哪类不确定性变成了可观察、可恢复、可评估的工程对象?

3. 必须掌握

  • 验收标准要能被工具或人审验证
  • 退出条件比计划更重要

4. 设计流程

用户意图 → 任务编排 → 验收断言 → 权限 → 失败条件 → done/abort/wait

5. 工程注意事项

  • 状态表里要有 started_at、deadline、retry_count、last_error、evidence_url。

6. 常见失败模式

  • 只会解释“任务编排、成功标准和退出条件”的概念,但说不出它在真实系统中的输入、输出和边界。
  • 把模型输出当成验证结果,没有使用工具、测试、引用或状态记录做外部确认。
  • 只追求功能跑通,没有留下 trace、指标、失败原因和下一步改进证据。

7. 学习笔记

今天围绕“任务编排、成功标准和退出条件”建立一个可复用的工程判断:先能定义它解决什么问题,再能指出它在 Agent Harness 中位于哪一层,最后能用一个真实系统环节验证它是否有效。Harness 要把模糊需求转成可验证任务,并先完成编排:确定 orchestrator 负责什么、worker/tool 做什么、何时验收、何时停止。没有成功标准、权限边界和终止条件,Agent 会过度探索、重复执行或沉默失败。 学习时不要只记名词,要把它和状态、工具、上下文、评估、成本或安全边界中的至少一项连接起来。

知识对应点

  • Orchestration / 编排
  • 任务流编排
  • 质量保证
  • 用户真实任务

必须掌握

  • 验收标准要能被工具或人审验证
  • 退出条件比计划更重要

工程注意事项

  • 状态表里要有 started_at、deadline、retry_count、last_error、evidence_url。

理解表达

我会把需求写成可执行任务规格,而不是只让模型自由发挥。

流程

用户意图 → 任务编排 → 验收断言 → 权限 → 失败条件 → done/abort/wait

练习

为“分析一篇文章并保存到学习平台”写 8 条验收标准,并补一张 orchestrator/worker/tool 分工表。

完成标准:每个 agent 任务都能说出完成、失败、等待人工、成本上限,以及编排者和执行者的职责边界。

配套图示

工具调用前定义权限和 schema,调用后验证副作用与证据。

💬AI Chat