第 5 周:Multi-Agent、Eval、Benchmark 与可观测性

Day 33 · 多 Agent 是否值得:成本、冲突与合并

核心指数 架构品味 5/5

关键逻辑释义

多 Agent 只有在可并行、需要独立评审或上下文过大时才值得。

今日关键术语释义

每个当天会被提问或用于练习的术语,先给通俗释义,再给专业释义,避免题目超出当天知识点。

多 Agent 是否值得:成本、冲突与合并

通俗释义:把“多 Agent 是否值得:成本、冲突与合并”先理解成今天要掌握的一种工程判断:它帮助你决定系统该如何稳定完成任务。

专业释义:多 Agent 是否值得:成本、冲突与合并 是 Agent Harness 课程中的专项能力点,需要从定义、输入输出、工程边界、失败模式、指标与验证方式六个角度掌握。

当天检查:能用自己的话解释 多 Agent 是否值得:成本、冲突与合并,并把它映射到 AI Digest / Hermes / 学习平台中的一个真实环节。

参考脉络:课程内置知识点;当天需结合 AI Digest 或真实系统案例验证

Subagent / Multi-Agent

通俗释义:把复杂工作拆给多个相对独立的小助手,并行做、再合并。

专业释义:orchestrator 将任务卡分发给 worker/subagent,通过隔离上下文、并行执行、独立评审和 merge protocol 处理复杂任务。

当天检查:能说明什么时候多 Agent 值得,什么时候只是增加复杂度。

参考脉络:Anthropic multi-agent patterns / OpenAI agent guide

Solve Rate / Cost

通俗释义:看任务成功率,也看花多少钱、多久、是否可恢复。

专业释义:production agent metrics 包括 solve rate、completion quality、latency、cost、recoverability、user trust 和 human escalation rate。

当天检查:能设计一个含成功率/质量/延迟/成本的看板。

参考脉络:OpenAI production agent metrics

conflict

通俗释义:把“conflict”先理解成今天要掌握的一种工程判断:它帮助你决定系统该如何稳定完成任务。

专业释义:conflict 是 Agent Harness 课程中的专项能力点,需要从定义、输入输出、工程边界、失败模式、指标与验证方式六个角度掌握。

当天检查:能用自己的话解释 conflict,并把它映射到 AI Digest / Hermes / 学习平台中的一个真实环节。

参考脉络:课程内置知识点;当天需结合 AI Digest 或真实系统案例验证

概念定义

通俗释义:把“概念定义”先理解成今天要掌握的一种工程判断:它帮助你决定系统该如何稳定完成任务。

专业释义:概念定义 是 Agent Harness 课程中的专项能力点,需要从定义、输入输出、工程边界、失败模式、指标与验证方式六个角度掌握。

当天检查:能用自己的话解释 概念定义,并把它映射到 AI Digest / Hermes / 学习平台中的一个真实环节。

参考脉络:课程内置知识点;当天需结合 AI Digest 或真实系统案例验证

工程实现

通俗释义:把“工程实现”先理解成今天要掌握的一种工程判断:它帮助你决定系统该如何稳定完成任务。

专业释义:工程实现 是 Agent Harness 课程中的专项能力点,需要从定义、输入输出、工程边界、失败模式、指标与验证方式六个角度掌握。

当天检查:能用自己的话解释 工程实现,并把它映射到 AI Digest / Hermes / 学习平台中的一个真实环节。

参考脉络:课程内置知识点;当天需结合 AI Digest 或真实系统案例验证

失败模式

通俗释义:把“失败模式”先理解成今天要掌握的一种工程判断:它帮助你决定系统该如何稳定完成任务。

专业释义:失败模式 是 Agent Harness 课程中的专项能力点,需要从定义、输入输出、工程边界、失败模式、指标与验证方式六个角度掌握。

当天检查:能用自己的话解释 失败模式,并把它映射到 AI Digest / Hermes / 学习平台中的一个真实环节。

参考脉络:课程内置知识点;当天需结合 AI Digest 或真实系统案例验证

理解表达

通俗释义:把“理解表达”先理解成今天要掌握的一种工程判断:它帮助你决定系统该如何稳定完成任务。

专业释义:理解表达 是 Agent Harness 课程中的专项能力点,需要从定义、输入输出、工程边界、失败模式、指标与验证方式六个角度掌握。

当天检查:能用自己的话解释 理解表达,并把它映射到 AI Digest / Hermes / 学习平台中的一个真实环节。

参考脉络:课程内置知识点;当天需结合 AI Digest 或真实系统案例验证

核心知识展开

1. 是什么

多 Agent 只有在可并行、需要独立评审或上下文过大时才值得。

2. 工程位置

它在 Agent Harness 中连接“目标/约束、上下文、工具、状态、验证、运营指标”这些层。学习时要问:这一层负责限制什么风险?它把哪类不确定性变成了可观察、可恢复、可评估的工程对象?

3. 必须掌握

  • 概念定义
  • 工程实现
  • 失败模式
  • 理解表达

4. 设计流程

复杂度评估 → 角色边界 → 成本预算 → 合并策略

5. 工程注意事项

  • 把该主题绑定到一个真实系统,不只记概念。
  • 每个练习都要产出可展示 artifact 或可执行验收标准。

6. 常见失败模式

  • 只会解释“多 Agent 是否值得”的概念,但说不出它在真实系统中的输入、输出和边界。
  • 把模型输出当成验证结果,没有使用工具、测试、引用或状态记录做外部确认。
  • 只追求功能跑通,没有留下 trace、指标、失败原因和下一步改进证据。

7. 学习笔记

今天围绕“多 Agent 是否值得:成本、冲突与合并”建立一个可复用的工程判断:先能定义它解决什么问题,再能指出它在 Agent Harness 中位于哪一层,最后能用一个真实系统环节验证它是否有效。多 Agent 只有在可并行、需要独立评审或上下文过大时才值得。 学习时不要只记名词,要把它和状态、工具、上下文、评估、成本或安全边界中的至少一项连接起来。

知识对应点

  • multi-agent
  • cost
  • conflict

必须掌握

  • 概念定义
  • 工程实现
  • 失败模式
  • 理解表达

工程注意事项

  • 把该主题绑定到一个真实系统,不只记概念。
  • 每个练习都要产出可展示 artifact 或可执行验收标准。

理解表达

我能围绕 多 Agent 是否值得:成本、冲突与合并 讲清楚工程目标、实现方式、指标和失败处理。

流程

复杂度评估 → 角色边界 → 成本预算 → 合并策略

练习

给一个需求判断是否需要多 Agent。

完成标准:避免为了多 Agent 而多 Agent。

配套图示

多角色协作只有在边界清晰、可评估、可回归时才值得引入。

💬AI Chat