第 1 周:能力图谱与 Harness 基础

Day 01 · Agent Harness 能力图谱:Model + Harness = Agent

核心指数 知识覆盖 5/5 · 全局视角 5/5

关键逻辑释义

核心知识主线是:模型本身不是产品,Harness 把模型能力转成可运行、可控、可评估的 Agent 产品。除模型训练以外,架构、工具、上下文、状态、评估、运行环境都属于 Harness 范畴。

今日关键术语释义

每个当天会被提问或用于练习的术语,先给通俗释义,再给专业释义,避免题目超出当天知识点。

Agent Harness

通俗释义:把大模型变成可控助手的“运行外壳”:负责给目标、喂上下文、调工具、记状态、验结果和控成本。

专业释义:围绕 LLM 的运行时工程层,组合 context builder、tool runtime、state machine、policy/guardrail、eval/trace 与成本延迟控制,使模型能力可产品化。

当天检查:能指出一个 Agent 功能中哪些属于模型层,哪些属于 Harness 层。

参考脉络:OpenAI Agents guide / Anthropic effective agents / 12-factor agents

Agent Protocol

通俗释义:让 Agent 和外部工具/服务约定怎么说话的规则。

专业释义:定义 agent runtime 与 tools/resources/worker 之间的消息、schema、权限、状态和错误语义的接口协议。

当天检查:能写出一次工具调用的输入、输出、错误码和验证证据。

参考脉络:Google ADK / MCP / OpenAI tools

Token Budget

通俗释义:上下文窗口不是垃圾桶:输入和输出都要预留 token。

专业释义:对 input/output token、reserved completion tokens、retrieval chunks 与工具 schema 进行预算分配,以控制成本、延迟和截断风险。

当天检查:能估算一次学习推送的输入、输出、缓存和预留 token。

参考脉络:OpenAI / Anthropic API usage guidance

Latency

通俗释义:用户等多久,包括检索、排队、首字和完整生成时间。

专业释义:端到端延迟由 retrieval、routing、prefill、time-to-first-token、decoding、tool I/O 与 retry 共同决定。

当天检查:能把一次慢响应拆成至少 3 个可优化段。

参考脉络:LLM serving metrics / OpenAI production guidance

Eval / Benchmark

通俗释义:用固定题集和指标反复测,不靠感觉判断变好。

专业释义:eval 定义任务集、期望行为、评分器和回归门禁;benchmark 提供可比较的离线/线上质量、成本、延迟基线。

当天检查:能为学习助手写覆盖正常、边界、故障、越权的 eval cases。

参考脉络:OpenAI Evals / Google agent evaluation guidance

Solve Rate / Cost

通俗释义:看任务成功率,也看花多少钱、多久、是否可恢复。

专业释义:production agent metrics 包括 solve rate、completion quality、latency、cost、recoverability、user trust 和 human escalation rate。

当天检查:能设计一个含成功率/质量/延迟/成本的看板。

参考脉络:OpenAI production agent metrics

主题不是只写 prompt,而是做工程系统

通俗释义:把“主题不是只写 prompt,而是做工程系统”先理解成今天要掌握的一种工程判断:它帮助你决定系统该如何稳定完成任务。

专业释义:主题不是只写 prompt,而是做工程系统 是 Agent Harness 课程中的专项能力点,需要从定义、输入输出、工程边界、失败模式、指标与验证方式六个角度掌握。

当天检查:能用自己的话解释 主题不是只写 prompt,而是做工程系统,并把它映射到 AI Digest / Hermes / 学习平台中的一个真实环节。

参考脉络:课程内置知识点;当天需结合 AI Digest 或真实系统案例验证

能力掌握要落到可运行项目和指标

通俗释义:把“能力掌握要落到可运行项目和指标”先理解成今天要掌握的一种工程判断:它帮助你决定系统该如何稳定完成任务。

专业释义:能力掌握要落到可运行项目和指标 是 Agent Harness 课程中的专项能力点,需要从定义、输入输出、工程边界、失败模式、指标与验证方式六个角度掌握。

当天检查:能用自己的话解释 能力掌握要落到可运行项目和指标,并把它映射到 AI Digest / Hermes / 学习平台中的一个真实环节。

参考脉络:课程内置知识点;当天需结合 AI Digest 或真实系统案例验证

核心知识展开

1. 是什么

核心知识主线是:模型本身不是产品,Harness 把模型能力转成可运行、可控、可评估的 Agent 产品。除模型训练以外,架构、工具、上下文、状态、评估、运行环境都属于 Harness 范畴。

2. 工程位置

它在 Agent Harness 中连接“目标/约束、上下文、工具、状态、验证、运营指标”这些层。学习时要问:这一层负责限制什么风险?它把哪类不确定性变成了可观察、可恢复、可评估的工程对象?

3. 必须掌握

  • Model + Harness = Agent
  • 主题不是只写 prompt,而是做工程系统
  • 能力掌握要落到可运行项目和指标

4. 设计流程

主题关键词 → 能力簇 → 项目模块 → 学习节点 → 知识表达

5. 工程注意事项

  • 先建立主题词典:Agent Loop / Tool Use / MCP / Memory / Subagent / Multi-Agent / Evaluation / Sandboxing / Prompt Cache。
  • 所有后续学习都要能映射到 主题中的一条知识点。

6. 常见失败模式

  • 只会解释“Agent Harness 能力图谱”的概念,但说不出它在真实系统中的输入、输出和边界。
  • 把模型输出当成验证结果,没有使用工具、测试、引用或状态记录做外部确认。
  • 只追求功能跑通,没有留下 trace、指标、失败原因和下一步改进证据。

7. 学习笔记

今天围绕“Agent Harness 能力图谱:Model + Harness = Agent”建立一个可复用的工程判断:先能定义它解决什么问题,再能指出它在 Agent Harness 中位于哪一层,最后能用一个真实系统环节验证它是否有效。核心知识主线是:模型本身不是产品,Harness 把模型能力转成可运行、可控、可评估的 Agent 产品。除模型训练以外,架构、工具、上下文、状态、评估、运行环境都属于 Harness 范畴。 学习时不要只记名词,要把它和状态、工具、上下文、评估、成本或安全边界中的至少一项连接起来。

知识对应点

  • Harness 产品架构与技术选型
  • Agent Protocol 与真实任务执行
  • Eval、Benchmark、token cost、latency

必须掌握

  • Model + Harness = Agent
  • 主题不是只写 prompt,而是做工程系统
  • 能力掌握要落到可运行项目和指标

工程注意事项

  • 先建立主题词典:Agent Loop / Tool Use / MCP / Memory / Subagent / Multi-Agent / Evaluation / Sandboxing / Prompt Cache。
  • 所有后续学习都要能映射到 主题中的一条知识点。

理解表达

我会把 Harness 定义为把模型能力转化为稳定 Agent 产品的工程层,负责上下文、工具、状态、评估、运行环境和成本延迟。

流程

主题关键词 → 能力簇 → 项目模块 → 学习节点 → 知识表达

练习

把核心主题合并成一张能力矩阵:职责、必备技术、加分项、可实践项目。

完成标准:能用 3 分钟解释 Harness 层负责什么,以及它和模型层、产品层的边界。

配套图示

目标、状态、计划、工具、观察、评估、记忆构成最小 agentic 闭环。

学习导航

💬AI Chat