第 1 周:能力图谱与 Harness 基础

Day 02 · 一次 LLM 调用生命周期:从 Context Builder 到 Trace

核心指数 工程基础 5/5 · 成本意识 4/5

关键逻辑释义

一次调用不是“发 prompt 收答案”,而是上下文构造、token 预算、模型路由、API 调用、解析、验证、trace 和成本记录。主题中的 Prompt Cache、KV Cache、latency、cost 都依赖这个生命周期。

今日关键术语释义

每个当天会被提问或用于练习的术语,先给通俗释义,再给专业释义,避免题目超出当天知识点。

Context Engineering

通俗释义:不是把 prompt 写长,而是只放当前任务真正需要的规则、证据、记忆和输出格式。

专业释义:对模型输入窗口进行目标、约束、检索证据、记忆、工具状态、历史摘要和输出契约的选择、压缩、排序与隔离。

当天检查:能把一个任务压缩成 objective/constraints/evidence/output contract。

参考脉络:OpenAI prompt/context guidance / 12-factor agents

Trace

通俗释义:每一步做了什么、为什么做、结果是什么的证据链。

专业释义:跨模型调用、工具调用、状态迁移和评估事件的结构化执行轨迹,用于调试、审计、eval 和成本归因。

当天检查:能从 trace 找到失败层:上下文、工具、模型、权限或外部系统。

参考脉络:OpenAI tracing/evals / production observability

Prompt Cache

通俗释义:把每次都一样的系统提示、工具说明、长文档等稳定前缀缓存起来;下次复用,少花钱、少等。

专业释义:供应商侧或应用侧对稳定 prompt prefix 的 tokenization/attention 前缀结果进行缓存复用,常用 cache key、TTL 和 prefix 命中率优化输入成本与首包延迟。

当天检查:能为每日学习生成设计稳定前缀,并说明缓存失效条件。

参考脉络:Anthropic prompt caching / OpenAI prompt caching practices

KV Cache

通俗释义:模型生成时把已经算过的注意力中间结果存起来,后面不用重算。

专业释义:Transformer 推理中缓存每层注意力的 key/value states,用于自回归 decoding 和长上下文增量生成;它不同于 Prompt Cache,通常发生在模型推理内部。

当天检查:能说出 KV Cache 与 Prompt Cache 的边界和失效风险。

参考脉络:Transformer inference engineering / vLLM-style serving

Token Budget

通俗释义:上下文窗口不是垃圾桶:输入和输出都要预留 token。

专业释义:对 input/output token、reserved completion tokens、retrieval chunks 与工具 schema 进行预算分配,以控制成本、延迟和截断风险。

当天检查:能估算一次学习推送的输入、输出、缓存和预留 token。

参考脉络:OpenAI / Anthropic API usage guidance

Latency

通俗释义:用户等多久,包括检索、排队、首字和完整生成时间。

专业释义:端到端延迟由 retrieval、routing、prefill、time-to-first-token、decoding、tool I/O 与 retry 共同决定。

当天检查:能把一次慢响应拆成至少 3 个可优化段。

参考脉络:LLM serving metrics / OpenAI production guidance

Eval / Benchmark

通俗释义:用固定题集和指标反复测,不靠感觉判断变好。

专业释义:eval 定义任务集、期望行为、评分器和回归门禁;benchmark 提供可比较的离线/线上质量、成本、延迟基线。

当天检查:能为学习助手写覆盖正常、边界、故障、越权的 eval cases。

参考脉络:OpenAI Evals / Google agent evaluation guidance

核心知识展开

1. 是什么

一次调用不是“发 prompt 收答案”,而是上下文构造、token 预算、模型路由、API 调用、解析、验证、trace 和成本记录。主题中的 Prompt Cache、KV Cache、latency、cost 都依赖这个生命周期。

2. 工程位置

它在 Agent Harness 中连接“目标/约束、上下文、工具、状态、验证、运营指标”这些层。学习时要问:这一层负责限制什么风险?它把哪类不确定性变成了可观察、可恢复、可评估的工程对象?

3. 必须掌握

  • 输入 token 影响首包延迟和检索负载
  • 输出 token 影响生成耗时和账单
  • trace 是后续 eval 和优化的原始证据

4. 设计流程

Task → Context Builder → Token Budget → Model Router → LLM Call → Parser → Verifier → Trace/Cost

5. 工程注意事项

  • 调用级日志至少记录 model、prompt version、input/output token、latency、parse success、retry count。

6. 常见失败模式

  • 只会解释“一次 LLM 调用生命周期”的概念,但说不出它在真实系统中的输入、输出和边界。
  • 把模型输出当成验证结果,没有使用工具、测试、引用或状态记录做外部确认。
  • 只追求功能跑通,没有留下 trace、指标、失败原因和下一步改进证据。

7. 学习笔记

今天围绕“一次 LLM 调用生命周期:从 Context Builder 到 Trace”建立一个可复用的工程判断:先能定义它解决什么问题,再能指出它在 Agent Harness 中位于哪一层,最后能用一个真实系统环节验证它是否有效。一次调用不是“发 prompt 收答案”,而是上下文构造、token 预算、模型路由、API 调用、解析、验证、trace 和成本记录。主题中的 Prompt Cache、KV Cache、latency、cost 都依赖这个生命周期。 学习时不要只记名词,要把它和状态、工具、上下文、评估、成本或安全边界中的至少一项连接起来。

知识对应点

  • Prompt Cache / KV Cache
  • token 成本与延迟
  • trace 与质量判断

必须掌握

  • 输入 token 影响首包延迟和检索负载
  • 输出 token 影响生成耗时和账单
  • trace 是后续 eval 和优化的原始证据

工程注意事项

  • 调用级日志至少记录 model、prompt version、input/output token、latency、parse success、retry count。

理解表达

我能从调用生命周期解释成本、延迟和质量优化,而不是只说“换更强模型”。

流程

Task → Context Builder → Token Budget → Model Router → LLM Call → Parser → Verifier → Trace/Cost

练习

为 AI Digest 学习推送画出一次 LLM 调用链路,并标注 input/output token、缓存点、失败点。

完成标准:能说明为什么 128k 上下文不是垃圾桶,为什么每次调用都要预留输出 token。

配套图示

工具调用前定义权限和 schema,调用后验证副作用与证据。

💬AI Chat