Today · Harness / Loop Engineering · 第 1 周:能力图谱与 Harness 基础

今日 25 分钟学习闭环

今日状态:未完成 · Day 02

今日主题:一次 LLM 调用生命周期:从 Context Builder 到 Trace

主题轨道:Harness / Loop Engineering · 第 1 周:能力图谱与 Harness 基础

一次调用不是“发 prompt 收答案”,而是上下文构造、token 预算、模型路由、API 调用、解析、验证、trace 和成本记录。主题中的 Prompt Cache、KV Cache、latency、cost 都依赖这个生命周期。

1. 今日要掌握什么

一次调用不是“发 prompt 收答案”,而是上下文构造、token 预算、模型路由、API 调用、解析、验证、trace 和成本记录。主题中的 Prompt Cache、KV Cache、latency、cost 都依赖这个生命周期。

交付物:能说明为什么 128k 上下文不是垃圾桶,为什么每次调用都要预留输出 token。

今日关键术语释义

每个当天会被提问或用于练习的术语,先给通俗释义,再给专业释义,避免题目超出当天知识点。

Context Engineering

通俗释义:不是把 prompt 写长,而是只放当前任务真正需要的规则、证据、记忆和输出格式。

专业释义:对模型输入窗口进行目标、约束、检索证据、记忆、工具状态、历史摘要和输出契约的选择、压缩、排序与隔离。

当天检查:能把一个任务压缩成 objective/constraints/evidence/output contract。

参考脉络:OpenAI prompt/context guidance / 12-factor agents

Trace

通俗释义:每一步做了什么、为什么做、结果是什么的证据链。

专业释义:跨模型调用、工具调用、状态迁移和评估事件的结构化执行轨迹,用于调试、审计、eval 和成本归因。

当天检查:能从 trace 找到失败层:上下文、工具、模型、权限或外部系统。

参考脉络:OpenAI tracing/evals / production observability

Prompt Cache

通俗释义:把每次都一样的系统提示、工具说明、长文档等稳定前缀缓存起来;下次复用,少花钱、少等。

专业释义:供应商侧或应用侧对稳定 prompt prefix 的 tokenization/attention 前缀结果进行缓存复用,常用 cache key、TTL 和 prefix 命中率优化输入成本与首包延迟。

当天检查:能为每日学习生成设计稳定前缀,并说明缓存失效条件。

参考脉络:Anthropic prompt caching / OpenAI prompt caching practices

KV Cache

通俗释义:模型生成时把已经算过的注意力中间结果存起来,后面不用重算。

专业释义:Transformer 推理中缓存每层注意力的 key/value states,用于自回归 decoding 和长上下文增量生成;它不同于 Prompt Cache,通常发生在模型推理内部。

当天检查:能说出 KV Cache 与 Prompt Cache 的边界和失效风险。

参考脉络:Transformer inference engineering / vLLM-style serving

Token Budget

通俗释义:上下文窗口不是垃圾桶:输入和输出都要预留 token。

专业释义:对 input/output token、reserved completion tokens、retrieval chunks 与工具 schema 进行预算分配,以控制成本、延迟和截断风险。

当天检查:能估算一次学习推送的输入、输出、缓存和预留 token。

参考脉络:OpenAI / Anthropic API usage guidance

Latency

通俗释义:用户等多久,包括检索、排队、首字和完整生成时间。

专业释义:端到端延迟由 retrieval、routing、prefill、time-to-first-token、decoding、tool I/O 与 retry 共同决定。

当天检查:能把一次慢响应拆成至少 3 个可优化段。

参考脉络:LLM serving metrics / OpenAI production guidance

Eval / Benchmark

通俗释义:用固定题集和指标反复测,不靠感觉判断变好。

专业释义:eval 定义任务集、期望行为、评分器和回归门禁;benchmark 提供可比较的离线/线上质量、成本、延迟基线。

当天检查:能为学习助手写覆盖正常、边界、故障、越权的 eval cases。

参考脉络:OpenAI Evals / Google agent evaluation guidance

2. 原理讲解

Agentic System 是围绕目标、状态、工具、反馈和终止条件运行的工程系统,不等于一个会聊天的模型。

3. 和今日 AI Digest 的结合

今日还没有可引用的 AI Digest 条目;先用 AI Digest 系统本身作为实战案例。

4. 今日实作

为 AI Digest 学习推送画出一次 LLM 调用链路,并标注 input/output token、缓存点、失败点。

5. 主动回忆

先不看答案,用自己的话解释:一次 LLM 调用生命周期:从 Context Builder 到 Trace 的核心判断标准是什么?

6. 打卡问题

我能从调用生命周期解释成本、延迟和质量优化,而不是只说“换更强模型”。

用你自己的话解释给一个不了解 Agent 工程的人,并指出一个常见误区。

登录后可提交今日学习并记录完成状态。

💬AI Chat