这里集中展示每天的学习主题、知识对应点、术语释义覆盖、必须掌握、实践交付和详细页面入口。建议每天从对应 Day 页面进入,先读通俗释义 + 专业释义,再完成主动回忆、原理理解、AI Digest 迁移和打卡。
把 Agent 系统/Agent 系统/Agent 平台/Agent 系统 等 主题 拆成能力地图:Model + Harness = Agent,先理解主题到底在交付什么。
核心知识主线是:模型本身不是产品,Harness 把模型能力转成可运行、可控、可评估的 Agent 产品。除模型训练以外,架构、工具、上下文、状态、评估、运行环境都属于 Harness 范畴。
Agent Harness、Agent Protocol、Token Budget、Latency、Eval / Benchmark… · 每个 Day 页面提供通俗释义 + 专业释义。
把核心主题合并成一张能力矩阵:职责、必备技术、加分项、可实践项目。
一次调用不是“发 prompt 收答案”,而是上下文构造、token 预算、模型路由、API 调用、解析、验证、trace 和成本记录。主题中的 Prompt Cache、KV Cache、latency、cost 都依赖这个生命周期。
Context Engineering、Trace、Prompt Cache、KV Cache、Token Budget… · 每个 Day 页面提供通俗释义 + 专业释义。
为 AI Digest 学习推送画出一次 LLM 调用链路,并标注 input/output token、缓存点、失败点。
多个系统实践都把 Context Engineering 列为核心。它不是写长 prompt,而是决定当前任务需要哪些系统规则、用户目标、工具证据、记忆、历史轨迹和输出契约。
Context Engineering、Context Compaction、Agent Harness、上下文必须有用途、临时状态不能默认变长期记忆… · 每个 Day 页面提供通俗释义 + 专业释义。
把一条真实用户任务压缩成 12 行 context card,分事实/假设/证据/禁区。
系统设计强调“对模型行为有品味的判断”。固定、高频、可枚举任务优先 workflow;开放、多工具、可根据观察修正的任务才需要 agent loop。
Workflow、Product Judgment、Agent 增加成本、不确定性和安全面、State Machine · 每个 Day 页面提供通俗释义 + 专业释义。
把摘要系统拆成 workflow、agent、worker、human-in-loop 四层。
Harness 要把模糊需求转成可验证任务,并先完成编排:确定 orchestrator 负责什么、worker/tool 做什么、何时验收、何时停止。没有成功标准、权限边界和终止条件,Agent 会过度探索、重复执行或沉默失败。
Orchestration / 编排、Subagent / Multi-Agent、Workflow、质量保证、Product Judgment… · 每个 Day 页面提供通俗释义 + 专业释义。
为“分析一篇文章并保存到学习平台”写 8 条验收标准,并补一张 orchestrator/worker/tool 分工表。
学习计划必须服务于可掌握能力:一个 AI Digest 学习教练、一个工具调用/记忆系统、一个 sandboxed coding agent 或多 Agent 代码评审项目。
知识能力路线与项目选择、Project Practice、Eval / Benchmark、每周至少产出一个可展示 artifact · 每个 Day 页面提供通俗释义 + 专业释义。
选 2 个你最想做进学习记录的项目,写出目标、技术栈、指标和一周 MVP。
第一周的产物是一张差距图:哪些能力已经能证明,哪些只有概念,哪些完全缺项目实践。
周复盘:从 主题 到个人能力差距、Learning Loop、不要把“看过文章”当作掌握、证据优先于感觉 · 每个 Day 页面提供通俗释义 + 专业释义。
给自己每个 主题关键词打分:0 不懂、1 概念、2 能实现、3 有项目实践。
掌握 Agent Loop、工具契约、MCP/Tool schema、状态机、错误恢复和 Human-in-the-loop。
Agent Loop 的关键是每一步都有状态和证据,不能只让模型连续思考。
Agent Loop、Reasoning / Verification、概念定义、工程实现、失败模式… · 每个 Day 页面提供通俗释义 + 专业释义。
把 AI Digest 生成过程拆成四段 loop。
工具是模型接触真实世界的边界,主题中的 Tool Use/MCP/协议都依赖严格契约。
Tool Use、MCP、概念定义、工程实现、失败模式… · 每个 Day 页面提供通俗释义 + 专业释义。
为发送微信通知工具写 schema、错误码和验证方式。
MCP 的价值是把工具、资源、prompt 以统一协议接入 Agent runtime,但权限和可观测性仍要由 harness 兜底。
Agent Protocol、Tool Use、MCP、概念定义、工程实现… · 每个 Day 页面提供通俗释义 + 专业释义。
给学习平台设计 3 个 MCP tools。
状态比聊天历史可靠;长任务、重试、异步执行和用户刷新都依赖持久状态。
State Machine、Idempotency、概念定义、工程实现、失败模式… · 每个 Day 页面提供通俗释义 + 专业释义。
为文章学习保存流程设计状态表。
真实环境一定失败,优秀 harness 会区分网络、权限、格式、语义和安全失败。
错误恢复:重试、降级、人工介入、Retry / Fallback、HITL、概念定义、工程实现… · 每个 Day 页面提供通俗释义 + 专业释义。
给工具调用失败设计三层 fallback。
删除、发布、外发、支付、高权限文件写入必须在人类确认前停住。
HITL、Permission / Sandbox、概念定义、工程实现、失败模式… · 每个 Day 页面提供通俗释义 + 专业释义。
列出当前站点 5 个需要确认的动作。
本周要把概念做成最小 loop:任务规格、工具契约、状态、验证、失败恢复。
Agent Harness、Project Practice、Tool Use、概念定义、工程实现… · 每个 Day 页面提供通俗释义 + 专业释义。
实现一个小型“网页读取并保存分析”的 harness spec。
训练 Context Engineering、记忆治理、长时记忆、Prompt/KV Cache、上下文压缩与检索引用。
主题中的 Memory 不等于保存聊天记录,而是多层生命周期治理。
Memory、RAG、Wiki / Knowledge Base、Skill、概念定义… · 每个 Day 页面提供通俗释义 + 专业释义。
把 10 条信息分类到不同记忆层。
RAG 是读取机制,质量来自语料、切分、元数据、rerank 和引用,不是“接向量库”。
RAG、Metadata / Citation、概念定义、工程实现、失败模式… · 每个 Day 页面提供通俗释义 + 专业释义。
为 Agent 学习资料设计 metadata schema。
Agent 系统 主题 提到更可靠的 memory/personalization;关键是写入门槛、权限隔离和过期治理。
Memory、Permission / Sandbox、概念定义、工程实现、失败模式… · 每个 Day 页面提供通俗释义 + 专业释义。
设计一个 memory 写入审核清单。
长时任务不能无限带历史,必须把轨迹压缩成目标、决策、证据、未决风险。
Context Engineering、Context Compaction、Handoff、概念定义、工程实现… · 每个 Day 页面提供通俗释义 + 专业释义。
把 20 条工具日志压缩为 handoff card。
主题中的 Prompt Cache/KV Cache 体现的是运行成本意识:稳定前缀、复用上下文和减少重复推理。
Prompt Cache、KV Cache、Latency、概念定义、工程实现… · 每个 Day 页面提供通俗释义 + 专业释义。
给每日学习推送设计可缓存 prompt 前缀。
多用户 Agent 必须在检索前做权限过滤,不能把隔离寄托给 prompt。
Permission / Sandbox、Memory、概念定义、工程实现、失败模式… · 每个 Day 页面提供通俗释义 + 专业释义。
为 Hermes 多用户使用设计隔离矩阵。
本周产物是一套可审计的知识系统:RAG source、Wiki、Memory、Skill 和 Review queue。
第 3 周复盘:构建知识与记忆底座、Wiki / Knowledge Base、Skill、概念定义、工程实现… · 每个 Day 页面提供通俗释义 + 专业释义。
把一个工程经验沉淀成 Skill + Wiki + Test。
理解 Planning、Reasoning、MCTS/Trace 搜索、反思、自主调试和策略优化。
Planning 要把不确定需求拆成可暂停、可验证、可回滚的小步,而不是生成漂亮待办。
Planning / DAG、概念定义、工程实现、失败模式、理解表达 · 每个 Day 页面提供通俗释义 + 专业释义。
把“更新学习计划”拆成 8 步 DAG。
模型可以推理,但验证需要测试、工具、引用和真实外部状态。
Reasoning / Verification、概念定义、工程实现、失败模式、理解表达 · 每个 Day 页面提供通俗释义 + 专业释义。
给一条模型结论标注事实/推断/待验证。
Reflection 适合在关键节点检查遗漏、格式、风险,但不能代替外部验证。
Reflection、概念定义、工程实现、失败模式、理解表达 · 每个 Day 页面提供通俗释义 + 专业释义。
为学习卡片设计 8 项自检。
顶尖应届 主题 提到 Trace 自动诊断、搜索 harness 代码空间、MCTS 工作流搜索,核心是把尝试路径显式化。
Trace、Search / MCTS、概念定义、工程实现、失败模式… · 每个 Day 页面提供通俗释义 + 专业释义。
为一个失败工具调用列出 3 条可搜索修复路径。
Agentic RL 关注在交互环境中用 reward/反馈优化策略;工程上先要有可度量任务和安全边界。
Search / MCTS、Agentic RL / Reward、概念定义、工程实现、失败模式… · 每个 Day 页面提供通俗释义 + 专业释义。
为学习问答定义一个简单 reward。
本周产物是一个能解释“为什么这样走”的 agent:有计划、有 trace、有评分、有失败归因。
第 4 周复盘:策略优化与可解释执行轨迹、Trace、Search / MCTS、概念定义、工程实现… · 每个 Day 页面提供通俗释义 + 专业释义。
写一份失败案例复盘。
编排的价值是把复杂任务拆成可验证责任边界:orchestrator 负责计划、调度、合并、验收和失败恢复,worker/subagent 只承担清晰子任务;多 Agent 价值来自隔离、并行和独立评审,不是堆角色名。
Orchestration / 编排、Subagent / Multi-Agent、概念定义、工程实现、失败模式… · 每个 Day 页面提供通俗释义 + 专业释义。
设计三路并行:研究、实现、评审,并写出每一路输入、输出、验收证据和失败降级。
把多 Agent 编排、subagent、handoff、eval、benchmark、回归测试和 trace 串成质量闭环。
交接要包含目标、已做、证据、风险、下一步,否则上下文会丢失。
Handoff、Context Engineering、Subagent / Multi-Agent、概念定义、工程实现… · 每个 Day 页面提供通俗释义 + 专业释义。
写一份 worker handoff 模板。
主题 高频要求 eval、benchmark、回归测试。没有 eval 的 Agent 只能 demo。
Eval / Benchmark、概念定义、工程实现、失败模式、理解表达 · 每个 Day 页面提供通俗释义 + 专业释义。
为学习助手写 6 个 eval cases。
Agent 系统/Agent 系统 主题 强调任务成功率、completion quality、latency、cost、user trust、recoverability。
Latency、Reflection、Eval / Benchmark、Solve Rate / Cost、概念定义… · 每个 Day 页面提供通俗释义 + 专业释义。
设计一个 agent 指标看板。
可观测性让失败可归因:模型、上下文、工具、权限还是外部系统。
Trace、概念定义、工程实现、失败模式、理解表达 · 每个 Day 页面提供通俗释义 + 专业释义。
为一个多工具任务设计 trace schema。
多 Agent 只有在可并行、需要独立评审或上下文过大时才值得。
多 Agent 是否值得:成本、冲突与合并、Subagent / Multi-Agent、Solve Rate / Cost、conflict、概念定义… · 每个 Day 页面提供通俗释义 + 专业释义。
给一个需求判断是否需要多 Agent。
本周产物是一个带 eval、trace、benchmark 和多角色评审的小型 Agent 项目。
第 5 周复盘:质量闭环项目、Reflection、Eval / Benchmark、Trace、概念定义… · 每个 Day 页面提供通俗释义 + 专业释义。
给现有站点学习助手补一个 eval 方案。
多个系统实践 提到 Docker、沙箱隔离、执行代码/终端/浏览器。Sandbox 决定 Agent 能否安全做真实任务。
Permission / Sandbox、Docker / Runtime、概念定义、工程实现、失败模式… · 每个 Day 页面提供通俗释义 + 专业释义。
为 coding agent 设计 Docker sandbox 策略。
补齐浏览器/终端/代码环境、Docker sandbox、权限安全、SLO、成本延迟和学习记录级项目表达。
Agent 真正决定能走多远的是能否稳定操作浏览器、终端、桌面、企业系统和代码仓库。
Docker / Runtime、概念定义、工程实现、失败模式、理解表达 · 每个 Day 页面提供通俗释义 + 专业释义。
写一个浏览器自动化任务的断言清单。
Harness 不是脚本;长任务要异步化,服务要健康检查,改动要 CI/CD。
Queue / Cron / CI-CD、概念定义、工程实现、失败模式、理解表达 · 每个 Day 页面提供通俗释义 + 专业释义。
为批量学习图生成设计队列状态。
强模型不该包办一切;规划、工具参数、总结、验证可采用不同模型和缓存策略。
模型路由与成本预算、Model Routing、Solve Rate / Cost、Latency、概念定义… · 每个 Day 页面提供通俗释义 + 专业释义。
给学习系统设计 fast/standard/deep 三档路由。
Agent 系统/Agent 系统 主题 都提到用户反馈和社区。Harness 层要把真实失败转成 prompt、工具、eval、UI 改进。
Agent Harness、Product Judgment、概念定义、工程实现、失败模式… · 每个 Day 页面提供通俗释义 + 专业释义。
把一次用户投诉转成改进任务。
Agent 系统/Agent 系统 主题 要求真实一线工程实践。Agent 产品需要前端、后端、数据库、异步任务、监控一起设计。
Full-stack Agent Product、概念定义、工程实现、失败模式、理解表达 · 每个 Day 页面提供通俗释义 + 专业释义。
画出学习平台全栈架构。
最后要把学习成果变成讲解可讲的 case:问题、架构、权衡、指标、失败恢复、材料。
Project Practice、case-study、概念定义、工程实现、失败模式… · 每个 Day 页面提供通俗释义 + 专业释义。
为 AI Digest 学习教练写一页 工程案例。
用主题语言回答:如何设计一个能在浏览器和代码仓库中长期执行任务的 Agent Harness。
Agent Harness、scenario design、system design、Product Judgment、概念定义… · 每个 Day 页面提供通俗释义 + 专业释义。
做一次 20 分钟系统设计自问自答。
合格的 Harness 工程师能连接模型、工具、上下文、状态、eval、安全和产品指标,并能把失败样本转成工程迭代。
Agent Harness、Project Practice、Planning / DAG、Learning Loop、概念定义… · 每个 Day 页面提供通俗释义 + 专业释义。
列出未来 30 天最值得做的 3 个项目。