Daily Plan

每日学习计划 · 6 周 / 43 天

这里集中展示每天的学习主题、知识对应点、术语释义覆盖、必须掌握、实践交付和详细页面入口。建议每天从对应 Day 页面进入,先读通俗释义 + 专业释义,再完成主动回忆、原理理解、AI Digest 迁移和打卡。

今日学习任务返回学习总览

第 1 周:能力图谱与 Harness 基础

把 Agent 系统/Agent 系统/Agent 平台/Agent 系统 等 主题 拆成能力地图:Model + Harness = Agent,先理解主题到底在交付什么。

第 1 周:能力图谱与 Harness 基础

Day 01 · Agent Harness 能力图谱:Model + Harness = Agent

核心指数知识覆盖 5/5 · 全局视角 5/5

核心知识主线是:模型本身不是产品,Harness 把模型能力转成可运行、可控、可评估的 Agent 产品。除模型训练以外,架构、工具、上下文、状态、评估、运行环境都属于 Harness 范畴。

知识对应点

  • Harness 产品架构与技术选型
  • Agent Protocol 与真实任务执行
  • Eval、Benchmark、token cost、latency

术语释义覆盖

Agent Harness、Agent Protocol、Token Budget、Latency、Eval / Benchmark… · 每个 Day 页面提供通俗释义 + 专业释义。

必须掌握

  • Model + Harness = Agent
  • 主题不是只写 prompt,而是做工程系统
  • 能力掌握要落到可运行项目和指标

实践交付

把核心主题合并成一张能力矩阵:职责、必备技术、加分项、可实践项目。

第 1 周:能力图谱与 Harness 基础

Day 02 · 一次 LLM 调用生命周期:从 Context Builder 到 Trace

核心指数工程基础 5/5 · 成本意识 4/5

一次调用不是“发 prompt 收答案”,而是上下文构造、token 预算、模型路由、API 调用、解析、验证、trace 和成本记录。主题中的 Prompt Cache、KV Cache、latency、cost 都依赖这个生命周期。

知识对应点

  • Prompt Cache / KV Cache
  • token 成本与延迟
  • trace 与质量判断

术语释义覆盖

Context Engineering、Trace、Prompt Cache、KV Cache、Token Budget… · 每个 Day 页面提供通俗释义 + 专业释义。

必须掌握

  • 输入 token 影响首包延迟和检索负载
  • 输出 token 影响生成耗时和账单
  • trace 是后续 eval 和优化的原始证据

实践交付

为 AI Digest 学习推送画出一次 LLM 调用链路,并标注 input/output token、缓存点、失败点。

第 1 周:能力图谱与 Harness 基础

Day 03 · Context Engineering:主题里的核心基本功

核心指数上下文质量 5/5 · 抗污染 5/5

多个系统实践都把 Context Engineering 列为核心。它不是写长 prompt,而是决定当前任务需要哪些系统规则、用户目标、工具证据、记忆、历史轨迹和输出契约。

知识对应点

  • 上下文工程
  • context management / context compaction
  • Harness Engineering

术语释义覆盖

Context Engineering、Context Compaction、Agent Harness、上下文必须有用途、临时状态不能默认变长期记忆… · 每个 Day 页面提供通俗释义 + 专业释义。

必须掌握

  • 上下文必须有用途
  • 临时状态不能默认变长期记忆
  • 长上下文需要压缩和排序

实践交付

把一条真实用户任务压缩成 12 行 context card,分事实/假设/证据/禁区。

第 1 周:能力图谱与 Harness 基础

Day 04 · Workflow vs Agent:什么时候不要 Agent 化

核心指数架构判断 5/5

系统设计强调“对模型行为有品味的判断”。固定、高频、可枚举任务优先 workflow;开放、多工具、可根据观察修正的任务才需要 agent loop。

知识对应点

  • 产品判断
  • 开发者体验洞察
  • 稳定性优先

术语释义覆盖

Workflow、Product Judgment、Agent 增加成本、不确定性和安全面、State Machine · 每个 Day 页面提供通俗释义 + 专业释义。

必须掌握

  • Agent 增加成本、不确定性和安全面
  • 可枚举流程应用状态机和规则先解决

实践交付

把摘要系统拆成 workflow、agent、worker、human-in-loop 四层。

第 1 周:能力图谱与 Harness 基础

Day 05 · 任务编排、成功标准和退出条件

核心指数可靠性 5/5

Harness 要把模糊需求转成可验证任务,并先完成编排:确定 orchestrator 负责什么、worker/tool 做什么、何时验收、何时停止。没有成功标准、权限边界和终止条件,Agent 会过度探索、重复执行或沉默失败。

知识对应点

  • Orchestration / 编排
  • 任务流编排
  • 质量保证
  • 用户真实任务

术语释义覆盖

Orchestration / 编排、Subagent / Multi-Agent、Workflow、质量保证、Product Judgment… · 每个 Day 页面提供通俗释义 + 专业释义。

必须掌握

  • 验收标准要能被工具或人审验证
  • 退出条件比计划更重要

实践交付

为“分析一篇文章并保存到学习平台”写 8 条验收标准,并补一张 orchestrator/worker/tool 分工表。

第 1 周:能力图谱与 Harness 基础

Day 06 · 知识能力路线与项目选择

核心指数实践产出 5/5

学习计划必须服务于可掌握能力:一个 AI Digest 学习教练、一个工具调用/记忆系统、一个 sandboxed coding agent 或多 Agent 代码评审项目。

知识对应点

  • 项目实践
  • 开源贡献
  • 产品迭代经验

术语释义覆盖

知识能力路线与项目选择、Project Practice、Eval / Benchmark、每周至少产出一个可展示 artifact · 每个 Day 页面提供通俗释义 + 专业释义。

必须掌握

  • 项目要包含真实数据、用户入口、失败恢复、eval 指标
  • 每周至少产出一个可展示 artifact

实践交付

选 2 个你最想做进学习记录的项目,写出目标、技术栈、指标和一周 MVP。

第 1 周:能力图谱与 Harness 基础

Day 07 · 周复盘:从 主题 到个人能力差距

核心指数诊断 5/5

第一周的产物是一张差距图:哪些能力已经能证明,哪些只有概念,哪些完全缺项目实践。

知识对应点

  • 自我诊断
  • 学习监督
  • 打卡

术语释义覆盖

周复盘:从 主题 到个人能力差距、Learning Loop、不要把“看过文章”当作掌握、证据优先于感觉 · 每个 Day 页面提供通俗释义 + 专业释义。

必须掌握

  • 不要把“看过文章”当作掌握
  • 证据优先于感觉

实践交付

给自己每个 主题关键词打分:0 不懂、1 概念、2 能实现、3 有项目实践。

第 2 周:Agent Loop、Tool Use 与协议边界

掌握 Agent Loop、工具契约、MCP/Tool schema、状态机、错误恢复和 Human-in-the-loop。

第 2 周:Agent Loop、Tool Use 与协议边界

Day 08 · Agent Loop:Observe → Decide → Act → Verify

核心指数Agent Loop 5/5

Agent Loop 的关键是每一步都有状态和证据,不能只让模型连续思考。

知识对应点

  • Agent Loop
  • reasoning
  • verification

术语释义覆盖

Agent Loop、Reasoning / Verification、概念定义、工程实现、失败模式… · 每个 Day 页面提供通俗释义 + 专业释义。

必须掌握

  • 概念定义
  • 工程实现
  • 失败模式
  • 理解表达

实践交付

把 AI Digest 生成过程拆成四段 loop。

第 2 周:Agent Loop、Tool Use 与协议边界

Day 09 · Tool Contract:Schema、副作用、幂等与验证

核心指数工具工程 5/5

工具是模型接触真实世界的边界,主题中的 Tool Use/MCP/协议都依赖严格契约。

知识对应点

  • Tool Use
  • MCP
  • tool schema

术语释义覆盖

Tool Use、MCP、概念定义、工程实现、失败模式… · 每个 Day 页面提供通俗释义 + 专业释义。

必须掌握

  • 概念定义
  • 工程实现
  • 失败模式
  • 理解表达

实践交付

为发送微信通知工具写 schema、错误码和验证方式。

第 2 周:Agent Loop、Tool Use 与协议边界

Day 10 · MCP 与 Tool Ecosystem:统一工具协议

核心指数协议能力 4/5

MCP 的价值是把工具、资源、prompt 以统一协议接入 Agent runtime,但权限和可观测性仍要由 harness 兜底。

知识对应点

  • MCP
  • tool ecosystem
  • protocol

术语释义覆盖

Agent Protocol、Tool Use、MCP、概念定义、工程实现… · 每个 Day 页面提供通俗释义 + 专业释义。

必须掌握

  • 概念定义
  • 工程实现
  • 失败模式
  • 理解表达

实践交付

给学习平台设计 3 个 MCP tools。

第 2 周:Agent Loop、Tool Use 与协议边界

Day 11 · 状态机:让 Agent 可恢复

核心指数状态 5/5

状态比聊天历史可靠;长任务、重试、异步执行和用户刷新都依赖持久状态。

知识对应点

  • state
  • recoverability
  • idempotency

术语释义覆盖

State Machine、Idempotency、概念定义、工程实现、失败模式… · 每个 Day 页面提供通俗释义 + 专业释义。

必须掌握

  • 概念定义
  • 工程实现
  • 失败模式
  • 理解表达

实践交付

为文章学习保存流程设计状态表。

第 2 周:Agent Loop、Tool Use 与协议边界

Day 12 · 错误恢复:重试、降级、人工介入

核心指数稳定性 5/5

真实环境一定失败,优秀 harness 会区分网络、权限、格式、语义和安全失败。

知识对应点

  • retry
  • fallback
  • HITL

术语释义覆盖

错误恢复:重试、降级、人工介入、Retry / Fallback、HITL、概念定义、工程实现… · 每个 Day 页面提供通俗释义 + 专业释义。

必须掌握

  • 概念定义
  • 工程实现
  • 失败模式
  • 理解表达

实践交付

给工具调用失败设计三层 fallback。

第 2 周:Agent Loop、Tool Use 与协议边界

Day 13 · Human-in-the-loop 与权限分级

核心指数安全 5/5

删除、发布、外发、支付、高权限文件写入必须在人类确认前停住。

知识对应点

  • permission
  • sandbox
  • HITL

术语释义覆盖

HITL、Permission / Sandbox、概念定义、工程实现、失败模式… · 每个 Day 页面提供通俗释义 + 专业释义。

必须掌握

  • 概念定义
  • 工程实现
  • 失败模式
  • 理解表达

实践交付

列出当前站点 5 个需要确认的动作。

第 2 周:Agent Loop、Tool Use 与协议边界

Day 14 · 第 2 周复盘:实现一个最小 Harness Loop

核心指数MVP 5/5

本周要把概念做成最小 loop:任务规格、工具契约、状态、验证、失败恢复。

知识对应点

  • MVP
  • harness
  • tool

术语释义覆盖

Agent Harness、Project Practice、Tool Use、概念定义、工程实现… · 每个 Day 页面提供通俗释义 + 专业释义。

必须掌握

  • 概念定义
  • 工程实现
  • 失败模式
  • 理解表达

实践交付

实现一个小型“网页读取并保存分析”的 harness spec。

第 3 周:Context、Memory、RAG 与缓存

训练 Context Engineering、记忆治理、长时记忆、Prompt/KV Cache、上下文压缩与检索引用。

第 3 周:Context、Memory、RAG 与缓存

Day 15 · Memory 系统分层:Session / Memory / Wiki / Skill / RAG

核心指数记忆 5/5

主题中的 Memory 不等于保存聊天记录,而是多层生命周期治理。

知识对应点

  • Memory
  • RAG
  • Skill

术语释义覆盖

Memory、RAG、Wiki / Knowledge Base、Skill、概念定义… · 每个 Day 页面提供通俗释义 + 专业释义。

必须掌握

  • 概念定义
  • 工程实现
  • 失败模式
  • 理解表达

实践交付

把 10 条信息分类到不同记忆层。

第 3 周:Context、Memory、RAG 与缓存

Day 16 · RAG:Chunk、Metadata、Rerank、Citation

核心指数检索 4/5

RAG 是读取机制,质量来自语料、切分、元数据、rerank 和引用,不是“接向量库”。

知识对应点

  • RAG
  • metadata
  • citation

术语释义覆盖

RAG、Metadata / Citation、概念定义、工程实现、失败模式… · 每个 Day 页面提供通俗释义 + 专业释义。

必须掌握

  • 概念定义
  • 工程实现
  • 失败模式
  • 理解表达

实践交付

为 Agent 学习资料设计 metadata schema。

第 3 周:Context、Memory、RAG 与缓存

Day 17 · 长时记忆与个性化:Memory Personalization

核心指数个性化 4/5

Agent 系统 主题 提到更可靠的 memory/personalization;关键是写入门槛、权限隔离和过期治理。

知识对应点

  • personalization
  • memory hygiene
  • privacy

术语释义覆盖

Memory、Permission / Sandbox、概念定义、工程实现、失败模式… · 每个 Day 页面提供通俗释义 + 专业释义。

必须掌握

  • 概念定义
  • 工程实现
  • 失败模式
  • 理解表达

实践交付

设计一个 memory 写入审核清单。

第 3 周:Context、Memory、RAG 与缓存

Day 18 · Context Compaction:长任务上下文压缩

核心指数长上下文 5/5

长时任务不能无限带历史,必须把轨迹压缩成目标、决策、证据、未决风险。

知识对应点

  • context compaction
  • handoff
  • long context

术语释义覆盖

Context Engineering、Context Compaction、Handoff、概念定义、工程实现… · 每个 Day 页面提供通俗释义 + 专业释义。

必须掌握

  • 概念定义
  • 工程实现
  • 失败模式
  • 理解表达

实践交付

把 20 条工具日志压缩为 handoff card。

第 3 周:Context、Memory、RAG 与缓存

Day 19 · Prompt Cache 与 KV Cache:成本/延迟优化

核心指数性能 4/5

主题中的 Prompt Cache/KV Cache 体现的是运行成本意识:稳定前缀、复用上下文和减少重复推理。

知识对应点

  • Prompt Cache
  • KV Cache
  • latency

术语释义覆盖

Prompt Cache、KV Cache、Latency、概念定义、工程实现… · 每个 Day 页面提供通俗释义 + 专业释义。

必须掌握

  • 概念定义
  • 工程实现
  • 失败模式
  • 理解表达

实践交付

给每日学习推送设计可缓存 prompt 前缀。

第 3 周:Context、Memory、RAG 与缓存

Day 20 · 权限过滤:多用户 Memory / Session / Profile 隔离

核心指数隔离 5/5

多用户 Agent 必须在检索前做权限过滤,不能把隔离寄托给 prompt。

知识对应点

  • permission
  • profile
  • session isolation

术语释义覆盖

Permission / Sandbox、Memory、概念定义、工程实现、失败模式… · 每个 Day 页面提供通俗释义 + 专业释义。

必须掌握

  • 概念定义
  • 工程实现
  • 失败模式
  • 理解表达

实践交付

为 Hermes 多用户使用设计隔离矩阵。

第 3 周:Context、Memory、RAG 与缓存

Day 21 · 第 3 周复盘:构建知识与记忆底座

核心指数知识底座 5/5

本周产物是一套可审计的知识系统:RAG source、Wiki、Memory、Skill 和 Review queue。

知识对应点

  • knowledge base
  • skill
  • review

术语释义覆盖

第 3 周复盘:构建知识与记忆底座、Wiki / Knowledge Base、Skill、概念定义、工程实现… · 每个 Day 页面提供通俗释义 + 专业释义。

必须掌握

  • 概念定义
  • 工程实现
  • 失败模式
  • 理解表达

实践交付

把一个工程经验沉淀成 Skill + Wiki + Test。

第 4 周:Planning、Reasoning、Search 与 Agentic RL

理解 Planning、Reasoning、MCTS/Trace 搜索、反思、自主调试和策略优化。

第 4 周:Planning、Reasoning、Search 与 Agentic RL

Day 22 · Planning:从自然语言到可执行 DAG

核心指数规划 5/5

Planning 要把不确定需求拆成可暂停、可验证、可回滚的小步,而不是生成漂亮待办。

知识对应点

  • Planning
  • DAG
  • rollback

术语释义覆盖

Planning / DAG、概念定义、工程实现、失败模式、理解表达 · 每个 Day 页面提供通俗释义 + 专业释义。

必须掌握

  • 概念定义
  • 工程实现
  • 失败模式
  • 理解表达

实践交付

把“更新学习计划”拆成 8 步 DAG。

第 4 周:Planning、Reasoning、Search 与 Agentic RL

Day 23 · Reasoning 与 Verification:推理不等于验证

核心指数可靠性 5/5

模型可以推理,但验证需要测试、工具、引用和真实外部状态。

知识对应点

  • Reasoning
  • verification
  • hallucination

术语释义覆盖

Reasoning / Verification、概念定义、工程实现、失败模式、理解表达 · 每个 Day 页面提供通俗释义 + 专业释义。

必须掌握

  • 概念定义
  • 工程实现
  • 失败模式
  • 理解表达

实践交付

给一条模型结论标注事实/推断/待验证。

第 4 周:Planning、Reasoning、Search 与 Agentic RL

Day 24 · Reflection:结构化自检而不是自言自语

核心指数自检 4/5

Reflection 适合在关键节点检查遗漏、格式、风险,但不能代替外部验证。

知识对应点

  • Reflection
  • quality
  • checklist

术语释义覆盖

Reflection、概念定义、工程实现、失败模式、理解表达 · 每个 Day 页面提供通俗释义 + 专业释义。

必须掌握

  • 概念定义
  • 工程实现
  • 失败模式
  • 理解表达

实践交付

为学习卡片设计 8 项自检。

第 4 周:Planning、Reasoning、Search 与 Agentic RL

Day 25 · Trace 搜索、代码空间搜索与自主调试

核心指数前沿 4/5

顶尖应届 主题 提到 Trace 自动诊断、搜索 harness 代码空间、MCTS 工作流搜索,核心是把尝试路径显式化。

知识对应点

  • Trace
  • MCTS
  • self-debugging

术语释义覆盖

Trace、Search / MCTS、概念定义、工程实现、失败模式… · 每个 Day 页面提供通俗释义 + 专业释义。

必须掌握

  • 概念定义
  • 工程实现
  • 失败模式
  • 理解表达

实践交付

为一个失败工具调用列出 3 条可搜索修复路径。

第 4 周:Planning、Reasoning、Search 与 Agentic RL

Day 26 · Agentic RL 与 Test-time Optimization

核心指数前沿 4/5

Agentic RL 关注在交互环境中用 reward/反馈优化策略;工程上先要有可度量任务和安全边界。

知识对应点

  • Agentic RL
  • reward
  • test-time

术语释义覆盖

Search / MCTS、Agentic RL / Reward、概念定义、工程实现、失败模式… · 每个 Day 页面提供通俗释义 + 专业释义。

必须掌握

  • 概念定义
  • 工程实现
  • 失败模式
  • 理解表达

实践交付

为学习问答定义一个简单 reward。

第 4 周:Planning、Reasoning、Search 与 Agentic RL

Day 27 · 第 4 周复盘:策略优化与可解释执行轨迹

核心指数优化 5/5

本周产物是一个能解释“为什么这样走”的 agent:有计划、有 trace、有评分、有失败归因。

知识对应点

  • trace
  • debug
  • optimization

术语释义覆盖

第 4 周复盘:策略优化与可解释执行轨迹、Trace、Search / MCTS、概念定义、工程实现… · 每个 Day 页面提供通俗释义 + 专业释义。

必须掌握

  • 概念定义
  • 工程实现
  • 失败模式
  • 理解表达

实践交付

写一份失败案例复盘。

第 4 周:Planning、Reasoning、Search 与 Agentic RL

Day 28 · Orchestration / 编排:Orchestrator-Worker 与 Subagent

核心指数编排 5/5

编排的价值是把复杂任务拆成可验证责任边界:orchestrator 负责计划、调度、合并、验收和失败恢复,worker/subagent 只承担清晰子任务;多 Agent 价值来自隔离、并行和独立评审,不是堆角色名。

知识对应点

  • Orchestration / 编排
  • Subagent
  • Multi-Agent
  • orchestrator/worker

术语释义覆盖

Orchestration / 编排、Subagent / Multi-Agent、概念定义、工程实现、失败模式… · 每个 Day 页面提供通俗释义 + 专业释义。

必须掌握

  • 概念定义
  • 工程实现
  • 失败模式
  • 理解表达

实践交付

设计三路并行:研究、实现、评审,并写出每一路输入、输出、验收证据和失败降级。

第 5 周:Multi-Agent、Eval、Benchmark 与可观测性

把多 Agent 编排、subagent、handoff、eval、benchmark、回归测试和 trace 串成质量闭环。

第 5 周:Multi-Agent、Eval、Benchmark 与可观测性

Day 29 · Handoff 协议:多 Agent 交接格式

核心指数协作 4/5

交接要包含目标、已做、证据、风险、下一步,否则上下文会丢失。

知识对应点

  • handoff
  • context
  • worker

术语释义覆盖

Handoff、Context Engineering、Subagent / Multi-Agent、概念定义、工程实现… · 每个 Day 页面提供通俗释义 + 专业释义。

必须掌握

  • 概念定义
  • 工程实现
  • 失败模式
  • 理解表达

实践交付

写一份 worker handoff 模板。

第 5 周:Multi-Agent、Eval、Benchmark 与可观测性

Day 30 · Eval:从 Demo 到 Regression

核心指数评估 5/5

主题 高频要求 eval、benchmark、回归测试。没有 eval 的 Agent 只能 demo。

知识对应点

  • Eval
  • benchmark
  • regression

术语释义覆盖

Eval / Benchmark、概念定义、工程实现、失败模式、理解表达 · 每个 Day 页面提供通俗释义 + 专业释义。

必须掌握

  • 概念定义
  • 工程实现
  • 失败模式
  • 理解表达

实践交付

为学习助手写 6 个 eval cases。

第 5 周:Multi-Agent、Eval、Benchmark 与可观测性

Day 31 · Benchmark 与线上指标:solve rate / completion quality / latency / cost

核心指数指标 5/5

Agent 系统/Agent 系统 主题 强调任务成功率、completion quality、latency、cost、user trust、recoverability。

知识对应点

  • solve rate
  • latency
  • cost

术语释义覆盖

Latency、Reflection、Eval / Benchmark、Solve Rate / Cost、概念定义… · 每个 Day 页面提供通俗释义 + 专业释义。

必须掌握

  • 概念定义
  • 工程实现
  • 失败模式
  • 理解表达

实践交付

设计一个 agent 指标看板。

第 5 周:Multi-Agent、Eval、Benchmark 与可观测性

Day 32 · Observability:日志、Trace、证据链

核心指数可观测 5/5

可观测性让失败可归因:模型、上下文、工具、权限还是外部系统。

知识对应点

  • observability
  • trace
  • logs

术语释义覆盖

Trace、概念定义、工程实现、失败模式、理解表达 · 每个 Day 页面提供通俗释义 + 专业释义。

必须掌握

  • 概念定义
  • 工程实现
  • 失败模式
  • 理解表达

实践交付

为一个多工具任务设计 trace schema。

第 5 周:Multi-Agent、Eval、Benchmark 与可观测性

Day 33 · 多 Agent 是否值得:成本、冲突与合并

核心指数架构品味 5/5

多 Agent 只有在可并行、需要独立评审或上下文过大时才值得。

知识对应点

  • multi-agent
  • cost
  • conflict

术语释义覆盖

多 Agent 是否值得:成本、冲突与合并、Subagent / Multi-Agent、Solve Rate / Cost、conflict、概念定义… · 每个 Day 页面提供通俗释义 + 专业释义。

必须掌握

  • 概念定义
  • 工程实现
  • 失败模式
  • 理解表达

实践交付

给一个需求判断是否需要多 Agent。

第 5 周:Multi-Agent、Eval、Benchmark 与可观测性

Day 34 · 第 5 周复盘:质量闭环项目

核心指数质量闭环 5/5

本周产物是一个带 eval、trace、benchmark 和多角色评审的小型 Agent 项目。

知识对应点

  • quality loop
  • eval
  • trace

术语释义覆盖

第 5 周复盘:质量闭环项目、Reflection、Eval / Benchmark、Trace、概念定义… · 每个 Day 页面提供通俗释义 + 专业释义。

必须掌握

  • 概念定义
  • 工程实现
  • 失败模式
  • 理解表达

实践交付

给现有站点学习助手补一个 eval 方案。

第 5 周:Multi-Agent、Eval、Benchmark 与可观测性

Day 35 · Sandboxing:Docker、文件系统、网络与权限

核心指数安全运行时 5/5

多个系统实践 提到 Docker、沙箱隔离、执行代码/终端/浏览器。Sandbox 决定 Agent 能否安全做真实任务。

知识对应点

  • Sandboxing
  • Docker
  • security

术语释义覆盖

Permission / Sandbox、Docker / Runtime、概念定义、工程实现、失败模式… · 每个 Day 页面提供通俗释义 + 专业释义。

必须掌握

  • 概念定义
  • 工程实现
  • 失败模式
  • 理解表达

实践交付

为 coding agent 设计 Docker sandbox 策略。

第 6 周:Sandbox、Runtime、产品化与项目沉淀

补齐浏览器/终端/代码环境、Docker sandbox、权限安全、SLO、成本延迟和学习记录级项目表达。

第 6 周:Sandbox、Runtime、产品化与项目沉淀

Day 36 · Browser / Computer Use:Playwright、Claw 与真实环境

核心指数运行环境 4/5

Agent 真正决定能走多远的是能否稳定操作浏览器、终端、桌面、企业系统和代码仓库。

知识对应点

  • Playwright
  • browser
  • Claw

术语释义覆盖

Docker / Runtime、概念定义、工程实现、失败模式、理解表达 · 每个 Day 页面提供通俗释义 + 专业释义。

必须掌握

  • 概念定义
  • 工程实现
  • 失败模式
  • 理解表达

实践交付

写一个浏览器自动化任务的断言清单。

第 6 周:Sandbox、Runtime、产品化与项目沉淀

Day 37 · 代码环境与异步任务:Service、Queue、Cron、CI/CD

核心指数工程化 5/5

Harness 不是脚本;长任务要异步化,服务要健康检查,改动要 CI/CD。

知识对应点

  • queue
  • cron
  • CI/CD

术语释义覆盖

Queue / Cron / CI-CD、概念定义、工程实现、失败模式、理解表达 · 每个 Day 页面提供通俗释义 + 专业释义。

必须掌握

  • 概念定义
  • 工程实现
  • 失败模式
  • 理解表达

实践交付

为批量学习图生成设计队列状态。

第 6 周:Sandbox、Runtime、产品化与项目沉淀

Day 38 · 模型路由与成本预算

核心指数运营 5/5

强模型不该包办一切;规划、工具参数、总结、验证可采用不同模型和缓存策略。

知识对应点

  • model routing
  • cost
  • latency

术语释义覆盖

模型路由与成本预算、Model Routing、Solve Rate / Cost、Latency、概念定义… · 每个 Day 页面提供通俗释义 + 专业释义。

必须掌握

  • 概念定义
  • 工程实现
  • 失败模式
  • 理解表达

实践交付

给学习系统设计 fast/standard/deep 三档路由。

第 6 周:Sandbox、Runtime、产品化与项目沉淀

Day 39 · 产品反馈与用户社区:从失败样本改进 Harness

核心指数产品 4/5

Agent 系统/Agent 系统 主题 都提到用户反馈和社区。Harness 层要把真实失败转成 prompt、工具、eval、UI 改进。

知识对应点

  • user feedback
  • community
  • iteration

术语释义覆盖

Agent Harness、Product Judgment、概念定义、工程实现、失败模式… · 每个 Day 页面提供通俗释义 + 专业释义。

必须掌握

  • 概念定义
  • 工程实现
  • 失败模式
  • 理解表达

实践交付

把一次用户投诉转成改进任务。

第 6 周:Sandbox、Runtime、产品化与项目沉淀

Day 40 · 全栈 Agent 产品:前端状态、后端 API、数据库与部署

核心指数全栈 5/5

Agent 系统/Agent 系统 主题 要求真实一线工程实践。Agent 产品需要前端、后端、数据库、异步任务、监控一起设计。

知识对应点

  • full-stack
  • API
  • database

术语释义覆盖

Full-stack Agent Product、概念定义、工程实现、失败模式、理解表达 · 每个 Day 页面提供通俗释义 + 专业释义。

必须掌握

  • 概念定义
  • 工程实现
  • 失败模式
  • 理解表达

实践交付

画出学习平台全栈架构。

第 6 周:Sandbox、Runtime、产品化与项目沉淀

Day 41 · 项目沉淀 工程案例:把项目讲成知识能力

核心指数学习记录 5/5

最后要把学习成果变成讲解可讲的 case:问题、架构、权衡、指标、失败恢复、材料。

知识对应点

  • project-practice
  • case-study
  • 工程案例

术语释义覆盖

Project Practice、case-study、概念定义、工程实现、失败模式… · 每个 Day 页面提供通俗释义 + 专业释义。

必须掌握

  • 概念定义
  • 工程实现
  • 失败模式
  • 理解表达

实践交付

为 AI Digest 学习教练写一页 工程案例。

第 6 周:Sandbox、Runtime、产品化与项目沉淀

Day 42 · 系统设计练习:设计 Agent Harness

核心指数讲解 5/5

用主题语言回答:如何设计一个能在浏览器和代码仓库中长期执行任务的 Agent Harness。

知识对应点

  • scenario design
  • system design
  • tradeoff

术语释义覆盖

Agent Harness、scenario design、system design、Product Judgment、概念定义… · 每个 Day 页面提供通俗释义 + 专业释义。

必须掌握

  • 概念定义
  • 工程实现
  • 失败模式
  • 理解表达

实践交付

做一次 20 分钟系统设计自问自答。

第 6 周:Sandbox、Runtime、产品化与项目沉淀

Day 43 · 总复盘:从学习者到 Harness 工程师

核心指数综合 5/5

合格的 Harness 工程师能连接模型、工具、上下文、状态、eval、安全和产品指标,并能把失败样本转成工程迭代。

知识对应点

  • playbook
  • roadmap
  • growth

术语释义覆盖

Agent Harness、Project Practice、Planning / DAG、Learning Loop、概念定义… · 每个 Day 页面提供通俗释义 + 专业释义。

必须掌握

  • 概念定义
  • 工程实现
  • 失败模式
  • 理解表达

实践交付

列出未来 30 天最值得做的 3 个项目。

💬AI Chat