0 · 总览与学习地图
进度 0%
AI LEARNING LAB · 学习路径

首页负责「对比 + 亲手跑」;基础馆把同一条控制半径拆成可通关章节(Tool → ReAct → Loop → MCP → Multi-Agent → Skill → A2A)。

前沿技术,亲手跑懂
并形成自己的知识网络

定期追踪一手来源,把最新 AI 工程知识沉淀成可操作、可比较、可验证的个性化课程;用 Harness / Loop / Graph 技术复现实验,再把 Skill 体系接进同一套学习台,帮助产品与工程人员高效熟悉最新能力。

3 个机制 DemoSkill 分层手册判断手感训练进度自动保存知识截止 2026-07-28
一句总纲
AI Learning Lab = 一手来源沉淀 × 概念对比网络 × 可运行技术 Demo × Skill 分层能力手册。不是词汇表,是控制半径。

学习地图

01
发现核验
官方文档、论文、成熟度
02
建图对比
依赖、边界、反例
03
技术复现
Harness / Loop / Graph
04
Skill 整合
手册、资料、工具、素材
05
判断迁移
先观察,再形式化
1

知识网络:不是词汇表,是控制半径

从“模型能调用工具”一路走到“多个优化循环如何不互相欺骗”,并把 MCP、A2A、Agent Card、Skill 放进同一张控制半径图。

基础能力

Tool Calling

让模型能改变外部状态

连接 → react / mcp
认知循环

ReAct

推理 → 行动 → 观察

连接 → loop
工具协议

MCP

Agent ↔ 工具 / API / 数据源

对比 → a2a / card
协作协议

A2A

独立 Agent 间发现、委托、长任务

依赖 → card · 对比 → mcp
能力名片

Agent Card

公开身份、技能、端点与认证

服务 → a2a · 不同于 → skill
能力模块

Skill

分层手册:路由、流程、资料、工具

连接 → harness / mcp
单次运行

Harness Engineering

环境、工具、可见性、约束、完成证据

连接 → loop
重复运行

Loop Engineering

状态、验证、预算、停止与升级

连接 → graph
多循环治理

Graph Engineering

目标所有权、冲突、节奏与外部锚点

外部目标与治理锚点
层级核心问题可运行产物典型误区
Harness一次运行能不能完成?工具、日志、约束、完成证明只改提示,不改环境
Loop重复运行能不能收敛?状态、验证器、预算、停止条件无限重试等于自动化
Graph多个循环会不会共同漂移?所有权、否决边、节奏、外部锚点局部指标全绿就是成功
Skill能力如何分层复用?手册、资料、脚本、素材、路由写成超长提示词一次塞满
MCP工具/数据如何标准化接入?tools/list、schema、结构化结果把 MCP 当成 Agent 社交协议
A2A / Card独立 Agent 如何发现与协作?Agent Card、Task、委托与推送用 A2A 替换掉一切 MCP 调用

协议层举一反三:MCP · A2A · Agent Card · Skill

先看“交互对象是什么”,再选协议。A2A 与 MCP 是互补,不是替代。

当前实践结论
外层 Agent 通过 MCP knowledge_chat 调用知识能力时,应保留 MCP;先做上下文边界治理。等出现跨团队独立 Agent、长任务生命周期、Artifact 交付时,再加 A2A Adapter,而不是重写知识库。
场景MCPA2A举一反三
外层调用知识查询适合过重角色像 Agent,协议仍是能力调用
工具 schema / 结构化结果核心不是重点像 function calling 的接入层
能力发现tools/listAgent Card菜单 vs 名片
Agent 间任务委托核心手 vs 社交
长任务取消/恢复/推送需另建原生支持短请求 vs 任务生命周期
跨团队/跨供应商 Agent有限更适合同进程工具 vs 对等协作
Agent ↔ 工具

MCP

连接工具、API、数据源;强调参数、schema、结构化结果。

类比:给 Agent 装上标准化的手
Agent ↔ Agent

A2A

发现、协商、委托、共享任务与上下文;面向独立对等体。

类比:给 Agent 装上社交与协作协议
公开身份

Agent Card

名片:名字、端点、skills、能力特性、认证方式。

类比:A2A 的发现入口,不是本地 SKILL.md
推荐分层,而不是替换
外层 Agent
  ├─ MCP:短请求、确定性工具、knowledge_chat
  └─ A2A:长任务、异步协作、独立 Agent 委托

知识库 Agent
  └─ MCP:内部检索、HSCode、合规等业务工具

注意:A2A contextId → opaque knowledge_thread_id
不要继续直接暴露数据库整数 conversation_id

场景判断:该留 MCP 还是上 A2A?

当前得分 0/3

外层客服 Agent 调用内层知识库的 knowledge_chat:传入 message / conversation_id,返回答案。该用什么?
你需要让对方 Agent 通过公开名片发现“我会什么、端点在哪、怎么认证”。核心构件是?
出现跨团队独立部署、长任务取消/恢复、Artifact 交付时,更合理的演进是?
和相邻概念怎么挂
Tool Calling 是模型怎么开单;MCP 是工具从哪接进来;Skill 是宿主内如何分层复用流程;Agent Card / A2A 是独立 Agent 如何被发现并协作。换协议解决不了“鞋子和玻璃杯是否同一主题”这类上下文边界问题。
2

技术复现 Demo:亲手观察机制

Demo 复现的是技术机制本身。每个实验都改变可观察状态,并明确显示为什么成功、为什么失败、为什么停止。

01

单次运行控制半径

Harness Lab

emerging

亲手拆掉或补回 Agent 的执行环境,观察它究竟卡在行动、观察、约束还是完成证明。

先切换开关,再运行。失败原因会停在第一个缺失能力。

02

重复运行控制半径

Loop Lab

emerging

调整目标、迭代上限和预算,观察循环是真实收敛,还是在耗尽预算后诚实停下。

试着把预算设得比目标所需更小,看它如何报告预算耗尽。

03

多循环治理控制半径

Graph Lab

proposed

复现“局部指标全绿但外部目标下跌”,再用外部锚点与否决边纠正互相冲突的循环。

默认状态会复现“局部仪表盘全绿、真实目标下跌”。再逐步接入锚点和否决边。

3

Skill:把能力做成可组合的分层手册

Skill 不是“很长的提示词”,而是一个节省上下文的分层执行系统:先路由,再加载流程,细节用到才读。

一句总纲
一个标准 Skill 真正必需的只有:一个独立目录 + `SKILL.md`。`references/`、`scripts/`、`assets/` 都是按需添加的可选资源,不是必需项。

最小形态 vs 推荐结构

最小 Skill
my-skill/
└── SKILL.md
完整推荐结构
my-skill/
├── SKILL.md
├── agents/openai.yaml
├── scripts/
├── references/
└── assets/
记忆口诀
`SKILL.md` 是操作手册,`references` 是资料库,`scripts` 是工具箱,`assets` 是原材料,Skill 仓库是把这些能力组合起来的工作系统。

三级加载:如何省上下文

第一级 · name + description
始终可见的轻量路由:这个 Skill 做什么、什么时候该触发。
第二级 · SKILL.md 正文
命中后才加载:执行顺序、判断分支、完成标准、何时读取其他文件。
第三级 · references / scripts / assets
某个任务分支需要时才读资料、跑脚本或使用模板,避免一次塞进全部知识。

内容该放哪里?动手分类

当前得分 0/4。先判断,再看解释。

“Agent 每次都必须先建立可复现的反馈循环,再提出假设。”
“只有用户问到 Stripe 退款时才需要阅读的退款政策细节。”
“把 JSONL 账本做 URL 规范化、内容指纹和 added/updated 判定。”
“生成课程时要复制并改写的单文件 HTML 模板。”

Skill 形态与触发方式

只有 SKILL.md

纯流程型

适合判断和文字流程

主流程稳定,分支查资料

流程 + Reference

如支付政策、术语表

判断 + 确定性自动化

流程 + Script

如诊断循环模板

Skill 定内容,模板给骨架

流程 + Asset

如向导、课件模板

不直接做工程,只指路

路由型 Skill

如 ask-matt / 总入口

多个 Skill 形成生产线

仓库级组合

grill → spec → tickets → implement

Matt 式工程生产线

想法
grill-with-docs
把模糊需求问透
规格
to-spec
写成可执行规格
拆分
to-tickets
变成可交付工单
实现
implement + tdd
按测试驱动推进
审查
code-review
对照标准验收
关系类型例子在 Lab 中的对应
调用关系implement 使用 tdd前沿追踪 Skill 调用账本脚本与课程渲染器
前后阶段to-spec → to-tickets发现核验 → 建图 → 技术复现 Demo → 学习反馈
共享知识多个 Skill 共用 codebase-designHarness / Loop / Graph 共用“控制半径”词汇
优秀 Skill 的标准
目标不是让每次输出完全相同,而是让 Agent 每次遵循相对可预测的过程。本 Lab 的 `track-ai-frontier` 正是按这个标准组织:入口流程在 `SKILL.md`,来源政策与课程规范按需读,账本与渲染脚本稳定执行。
4

判断手感:先训练注意力

不把直觉神秘化:先写下你看见的信号,再展开可观察的参考线索,把隐性判断桥接成显性知识。

01

先看失败落在哪一层

Agent 会写代码,却总要人类复制日志和截图才能继续。你先注意到什么?

02

先看问题是否跨轮出现

手动执行很顺,一到每周自动运行就重复修改、无限重试。你先注意到什么?

03

先看局部绿色是否背离真实目标

速度、质量分、成本指标都变绿,续费率却持续下降。你先注意到什么?

5

深入课程:同一路径的下一站

首页练「对比与复现」;基础馆把同一套控制半径拆成可通关章节。两边入口互通,章节也可直达。

6

一手来源

“Graph Engineering”当前标记为 proposed;来源支持定义,不等于证明行业已形成统一标准。