AI Learning Lab0 · 今日0%

今日

前沿技术,亲手跑懂 并形成自己的知识网络

一手来源沉淀 × 知识网络 × 可运行 Demo × Skill。选一个起点进入工作室画布。

今日路径:知识网络 → Graph Demo → 判断手感 → 基础馆

3 个机制 DemoSkill 分层手册判断手感训练System One 模型综述课程核对 2026-07-28账本 2026-09-27
一句总纲
AI Learning Lab = 一手来源沉淀 × 概念对比网络 × 可运行技术 Demo × Skill 分层能力手册。不是词汇表,是控制半径。

学习地图

01
发现核验
官方文档、论文、成熟度
02
建图对比
依赖、边界、反例
03
技术复现
Harness / Loop / Graph
04
Skill 整合
手册、资料、工具、素材
05
判断迁移
先观察,再形式化
1

知识网络:不是词汇表,是控制半径

从“模型能调用工具”一路走到“多个优化循环如何不互相欺骗”,并把 MCP、ACP、CLI、A2A、Agent Card、Skill 放进同一张控制半径图。

知识网络

点击任意卡片,查看它在控制半径中的直接连接;再次点击取消。概念馆每日账本会挂回同一组节点。

Graph Engineering 的直接连接:Loop Engineering
层级核心问题可运行产物典型误区
Harness一次运行能不能完成?工具、日志、约束、完成证明只改提示,不改环境
Loop重复运行能不能收敛?状态、验证器、预算、停止条件无限重试等于自动化
Graph多个循环会不会共同漂移?所有权、否决边、节奏、外部锚点局部指标全绿就是成功
Skill能力如何分层复用?手册、资料、脚本、素材、路由写成超长提示词一次塞满
MCP工具/数据如何标准化接入?tools/list、schema、结构化结果把 MCP 当成 Agent 社交协议
ACP客户端如何驱动本地 Agent 会话?stdio 子进程、JSON-RPC、NDJSON 流把 ACP 当成 MCP 或 A2A
CLIAgent 作为一条本地命令如何跑?Grok CLI / Codex CLI 等 stdio agent把编码 Agent 再包成 MCP 工具就当完事
A2A / Card独立 Agent 如何发现与协作?Agent Card、Task、委托与推送用 A2A 替换掉一切 MCP 调用

协议层举一反三:MCP · ACP · CLI · A2A · Agent Card · Skill

先看“谁在跟谁说话”,再选协议。MCP / ACP / A2A 互补,不是互相取代的版本号。

当前实践结论
外层 Agent 通过 MCP knowledge_chat 调用知识能力时,应保留 MCP;先做上下文边界治理。等出现跨团队独立 Agent、长任务生命周期、Artifact 交付时,再加 A2A Adapter,而不是重写知识库。
场景MCPACPA2A举一反三
谁连谁Agent ↔ 工具Client ↔ AgentAgent ↔ Agent先看两端再选协议
外层调用知识查询适合过重过重角色像 Agent,协议仍是能力调用
完整编码会话不够核心过重编辑器 spawn 本地 CLI Agent
能力发现tools/list初始化 / 会话Agent Card菜单 vs 工位 vs 名片
Agent 间任务委托弱不是这层核心手 vs 会话 vs 社交
长任务取消/恢复/推送需另建会话内取消原生支持短请求 vs 会话 vs 任务生命周期
Agent ↔ 工具

MCP

连接工具、API、数据源;强调参数、schema、结构化结果。

类比:给 Agent 装上标准化的手
Client ↔ Agent

ACP

客户端 spawn 本地 Agent 子进程,JSON-RPC 2.0 / NDJSON / stdio 驱动完整会话。

类比:把顾问请到工位上对话
本地进程

Agent CLI

会说 ACP stdio 的编码 Agent:一条命令,不是云端对话框。

类比:请来的那位顾问本人
Agent ↔ Agent

A2A

发现、协商、委托、共享任务与上下文;面向独立对等体。

类比:给 Agent 装上社交与协作协议
公开身份

Agent Card

名片:名字、端点、skills、能力特性、认证方式。

类比:A2A 的发现入口,不是本地 SKILL.md
推荐分层,而不是替换
编辑器 / IM 宿主
  └─ ACP:spawn 本地 CLI Agent,stdio 会话(完整编码任务)

外层 Agent
  ├─ MCP:短请求、确定性工具、knowledge_chat
  ├─ ACP:需要把本地编码 Agent 请来工位时
  └─ A2A:长任务、异步协作、独立 Agent 委托

知识库 Agent
  └─ MCP:内部检索、HSCode、合规等业务工具

注意:不要把整个 CLI Agent 包成一次 MCP tools/call
A2A contextId → opaque knowledge_thread_id

场景判断:该留 MCP 还是上 A2A?

0 / 4 正确 · 已作答 0/4
1外层客服 Agent 调用内层知识库的 knowledge_chat:传入 message / conversation_id,返回答案。该用什么?
2你需要让对方 Agent 通过公开名片发现“我会什么、端点在哪、怎么认证”。核心构件是?
3出现跨团队独立部署、长任务取消/恢复、Artifact 交付时,更合理的演进是?
4编辑器要把本地编码 Agent 拉起来做完整会话(提示、流式输出、diff、权限确认)。该用什么?
和相邻概念怎么挂
Tool Calling 是模型怎么开单;MCP 是工具从哪接进来;ACP 是客户端如何与本地 Agent 做完整会话;CLI 是那条可执行命令;Skill 是宿主内如何分层复用流程;Agent Card / A2A 是独立 Agent 如何被发现并协作。换协议解决不了“鞋子和玻璃杯是否同一主题”这类上下文边界问题。
2

技术复现 Demo:亲手观察机制

Demo 复现的是技术机制本身。每个实验都改变可观察状态,并明确显示为什么成功、为什么失败、为什么停止。

01

单次运行控制半径

Harness Lab

emerging

亲手拆掉或补回 Agent 的执行环境,观察它究竟卡在行动、观察、约束还是完成证明。

runHarnessDemotoolsobservabilityconstraints

先切换开关,再运行。失败原因会停在第一个缺失能力。

02

重复运行控制半径

Loop Lab

emerging

调整目标、迭代上限和预算,观察循环是真实收敛,还是在耗尽预算后诚实停下。

runLoopDemobudgetvalidatorstop

试着把预算设得比目标所需更小,看它如何报告预算耗尽。

03

多循环治理控制半径

Graph Lab

proposed

复现“局部指标全绿但外部目标下跌”,再用外部锚点与否决边纠正互相冲突的循环。

runGraphDemoanchorvetoownership

默认状态会复现“局部仪表盘全绿、真实目标下跌”。再逐步接入锚点和否决边。

3

Skill:把能力做成可组合的分层手册

Skill 不是“很长的提示词”,而是一个节省上下文的分层执行系统:先路由,再加载流程,细节用到才读。

一句总纲
一个标准 Skill 真正必需的只有:一个独立目录 + `SKILL.md`。`references/`、`scripts/`、`assets/` 都是按需添加的可选资源,不是必需项。

最小形态 vs 推荐结构

最小 Skill
my-skill/
└── SKILL.md
完整推荐结构
my-skill/
├── SKILL.md
├── agents/openai.yaml
├── scripts/
├── references/
└── assets/
记忆口诀
`SKILL.md` 是操作手册,`references` 是资料库,`scripts` 是工具箱,`assets` 是原材料,Skill 仓库是把这些能力组合起来的工作系统。

三级加载:如何省上下文

第一级 · name + description
始终可见的轻量路由:这个 Skill 做什么、什么时候该触发。
第二级 · SKILL.md 正文
命中后才加载:执行顺序、判断分支、完成标准、何时读取其他文件。
第三级 · references / scripts / assets
某个任务分支需要时才读资料、跑脚本或使用模板,避免一次塞进全部知识。

内容该放哪里?动手分类

0 / 4 正确 · 已作答 0/4
1“Agent 每次都必须先建立可复现的反馈循环,再提出假设。”
2“只有用户问到 Stripe 退款时才需要阅读的退款政策细节。”
3“把 JSONL 账本做 URL 规范化、内容指纹和 added/updated 判定。”
4“生成课程时要复制并改写的单文件 HTML 模板。”

Skill 形态与触发方式

只有 SKILL.md

纯流程型

适合判断和文字流程

主流程稳定,分支查资料

流程 + Reference

如支付政策、术语表

判断 + 确定性自动化

流程 + Script

如诊断循环模板

Skill 定内容,模板给骨架

流程 + Asset

如向导、课件模板

不直接做工程,只指路

路由型 Skill

如 ask-matt / 总入口

多个 Skill 形成生产线

仓库级组合

grill → spec → tickets → implement

Matt 式工程生产线

想法
grill-with-docs
把模糊需求问透
规格
to-spec
写成可执行规格
拆分
to-tickets
变成可交付工单
实现
implement + tdd
按测试驱动推进
审查
code-review
对照标准验收
关系类型例子在 Lab 中的对应
调用关系implement 使用 tdd前沿追踪 Skill 调用账本脚本与课程渲染器
前后阶段to-spec → to-tickets发现核验 → 建图 → 技术复现 Demo → 学习反馈
共享知识多个 Skill 共用 codebase-designHarness / Loop / Graph 共用“控制半径”词汇
优秀 Skill 的标准
目标不是让每次输出完全相同,而是让 Agent 每次遵循相对可预测的过程。本 Lab 的 `track-ai-frontier` 正是按这个标准组织:入口流程在 `SKILL.md`,来源政策与课程规范按需读,账本与渲染脚本稳定执行。
4

判断手感:先训练注意力

不把直觉神秘化:先写下你看见的信号,再展开可观察的参考线索,把隐性判断桥接成显性知识。

01

先看失败落在哪一层

Agent 会写代码,却总要人类复制日志和截图才能继续。你先注意到什么?

02

先看问题是否跨轮出现

手动执行很顺,一到每周自动运行就重复修改、无限重试。你先注意到什么?

03

先看局部绿色是否背离真实目标

速度、质量分、成本指标都变绿,续费率却持续下降。你先注意到什么?

5

深入课程:同一路径的下一站

首页练对比与复现;基础馆把控制半径拆成可通关章节;概念馆把新入库条目挂回同一组节点。馆翼共用顶栏与路径。

6

一手来源

“Graph Engineering”当前标记为 proposed;来源支持定义,不等于证明行业已形成统一标准。