门户首页
教学网站 · 卡片式讲义

AI Agent 融合开发 · 学习平台

44 张讲义页面,按 7 个层次组织: 0 层 调研速查(人机融合全景 + 可信 AI Agent,7 张)· 0.1 层 独立深读(2 篇深读 + 4 篇论文精读)· 第 1 层 教学(按序读懂,25 张)· 第 2 层 总结(跨协议总览,1 张)· 第 3 层 详细参考(按需翻字段手册,3 张)· 第 4 层 工业案例(1 张 · 真实工业级案例讲解)· 第 5 层 专题(5 张 · 专题讲解 / 调研 / 讲座研读 / 工具链讲义)。 点击任一卡片直达;按角色分流请看下方"读者路径"。

生成时间:2026-09-12 · 版本 v0.1(新增 1.7 训练闭环单元 3 讲:训练链路 / 工具能力 / 过程监督,总 40 张)· 2026-09-13 更新:新增专题系列第 1 期(最小 Agent Loop)与 Agent 最小六部分规格页,总 41 张 · 2026-09-15 更新:新增 SWE-agent 执行引擎案例拆解(1.4 组),总 42 张 · 2026-09-15 更新②:0.1 层新增论文精读 2 篇(SWE-bench / SWE-agent,与 MegaFlow / SWE-Universe 组成 4 篇),总 44 张 · 2026-09-16 更新:第 5 层专题新增专题 2《从 SWE-agent 到 mini-swe-agent:架构演进调研》(topics/ 系列,专题单独计数,讲义总数 44 张不变)· 2026-09-17 更新:专题 1 迁入 topics/ 系列并统一编号(原 topic-1 归档 archive/),总 43 张 · 2026-09-18 更新:第 5 层专题新增专题 3《用 UML 拆解两个 Agent 的骨架》(topics/ 系列,专题单独计数,讲义总数 43 张不变)· 2026-09-19 更新:第 5 层专题新增专题 4《驾驭 AI 的软件工程》(topics/ 系列,专题单独计数,讲义总数 43 张不变)· 2026-09-19 更新②:专题 4 织入现场录音稿增量(驾驭目的两件事 / 现场问答实录 / 现场原声补强) · 生成 Agent:DeepSeek Harness (LLM: glm-5.3) · v0.1:MiniMax Code (LLM: MiniMax-M3) · 2026-09-21 更新:1.6 过程分析新增方法入口《如何阅读与分析 AI Agent 的执行轨迹》,总 44 张 · 2026-09-22 更新:新增"高级讲义"独立模块 mde/,收录张天《软件方法学》课程 MDE 章节讲义 2 篇(第一部分 导论 + 第二部分 元建模和建模,原始 247 张幻灯片),单独计数(讲义总数 44 张不变)· 2026-09-22 增量:基于《模型驱动工程-导论与元建模-深度调研报告-2026.09》(31 篇参考文献)升级为 v0.2——第一/二部分追加深读拓展区块(OMG 2025 治理变更、4 标准现状核验、SysML v2 简介、EMF 2.44 生态、KM3 Atlantic Zoo、feature ID + nsURI 设计等),并新增第三部分《前沿拓展(2026)》长讲义(SysML v2/KerML + LLM×MDE + 语言工程新栈 + MBSE),总计 3 篇讲义 · 2026-10-04 更新:第 5 层专题新增专题 5《Agent 轨迹建模:把任意轨迹变成统一模型》(topics/ 系列,工具链讲义+三态交互演示,专题单独计数,讲义总数不变)· 2026-10-04 更新②:全站版本号统一升级为 v0.2(张老师指令,35 页齐升);此后新增内容以 v0.2.x 递增计版本(形如 v0.2.1) · 载体:agentsoft-research-platform teaching-web-platform

全站目录(44 张 · 快速跳转)

全站目录 · 按层 → 按分组 → 点页面直达
右列每个 chip 即一页,点击直达正文;「跳到本层区块」chip 则滚动到本页对应的层区块(含每页导航卡与定位说明)。想先理解各层定位与阅读模式,看下方「概览」;想按角色选路,看「读者路径分流」。
层分组页面(点击直达)
0 层 · 调研速查
跳到本层区块 ↓
人机融合式软件开发(6 张)
可信 AI Agent 开发(1 张)
0.1 层 · 独立深读
跳到本层区块 ↓
深入阅读(2 张)
论文精读(4 张)
第 1 层 · 教学
跳到本层区块 ↓
1.0 PR / GitHub 协作(3 张)
1.1 SWE-bench 领域(3 张)
1.2 协议基础(3 张)
1.3 协议精讲(1 张)
1.4 Agent 实践(3 张)
1.5 插件化架构(4 张)
1.6 过程分析(5 张)
1.7 训练闭环(3 张 · 单元收官)
第 2 层 · 总结
跳到本层区块 ↓
跨协议总览(1 张)
第 3 层 · 详细参考
跳到本层区块 ↓
字段手册(3 张)
第 4 层 · 工业案例
跳到本层区块 ↓
真实工业级案例讲解(1 张)
第 5 层 · 专题
跳到本层区块 ↓
专题讲解 / 调研 / 讲座研读 / 工具链讲义(5 张)

概览

概念模块结构图(点击任一模块跳转对应页面)
AI Agent 融合开发 · 概念模块结构图 概念模块结构(上) + 44 张讲义索引(下) · 按主题聚合 · 点击跳转 七层骨架(中央) 按阅读模式分 0 层 调研速查人机融合 + 可信 · 7 张 0.1 层 独立深读深读 + 论文精读 · 6 张 第 1 层 教学按序读懂 · 25 张 第 2 层 总结跨协议总览 · 1 张 第 3 层 详细参考字段手册 · 3 张 第 4 层 工业案例真实工业级案例讲解 · 1 张 第 5 层 专题总→分→例→实 + 调研 · 研读 · 工具链 · 5 张 选读 再深化 按序读懂 横向对比 案例拆解 讲解与实现 协作与评测线(教学主线 A) 4 节点 Git / GitHub 协作版本控制与协作机制 Pull Request协作核心 · SWE-bench 题源 Benchmark 构造从 PR 到评测题目 SWE-bench 评测schema → S1-S7 流水线 协议与实现线(教学主线 B) 4 节点 协议基础是什么 · 5 件事 对话协议讲义Chat Completions 主线 Agent 心智harness 循环 工程决策ollama 案例 插件化架构形式化 · 4 张 ↓ AI Agent 融合开发(应用层 · 数据 + 训练) MegaFlow 编排底座 10K 并发 / 2M rollout SWE-Universe 数据构造 807K / 75.3% rollout 轨迹 SWE-bench 精读 评测基准 · ICLR 2024 SWE-agent 精读 ACI · NeurIPS 2024 1.7 训练闭环 能力来源 · 工具 · 过程监督 3 讲 · 单元收官 轨迹 闭环:轨迹 → 奖励 → 训练 → 新轨迹 人机融合六章范式→需求→设计→实现→测试→维护 可信 AI Agent 开发风险 · 评测 · 纵深防御 两篇独立深读测试价值悖论 · 八位先驱 参考与协议手册Schema 总结 + 字段手册 44 张讲义索引(按主题模块聚合 · 点击任一条跳转)M1 基础(4)· Git / GitHub 协作· Pull Request· Benchmark 构造· SWE-bench 是什么M2 评测(3)· data schema· 评测流程· Chat CompletionsM3 协议(7)· 协议基础· 5 件事· 消息结构· 对话协议讲义· Schema 参考· Anthropic· OpenAI RespM4 Agent(8)· Harness 循环· 插件化总览· Temporal· Spatial· Unified· Ollama 案例· 最小六部分· SWE-agent 执行引擎M5 范式(7)· 第 1 章 范式· 第 2 章 需求· 第 3 章 设计· 第 4 章 实现· 第 5 章 测试· 第 6 章 维护· 可信 Agent 开发M6 参考(2)· 八位先驱· 测试价值悖论应用层(4)· SWE-bench 精读· SWE-agent 精读· MegaFlow· SWE-UniverseM7 过程分析(5)· 八阶段模型· PRA 过程评分· step 分类学· 点+线与 Linting· 如何读轨迹(方法入口)M8 训练闭环(3)· 训练链路(五阶段)· 工具能力(训练+注入)· 过程监督(反哺训练)第 5 层 专题(5)· 最小 Agent Loop· SWE-agent → mini 演化· UML 架构建模· 驾驭 AI 的软件工程· Agent 轨迹建模可点击(跳转)阅读/依赖顺序主题归属/支撑蓝紫=基础/协议 · 青绿=范式/参考/应用层
图 1 · 教学网站概念模块结构——上部抽象概念模块(7 层骨架 + 2 教学主线 + 4 支撑 + AI Agent 融合开发应用层 + 1.7 训练闭环)+ 下部横向 44 张讲义索引(按 8 主题模块 + 专题 + 应用层聚合)。点击任一模块或讲义条目跳转。
44
讲义页面
14
主题分组
3
主流协议
7
内容层次
高级讲义 · 独立模块

MDE 高级讲义 · 张天《软件方法学》课程讲义

与按"层"组织的 44 张讲义并列的独立模块——专讲模型驱动工程(MDE)这条"提高抽象层次"的方法学主线。从 OMG 四标准(UML/MOF/XMI/CWM)与 MDA 框架的历史动因,到 MOF / Ecore / KM3 三大主流元-元模型的工程取舍,铺清"用模型构造软件"的整套方法论。

适合想理解"模型如何成为一等软件制品"的读者;实验部分将在未来单独扩展(基于 Ecore / KM3 构造领域 DSL 元模型的 IDE 实战)。当前收录 3 篇长讲义 + 实战专题 5 讲:① 导论 ② 元建模和建模 ③ 前沿拓展(SysML v2/LLM×MDE/语言工程新栈);第四模块实战专题(2026-10 新增)用本仓两套轨迹元模型(19-EClass / 13-EClass)与 18 源真实轨迹,把理论跑成活案例。

读者路径分流(按角色选路)
角色目标推荐路径
第一次来 系统了解本仓在做什么 第 1 层按序读:1.0 PR/GitHub → 1.1 SWE-bench → 1.2-1.3 协议 → 1.4 Agent 实践,再扫第 2/3 层
调研派 看"LLM + 软件工程"研究全景 0 层 7 张(人机融合全生命周期 6 张 + 可信 AI Agent 1 张)+ 0.1 层 2 张深读(Agent 测试价值悖论 / 八位先驱立场光谱)+ 4 篇论文精读(SWE-bench / SWE-agent / MegaFlow / SWE-Universe),再进教学层
动手派 直接写一个 Agent 「SWE-bench 评测流程」+「协议讲义」+「Agent 心智」3 张——够写最小 harness 并理解评测链路
查询派 确认某个字段是什么意思 直接跳第 3 层——3 个协议各一页字段手册,按字母序查;跨协议对字段先看第 2 层翻译词典
协作派 本仓项目成员入职 1.0 三张(理解题源)+ 1.1 三张(理解评测对象)+「Agent 心智」(S1-S7 ↔ harness loop)+「工程决策案例」(ollama 三 runner 设计逻辑)
构造派 自己造一道 benchmark 题 「从 PR 构造 Benchmark 题目」——5 步流程 + 7 个常见坑 + 10 项审查清单
避坑派 跨厂商协议兼容 「工程决策案例」§1 L1/L2/L3 三层叠加 + §2 三类失败模式——读完知道"为什么 ollama 不传 tools 字段"不是偷懒
本科生派 一次实验课入门,产出实验报告 5+1 步线路图(每步 5–15 分钟,总计约 1 小时,仅用 3 张讲义)——看一道题→看一次解题→学判分规则→理解 Agent 心智→范式串联→课堂收口
概念模块 + 讲义索引(左侧抽象概念 + 右侧 44 张讲义映射)
层定位包含阅读模式
0 层 调研速查(研究性) 人机融合式软件开发 6 张(范式 → 需求 → 设计 → 实现 → 测试 → 维护)+ 可信 AI Agent 开发 1 张(风险 / 评测 / 纵深防御)= 7 张 选读——想理解"LLM + 软件工程全生命周期"研究全景时读,不强制
0.1 层 独立深读(Featured) Agent 测试价值悖论 + 计算机先驱对 AI 生成代码的立场(深读 ×2)+ SWE-bench / SWE-agent / MegaFlow / SWE-Universe 论文精读 ×4 = 6 张 读完 0 层对应章节后的再深化,独立成篇
第 1 层 教学(按序读懂) PR/GitHub 3 + SWE-bench 领域 3 + 协议基础 3 + 协议精讲 1 + Agent 实践 3 + 插件化架构 4 + 过程分析 5 + 训练闭环 3 = 25 张 从头读到尾,建立完整心智模型(先懂"协作基础"→"被评估的对象"→"评估用的工具"→"动手做 Agent"→"分析 Agent 的过程")
第 2 层 总结(跨协议总览) 三协议 Schema 全景总结 = 1 张 读完教学后做横向对比(Chat ↔ Responses ↔ Messages)
第 3 层 详细参考(按需翻) 3 个协议各 1 张完整字段手册 = 3 张 开发时查字段,按字母序检索
第 4 层 工业案例(真实工业级) SWE-agent 执行引擎源码级拆解(NeurIPS 2024 论文 + v1.1.0 代码)= 1 张 概念与规格读完后看真实实现,抽象机制逐行指认到一线代码
第 5 层 专题(讲解 / 调研 / 讲座研读 / 工具链讲义) 最小 Agent Loop 专题(总 → 分 → 例 → 实)+ SWE-agent → mini-swe-agent 架构演进调研 + UML 架构建模 + 驾驭 AI 的软件工程(讲座研读)+ Agent 轨迹建模(工具链讲义+交互演示) = 5 张 按「做」组织——跟着完整路径把概念变成能跑的代码;或以对照实验读透架构演进规律
全站高频缩写速查(各页正文首次出现处均有展开)
缩写全称一句话解释
AIArtificial Intelligence,人工智能本站语境多指用大模型自动完成软件工程任务
Agent智能体能自主多步调用工具/模型完成任务的程序(= harness 循环代码 + LLM)
LLMLarge Language Model,大语言模型通过 HTTP API 以 JSON 收发消息的大模型服务
APIApplication Programming Interface,应用程序接口程序之间约定的调用方式
JSONJavaScript Object Notation人类可读的文本数据格式,LLM 协议的事实标准
SWE-benchSWE(Software Engineering 软件工程)+ bench(benchmark 基准测试)用真实 GitHub issue 评测代码 agent 的软件工程基准
PRPull Request,拉取请求GitHub 上"请你合并我的代码"的请求,SWE-bench 的题源
F2P / P2PFail-to-Pass / Pass-to-Pass评测契约:修好 bug 的测试 / 不被破坏的回归测试
APRAutomated Program Repair,自动程序修复用程序/模型自动定位并修复代码缺陷
AI-DLCAI-Driven Development Lifecycle,AI 驱动的开发生命周期IBM 2025 提出的"以 AI 为核心参与者"重设计 SDLC 的方法论
SDLCSoftware Development Lifecycle,软件开发生命周期需求→设计→实现→测试→部署的全流程
SSEServer-Sent Events,服务器单向推送LLM 流式输出(打字机效果)的传输方式
Schema模式定义约定请求/响应里有哪些字段、什么类型、什么语义

0 层 · 调研速查(7 张 · 人机融合 + 可信 AI Agent)

0 层 · 人机融合 + 可信 AI Agent 调研速查
本层是研究性内容(不是"教学"也不是"参考")——把 2026 年 9 月的两份调研报告(人机融合式软件开发 6 张 + 可信 AI Agent 开发 1 张)浓缩成 7 张速查卡。读完后对 LLM + 软件工程全生命周期与 Agent 可信风险有"打过地基"的认知,再进教学层会更顺。不强制读,但对想理解"为什么本仓这么设计"的人必读。
调研 · 3 卡 + 1 数据点

范式迁移 + AI-DLC + 3 种协作模式

软件工程正从"自动化"迈向"智能化 + 人机共生"——AI 是贯穿全生命周期的协作主体。讲透范式本质(不是"AI 替代人",是"AI 执行 + 人治理")、AI-DLC 4 大原则、3 种可切换协作模式(Driver-Navigator / Review-First / Specialist)。

调研 · 2 用例 + 3 步 + 3 挑战

需求工程:AI 加速但受限于可解释性

需求工程是人机融合起步最慢的阶段——4 类高频用例已成熟,但研究占比 <10%,且可解释性即采用壁垒(受监管行业仅 16.1% 组织把 AI 推进到试点之外)。

调研 · 2 活动 + ADD + 3 挑战

分析与设计:方法化引导保质量

设计阶段 AI 的"自由度"最大也最危险——答案不是"限制 AI",是给它方法:ADD(Attribute-Driven Design)引导的 LLM 架构设计,把方法变成 prompt 的一部分。心法:"stay the architect, let LLM be the labor"。

调研 · 3 层 + PDD + 5 数据 + 3 挑战

实现:最成熟但主观-客观有落差

实现是人机融合渗透最深的环节(综述占 70%+),但藏着主观-客观生产力落差——开发者感觉变快,客观 commit 指标没显著变。3 层形态(补全 / 对话 / 自主 Agent)+ PDD(Prompt-Driven Development,提示驱动开发)方法论 + 5 个数据点。

调研 · 3 波 + Pyramid 2.0 + 价值悖论 + 3 挑战

测试:Test Pyramid 2.0 + Agent 测试价值悖论

测试是人机融合商业最活跃的领域——3 波演进、覆盖 59.6% vs 38.2%、9× 提速;但 2026 年新论文揭示Agent 测试价值悖论:对自主修 bug 的 Agent,改变测试量对任务解决率无统计显著影响。

调研 · 3 主线 + 4 审查数据 + 3 新债 + 4 治理原则

维护 + 治理:APR + 新债型 + 责任框架

维护消耗 50-70% 工程资源,收益最大 + 风险也最大:AIR 仓库级自主修复 87.1%,但 3 种新型技术债(GIST / LLM-SATD / PromptDebt)+ 质量稀释悖论 + 信任缺口并存;4 条治理原则 + 3 条责任规则收尾。

调研 · 5 部分 + 6 框架 + 4D-12 指标 + 五层防御栈

可信 AI Agent 开发:风险、评测与纵深防御

Agent 的可信问题新在多步自主轨迹——记忆投毒、目标劫持、奖励作弊(o3 实测 30.4%)等单轮 LLM 时代不存在的失败模式。六套维度框架与 4 维 12 项可靠性指标负责量化,五层纵深防御栈 + 贯穿评测闭环负责兜底。

0.1 层 · 独立深读(6 张 · 2 篇深读 + 4 篇论文精读)

0.1 层 · 独立深读(6 张 · 2 篇深读 + 4 篇论文精读)
这一层放值得重点传播的独立成篇内容——深读篇拆开讲一个反直觉的发现 / 值得辩论的立场,精读篇完整拆解一篇与本项目直接相关的系统 / 数据论文(原载 teaching-lecture-notes,本版迁入主站)。读 0 层对应章节后到这里会有"再深化一遍"的体验,不读也完全 OK。
深读 · 14 段 · 1 时序图 · 4 条实操 · 3 个开放问题

Agent 测试价值悖论:写测试不解决 bug

SWE-bench Verified 上 6 个 SOTA LLM 的 Agent 轨迹分析,3 个反直觉事实:已解决 vs 未解决任务写测试频率相近、Agent 偏好 print 而非断言、测试量对解决率无统计显著影响——从"质量门"到"反馈通道"的范式转移,附 4 条实操 + 3 个开放问题。

深读 · 8 张人物卡 · 立场光谱 · 4 道讨论题 · 全程事实核查

计算机先驱如何看待 AI 生成代码:立场光谱与教学解析

从 C++ 之父到 Redis 之父,八位先驱对 AI 代码的立场构成一条"严守核心系统 ↔ 拥抱效率"光谱;所有言论对照原始访谈 / 论文 / 博客逐条核查(核实属实 ×2 · 部分属实 ×5 · 未获证实 ×1)——"核查大佬语录"本身就是第一课。附理解债务理论 + 4 道课堂讨论题。

论文精读 · arXiv 2310.06770 · ICLR 2024 · 三阶段构造管线 · F2P/P2P 合约

SWE-bench:2,294 个真实 GitHub Issue 定义的评测合约

从约 90,000 个 PR 三阶段过滤出 2,294 个任务实例;判分不读补丁、只跑测试——F2P 全过 ∧ P2P 全过。2023 年底最好模型(Claude 2)仅解 1.96%;本站评分模块 answer_evaluator 与数据仓库的源头。

论文精读 · arXiv 2405.15793 · NeurIPS 2024 · ACI 四原则 · 消融逐条验证

SWE-agent:给模型而非人设计的计算机接口(ACI)

同一个 GPT-4 Turbo:裸 shell 11.00% vs 专门接口 18.00%(Lite);全量 12.47% 刷新最好成绩。消融表证明限制信息量反而更好:全文件视图 ↓5.3、仿 IDE 翻页搜索比没有搜索还差。讲义「SWE-agent 执行引擎」的论文侧。

论文精读 · arXiv 2601.07526 · 三服务架构 · 2 结构图 · 关键数据逐条对照

MegaFlow:大规模分布式 Agent 训练编排系统

Model / Agent / Environment 三服务解耦 + 阿里云 ECS 编排——32% 成本降低 · 10K 并发 · 2M+ rollout execution · 1024 并行 envs;作为 SWE-Universe 的底层基础设施,为下游 80 万环境构建 + 50 万轨迹生成铺路。

论文精读 · arXiv 2602.02361 · 33.3M PR → 807K 实例 · 4 图拆解流水线

SWE-Universe:百万级真实可验证 SWE 环境

Building agent(mini-sweagent + Qwen-Next-80A3)+ iterative self-verification + in-loop hacking 检测——从 33.3M GitHub PR 构造 807,693 多语言实例,跑出 50 万轨迹 / 30B tokens,让 Qwen3-Max-Thinking 在 SWE-Bench Verified 达到 75.3%。

第 1 层 · 教学(25 张 · 按序读懂:协作基础 → 被评估对象 → 评估工具 → 动手实践 → 形式化 → 过程分析 → 训练闭环)

教学层 · 1.0 协作 + 1.1 领域 + 1.2-1.3 协议 + 1.4 动手 + 1.5 形式化 + 1.6 过程分析 + 1.7 训练闭环
从"GitHub PR 是什么"到"用协议写 Agent"再到"分析 Agent 的解题过程"——25 张页面走完完整学习路径。前 3 张讲 PR/GitHub 协作基础,接下来 3 张讲 SWE-bench 领域基础,中间 4 张讲协议与 Schema,2 张讲怎么用协议做 Agent,4 张讲插件化 Agent 架构的形式化基础(选读),5 张讲轨迹分析与过程评估(本仓独有的差异化主题:读轨迹 → 评过程 → 诊问题 → 立方法论),收官 3 张讲训练闭环——能力从哪来、工具怎么用、分析到哪去,把全站从"评测视角"升级为"评测 ↔ 训练闭环视角"。
1.0 · PR / GitHub 协作基础(3 张 · 必读)
理解 SWE-bench 题源之前,先理解"题目从哪儿来"——这是本仓 SWE-bench 题目的"上游"。
基础 · 7 章 + 7 表 + 3 代码

Git vs GitHub:理解两者的根本区别

Git 是版本控制工具(管本地历史),GitHub 是其上的托管协作服务(PR / Issue / Review / Actions)——7 个核心差异 + 3 个类比,理解 PR 与 SWE-bench 题源的前提。

基础 · 7 章 + 7 表 + 4 代码

GitHub Pull Request:设计与使用

GitHub 的核心协作机制——7 个组件 + 5 步生命周期 + 3 种合并方式 + 6 条最佳实践。PR 是 SWE-bench 题目的"题源",每条题目都来自一个真实 PR。

基础 · 7 章 + 6 表 + 4 代码

从 PR 构造 Benchmark 题目:SWE-bench 题目构造工程

怎么把一个真实 GitHub PR 转成 SWE-bench 题目——5 步构造流程 + 7 个常见坑 + 真实例子 django__django-10914 walk-through + 10 项题目审查清单,读完你就能自己构造一道题。

1.1 · SWE-bench 领域基础(3 张 · 必读)
理解本仓在做什么之前,先理解"被评估的对象"——这是本仓整套工具链的"目标"和"度量"。
领域 · 8 章 + 12 表 + 6 代码

SWE-bench 入门:背景、特点与任务定义

Princeton 提出的、用真实 GitHub issue 评测代码 LLM 的 benchmark——本仓评估系统的地基。任务定义、F2P/P2P 双向验证、6 个变体(Lite / Verified / Pro 等)与 HumanEval 类 benchmark 的关键差异。

领域 · 7 章 + 7 表 + 5 代码

SWE-bench 数据长什么样:Schema 详解与实例

jsonl 每行一条 instance——9 个核心字段逐个讲清,配真实实例 django__django-10914,最后讲本仓零依赖加载器(load / get / filter_by_repo)怎么用,读完就能自己加载、过滤、统计数据。

领域 · 8 章 + 8 表 + 4 代码

SWE-bench 怎么用:评测流程与本仓 S1-S7

5 步评测流程(拉 base → pre-fix → apply patch → post-fix → 判分)+ 3 层 Docker 镜像机制 + 本仓 S1-S7 流水线怎么把评测契约工程化——读完就能自己跑一遍评测。

1.2 · 协议基础(3 张 · 入门必读)
在比较"三种协议哪家强"之前,先把基础钉死——协议是什么 + 5 件事 + 消息结构层。
基础 · 1 讲 + 0 实验

LLM 交互协议基础:协议是什么

大模型的"对话协议"到底是什么——客户端与 LLM 推理服务之间预先约定的一套消息结构。建立底层定义后,再看一次完整推理回合要装下的 5 件事与两层拆解(消息结构 vs 传输)。

基础 · 5 卡 · 1 卡 1 件事

LLM 协议 5 件事专章:1 卡 1 件事

把 5 件事(请求骨架 / 工具调用 / 流式 / 状态 / 终止)各展开成独立卡片——每张配 JSON 示例 + 关键陷阱。可以从任何一张切入读,不依赖顺序。

基础 · 4 讲 + 0 实验

消息结构层:JSON 为什么是事实标准、变体差异、何时该用 Protobuf

JSON 不是一种格式,是一族格式(标准 / JSONL / JSON5 / JSON Schema / Stringified JSON)——摸清边界,再回答"什么时候该离开 JSON"(答案是 Protobuf,但 LLM 公开 API 永远不用)。

1.3 · 协议精讲(1 张 · 深入 Chat Completions)
协议基础讲"5 件事",协议讲义讲"用 Chat Completions 写 Agent 的全攻略"——以 Chat Completions 为主线,对照 Responses 与 Messages。
讲义 · 7 篇 + 附录

大模型对话协议讲义:手写 Agent 的第一课

手写 Agent 的第一道坎不是循环,而是协议——消息长什么样、tool_calls 怎么接、流式怎么拼。以 Chat Completions 为主线,最后落到一份手写 Agent 协议 Checklist(10 条)。

1.4 · Agent 实践(3 张 · 动手)
协议讲完了,怎么用?前者是心智模型,后者是案例复盘。
心智模型 · 7 讲 + 1 可运行

理解 Agent 开发过程:harness + LLM 的任务循环

所谓 Agent,就是一段循环代码(harness)+ 一个外部大模型(LLM)协同工作的产物——从 30 秒 LLM API 入门到本仓 S1-S7 真实例子,把"AI 做事"黑盒拆开,附 30 行可运行 harness。

规格 · 6 部分 + 1 修正伪代码 + 1 数据流图

Agent 程序的最小结构:六个部分

以 OpenAI 兼容格式为唯一主线的最小 Agent 结构规格——工具清单 / 系统提示词 / 对话历史 / 模型调用器 / 响应解析与调度 / 主循环六部分逐一拆解,每部分对应到具体 API 字段,附逐行修正标注的主循环伪代码(json.loads 参数解析、空列表判定、错误回传)与六部分 ↔ harness 六组件映射表。

Case Study · 6 讲 + 3 图 + 1 决策树

OLLAMA 本地模型不支持 tool_call 的根因与等效替代方案

本仓 ollama 三个 runner 均不传 tools 字段——不是偷懒,而是 L1 协议层 + L2 兼容层 + L3 模型能力层三层叠加 + 任务形态分析后的工程结论。含 4 类失败模式实测与 4 场景选型决策树。

1.5 · 插件化 Agent 架构(4 张 · 形式化基础 · 选读)
从一篇 2026 年形式化论文(北大 + DeepSeek-AI)出发,给"基于插件的 agent 架构"补上形式化基础:Temporal + Spatial Composability + Context Paradigm + Cordis 落地。
形式化 · 3 卡(3 概念 / 2 维度 / 1 痛点)

基于插件的 Agent 架构:为什么 + 是什么

Agent 是运行时进程,"插件化"说的是这个进程的组装方式:每个能力都是独立可插拔单元,运行时可演化,依赖透明。本系列 4 张从形式化论文出发拆解这套骨架的设计哲学。

形式化 · 2 卡(1 公式 + 1 时序图 + 1 伪代码)

Temporal Composability:组件可进可出(Revertible Effects)

时间维度 = 组件卸载时能否完全撤销它的所有副作用——Revertible Effects:每个 effect 配对一个显式 inverse,runtime 自动按 LIFO 顺序撤销。

形式化 · 2 卡(1 时序图 + 3 反应类型)

Spatial Composability:依赖可声明可反应(Reactive Coeffects)

空间维度 = 组件间依赖能不能显式声明 + 反应式协调——Reactive Coeffects:依赖变化时自动通知,3 种反应(activate / deactivate / neutral),以 uid(不是 value)判定变化。

形式化 · 4 卡(1 范式 + 1 API + 1 案例 + 1 连接)

Context Paradigm + Cordis 落地 + Agent 架构连接

把 temporal 和 spatial 合起来——Context Paradigm:effect 与 coeffect 统一成一个 context type。落地看 Cordis 5 个核心 API、Koishi 4000+ 插件案例,最后连回本仓 4 brand adapter 架构。

1.6 · 过程分析(5 张 · 轨迹分析与过程评估 · 本仓独有)
Agent 做完题之后,怎么读它的轨迹、评它的过程、诊它的问题 step、立方法论框架——方法入口 + 四讲递进,全部配本仓真实实验数据(44 条实验、5940 轨迹事件、49 条消融洞察)。
过程分析 · 方法入口

如何阅读与分析 AI Agent 的执行轨迹

进入四讲之前的"怎么读"方法页:3 种轨迹载体选读指南(trajectory_events 表 / sidecar JSONL / ecore 元模型视图,按需各取)+ 三遍阅读法(概览 5 分钟 → 定位 10 分钟 → 深读 15 分钟,把读轨迹从 O(N) 扫读降为 O(1) 定位)+ 30 分钟实训(T1 五问初读 / T2 两遍对比 / T3 写一页纸分析)——不重复四讲内容,只负责把你领进门。

过程分析 · 4 讲 + 2 图 + 弯路库

读一条 Agent 轨迹:八阶段解题过程模型

对 5 个真实任务约 1700 行推理日志做行为序列抽取,提炼出 S0 元决策 → S7 交付的八阶段结构:每个阶段由谁控制(Prompt 骨架 vs Agent 自主)、两个迭代循环(S3 环境修复 / S6→S4 验证回退)、弯路恢复四元组——读轨迹的地图。

过程分析 · 5 维量表 + 4 否决项

过程可靠性评估(PRA):给 AI 的工作过程打分

harness 只答"结果对不对";PRA 答"即使这次对了,方法论值得信任吗"——100 分五维(复现先行 10 分 / 验证真实性 25 分 / 约束遵守 20 分…)+ V1-V4 一票否决 + 过程×结果二维矩阵。附 astroid-1196 示范评分 98/A 与工具版七维。

过程分析 · 4 分类 + 5 工具 + 消融数据

问题 step 分类学:无用 · 冗余 · 低效 · 错误

两篇论文 7 个标签收敛成用户视角四分类;LLM 判冗余的步级 F1 只有 24.88%——所以启发式优先 + LLM 兜底 + 双写审计。配真实消融案例:同一条 144 步轨迹 5 种判定,冗余率从 0.7% 到 42.4%。

过程分析 · 5 层栈 + 8 条规则

点 + 线:过程评估方法论与 Trajectory Linting

五层评估栈(任务级 / 点级 / 流程级 / 线级 / 形式层)+ LoopsBench 的 25.00% 线级天花板与 loop 3 倍差 + Trajectory Linting 8 条机械规则——在真实 45 步轨迹上抓出 75% 形式问题,毫秒级、零 LLM。

1.7 · 训练闭环(3 张 · 能力从哪来,分析到哪去 · 单元收官)
前 20 张站在评测者视角:题目从哪来、怎么判分、怎么读轨迹。这 3 张补上视角的另一半——被评测的 agent 能力是怎么训出来的,以及过程分析的结果最终去了哪里:宏观训练链路 → 工具能力的训练/注入双重来源 → 过程监督把轨迹变成训练信号,收官于「评测 → 分析 → 构造 → 训练」闭环图。全单元执行四级证据分级(① 官方 · ② 论文 · ③ 逆向/工程博客 · ④ 新闻)。
训练 · 5 阶段链路 + 2 修正 + 1 工业配方

编程能力是怎么训出来的:从预训练到过程强化

五阶段链路(预训练 → mid-training → SFT → RL → 蒸馏)逐段标注数据、奖励与能力产出;Nebius 三段数字(11.4 → 20.5 → 39.0)与 SWE-smith 轨迹 scaling 曲线做实证;并用 pass@k 与 Spurious Rewards 两条证据链修正「RL 创造能力」的流行误解——RL 是分布收敛,不是能力注入;轨迹是资产。

打开本页 下一篇:工具能力 arXiv 2501.12948 · 2508.03501 · 2603.00729
机制 · 2 官方证据 + 1 边界表 + 1 反直觉机制

工具使用能力:训练与注入的双重来源

「模型怎么知道有哪些工具」的机制层答案:tools 字段 → 服务端 special system prompt(工具定义注入在用户 system prompt 之前①);训练学「填表」、注入给「菜单」的归因表;defer_loading 的反直觉真相(控制进不进上下文,不控制发不发送);30–50 个工具后选择准确率下降——最后落到本仓轨迹记录的三处缺口。

打开本页 姊妹:tool_call 工程决策 doc: Anthropic Tool Use / Tool Search
出口 · 4 档密度谱 + first-error + 3 落点

过程监督:让轨迹分析反哺训练

信用分配难题与三副药;奖励密度谱四档(ORM → 执行反馈 → PRM → 人工标注)与「判据来自环境天然抗黑客」;first-error 标注的自动推断路径;reward hacking 阴影下过程可信的价值——收官图把全站 44 张在「评测 → 分析 → 构造 → 训练」闭环上各归其位,并给出本平台三个可执行落点(pass@k 一致性 / reward-hacking detector / 六模块信号 → PRM 燃料)。

打开本页 前置:过程分析四讲 arXiv 2505.10978 · 2502.12130

第 2 层 · 总结(1 张 · 跨协议总览)

总结层 · 跨协议横向对比
读懂单协议后,到这一层做横向对比——OpenAI Chat Completions / OpenAI Responses / Anthropic Messages 三套协议的 Schema 全景 + 翻译词典。
参考 · 5 篇 Schema + 翻译词典

三大 LLM 对话协议 Schema 详解

三套协议的完整 Schema 定义、字段语义与往返示例,并附三协议"翻译词典"——既是教学的总结(讲完 3 协议后横向回看),又是参考的入口(查字段先看摘要,再跳第 3 层详细版)。

第 3 层 · 详细参考(3 张 · 字段手册)

详细参考层 · 字段手册(按需翻)
每个协议一页的"完整 schema 字段参考"——10 章统一结构,适合想确认一个字段到底是什么意思、能不能传、传了会怎样时翻阅。不按序读,缺什么查什么。
附录 · 10 章 + 16 表 + 11 代码

OpenAI Chat Completions API · Schema 完整参考

POST /v1/chat/completions 的完整字段参考——~25 个请求字段、5 种 message role、finish_reason 5 个值、流式 6 条规则,末章按字母序速查。

附录 · 10 章 + 14 表 + 10 代码

OpenAI Responses API · Schema 完整参考

POST /v1/responses 的完整字段参考——OpenAI 新一代协议(GPT-5 起新模型只在它上提供),三大差异:判别联合 item、服务端状态、推理链加密续接。

附录 · 10 章 + 17 表 + 12 代码

Anthropic Messages API · Schema 完整参考

POST /v1/messages 的完整字段参考——三大差异:system 是顶层参数、max_tokens 必填、tool_result 嵌在 user 消息里;工具入参已是对象。

第 4 层 · 工业案例(1 张 · 真实工业级案例讲解)

第 4 层 · 工业案例(真实工业级案例讲解)
前面各层把概念、规格与协议讲清,本层拿真实工业级开源实现做标本——把抽象机制逐行指认到一线代码里。第一个标本:Princeton SWE-agent(NeurIPS 2024 论文 + v1.1.0 源码)。
Case Study · 8 节 + 2 图 + 1 消融表

SWE-agent 执行引擎拆解:一次任务如何走完 N 轮对话

以 Princeton SWE-agent(NeurIPS 2024 论文 + v1.1.0 源码)为标本的源码级拆解——一个 while 循环撑起的主循环、每轮"恰好一次模型调用 + 恰好一个动作"的四拍结构、history 三模板与 10 万字符观测截断、submit 哨兵终止(15 行 bash)与 12 种 exit_status 护栏,附 ACI 消融实验与 15 行最小伪代码重建。

第 5 层 · 专题(5 张 · 专题讲解 / 调研 / 讲座研读 / 工具链讲义)

第 5 层 · 专题(总 → 分 → 例 → 实,把概念变成能跑的代码;或以对照调研读透演进规律;或以讲座研读建立学科级理论框架)
前三层按「读」组织,本层按「做」与「深挖」组织:每个专题先用一张图把概念体系讲清楚(总),再逐个展开子概念(分),跟着完整例子走一遍(例),最后给出工具极简的完整实现(实);调研型专题则以一组可量化的对照实验把一条演进脉络讲透;讲座研读型专题把一场前沿讲座整理为观点可归属、数据可溯源的教学材料。
专题 1 · 四篇结构 + 1 总图 + <90 行实现

最小化 Agent Loop:亲手造一个简化版 Code Agent

像 Claude Code 的产品拆开是一个朴素的循环——本专题按总 → 分 → 例 → 实四篇展开:一张总框图讲清六步骤概念体系,六卡逐个展开(干什么 / 为什么 / 没有它会怎样),一个改端口任务的三轮消息实录,最后是不足 90 行、只有读/写两个工具的最简完整实现——例与实用同一任务互为镜像,附与 Claude Code、mini-swe-agent 的三列对照。

专题 2 · 调研报告 · 十章 + 38 条一手来源 · 数据核查至 2026-09

从 SWE-agent 到 mini-swe-agent:以大模型能力跃迁为棱镜的架构演进调研

同一团队相隔 14 个月的对照实验:2024 年 NeurIPS 论文用数千行 ACI 工具集证明"接口设计至关重要"(GPT-4 Turbo 11.00% → 18.00%),2025 年又用约 100 行 bash-only 的 mini-swe-agent 证明"大部分接口设计已不重要"(Claude Sonnet 4 约 65%)。本专题把这条演进线讲透——完整 9 行消融表、四维度复杂度迁移、机制归因、性能-成本-复杂度三角,并用 2026 年最新证据(mini v2、官方 Bash Only 子榜、Live-SWE-agent 登顶、Verified 退役与 Pro 审计反转)修正并延伸核心命题:架构复杂度是模型能力缺口的函数。

专题 3 · 七张 UML 结构图 + 两张行为图 · 源码反向建模 · 指令书 v3.0

用 UML 拆解两个 Agent 的骨架:mini-swe-agent 与 SWE-agent 的架构建模

把 mini-swe-agent 与 SWE-agent 的源码反向拆成七张 UML 图——包图 / 类图 / 顺序图 / 状态机图 / 组件图 / 泳道活动图 / Hook 织入时序图,看清同样是「Agent 主循环」,在两个项目里为何会长成完全不同的样子;最后用两张行为图直击「结构相似、行为差异」的本质。全程证据可溯(evidence.csv 逐图锚点),配套 UML 建模指令书 skill 可复用于任意 code agent。

专题 4 · 讲座研读 · 1 条公式 + 7 维框架 + 10 项溯源数据 + 4 个思考题

驾驭 AI 的软件工程:可信性判断、双重驾驭与智能化工程师培养

完整研读南京大学李宣东教授 2026 年 9 月的同名讲座——核心公式 (AI 预测 + 可信性判断)× 迭代 = 决策、八字诀「先解后证、解证分离、解证迭代」、七维框架与本科三阶段培养路径;全部 10 项外部数据经独立信源溯源(判断等级逐条标注,效率悖论、信任缺口、2026 年安全事件),并以「难解易证 / 难解难证」判据把「AI 会不会取代程序员」转化为可判定的结构问题;最后落到本平台的工程承接:可信性判断 = F2P/P2P 结果验证 + PRA 过程评估 + 关键节点人工确认。

专题 5 · 工具链讲义 · 19 源认源 · 13 EClass · 四态判档 · 三态交互演示

Agent 轨迹建模:把任意轨迹变成统一模型

19 种 Code Agent 各有各的落盘格式——做轨迹研究的第一步是认出它是谁,再把它回译成统一的元模型实例并诚实判档。本专题把「认源 → 回译 → 合模 → 四态判档」这条完整工具链拆开讲透:多信号打分为什么宁可拒答不可错认、判档怎么不说谎、隐私怎么长成架构而不是补丁;页内附可直接点的三态演示(数据来自真实作业、零后端零网络请求),并给出本机一键复现入口(bash scripts/start_tmr.sh start)。

维护指引:新增页面请按 7 层定位——0 层调研速查(研究性速查卡)/0.1 层独立深读(值得重点传播的单篇深读)/第 1 层教学(按序读的讲义)/第 2 层总结(跨协议横向对比)/第 3 层详细参考(按需翻字段手册)/第 4 层工业案例(真实工业级案例讲解)/第 5 层专题(总 → 分 → 例 → 实,专题讲解与实现)——选择合适的 super-section 放入。复制 _shared/page-template.html 起手,样式全部复用 _shared 令牌与组件,生成后跑 python3 _shared/verify.py <page>.html 通过;统计数字(页面数 / 分组数)随收录变化同步更新。入口卡片保持紧凑导航卡形态(标题 + 一句话定位 + chips),不放知识点清单——详细内容留给各页面自身;全站目录表(#site-toc)与概念图(支撑卡 + 讲义索引)须同步收录新页面;左侧页面目录导航由 _shared/toc-sidebar.js 扫描 section 自动生成(模板已含引用),无需手工维护。