看懂 Agent 如何解题,只要 5 步
面向第一次接触 code agent 评测的本科生—— 5 步走通"看一道题 → 看一次解题 → 学判分规则 → 理解 Agent 心智 → 回顾串联", 加 1 步课堂收口。围绕同一道真实题贯通,全程仅用 3 张讲义。 每步 5–15 分钟,总计约 1 小时,可分两次完成。
进度
已完成 0 / 6 步 · 进度自动保存到本机 localStorage
- 滚读讲义站首页"全站目录"和"读者路径分流"两块,认 5 层组织
- 新开公网实验平台首页,认出 6 个公网可见导航项(实验总览 / 数据集 / 已做实验 / 过程分析 / 模拟执行 / 使用指南)——作业管理 / Agent 配置 需 admin 权限,你看不到属于正常
- 默念一遍:「讲义站学原理,平台看真东西」
这一站没有"题"可做——是认知锚定。第 1 步起开始动手。
对一对参考答案
这一步骤没有任何"对错"——它只检测你有没有在两个站之间建立方向感。如果你打开平台时能找到 6 个公网可见项中的任意 3 个,就算完成。
- 打开平台数据集页,搜索
django__django-14915,点开该题 - 读 3 块内容:issue 原文(用户报的问题)、FAIL_TO_PASS(修好之前会失败的测试)、PASS_TO_PASS(本来就要通过不能被改坏的测试)
- (选学深化)读讲义站《SWE-bench 数据 schema》:9 个字段逐个讲清
- issue 描述通常包含一段最小复现代码 + 报错信息
- F2P 是"修对"的合约,P2P 是"不破坏"的合约
- 题目形式:真实 bug 报告,不是教科书例题
对一对参考答案
要点:读真实 issue → 定位并修复缺陷 → 通过 F2P(证明修好)且不破坏 P2P(证明没改坏别的)。(注:参考答案定位为"对照要点"非唯一标准——只要包含"读 issue + 修 bug + 不破坏回归"三要素即合格。)
- 打开实验详情页(kimi-agent 跑 django__django-14915,resolved=100%):先看 S1-S7 阶段耗时条,再滑到 补丁对比(Agent 改动了哪些文件)
- 打开轨迹页正文(重点):从第一条 LLM 思考读到最后一条工具调用,关注节奏——读文件→想→改→测试→再读→再改
- (若该题有沙箱数据)到模拟执行列表找 django__django-14915,看终端一步步解题的回放——零背景要求,最直观;缺数据时跳过
- (选学)打开insights · replay 视角,看时间轴节奏的结构化呈现
- S1-S7 七阶段:S1 准备环境 → S2 拉镜像 → S3-4 启动 Agent → S5 等待 → S6 评测 → S7 收尾
- 补丁对比:Agent 通常改 1-3 个文件,行数 5-30 行为常见
- 轨迹页:不必逐条读,先看节奏——「读/想/改/测」的循环
对一对参考答案
读文件:通常是 cat / view_file 类工具调用——Agent 在「认识现场」。
改代码:通常是 str_replace / edit_file 类——通常改 1-3 个文件、5-30 行。
跑测试:通常是 bash 跑 pytest 或项目自定义测试命令——失败后 Agent 会回到「读/改」再试。
(注:解法不唯一,可能 Agent 走的路径与上述不完全一致——只要包含「读 → 改 → 验证」三步循环即合格。)
- 读讲义站《SWE-bench 入门》——判分主体在此:F2P/P2P 合约、"宿主机做题 + 容器判分"执行模型、%Resolved 公式
- 回第 2 步实验详情页找 F2P 通过数 和 P2P 通过数,验证 100% 从哪来
- (选学深化)讲义《SWE-bench 评测流程》:5 步流程 + 3 层 Docker 镜像
- %Resolved 公式固定:
count(FULL) / count(total),FULL = F2P 全过 ∧ P2P 全过(防回归) - 第 2 步看到的 100% 意味着:F2P 全过 ∧ P2P 全过(既修好又不破坏)
- 判分模型:宿主机上 Agent 改代码,容器内跑测试——保证评测隔离
对一对参考答案
django__django-14915 在 kimi-agent 解中 F2P 全过 ∧ P2P 全过,resolved=1 → %Resolved=100.0%。如果数字与页面不符,先回看第 2 步实验详情页的「测试结果」段。(注:单题 100% 与"该 Agent 在全部 Lite 题上的 100%"是两件事——前者只代表这一道做对。)
- 读讲义站《理解 Agent 开发过程:harness + LLM 的任务循环》:6 大组件(system / user / tool result / tool call / observe / think)+ 最小 harness 伪代码
- 回看第 2 步轨迹页,对照伪代码走一遍——找到「observe(读文件结果)→ think(LLM 思考)→ act(工具调用)」的三段式在哪里
- 6 大组件:
system prompt·user prompt·tool result·tool call·observe·think - 最小循环:观察环境 → 思考下一步 → 行动 → 观察新结果 → …
- Agent ≠ LLM:LLM 是大脑,harness 是身体+记忆
对一对参考答案
循环结构通常是:[observe 工具结果] → [think LLM 决策] → [act 工具调用] → [observe 新结果] → ...。在第 2 步轨迹中,找一条「读文件 → 修改 → 跑测试 → 失败 → 再读」的完整循环就是一次完整观察-思考-行动。(注:不同 Agent 实现细节不同,但核心三段式必出现。)
- 读讲义站《范式迁移 + AI-DLC + 3 种协作模式》开头节:3 种协作模式(人主导 / AI 主导 / 人机融合)+ AI-DLC 四原则
- 回看前 4 步:你这 5 步实际上走的就是「人主导 + AI 协助」模式——题目由人解读,Agent 跑题,判分由系统执行
- 3 种协作模式:「人主导 AI 协助」「AI 主导人审核」「人机融合」
- AI-DLC 四原则:把传统 SDLC 改造为「AI 是协作者而非工具」
- 从「人写代码」到「人描述需求 + Agent 写代码 + 人审核」
对一对参考答案
要点:「人机融合」中,人仍是目标设定者 + 价值判断者,AI 是执行 + 检索 + 试错放大器;「全自动 Agent」是 AI 闭环所有决策,但当前技术下代价是质量与可解释性下降。本线路你是「人主导」——这就是为什么实验报告要你写小结,因为学习闭环最后一步必须由人完成。(注:开放问题,无标准答案。)
实验报告模板(照抄小节标题即可)
| 报告小节 | 对应任务(来自线路图) | 必含元素 |
|---|---|---|
| 一、题目理解 | 第 1 步任务:一句话写「这道题让 Agent 做什么」 | issue 核心问题 · F2P / P2P 含义 · 题目来源(哪个 repo) |
| 二、解题过程观察 | 第 2 步任务:3 张截图 + 说明 | 读文件截图 · 改代码截图 · 跑测试截图 · S1-S7 耗时条观察 |
| 三、判分回验 | 第 3 步任务:抄 F2P/P2P 计数 + 算 %Resolved | F2P 数 · P2P 数 · %Resolved 公式 · 与平台数字核对 |
| 四、Agent 心智 | 第 4 步任务:循环流程图 + 标注真实片段 | observe → think → act 流程图 · 至少 1 处真实轨迹标注 |
| 五、范式小结 | 第 5 步任务:200 字「人机融合 vs 全自动」 | 3 种协作模式其一 · AI-DLC 四原则其一 · 你的立场 |
常见问题(FAQ)
1. F2P 和 P2P 有什么区别?
F2P(FAIL_TO_PASS):修对之前会失败、修对后必须通过的测试——证明"修好"。 P2P(PASS_TO_PASS):本来就要通过的测试,修完后仍必须通过——证明"没改坏别的"。 两者都通过才记为 FULL,%Resolved 就是 FULL 数 / 总题数。
2. 轨迹(trajectory)里那么长该从哪看起?
只看节奏——read_file → str_replace → bash test → fail → read_file → ...
的循环次数与间隔。不要逐条读每条 LLM 思考;那个量级(动辄上千条)超出入门负荷。
想看时间轴结构化版本,去 insights · replay 视角。
3. 为什么这道题 Agent 改的文件和我预想的不一样?
解法不唯一。bug 修复可以改根因(修源文件)也可以加补丁(加新文件 hook),
只要 F2P 全过 ∧ P2P 全过就算对。如果你对 Agent 的具体改动路径有疑问,
看 补丁对比 段,记录「改了哪些文件、几行」,不必纠结「为什么改这里」。
4. %Resolved 是 100% 才算"做对"吗?
本题 100% = 这道题 FULL = F2P 全过 ∧ P2P 全过,等于"做对"。 汇总 100% = 该 Agent 在该数据集上所有题都做对,极少见。 看到 %Resolved 数字时,先看分母——是单题还是多题汇总。
5. 学完 5 步接下来干什么?
你已经是讲义站首页「读者路径」中 「第一次来」派 的毕业生。 接下来按你的目标选路:想写 Agent → 走「动手派」(协议讲义 + Agent 心智); 想造 benchmark → 走「构造派」(从 PR 构造 Benchmark 题目); 想参与本仓 → 走「协作派」。详见讲义站首页「读者路径分流」表。