门户首页
Paper Reading · Agentic Data · arXiv 2602.02361

SWE-Universe: 百万级真实可验证 SWE 环境

Building agent(mini-sweagent + Qwen-Next-80A3)+ iterative self-verification + in-loop hacking 检测,从 33.3M GitHub PR(Pull Request,GitHub 上的代码合并请求)构造 807,693 实例,跑出 50 万轨迹 / 30B tokens,让 Qwen3-Max-Thinking 在 SWE-Bench Verified 达到 75.3%。标题中的 SWE = Software Engineering(软件工程)——指基于真实软件仓库的工程任务;SWE-Bench 是该方向的权威基准(见 SWE-bench 入门)。

生成时间:2026-09-03 · 版本 v0.2(v0.1 原载 teaching-lecture-notes/html-format-slides,本版迁入主站)· 生成 Agent:MiniMax Code · 载体:agentsoft-research-platform teaching-web-platform
1 2 3 4 5 问题 3 难 · 15 min Pipeline 4 阶段 · 20 min 创新 self-verify · 20 min 数字 807K · 15 min 训练 75.3% · 15 min 学习路径 · 总时长 ~85 min
图 1 · 学习路径(5 步:问题 → Pipeline → 创新 → 数字 → 训练落地)
SWE-Universe 内部模块结构 · 5 阶段 Pipeline × 子任务展开 1. PR Crawling 33.3M → 1M 候选 GitHub API 33.3M PR 全量抓 启发式过滤 language / repo / 长度 候选 1M 通过初步质量过滤 2. Building Agent Qwen-Next-80A3 · mini-sweagent patch 拆分 test_patch / fix_patch 分离 环境构造 apply test_patch 跑 dependency install evaluation.sh switch-to-bug + switch-to-resolved 3. 5 Scaffold Rollout Qwen3-Coder-480B SWE-Agent rollout Mini rollout OpenHands rollout Claude Code rollout Qwen rollout 4. Rejection Sampling 30B tokens · 50 万高质量轨迹 质量过滤 通过 evaluation.sh 验证 样本筛选 成功 trajectory → 训练集 5. Training Qwen3-Max-Thinking · 256K seq · mid-train + RL SWE-Bench Verified 75.3% 5 阶段顺序 Pipeline → 807,693 实例 → 50 万轨迹 / 30B tokens → 75.3% SOTA
图 · SWE-Universe 内部模块结构(5 阶段 Pipeline × 子任务展开 → 80 万实例 / 50 万轨迹 / 30B tokens → SWE-Bench 75.3%)

概览

33.3M
GitHub PR 源
807K
构造的 SWE 实例
500K
高质量轨迹
75.3%
SWE-Bench Verified

论文精读

SWE-Universe · 论文精读(4 张 card)
回答「3 类工程难题(低产率 / 弱 verifier / 高成本)怎么同时解」+「iterative self-verification + in-loop hacking 检测是什么思路」
卡片 1 · 问题与挑战

3 难:低产率 / 弱 verifier / 高成本

SWE-Bench 已证明「真实仓库 PR = 自包含训练环境」,但手工扩展到百万级撞 3 类工程难题。SWE-Universe 论文给出一个全自动 pipeline 同时解决。

核心知识点
  • 低产率:真实仓库依赖复杂,build 成功率 < 10%(很多 PR 装不上)
  • 弱 verifier:浅薄 evaluation.sh 骗训练信号(用未来 patch 反向验证才能识破)
  • 高成本:每实例 1 个大模型构造 N 次,80 万实例 = 几百万美元
  • 规模目标:从 33.3M GitHub PR → 80 万+ 可验证 SWE 实例
课堂实训
对照本仓 data/swe_bench_scripts/loader.py 零依赖加载器,看「为什么 SWE-bench Lite 只 323 条」+ 「怎么筛选可信 PR」。
思考与讨论
如果 verifier 不强,训练信号全是噪声——为什么业界至今没共识的 verifier 评测标准?SWE-Universe 的 in-loop hacking 检测在解什么本质问题?
卡片 2 · Pipeline 4 阶段

PR 抓取 → Building agent → 5 scaffold rollout → rejection

完整 4 阶段 pipeline:33.3M GitHub PR → 启发式过滤到 1M 候选 → 自动构造 + 5 scaffold rollout → rejection sampling 收 50 万高质量轨迹。

核心知识点
  • 阶段 1:33.3M PR → 启发式过滤 → 1M 候选
  • 阶段 2:Building agent(mini-sweagent + Qwen-Next-80A3)自动构造 + test_patch / fix_patch 分离 + 迭代 self-verification
  • 阶段 3:5 scaffold rollout(OpenHands / Mini / OpenHands / Claude-Code / Qwen-Code),跑出 50 万成功轨迹
  • 阶段 4:rejection sampling 30B tokens + 拒绝浅薄 verifier
课堂实训
对照本仓 swebench_exp_web/ + experiment_modules/,理解 5 scaffold(SWE-agent / mini / OpenHands / Claude-Code / Qwen-Code)和本仓 5 brand adapter(kimi / qwen / mimo / opencode / codebuddy)的对应关系。
思考与讨论
为什么 5 scaffold rollout?单 scaffold 跑 5 次和 5 scaffold 各跑 1 次在轨迹多样性上有何区别?这对训练数据有何影响?
卡片 3 · 关键创新

iterative self-verification + in-loop hacking detection

两个创新解决「弱 verifier」难题:1)自我验证(switch-to-bug / switch-to-resolved 双向)让构建 agent 反复测试;2)in-loop hacking 检测识别「跑未来 patch 才过、跑当前 patch 反而挂」的浅薄 verifier。

核心知识点
  • iterative self-verification:构建 agent 生成 evaluation.sh 后跑 2 步(switch-to-bug / switch-to-resolved)
  • in-loop hacking detection:检测「未来 patch 反而让 verifier 挂」的浅薄脚本(用真实测试 patch 反向验证)
  • 5 scaffold rollout 提供跨环境/语言/格式的轨迹多样性
  • Qwen3-Max-Thinking 最终 SWE-Bench Verified 75.3%(达开源模型 SOTA(State of the Art,当前最强水平))
课堂实训
读本仓 experiment_modules/scoring/answer_evaluator/ 了解真实 verifier 怎么跑 F2P/P2P 校验 + 拒绝策略(与 SWE-Universe 的「拒绝浅薄 verifier」同一思想)。
思考与讨论
iterative self-verification 用「来回切换 patch」测试是创新,但 verifier 仍然只看测试 patch + 测试 run 能不能过——会不会被「先改测试再 revert」的对抗攻击骗过?
卡片 4 · 关键成果

807,693 实例 / 50 万轨迹 / 30B tokens / SWE-Bench 75.3%

从 33.3M GitHub PR 构造 80 万+ SWE 实例(75.9% non-hack success + 90,571 合成),跑出 50 万高质量轨迹,最终让 Qwen3-Max-Thinking 在 SWE-Bench Verified 达到 75.3%。

核心知识点
  • 规模:807,693 实例(717,122 real + 90,571 synthesized 多语言)
  • 质量:50 万成功轨迹 / 30B tokens(5 scaffold 各跑一轮)
  • 终态:Qwen3-Max-Thinking 在 SWE-Bench Verified 75.3%(达开源 SOTA)
  • 训练:256K 序列 mid-training(无 loss mask)+ agentic RL
课堂实训
对照本仓 experiment_warehouse/store/experiments.db(3.2GB,gitignore)看 51/66 已解决记录,理解「真实跑通」与「论文声明」的差距(论文 75.3% 是在大集群 + 半年训练 + 精心 verifier 下的数字)。
思考与讨论
SWE-Bench Verified 75.3% 是不是「过拟合 benchmark」?论文 75.9% non-hack success rate 隐含 24.1% 是 hack——这些被拒的实例能反向揭示当前 benchmark 的什么盲点?