Paper Reading · Agentic Infra · arXiv 2601.07526
MegaFlow: 大规模分布式 Agent 训练编排系统
三服务架构(Model / Agent / Environment)+ 阿里云 ECS(Elastic Compute Service,弹性计算服务)编排,32% 成本降低 / 10K 并发 / 2M+ rollout execution,为下游 SWE-Universe(SWE = Software Engineering,软件工程;姊妹篇系统,构建百万级软件工程训练环境)80 万环境构建 + 50 万轨迹生成铺路。
概览
3
传统基础设施天花板
3
解耦服务
4
核心设计原则
10K
单集群并发
论文精读
卡片 1 · 背景与动机
3 个天花板:训练 agent 撞到基础设施墙
2026 年 agent 训练需要成千上万的长时 agent-environment 交互并行跑,但传统集中式基础设施撞 3 类天花板。MegaFlow 论文把这 3 类天花板拆开,一一给出解法。
核心知识点
- Security & Isolation:训练集群安全策略禁止跑任意容器
- Storage Scalability:仅 SWE-bench + SWE-Gym 就要 25TB Docker 镜像
- Computational Throughput:单台 208-core 大机器最多 50 并发
- Megatron-LM / DeepSpeed 等单大机路线撞了这 3 类墙
课堂实训
用 docker stats 观察本地一个 27B 推理容器吃多少 memory + vRAM,对比论文说的「25TB 镜像 + 50 并发」瓶颈量级。
思考与讨论
为什么「单台大机器」路线在 agent 训练场景失效,但传统 LLM pretraining 用得好?两种 workload 的本质差异是什么?
卡片 2 · 三服务架构
Model / Agent / Environment 解耦 + 4 设计原则
把训练基础设施拆成 3 个独立服务,各自弹性扩展;4 个设计原则(弹性 / 混合执行 / 事件驱动 / 委托专业系统)保证解耦有效。
核心知识点
- Model Service:vLLM / SGLang(inference)+ VeRL / FSDP / Megatron(training)
- Agent Service:OpenHands / SWE-Agent / mini-SWE-Agent + Qwen Code / Claude Code(rollout 协调)
- Environment Service:阿里云 ECS(弹性计算实例)+ ACR(阿里云容器镜像仓库)+ Docker layer 缓存(on-demand 镜像)
- 4 设计原则:Elastic Resource / Hybrid Execution / Event-Driven / Specialized Delegation
课堂实训
对照本仓 experiment_modules/solving/ 看 4 brand agent + 8 runner 如何呼应「Model/Agent/Environment」三层分离。
思考与讨论
如果用「单大机 + 本地 Docker」跑 50 并发就够,为什么要拆 3 个独立服务?规模化的成本拐点在哪里?
卡片 3 · 阿里云 ECS 编排
many-small-instances + FIFO scheduler + 分布式信号量
替代「少大实例」,用阿里云 ECS 弹性小实例 + FIFO(First In First Out,先进先出——先提交的任务先被调度,不插队)调度器 + 分布式信号量,把 50 并发的天花板推到 10K 并发 + 2M+ rollout。
核心知识点
- Elastic Resource:many-small-instances 替代 few-large-instances(208-core → 52xlarge / 2xlarge 池)
- Hybrid Execution:ephemeral(隔离)/ persistent(资源效率)双模式
- Event-Driven Coordination:替代复杂 consensus 协议(FIFO scheduler + 信号量)
- Specialized Component Delegation:容器编排 / 存储 / 监控委托给 ACR / ECS / 云监控
课堂实训
看本仓 runtime-cache/venvs/<repo>__<commit>/ 目录结构,体会「ephemeral venv 按需建」思想 vs MegaFlow 的 ephemeral 容器是同一思路。
思考与讨论
FIFO 调度器对 agent rollout 是否足够?哪些场景需要更复杂的优先级(interactive agent vs batch rollout)?
卡片 4 · 关键成果
32% 成本 / 10K 并发 / 2M rollout + 对 SWE-Universe 的铺垫
实际部署数据:相对基线 32% 成本降低,10K 并发 agent 任务,2M+ 训练 rollout 跑通。更重要的是为下游 SWE-Universe(80 万 SWE 环境 + 50 万轨迹)提供了编排底座。
核心知识点
- 成本:相对单大机基线 32% 降低(云资源弹性 + layer 缓存 + 事件驱动)
- 并发:单集群 10K 并发 agent-environment 任务(vs 单大机 50 并发天花板)
- 规模:累计 2M+ 训练 rollout execution 完成
- 下游:SWE-Universe 在 MegaFlow 上构建 807,693 SWE 环境 + 跑 50 万轨迹
课堂实训
对照本仓 experiment_warehouse/ 数据层(gitignore 排除,3.2GB experiments.db + 75MB swe_bench.db),看本仓数据规模与 MegaFlow 上「百万级」差几个量级,理解「数据 vs 基础设施」是不同扩展问题。
思考与讨论
为什么 MegaFlow 选了阿里云 ECS(公有云)而不是 Kubernetes 私有部署?两类基础设施的能力边界和成本结构有何不同?