5 系统概览
表 4 给出 11 个系统的高层比较。 语料库横跨三个数量级的代码规模、三种编程语言和根本不同的设计哲学;最后一列给出每个系统的标志性能力——截至 2026 年 7 月,语料库中没有其他系统以同样形式实现的能力。444本研究的 4 月版曾逐系统列出 SWE-Bench Verified 分数。我们已把它们从比较表中移除:可得数字均为自报,来自不同代际的模型与配置,且若干早于各系统当前的默认设置。留档如下,2026 年春季的自报数字为:OpenHands 77.6%、Mini-SWE-Agent 74%+、Claude Code 72.7%、Codex 69.1%(均为 SWE-Bench Verified);其余系统未发布可比数字——Pi 明确征集真实会话数据,“而不是玩具基准”。
| 系统 | 语言 | 规模 | 供应商 | 工具 | 多智能体 | 沙箱 | UI | 标志性能力 |
| OpenHands | Python | 中等 | 多供应商 | 25+ | 是 | Docker/Apptainer/远程 | Web+CLI+SDK | 资源锁定的并行工具;把竞争对手 Harness 作为 ACP 后端托管 |
| Aider | Python | 小 | 多供应商 | 13 格式 | 否 | 无 | CLI | 13 种多态编辑格式;语料库中唯一的排序仓库地图 |
| Claude Code | TS | 大 | Anthropic | 43 | 是 | 可选运行时 + worktree | CLI | 工具延迟加载;共享提示词缓存的分叉;他人抄袭的参照物 |
| Codex | Rust | 超大 | OpenAI | 25–30 | 是 | 原生(3 操作系统) | CLI/TUI | 智能体自维护的跨会话记忆;工具调用作为 V8 执行的代码 |
| Gemini CLI | TS | 超大 | 35+ | 是 | 原生(3 操作系统) | CLI/TUI | 把模型路由做成运行时调度;语料库中唯一的 A2A 服务器 | |
| Mistral Vibe | Python | 小 | Mistral+ | 12+ | 是 | 可选 worktree | CLI/TUI | 中间件管线循环;经 ACP 暴露回退(rewind) |
| Mini-SWE-Agent | Python | 极小 | 多供应商 | 1 | 否 | Docker+ | CLI | 100 行的地板:七个子系统全部最小化实现 |
| Hermes | Python | 超大 | 多供应商(自研) | 69 | 是 | 6 个可插拔后端 | CLI/TUI/Web+28 通道 | 自我改进的技能循环;谱系压缩;停止时校验 |
| Pi | TS | 中等 | 多供应商,35 家 | 7 | 扩展 | 无(刻意设计) | CLI/TUI | 一切皆扩展的内核;会话树版本控制 |
| OpenCode | TS | 大 | 多供应商 | 17 | 是 | 无(策略层) | 客户端/服务器 | 客户端/服务器 Harness;语法感知的命令权限控制 |
| OpenClaw | TS | 大 | 多供应商 | 109+ | 是 | 无 | 多通道 | 网关委派;每次回复前运行 Active-Memory 子智能体 |
“规模”是定性指标,反映系统主要源码树中代码量的数量级:极小(约 5 K 行)、小(约 20–40 K)、中等(约 80–110 K)、大(约 500 K+)、超大(约 600 K+,其中 Codex 在 7 月快照中约有 110 万行 Rust)。这些数字跨语言与计数约定不可直接比较;报告它们只是为了让系统在“简单性-能力”轴上定位。
观察 1。11 个系统的代码规模横跨三个数量级,却面向相似的任务,然而循环的精巧程度并不能预测基准表现。Mini-SWE-Agent 的极简线性循环取得的报告结果与 OpenHands 的事件溯源对话引擎处于同一区间,尽管后者仅在循环编排上就投入了多得多的代码。生产级系统的大部分体量处理的都是与任务完成正交的关切:安全、用户体验、可扩展性——以及越来越多的客户端与传输:OpenCode 的非测试源码约有五分之三是它的 TUI、Web、桌面与 SDK 客户端而非 Harness 本体,而 Codex 的 7 月代码树用六位数的行数养着应用服务器传输层、插件和一个任何基准都不会度量的实时语音层。