📐 Harness 工程 · 中文翻译

5 系统概览

表 4 给出 11 个系统的高层比较。 语料库横跨三个数量级的代码规模、三种编程语言和根本不同的设计哲学;最后一列给出每个系统的标志性能力——截至 2026 年 7 月,语料库中没有其他系统以同样形式实现的能力。444本研究的 4 月版曾逐系统列出 SWE-Bench Verified 分数。我们已把它们从比较表中移除:可得数字均为自报,来自不同代际的模型与配置,且若干早于各系统当前的默认设置。留档如下,2026 年春季的自报数字为:OpenHands 77.6%、Mini-SWE-Agent 74%+、Claude Code 72.7%、Codex 69.1%(均为 SWE-Bench Verified);其余系统未发布可比数字——Pi 明确征集真实会话数据,“而不是玩具基准”。

表 4:11 个系统的高层比较,含每个系统的标志性能力。Claude Code 在本表及其他 7 月数据表中的条目反映的是 2026 年 3 月源码快照(我们可获得的最新的源码);交付的二进制(2.1.206,2026 年 7 月)可能有所不同。
系统 语言 规模 供应商 工具 多智能体 沙箱 UI 标志性能力
OpenHands Python 中等 多供应商 25+ 是 Docker/Apptainer/远程 Web+CLI+SDK 资源锁定的并行工具;把竞争对手 Harness 作为 ACP 后端托管
Aider Python 小 多供应商 13 格式 否 无 CLI 13 种多态编辑格式;语料库中唯一的排序仓库地图
Claude Code TS 大 Anthropic 43 是 可选运行时 + worktree CLI 工具延迟加载;共享提示词缓存的分叉;他人抄袭的参照物
Codex Rust 超大 OpenAI 25–30 是 原生(3 操作系统) CLI/TUI 智能体自维护的跨会话记忆;工具调用作为 V8 执行的代码
Gemini CLI TS 超大 Google 35+ 是 原生(3 操作系统) CLI/TUI 把模型路由做成运行时调度;语料库中唯一的 A2A 服务器
Mistral Vibe Python 小 Mistral+ 12+ 是 可选 worktree CLI/TUI 中间件管线循环;经 ACP 暴露回退(rewind)
Mini-SWE-Agent Python 极小 多供应商 1 否 Docker+ CLI 100 行的地板:七个子系统全部最小化实现
Hermes Python 超大 多供应商(自研) 69 是 6 个可插拔后端 CLI/TUI/Web+28 通道 自我改进的技能循环;谱系压缩;停止时校验
Pi TS 中等 多供应商,35 家 7 扩展 无(刻意设计) CLI/TUI 一切皆扩展的内核;会话树版本控制
OpenCode TS 大 多供应商 17 是 无(策略层) 客户端/服务器 客户端/服务器 Harness;语法感知的命令权限控制
OpenClaw TS 大 多供应商 109+ 是 无 多通道 网关委派;每次回复前运行 Active-Memory 子智能体

“规模”是定性指标,反映系统主要源码树中代码量的数量级:极小(约 ∼\sim5 K 行)、小(约 ∼\sim20–40 K)、中等(约 ∼\sim80–110 K)、大(约 ∼\sim500 K+)、超大(约 ∼\sim600 K+,其中 Codex 在 7 月快照中约有 ∼\sim110 万行 Rust)。这些数字跨语言与计数约定不可直接比较;报告它们只是为了让系统在“简单性-能力”轴上定位。

观察 1。11 个系统的代码规模横跨三个数量级,却面向相似的任务,然而循环的精巧程度并不能预测基准表现。Mini-SWE-Agent 的极简线性循环取得的报告结果与 OpenHands 的事件溯源对话引擎处于同一区间,尽管后者仅在循环编排上就投入了多得多的代码。生产级系统的大部分体量处理的都是与任务完成正交的关切:安全、用户体验、可扩展性——以及越来越多的客户端与传输:OpenCode 的非测试源码约有五分之三是它的 TUI、Web、桌面与 SDK 客户端而非 Harness 本体,而 Codex 的 7 月代码树用六位数的行数养着应用服务器传输层、插件和一个任何基准都不会度量的实时语音层。