📐 Harness 工程 · 中文翻译

4 研究方法

4.1 系统选择

本研究覆盖 11 个 Harness 加一个元 Harness 对照点,选择标准是它们在设计哲学、成熟度与市场位置三个轴上的分布(表 3);第 3.7 节把语料库置于 2026 年 7 月更广阔的领域背景中。 这组系统为每个主要商业 LLM 供应商各含一个智能体(Anthropic 的 Claude Code、OpenAI 的 Codex、Google 的 Gemini CLI [21]、Mistral 的 Mistral Vibe [20]),外加七个占据不同研究与生产生态位的开源项目——其中包括本修订版新增的三个系统:Hermes(增长最快的开源 Harness)、Pi(极简内核的逆流者)与 OpenCode(星标最多的专用编码智能体,带有独特的客户端/服务器拆分);沿用的开源系统是 OpenHands [13]、Aider [14]、Mini-SWE-Agent [15] 与 OpenClaw。 语料库横跨三种编程语言(Python、TypeScript、Rust)、三个数量级的代码规模,以及从研究基线到完全产品化 CLI 工具的种种设计哲学。 全部快照重新固定到 2026 年 7 月的最新可用版本(原系统的 2026 年 4 月快照被保留用于纵向比较,第 14.5 节两者并用)。

表 3:系统选择标准。前 11 行是研究语料库;Omnigent 仅作为元 Harness 对照点加以分析。
系统 供应商 语言 版本 入选理由
OpenHands OpenHands(原 All-Hands-AI) Python V1 SDK v1.34.0(2026 年 7 月) 成熟的模块化框架
Aider 社区(P. Gauthier) Python v0.86.3.dev(2026 年 5 月;维护模式) 多态编辑策略
Claude Code Anthropic TypeScript 源码快照 2026 年 3 月(二进制 2.1.206,2026 年 7 月) Anthropic 的旗舰智能体
Codex OpenAI Rust rust-v0.144.1(2026 年 7 月) OpenAI 的旗舰智能体
Gemini CLI Google TypeScript v0.50.0(2026 年 7 月) Google 的旗舰智能体
Mistral Vibe Mistral AI Python v2.19.1(2026 年 7 月) Mistral 的旗舰智能体
Mini-SWE-Agent Princeton/Stanford Python v2.4.5(2026 年 7 月) 极简主义研究基线
Hermes Nous Research Python 0.18.2(rel. 2026.7.7.2,2026 年 7 月) 自我改进的技能;个人/SWE 混合 Harness
Pi earendil-works(M. Zechner) TypeScript v0.80.6(2026 年 7 月) 最小内核,最大可扩展性
OpenCode Anomaly(原 SST) TypeScript v1.17.18(2026 年 7 月) 客户端/服务器架构;星标最多的专用编码智能体
OpenClaw 社区 TypeScript v2026.6.11(2026 年 7 月) 对照:多通道助手
Omnigent Databricks Python v0.4.0(2026 年 7 月) 对照:Harness 之上的元 Harness
OpenClaw:外部对照点。

OpenClaw 是这组系统里的离群者。 它的 README 把自己描述为个人 AI 助手网关,而不是编码智能体;它横跨 20 多个消息平台(WhatsApp、Slack、Discord、Signal、iMessage、Matrix 等等),不带任何原生代码编辑工具(见表 7,其条目为 N/A)。 OpenClaw 不亲自写代码,而是通过插件把编码任务委派给专门的 SWE 智能体(opencode、kimi-coding、github-copilot、copilot-proxy)。 把它作为外部对照点纳入,有三个理由。 第一,它的插件架构(260 个 SDK 文件、清单驱动的发现机制、严格的导入边界)把哪些可扩展性模式是 SWE 特有的、哪些属于更广的智能体平台品类区分了出来。 第二,它采纳与 SWE 优先的智能体相同的横切标准(ACP 会话派生、MCP、agentskills.io Skills),为检验趋同论断提供了一个非 SWE 参照。 第三,它展示了网关-委派模式:一个消费而非实现编码能力的多通道助手。 Hermes 介于两类之间:像 OpenClaw 一样,它是多通道个人助手网关(Telegram、Discord、Slack、WhatsApp、Signal、CLI);但与 OpenClaw 不同,它自带完整的原生编码工具集,因此我们把它当作语料库成员而非对照点,并在要紧处标注其混合属性。 凡采用计数对 OpenClaw 的纳入敏感之处,我们同时报告 11 系统计数与 10 编码 Harness 计数。 把趋同论断理解为严格限于编码智能体的读者,应采用 10 系统数字。

Omnigent:元 Harness 对照点。

Omnigent(Databricks,2026 年 6 月开源 [25])不是编码 Harness,而是架在 Harness 之上的编排层:它包裹 Claude Code、Codex、Cursor、OpenCode、Hermes、Pi 以及自定义 YAML 定义的智能体于一个公共 API 之后,加入跨 Harness 策略、统一的操作系统沙箱与可共享的多设备会话。 因为它不实现自己的编辑循环,把它和语料库一起放在七个维度上打分将是范畴错误;第 14.4 节改为把它作为证据,分析哪些 Harness 能力正在向上迁移进元层。

4.2 分析维度

每个系统沿七个维度分析: (D1) 智能体循环设计; (D2) LLM 集成与模型-智能体协同设计; (D3) 工具与动作系统; (D4) 记忆与上下文管理; (D5) 安全与权限模型; (D6) 多智能体编排; (D7) 可扩展性机制。 所有版本均为 2026 年 7 月(精确固定见表 3);对从本研究 2026 年 4 月版沿用的 8 个系统,我们保留了 4 月快照并与 7 月快照做 diff,第 14.5 节报告三个月的 Harness 演化在源码级是什么样子。 代码规模数字是在固定快照上测得的近似行数,报告它们是为了按数量级给系统定位;它们不是跨计数约定可复现的指标。