4 研究方法
4.1 系统选择
本研究覆盖 11 个 Harness 加一个元 Harness 对照点,选择标准是它们在设计哲学、成熟度与市场位置三个轴上的分布(表 3);第 3.7 节把语料库置于 2026 年 7 月更广阔的领域背景中。 这组系统为每个主要商业 LLM 供应商各含一个智能体(Anthropic 的 Claude Code、OpenAI 的 Codex、Google 的 Gemini CLI [21]、Mistral 的 Mistral Vibe [20]),外加七个占据不同研究与生产生态位的开源项目——其中包括本修订版新增的三个系统:Hermes(增长最快的开源 Harness)、Pi(极简内核的逆流者)与 OpenCode(星标最多的专用编码智能体,带有独特的客户端/服务器拆分);沿用的开源系统是 OpenHands [13]、Aider [14]、Mini-SWE-Agent [15] 与 OpenClaw。 语料库横跨三种编程语言(Python、TypeScript、Rust)、三个数量级的代码规模,以及从研究基线到完全产品化 CLI 工具的种种设计哲学。 全部快照重新固定到 2026 年 7 月的最新可用版本(原系统的 2026 年 4 月快照被保留用于纵向比较,第 14.5 节两者并用)。
| 系统 | 供应商 | 语言 | 版本 | 入选理由 |
| OpenHands | OpenHands(原 All-Hands-AI) | Python | V1 SDK v1.34.0(2026 年 7 月) | 成熟的模块化框架 |
| Aider | 社区(P. Gauthier) | Python | v0.86.3.dev(2026 年 5 月;维护模式) | 多态编辑策略 |
| Claude Code | Anthropic | TypeScript | 源码快照 2026 年 3 月(二进制 2.1.206,2026 年 7 月) | Anthropic 的旗舰智能体 |
| Codex | OpenAI | Rust | rust-v0.144.1(2026 年 7 月) | OpenAI 的旗舰智能体 |
| Gemini CLI | TypeScript | v0.50.0(2026 年 7 月) | Google 的旗舰智能体 | |
| Mistral Vibe | Mistral AI | Python | v2.19.1(2026 年 7 月) | Mistral 的旗舰智能体 |
| Mini-SWE-Agent | Princeton/Stanford | Python | v2.4.5(2026 年 7 月) | 极简主义研究基线 |
| Hermes | Nous Research | Python | 0.18.2(rel. 2026.7.7.2,2026 年 7 月) | 自我改进的技能;个人/SWE 混合 Harness |
| Pi | earendil-works(M. Zechner) | TypeScript | v0.80.6(2026 年 7 月) | 最小内核,最大可扩展性 |
| OpenCode | Anomaly(原 SST) | TypeScript | v1.17.18(2026 年 7 月) | 客户端/服务器架构;星标最多的专用编码智能体 |
| OpenClaw | 社区 | TypeScript | v2026.6.11(2026 年 7 月) | 对照:多通道助手 |
| Omnigent | Databricks | Python | v0.4.0(2026 年 7 月) | 对照:Harness 之上的元 Harness |
OpenClaw:外部对照点。
OpenClaw 是这组系统里的离群者。 它的 README 把自己描述为个人 AI 助手网关,而不是编码智能体;它横跨 20 多个消息平台(WhatsApp、Slack、Discord、Signal、iMessage、Matrix 等等),不带任何原生代码编辑工具(见表 7,其条目为 N/A)。 OpenClaw 不亲自写代码,而是通过插件把编码任务委派给专门的 SWE 智能体(opencode、kimi-coding、github-copilot、copilot-proxy)。 把它作为外部对照点纳入,有三个理由。 第一,它的插件架构(260 个 SDK 文件、清单驱动的发现机制、严格的导入边界)把哪些可扩展性模式是 SWE 特有的、哪些属于更广的智能体平台品类区分了出来。 第二,它采纳与 SWE 优先的智能体相同的横切标准(ACP 会话派生、MCP、agentskills.io Skills),为检验趋同论断提供了一个非 SWE 参照。 第三,它展示了网关-委派模式:一个消费而非实现编码能力的多通道助手。 Hermes 介于两类之间:像 OpenClaw 一样,它是多通道个人助手网关(Telegram、Discord、Slack、WhatsApp、Signal、CLI);但与 OpenClaw 不同,它自带完整的原生编码工具集,因此我们把它当作语料库成员而非对照点,并在要紧处标注其混合属性。 凡采用计数对 OpenClaw 的纳入敏感之处,我们同时报告 11 系统计数与 10 编码 Harness 计数。 把趋同论断理解为严格限于编码智能体的读者,应采用 10 系统数字。
Omnigent:元 Harness 对照点。
Omnigent(Databricks,2026 年 6 月开源 [25])不是编码 Harness,而是架在 Harness 之上的编排层:它包裹 Claude Code、Codex、Cursor、OpenCode、Hermes、Pi 以及自定义 YAML 定义的智能体于一个公共 API 之后,加入跨 Harness 策略、统一的操作系统沙箱与可共享的多设备会话。 因为它不实现自己的编辑循环,把它和语料库一起放在七个维度上打分将是范畴错误;第 14.4 节改为把它作为证据,分析哪些 Harness 能力正在向上迁移进元层。
4.2 分析维度
每个系统沿七个维度分析: (D1) 智能体循环设计; (D2) LLM 集成与模型-智能体协同设计; (D3) 工具与动作系统; (D4) 记忆与上下文管理; (D5) 安全与权限模型; (D6) 多智能体编排; (D7) 可扩展性机制。 所有版本均为 2026 年 7 月(精确固定见表 3);对从本研究 2026 年 4 月版沿用的 8 个系统,我们保留了 4 月快照并与 7 月快照做 diff,第 14.5 节报告三个月的 Harness 演化在源码级是什么样子。 代码规模数字是在固定快照上测得的近似行数,报告它们是为了按数量级给系统定位;它们不是跨计数约定可复现的指标。