四类资料分别回答不同问题
一手官方资料
用于确认工具当前名称、入口、权限、许可证和架构声明。官方文档能说明“厂商说支持什么”,但不能单独证明实际质量或跨工具优越性。
论文与评测
用于理解 Harness 对结果的影响、Loop/Graph 设计和 benchmark 表现。数字只在论文给定模型、预算、环境、样本与重试策略下成立,文中使用“作者报告”而非无条件断言。
行业观点
用于补充工程模式、中文语境和实践经验。观点能提供问题框架,不等同于实验事实;尽量追溯其引用的一手实现或论文。
本文分析
工具“适合谁”“主要代价”和推荐器权重属于本文分析,不是厂商声明。读者可以按自己的任务、成本、安全和运维条件重新判断。
检索与核验方法
Agent 工具优先查官方文档、官方仓库、官方博客和许可证;OpenAI 相关内容使用官方开发者文档,Claude Code、Cursor、xAI、Qwen、TRAE、腾讯云等使用各自官方页面。开源活跃度通过 GitHub API 在资料截止日做快照,只用于确认项目仍有社区关注和近期活动,不把 Star 当成功率。
涉及新论文时,记录题目、arXiv 页面和作者主张,不从摘要数字推导未被论文支持的因果关系。涉及商业工具时,不将营销用语直接改写成“已经证明更强”。涉及安全时,把“工具有某项开关”与“具体部署已经安全”严格分开。
本文没有做统一付费 benchmark,也没有访问厂商内部数据,因此不提供缺少统一实验条件的总榜。读者可以建立自己的任务集:固定仓库、输入、模型或预算、权限和验收条件,分别记录完成率、人工处理时间、成本、总耗时、风险操作和恢复能力。
核对工具页时还要留意文档版本和发布日期。同一个名称可能同时指 CLI、编辑器插件、云端服务或开源核心,它们的权限与运行位置并不相同;本文只在官方资料能对应到具体入口时,才把功能写进相应页面。
一手官方资料
用于说明工具功能和边界。仓库 README 既是官方项目资料,也可能随版本快速更新;读者核验时应同时查看 release、commit 与当前文档。
Codex CLI 的交互、工具、命令与执行方式。
项目指令的分层发现与覆盖规则。
沙箱、审批和风险边界。
Claude Code 的使用入口、扩展与工作方式。
确定性生命周期 Hook。
IDE Agent 模式与工具。
远程隔离环境及安全提醒。
终端入口与会话。
Grok Build 的官方入口。
开源实现、许可和功能面。
OpenCode 架构、模型、权限与扩展。
源码与活跃度快照。
LSP、DAP、工具和模型支持。
千问开源终端编码代理。
模型层能力与定位。
Qoder Editor、Quest、知识与 CLI。
字节跳动 TRAE 官方入口。
轨迹、Docker、MCP 与多模型开源实现。
通用桌面工作空间定位。
开发插件、IDE 与 CLI 功能边界。
Gateway、会话、渠道、工具与安全。
源码与社区活跃度。
学习循环、记忆、技能与多渠道。
安装、模型与运行后端。
开源代理平台与 SDK。
IDE 人在环编码代理。
自定义 modes 与权限。
基于依赖图和 token 预算的仓库地图。
AAIF 下的通用开源 Agent。
Google 官方开源的终端 Agent。
月之暗面开源 Agent Shell。
Charmbracelet 终端编码 Agent。
Agent-Computer Interface 研究实现。
IDE、CLI 与 AI Checks。
持久化、有状态的代理编排运行时。
state、nodes 与 edges。
agents、handoffs、guardrails、sessions 与 tracing。
论文与评测
2026 年多篇 Harness 论文仍很新,结论需要等待更多独立复现。Terminal-Bench、SWE-bench 类榜单也会随模型、Harness 和预算变化,不能脱离运行配置截取一个分数。
长时编程循环与依赖 DAG 评测;论文结论按作者陈述引用。
模型—Harness 配对影响的研究。
对代理 Harness 的基准尝试。
工具、中间件、记忆与可观测性迭代。
运行底座职责的系统化描述。
用代码表达代理控制流的研究。
Agent-Computer Interface 对软件工程代理的影响。
终端代理任务评测;榜单会持续变化。
跨编码代理的公开比较,需注意配置与日期。
行业观点
这些资料帮助解释 workflow、agent、Loop、Graph、“养马”等概念。它们提供的是工程视角,不替代一手文档和可复现实验。
workflow、agent 以及常见编排模式。
动态多代理 Harness 的模式与成本。
行业实践中关于循环、工具与验证的观察。
中文社区用马与马具解释模型和 Harness。
本文判断的依据与未覆盖范围
本文分析:“Codex CLI 更适合已有测试的终端仓库”“Cursor 便于在编辑器内检查修改”“OpenClaw 更接近个人 Agent Gateway”“Aider 用 repo map 选择上下文”等,都是根据功能结构推导的使用场景,不是厂商承诺,也不是统一实验结论。
推荐器:仓库任务匹配 5 分、使用入口 4 分、开放性 4 分、执行环境 3 分、上手难度 2 分,终端同时支持 CI 另加 1 分。规则保持简单,也直接公开在页面里;它不收集访问者信息,也不会上传选择。正式采购还要继续检查价格、数据驻留、账户治理、SLA、采购条款和团队技能。
Star 口径:快照来自 GitHub API,时间为 2026-08-13。Star 体现关注度,不代表活跃贡献者数量、维护质量、安全性、企业采用或任务成功率。闭源 Cursor、Qoder、WorkBuddy 没有同口径 Star,因此不参与相关比较。
未覆盖:本文没有逐版本复测所有模型提供方、插件、MCP server 和企业管理功能,也没有展示很快会过期的价格表。GitHub Copilot、JetBrains Junie、Amazon Q 等平台型工具同样重要,只是本轮没有为它们单独写页面。
更新建议:读者发现名称、许可证或官方 URL 变化时,应优先以项目官方 release 和文档为准。任何引用本文的文章都应保留资料日期,避免把 2026 年的工具状态写成永久事实。