铭鸿体育资讯网

代码智能体Harness的系统性分析研究 An Empirical Study

代码智能体Harness的系统性分析研究
An Empirical Study of Harness Design for Coding Agents

本文提出了针对编码智能体harness设计的系统性实证研究框架,通过固定通用执行循环、独立消融三类核心harness组件,跨4个不同规模的编码模型、2个长时程编码基准、4档上下文窗口预算开展176组控制变量实验,量化拆解了供了可迁移的实证依据。

主要创新点:
1. 构建了可独立配置三个核心harness模块(上下文管理、规划、动作空间)的轻量化统一测试harness,排除了完整框架跨评估时的组件效应混淆问题,实现了组件级的控制变量对比。
2. 明确了上下文管理的价值规律:该模块的收益随上下文窗口预算收紧同步升高,核心作用是防止上下文溢出导致的任务提前终止;其中“轻量规则剪枝优先、LLM长时摘要兜底”的组合策略在准确率持平的前提下实现了最低的平均任务成本,而可回溯外部存储的记忆召回机制几乎不被模型调用,无法带来准确率增益。
3. 揭示了规划模块的条件性价值:对能力较弱的模型,规划是准确率脚手架,可延长智能体轨迹直到能发起代码修改;对能力较强的模型,规划是成本优化工具,主要通过削减冗余的编辑后验证步骤降低开销,准确率变化幅度极小。
4. 厘清了动作空间的适配逻辑:预定义结构化工具集对bash能力薄弱的模型有显著性能提升,而纯bash接口对bash能力强的模型更友好——既可以降低任务成本,也能在shell-centric类任务上获得更高成功率,最优动作空间随模型的shell熟练度、任务的shell依赖度发生适配 crossover。
5. 通过轨迹级行为标注拆解了各组件的底层作用机制:上下文管理仅延长轨迹长度、不改变智能体的行为阶段分布;规划通过调整过早终止、冗余验证两类行为的占比产生效果;动作空间决定了单次操作的粒度,强模型可通过bash完成复合操作,大幅减少交互轮次。

大模型 人工智能 coding codingagent 代码智能体 agent