SOTA Sync
全部文章
部署与运行2026-04-30

Model-Harness-Task fit 是真实的:Deep Agents 发布 Harness Profiles

Deep Agents 新增 Harness Profiles,允许按模型调整 prompt、tools、middleware、subagents 和 skills,在评测中相对默认 harness 带来明显提升。

Deep Agents 发布 Harness Profiles,背后的判断很明确:Model-Harness-Task fit 是真实存在的。

同一个模型,放在不同 harness 里,表现可能差很多。不同模型家族对 prompt、工具名称、上下文组织方式和中间件的偏好也不同。用一套默认配置覆盖所有模型,方便,但不一定最优。

#Harness Profiles 是什么

Deep Agents 过去提供一套跨模型通用的基础 harness。它包含 prompts、tools、middleware 等默认设置,让开发者可以快速创建 agent。

Profiles 则是在这个基础上增加按模型覆盖的配置层。开发者可以针对某个模型或供应商调整 system prompt、工具包含关系、工具命名、中间件、subagent 配置和 skills。

官方文章提到,Deep Agents 开箱内置 OpenAI、Anthropic 和 Google 模型的默认 profiles,也支持开发者注册自己的 profile 或通过 YAML 加载。

#为什么按模型调 harness

模型提示指南本身就不同。某些模型对工具名称、补丁工具、shell 命令和计划方式有明确偏好;另一些模型则需要不同的提示约束。

如果 harness 不跟着模型调整,就会出现一种浪费:模型本身能力很强,但外层工具协议、提示结构或中间件没有把能力释放出来。

原文还提到评测差异。Terminal-Bench 等榜单显示,同一个模型在不同 harness 下表现可能明显不同。Deep Agents 团队在 tau2-bench 子集上观察到,model-specific profiles 相对默认 harness 可以带来 10 到 20 个点的提升。

#Profiles 改的不是一个参数

Profiles 不是简单的温度或模型名配置。它覆盖的是 agent 运行环境:

  • system prompt 的前缀和后缀
  • 工具是否启用,以及工具名称如何暴露
  • middleware 是否启用
  • subagent 配置
  • skills 组合

这些东西共同决定模型如何理解任务、如何调用工具、如何保存状态,以及如何处理长程步骤。

#对 agent 团队的意义

Agent 工程会越来越像应用工程:需要版本化、评测、回滚和配置管理。Harness Profiles 把“某个模型最适合怎么跑”从经验变成可保存的配置。

这对团队很重要。换模型不应该只是改一个模型名,然后祈祷行为一致。更合理的方式是为不同模型维护对应 harness,再用评测验证哪套组合最适合当前任务。

Deep Agents 的这个功能说明,未来 agent 产品的竞争不只在模型选择,还在 harness 设计和任务适配能力。