Harness Engineering 这么偏工程,和 AI PM 有什么关系?
Harness engineering and the AI PM了解 Harness Engineering 后,我有一个很直接的疑问:
这听起来明明更像工程师的工作,为什么要把它和 AI PM 联系起来?
这个感觉没有错。
Harness Engineering 会涉及代码仓库、工具接入、测试、日志、权限、版本控制和运行环境。具体搭建这些东西,通常需要工程团队主导。
它不像 Eval Design 那样,天然从一个产品问题开始:
这个 AI 在什么情况下算做对?哪些错误可以接受?哪些错误必须拦住?
所以,我不会直接把 Harness Engineering 称为所有 AI PM 都必须掌握的核心能力。
它与 PM 的关系,要看 AI 在产品里到底负责什么。
如果 AI 只负责生成一段内容
例如:
改写一段文案;总结一篇文章;生成几个标题;提供一个初稿。
PM 当然仍然需要定义质量标准,但未必需要深度参与一套复杂的 Harness。
因为 AI 的行动范围很小。
结果不满意,可以修改或重新生成;即使出错,影响通常也停留在内容层面。
如果 Agent 开始调用工具和采取行动
情况就不一样了。
比如一个 AI 客服 Agent,不只回答问题,还可以:
查询账户;读取订单;修改工单状态;申请退款;发送客户回复;把问题转交给其他团队。
这时,产品不能只定义:
用户提出问题,AI 自动处理。
还必须继续回答:
Agent 可以看到哪些账户信息?可以直接执行多大金额的退款?什么情况必须先征得用户确认?哪些问题一定要转人工?执行失败后怎样恢复?转人工时,需要保留哪些上下文?
这些问题最后会由工程系统实现。
但它们不能完全由工程师自行决定,因为其中包含业务政策、用户预期、责任边界和风险取舍。
这就是 AI PM 与 Harness Engineering 发生关系的地方。
Eval Design 和 Harness Engineering 有什么区别?
还是用 AI 客服 Agent 举例。
Eval Design 可能定义:
回复必须符合退款政策;不能编造订单状态;不能承诺不存在的补偿;账户安全问题必须转人工;没有证据时不能自信回答。
也就是:
哪些结果算对,哪些结果算错。
Harness Engineering 继续处理:
Agent 去哪里读取最新退款政策;它可以查询哪些账户字段;是否拥有直接退款的权限;退款达到什么条件时自动暂停;回复发送前经过哪些检查;转人工时怎样带上已有信息。
也就是:
Agent 实际工作时,能获得什么、能做到哪里,以及中间有哪些检查和限制。
两者的连接,可以用一个具体变化来看。
假设 Eval 发现一个高风险失败:
Agent 偶尔会向用户承诺未经批准的补偿。
只把它记录成 failure type,还不够。
团队接下来可能决定:
- 收紧回复规则;
- 检查回复里是否出现补偿承诺;
- 涉及金额时禁止自动发送;
- 要求人类客服确认;
- 把这类案例加入固定测试。
这时,Eval 帮团队发现并定义了问题。
Harness 则把其中一部分判断变成 Agent 工作时真正会遇到的检查、权限和停止条件。
所以我现在更愿意把两者的关系说成:
Eval Design 帮团队识别哪些错误重要;Harness Engineering 决定怎样通过信息、工具和系统边界,减少、发现或处理这些错误。
它们会交叉,但不是同一个概念。
PM 到底需要参与哪一部分?
PM 不一定要搭建测试框架,也不一定要配置代码仓库。
但如果产品里的 Agent 会读取数据、调用工具或者替用户行动,PM 至少要参与定义五件事。
1. 信息
Agent 做决定时,需要看到什么?
哪些来源可信?资料冲突时以什么为准?哪些数据不应该开放给它?
2. 权限
它只能提出建议,还是可以直接执行?
可以生成回复草稿,还是可以自动发送?可以推荐退款,还是可以实际退款?
3. 边界
什么情况下必须停下来?
信息不足时要不要追问?高风险操作前是否需要确认?连续失败后是否必须转人工?
4. 完成
Agent 说“已经完成”,需要提供什么证据?
是操作记录、引用来源、测试结果,还是最终状态?
5. 失败处理
如果 Agent 判断错误、工具调用失败或者执行了一半,接下来会发生什么?
能不能撤回?怎样告诉用户?怎样把已有工作交给人继续?
Harness Engineering 会成为 AI PM 的核心能力吗?
我现在不会统一下这个结论。
对主要负责简单 AI 生成功能的 PM,它可能只是一个需要了解的工程概念。
但对负责这些产品的人:
Agent;企业内部助手;自动化 workflow;需要读取真实业务数据的 AI;可以调用工具并采取行动的 AI;
理解 Harness Engineering 会更重要。
因为这时,PM 设计的已经不只是 AI 输出什么。
还包括:
它依据什么行动;拥有什么权限;在哪里必须停;怎样证明完成;失败后怎样把控制权交还给人。
Harness Engineering 的实现很工程。
但其中关于信息、权限、边界、验收和人工介入的决定,本来就是产品设计的一部分。