斜杠中年斜杠中年AI × 沟通 × 商业 × 人生
AI 实战指南

用 ChatGPT 做 Harness Engineering:把聊天窗口变成可靠的工作系统

ChatGPT 是强大的模型,但默认只包了一层很薄的 harness。学习如何用自定义指令、Projects、连接器与外部检查为 ChatGPT 搭建 harness,让它做可复现、可验证的工作,而不是一次性答案。

2026-08-14更新: 2026-08-1410 分钟阅读Wesley Chong
#harness engineering#ChatGPT#AI Agent#自定义指令#OpenAI#AI 工作流#效率
用 ChatGPT 做 Harness Engineering:把聊天窗口变成可靠的工作系统|AI 实战指南 封面图

摘要

ChatGPT 给你一个强模型,却只包了一层很薄的 harness。要用于真实工作,得自己补上缺失的层:持久指令、受控连接器、外部验证,以及对任何要上线的东西保留人工确认。

一句话答案

ChatGPT 是一个强模型包着一层很薄的 harness——所以用 ChatGPT 做 harness engineering,就是刻意补上它缺的层:持久指令、受控连接器、外部验证,以及对任何要上线的东西保留人工确认。

多数人把 ChatGPT 当成一个聪明的窗口:问、得到答案、复制、走人。这对头脑风暴有用,对可复现的工作会破——因为默认 harness 几乎不记得你的标准、不会自动检查、也不会对行动设护栏。

问题:好模型,薄 harness

单看一次对话,ChatGPT 在主题之间是「无状态」的,而且默认偏乐观。它很乐意产出看似合理却跑不起来的代码、漏掉你边界情况的摘要,或忽略你约束的计划——因为循环里没有任何东西强迫它验证。

这正是 harness engineering 填补的缺口。回顾总览文章的框架:Agent = Model + Harness。ChatGPT 给你顶级模型加最小 harness。你的工作,是把它之外的一切建起来。

ChatGPT 内建 harness 已经给了你什么

公平地说,现代 ChatGPT 不是裸的。它已经带着几个你该主动用起来的 harness 部件:

  • 自定义指令(Custom instructions)——关于你是谁、你希望回复怎么写的持久前馈引导。
  • 记忆(Memory)——跨对话记住你允许它保留的事实。
  • Projects——一个有自己指令、文件与聊天历史的作用域空间。
  • 连接器 / 资料访问——从已连接 app 与你上传的文件拉取资料的能力。
  • 临时或专注模式——结构化输出、深度研究、编码模式等约束行为的模式。

这些都是真的 harness 组件。但它们是通用、且大多被动的:它们引导模型,却不验证它的产出,也不在你的系统上行动。

不用代码,为 ChatGPT 搭一层 harness

你可以用手上已有的功能把 harness 加厚,再加一条纪律:永远在聊天之外验证。

1. 前馈:让你的标准可被读懂

把你的真实约束写进自定义指令与 Project brief,而不是写进一次性提示词:

  • 你的技术栈、约定、命名规则。
  • 你期望的产出格式(schema、语气、长度)。
  • 对你这类任务,「做完」是什么意思。
  • 明确的「不要」规则(不要编造 API、不要未测试就上生产)。

这提高第一次答案就接近的概率——任何 harness 的第一个目标。

2. 工具:把连接器限得很窄

如果你连接了数据源,先从只读开始。让 ChatGPT 读与汇总;所有写与发送都留给你自己确认。一个狭窄、只读的连接器,远比一个带删除权限的宽连接器安全。

3. 反馈:在聊天之外验证

ChatGPT harness 缺的传感器就是验证。手动补上:

  • 把生成的代码贴进你的项目跑测试套件或 linter。
  • 对生成的文档跑 schema 或拼写检查。
  • 让第二个模型或同事 critique 这份计划。
  • 保留一张「ChatGPT 在我们这里常写错什么」的清单,每次都重查那些点。

4. 审批:你就是护栏

任何要上线的东西——寄出的邮件、写下的文件、部署——都应经过你。ChatGPT 没有原生的执行边界,所以人工确认这一步就是 harness。

你今天就能跑的实用循环

| 步骤 | ChatGPT 做什么 | 你加的(harness) | | --- | --- | --- | | 指定 | 把目标变成清楚 brief | Project 指令 + 自定义规则 | | 行动 | 起草代码、文档或计划 | 狭窄连接器,只读资料 | | 感知 | — | 在聊天外跑测试/lint/清单 | | 修正 | 根据你的反馈改 | 把错误作为新指令喂回去 | | 批准 | — | 任何上线前你确认 |

那个循环——行动、感知、修正、批准——就是你用现有工具做 harness engineering。模型推理,你提供 ChatGPT 默认缺的纪律。

这个天花板在哪里显现

ChatGPT 的 harness 刻意安全且通用,意味着它在这些地方止步:

  • 在你系统上执行——它不会原生跑你的脚本或管 git。
  • 真正的验证回路——检查之所以发生,是因为你跑了,而不是系统要求。
  • 代码的跨会话持久状态——记忆有帮助,但不是带持久任务状态的运行时。

当你需要这些,有两条路:用一段外部脚本包住 ChatGPT 来驱动它并检查结果,或把执行的部分交给本来就有运行时的 Agent——例如编码 Agent,或 Hermes

重点整理

  • ChatGPT 是强模型,配一层薄且大多被动的 harness。
  • 你可以用自定义指令、Projects、受控连接器,以及「在聊天外验证」的习惯把它加厚。
  • 人工批准那一步,是 ChatGPT 自己不给的护栏。
  • 要执行与自动验证,就用代码包住它,或用一个生来就会跑的 Agent。

接着看:Hermes 如何把许多 harness 层开箱即用地交付给你。

常见问题

ChatGPT 已经是一个 AI Agent 了吗?

它是一个模型加一层轻量 harness:记忆、自定义指令、连接器。用于对话够了,用于多步骤、需验证的工作则太薄。Harness engineering 就是你把它加厚、用于生产级任务的方法。

不用写代码,我能加哪些 harness 层?

用自定义指令与 Project brief 做前馈引导,用连接器与资料访问做工具,并养成把输出贴进测试或清单做检查的习惯——那就是反馈传感器。你提供审批那一步。

ChatGPT 的 harness 在哪里会破?

它无法原生在你的系统上执行、跑验证回路,也无法在自身之外保存状态。要做到这些,你需要一个外部流程,或一个真正有运行时的 Agent。

软件任务该用 ChatGPT 还是编码 Agent?

用 ChatGPT 起草、研究、规划。当工作必须真的跑起来、在你的机器上被验证时,用一个内建 harness(测试、git、shell)的编码 Agent。

分享这篇文章 / Share Article
Wesley Chong

作者

Wesley Chong

来自马来西亚居銮的软件开发者、数字顾问、Toastmasters 讲员。

专注帮助普通人用 AI 升级沟通、表达、商业与人生。

相关阅读