Harness in Agentic Systems (Agent 控制系统)
Harness 是指环绕在底层大语言模型(LLM)外部,使其能够在实际工程中有效运转的控制系统、运行时环境及反馈环路。在 AI Agent 系统中,Harness 才是真正的核心产品本身。
黄仁勋:Agent 五要素精准定义
Source: 2026-06-21-xiaohongshu-xhslink-com-o-AmzoMy5cNSE(来源未公开)
黄仁勋(Jensen Huang)给出了 Agent 组成的最简洁定义:
“The agent consists of model, harness, tools and skills and a runtime — you can think of the model as the brain, the harness as the body, the tools that it uses, working in a runtime, think of it as a workshop. So this is a person, a worker working with tools in a workshop.”
五要素对应:
| 要素 | 比喻 | 职责 |
|---|---|---|
| Model(模型) | 大脑 (Brain) | 推理、决策、生成内容 |
| Harness(控制层) | 身体 (Body) | 编排、记忆、流程控制 |
| Tools(工具) | 工具 (Tools) | 执行外部操作(API、搜索、代码运行) |
| Skills(技能集) | 技能 (Skills) | 预设知识与操作规范(SKILL.md) |
| Runtime(运行时) | 工坊 (Workshop) | 执行环境,提供沙盒、资源与基础设施 |
这一定义与 loop-engineering 中的六大核心积木形成精确对应,共同构成生产级 AI Agent 的完整架构蓝图。
汽车引擎比喻
如果把 AI Agent 系统比作一辆跑在地面上的汽车,那么:
- 引擎 (Engine):相当于底层大模型(如 Foundational LLM,例如 Opus-4.7, Codex-5.5 等)。它由基础大模型实验室提供。
- Harness:则相当于汽车的底盘、轮子、车身、燃油系统以及所有的控制传动机构。
- 产品本质:只有引擎是无法让人安全行驶的,必须依靠 Harness 把动力传递到地面。在 Agent 应用开发中,相比于单纯调用 LLM,如何设计外围的环境反馈、流程环路、状态记忆和评估机制(即 Harness)才是决定产品成败的关键。
Source: 2026-06-22-xiaohongshu-xhslink-com-o-3QNNBapJVwB(来源未公开)
模型升级与 Harness 的重构
- 联动进化:每当底层大模型能力改变时,外层的 Harness 必须进行相应的重新构建。
- 非简单替换:不能简单地把一个更强大的新引擎直接塞进旧的汽车底盘(Chassis)中。模型能力(如指令遵循、规划能力、上下文窗口)的变化,意味着与其交互并控制它的系统架构也必须随之演进。
Source: 2026-06-22-xiaohongshu-xhslink-com-o-3QNNBapJVwB(来源未公开)
Harness 的记忆治理子系统
为了克服大语言模型(LLM)的预测随机性与不确定性,Harness 必须构建一套分层记忆架构以规范智能体运行时的行为:
- Working Memory (工作记忆):即大模型的 Context Window,加载当前的输入 Prompt、即时会话历史以及 System Prompt。
- Procedural Memory (程序性记忆):定义智能体技能与动作边界的规范。以 Markdown 文件(例如特定
Skills指南)形式预置,充当 Harness 约束野马的“马具”。 - Semantic Memory (语义记忆/知识库):存放不可变事实的持久化文件或数据库,通过 RAG 机制进行语义召回,并注入工作记忆中。
- Episodic Memory (情境记忆/时间序列):由时间戳驱动的历史事件和多轮会话明细的列表,通常以结构化数据库(如 SQL / Vector DB)归档。
- 记忆的蒸馏与整合 (Consolidation):为了防止上下文迅速膨胀导致高昂 Token 成本与模型迷失,Harness 需设定阈值(例如每累积 2000 次会话)。自动触发后台的 Summarizer Agent,将 Episodic Memory 中的碎屑记录进行提炼,作为持久事实写入 Semantic Memory 中,实现自适应记忆瘦身。
黄仁勋:未来所有公司都将建立在 Harness 之上
Source: 2026-07-09-xiaohongshu-xhslink-com-o-6FzNySw55Zo(来源未公开)
NVIDIA CEO 黄仁勋 明确预言:“未来,绝大多数公司将建立在 Harness 之上(In the future, most companies will be built on harnesses)。”
LangChain 作为公司的操作系统(Company OS):
黄仁勋以 LangChain 为例,将其定位为企业运营的 AI 基础调度层——就像 Windows/macOS 是个人电脑的操作系统,LangChain 成为企业的”公司 OS”,将固定工作流(Workflow)串联并升级为自主智能体(Autonomous Agent)。
Harness 的进化路径:
- Workflow(工作流):预设规则、固定步骤的流程自动化,人类定义每一步
- Autonomous Agent(自主智能体):能够自行判断并决定下一步行动的系统
- Harness 是连接两者的架构——它是让 LLM 从”被动执行者”升级为”主动决策者”的控制层
“改 Harness vs. 改模型”的 ROI 对比(Nemotron 3 案例):
- 修改 Prompt 和 Tools(Harness 层):高 ROI,立竿见影,成本极低
- 后训练模型(Post-training):提升能力天花板,但成本高、周期长
- 结论:绝大多数团队的首要杠杆在 Harness 层,而非盲目追求更大的基础模型
Tracing 与 LLM Ops 反馈闭环
一个成熟的 Harness 系统不仅有静态配置,更应该具备动态监测与调优能力:
- 事件链路追踪 (Tracing System):通过工具(如 LangSmith)将单次 Agent Run 记录为一颗事件树(Tree of Events),详细搜集 Token 消耗量、网络时延(Latency)、工具调用次数及返回值等数据。
- 评估评分 (Evaluation System):通过确定性规则或引入 “LLM as a judge” 对时延和工具执行健康度进行打分。
- 闭环诊断与更新:通过评估得出的 Latency 瓶颈与错误,Harness 可以智能诊断(如是否是 RAG 文本切片过大)并自动热更新 System Prompt 或模型配置,完成自愈与自演进。 [来源:2026-06-29-xiaohongshu-xhslink-com-o-9V8xCcNLb4t(来源未公开)]
前沿技术终局:Harness 的动态自主化生成
- 动态生成与去静态化:AI 实验室的前沿预测共识指出,随着大模型推理与规划能力的极限提升,未来的 Harness 甚至不再需要人类开发者手动进行硬编码的规则配置。在未来一年内,大模型将能根据面临的具体物理、数学、材料科学或工程难题,在运行期动态地**“自主编排与生成(spinning up harnesses as needed)”**其所需的控制环路、工具调用及环境配置,甚至实现 AI 与 AI 之间的自主交互。
- “Anthropic 员工与性工作者”二分警示:技术前沿群体半调侃地指出,未来人类工作极简化图景只剩下“Anthropic 员工(AI 实验室核心开发者)”与“性工作者(或极少数需要物理具身操作的行业)”。这种极致的技术替代预示了人类退出生产和消费链条的生存困境。
- 社会学群体冲击与抗议:这种彻底的认知与体力工作替代,正在诱发大众对于生存资源被夺走的恐惧与愤怒。在“大众幻想与群体狂热”的心理驱动下,群体可能会寻找诸如保护水源或濒危物种的道德借口,针对 AI 基础设施(如数据中心)进行非理性攻击或呼吁技术国有化。
Source: 2026-07-12-xiaohongshu-xhslink-com-o-3S3wuCoyNaa(来源未公开)
窄工具面与按需扩展
Pi Agent 展示了一种极简 Harness:由 AGENTS.md、系统提示、模型和少量读写/编辑/Bash 工具构成主循环;会话在本地持久化并可分叉。它默认不预载 MCP、子 Agent 或规划层,把上下文预算与权限面留给当前任务。
- 程序性知识按需注入:将重复流程写成 agent-skills,在触发时加载,而非把所有工具说明常驻上下文。
- 会话不是全部记忆:本地会话树便于回溯和分支,但跨任务的稳定事实与决策仍应进入 agent-memory-architecture。
- 分层组合:极简 Agent 可以作为上层编排系统中的专职编码单元;是否引入多 Agent、RPC 或扩展,应由任务复杂度而非默认架构决定。
Source: 2026-07-27-xiaohongshu-xhslink-cn-o-37VvD2zqvpO-8aa7013d4a(来源未公开)
开源 Harness 范式:DeepSeek Harness (一切皆插件)
- 模块化底座:DeepSeek 于 2026 年 8 月开源的 deepseek-harness(v0.1 版本)采用了“一切皆插件”的设计原则。依托 Cordis 元框架,将 Agent 的所有组件(提示词工程、工具链、记忆存储、评估循环与 Web UI)全部解构为热插拔插件。
- 解耦优势:不同应用场景下的开发者无需更改框架核心,即可在配置层自由组合、无侵入替换任一能力,实现了真正工业级的 Agent 控制层治理。
Source: 2026-08-14-article-mp-weixin-qq-com-s-mANdGRI4fO_sEbC1ECEoZQ-74e904a3c6(来源未公开)
2026 演进:Harness 的分层架构与微决策轻量化
Source: 2026-09-26-bilibili-b23-tv-fvt1SW3-3927e88872.md(来源未公开), 2026-09-26-x-x-com-omarsar0-status-2102762406204076532-s-46-b821918a62.md(来源未公开)
- 向上一层:被 ADE(Agent Development Environment)编排:
在单智能体工具循环成熟后,工程焦点上移至多 Agent 协同。单个 Harness(如 Claude Code, Codex, Devin)不再孤立运行,而是被上层的 ADE 所调度,由人类指挥官统一管理工具流集成与数十个 Harness 的中途断点。 - 向内收敛:微决策门禁模型(Jev / Tev1 范式):
传统的 Harness 在工具调用安全审计、动态模型路由与终止条件判定时依赖全量通用 LLM,带来极高时延与 Token 开销。2026 年最新实践采用专门微调的 4B 专用分类器替代自由文本对话模型,输出纯数值/布尔裁决,将 Harness 每步状态拦截的耗时与成本降低 90% 以上。