# AI 不缺智商缺纪律：一场 Harness 工程化实践

> **来源**: https://mp.weixin.qq.com/s?__biz=Mzg4NTczNzg2OA==&mid=2247509774&idx=1&sn=02c8d0506c7d6ebc8fd58669160f1db3
> **出处**: 微信公众号文章（2026 年第 22 篇），作者为一线工程师的两个月 harness 演进复盘
> **归档日期**: 2026-06-10
> **owner 原话**: 私聊发来截图（「学习AI的1000天·白泽」群里小学 bot 的精读交付范例）+ 本文链接，
> 「你可以看看人家是怎么做到在群里@微信机器人 然后学习的」

## 核心论点

AI Coding 的瓶颈正从「模型能力」转移到「流程工程」：模型已经足够聪明但不稳定，
稳定性必须由外部框架（harness）供给。**堆 prompt 是负债，做框架才是资产**——
prompt 是一次性的说服，harness 是结构性的约束；模型供给智商，harness 供给纪律。

## 要点摘录（保留原文数字）

**遗忘的三重根因**（Agent 遗忘不是 bug，是当前架构的必然代价）：
压缩丢失（Auto-Compact 省略"看似不重要"的流程步骤）、检索失败（记忆文件在但没被加载）、
指令遵循失败（信息都在但模型仍然跳步）。harness 三层设计（规则外置/状态持久化/门禁阻断）逐一对应。

**三层加载模型**（核心思想：把上下文当预算管理）：
- 常驻入口层 CLAUDE.md ≤8K（角色+触发规则+门禁速查），深内容按需 Read
- 依据：LLM 注意力 U 型分布，中部信息准确率显著下降（Stanford "Lost in the Middle", TACL 2024）；
  声称 32K+ 的模型仅半数能在该长度保持可靠（NVIDIA RULER）
- 分层唯一标准不是"按功能分类"，而是"**按何时被读取**"

**检查比预算重要**（arXiv 2605.29682, Effective Feedback Compute）：
原始 token 消耗和工具调用次数仅解释 agent 成功率方差的 **R²=0.33~0.42**；
验证反馈质量达到 **R²=0.94~0.99**。决定 AI 干活靠谱度的不是"给多少预算"，是"检查做得多好"。

**门禁要阻断不要建议**：G1-G8 门禁全是确定性 Python 函数（产物在不在/编译过不过/单测通不通），
任一 FAIL 流程退回，**fail-closed**（默认拒绝）。"流程强制执行必须从 LLM 推理中外置到确定性
基础设施"——不能依赖模型'记住'该执行哪步。hook 是实时围栏不是事后审计。

**改完必部署**：检测到真实业务代码改动 → 自动把部署预发+接口测试追加为必需节点，
堵死"改了代码、没验证就收工"。

**四阶段演进**（每次切换都是止损不是优化）：
拿来主义（开源模板）→ 重 prompt 约束（三天就崩：选择性遵守/上下文爆炸/自我矛盾）→
减负+分层加载 → Agent 调度编排（dispatcher 状态机 + 文件交接）。
24 agent 过度拆分后又合并——"真正需要警惕的不是 agent 多，是 agent 间耦合多"。

**评测驱动**：把 harness 本身当被测软件。7 维确定性评分（流程完整性 22% + 代码正确性 22% 为最重），
零 LLM 调用、3 次跑分 hash 一致。"宁要可复现的粗糙分，不要会漂移的精准分"。
代码正确性真编译真跑单测，并算 AI 自报 vs 实际的"诚实度差距"（honesty gap）。

**经验三级进化**：lesson（单次记录）→ pattern（跨项目归纳）→ instinct（自动注入新项目规则），
每级晋升需人工确认防错误经验扩散。"每条规则都是一次事故的墓志铭"。

**编排三分法**：Workflow 管计算平面（高并行单阶段）、Agent Team 管协作平面、
dispatcher+文件交接管控制平面（有状态工序链+人工门禁+跨天续跑）。文件交接三优势：
天然持久化、可审计（git diff 看得见）、强一致（单写者+schema 校验）。

**记忆前沿**：VikingMem（VLDB 2026）——更少 Token 留存+更智能组织 > 全量保留
（16.82% 留存得分 75.80 vs 朴素 RAG 100% 留存仅 63.81）；Sverklo 双时态记忆
（valid_from_sha/valid_until_sha，更新插新行不覆盖）。

## 与本项目（wechat-agent）的落地点

1. **已对齐·门禁哲学**：self_modify worker 的 syntax+ruff fail-closed+健康检查+冒烟探针、
   记忆对账的 lesson Python 层硬保护、任务接力的 owner 闸/链深闸——全是"确定性代码拦截，
   不靠模型自觉"。文章证实这是业界共识方向，坚持。
2. **已对齐·分层加载**：记忆目录化（250 字目录+get_reflection 按需取全文）≈ 文章的按需上下文层；
   前缀缓存按变化频率分层 ≈ 把上下文当预算。**警惕点**：system_prompt 已 ~10K，group_note 2.4K
   常驻——可引入文章/MemoryOS 的"热度决定常驻资格"（recall_count 高的晋升常驻、长期没碰的降回 FTS 层）。
3. **可抄·验证反馈质量 R²=0.94**：bot_tasks 的任务执行目前零验证层（Claude 输出直接交付）。
   可加最小验证：交付前让 worker 自查"答案是否回应了任务标题"+关键事实有出处，不过度工程。
4. **可抄·经验三级进化**：现在 lesson 是单级。夜间反思可加"同类 lesson 出现 ≥2 次 → 提议晋升
   bot_rule（owner 确认）"——对应 lesson→pattern→instinct 的前两跳。
5. **可抄·诚实度差距**：self_modify 已对比 Claude 自报 JSON vs 实际 changed_files；
   可推广到 bot_tasks（自报"查到了" vs tool_use_log 里真调了搜索工具吗）。
6. **暂不抄**：七维评测平台（重资产，等 harness 改动频率高到"改完不知好坏"再上）；
   向量记忆（文章和咱们的调研结论一致：SQLite+FTS 未被证明是瓶颈前不动）。
