很多人用 AI 写代码都有种错觉:模型越强,活就干得越好。真到工程现场就被打脸——给 Claude 或 GPT 一个仓库任务,它开头挺像样,读文件写代码一套一套,然后突然跳步、改坏测试、嘴上说「完成」其实啥也没跑通,你收拾烂摊子花的时间比自己写还长。Learn Harness Engineering 这门课要讲的就是这件事:模型没变聪明,变可靠的是它外面的「壳」。这个项目现在 1.9 万 Star,MIT 协议,一份从 0 到 1 的实战课。

是什么
一句话:一门教你自己搭 AI 编码 Agent「外壳」的免费课程。它不讲怎么写更好的 prompt,而是讲怎么给模型设计它赖以运行的整套系统——指令、状态、验证、范围、生命周期。课程叫 Learn Harness Engineering,作者用了一个扎心的实验当引子:Anthropic 同一模型(Opus 4.5)、同一句 prompt(做个 2D 复古游戏编辑器),没 harness 时 20 分钟花 9 美元做出个跑不起来的东西;配全套 harness(planner + generator + evaluator)后 6 小时花 200 美元,做出个真能玩的游戏。模型没变,变的是壳。
它不是视频课,是项目制(project-based)的文档仓库:14 节课、8 个实战项目、覆盖 15 种语言(含简体中文),而且一直在更新。最新加的「Frontier Harness Design Breakdowns」直接逆向拆解 Pi、Claude Code、Codex、DeepSeek 四家的 harness 是怎么搭的——给你框架,再给你真实生产环境里框架怎么落地。

Learn Harness Engineering 仓库主页:19.4K Star,MIT 协议
核心优势
把「不可靠」拆成五个可设计的子系统。课程的核心是一张 harness 五子系统图:Instructions(写什么、按什么顺序)、State(进度日志、特性清单、git 历史)、Verification(测试、lint、类型检查、冒烟跑)、Scope(一次只做一个特性、定义清楚什么叫完成)、Session Lifecycle(开头 init、结尾清状态、给下一轮留交接笔记)。模型决定写什么代码,壳决定它什么时候、在哪、怎么写——壳不让模型更聪明,只让它 output 可靠。
从单循环讲到图工程,不跳步。课程结构是从「为什么别再只会 prompt 你的 Agent」起步,到第 13 讲 Loop Engineering(目标循环、定时循环、maker-checker 循环,手动 vs 自动对比,量化少干预多少次),再到第 14 讲 Graph Engineering——讲清「一个循环就是只有一个节点的图」,什么时候任务需要专精、并行、共享状态、验证、回滚,它就已经不是循环而是图了。每讲配一个渐进式实战项目,模板直接丢进去用。
真实生产案例当教材。四家 frontier 拆解里,Claude Code 讲四层记忆、五级压缩、hooks、子 Agent 隔离;Codex 讲「仓库即真相源、AGENTS.md 当目录页、worktree 隔离」;DeepSeek 讲「一切皆插件、能力接缝、事件管道」。这些不是作者脑补,是照着大厂工程博客还原的。

课程官网:14 讲 + 8 个实战项目
怎么装、怎么用
它本质是 GitHub 上的文档仓库,不用装,clone 下来或直接在课程官网(walkinglabs.github.io/learn-harness-engineering)读就行。想动手,仓库里带 skills/harness-creator/ 这个技能,几分钟就能给你自己的项目脚手架出一个生产级 harness:AGENTS.md、特性清单、init.sh、验证工作流。每节课的实战项目有渐进实验和现成模板(goal-template.md、loop-state-template.md、maker-prompt.md、checker-prompt.md),照着填就能跑。仓库还带 PDF 构建流水线,npm run pdf:build 能生成本地课程书,CI 也能发到 Releases。
学习路径建议从「Quick Start:今天就能改进你的 Agent」那节切入,先把 Scope 和 Verification 两个子系统加上——这俩是投入最小、立刻见效的。再顺着 13、14 讲把循环和图搭起来。课程本身 MIT,可以随便 fork 改造成你们团队的内部培训材料。
不是没有槽点
它是「课」,不是「工具」。你学完不会多一个能直接用的 Agent,而是多了一套设计方法——落地还得你自己写配置、接工具。对只想「装个现成 Agent 开干」的人,这门课要你动脑,不是即插即用。
文档体量大、信息密度高。14 讲 + 8 项目 + 四家拆解,英文原版为主(中文等 15 语言是完整翻译,但术语多,读起来仍费劲)。没有视频,纯长文,对习惯看演示的人门槛偏高。而且它没有告诉你「用哪个框架」——刻意中立,所以初学者容易看完觉得「懂了但不知道第一步敲什么命令」,得靠 harness-creator 技能把抽象落到地上。
更新快,链接会漂。课程几乎每月加新章节(8 月加图工程、7 月加循环工程),读旧笔记时部分内部锚点可能已重构,建议跟官网最新版而不是某个 fork。
跟同类怎么比
和那些「10 分钟学会用 Cursor」的短视频比,它不教你点哪个按钮,教你为什么你的 Agent 会失败、失败在壳的哪一层——这是根因层面的认知,短期不爽但长期值钱。和 OpenAI / Anthropic 官方的 harness 工程博客比,它把这些分散的文章收成一套有序、带项目、带模板的课程,还补了 Pi / DeepSeek 的拆解,适合系统学而不是碎片化读。
一句话:如果你带团队做 AI 编码工具、或者受够了「模型聪明但活干不利索」,这门课是少有的把 harness 讲透的免费资源,先读第 13、14 讲和四家拆解就回本了。
GitHub:walkinglabs/learn-harness-engineering
你手上最想让 AI 稳定干完、现在却总翻车的那个开发任务,卡在哪个子系统上了?