引言:为什么需要Loop Engineering?
2026年6月,AI编程圈最火的一句话只有六个字:
“设计Loop”
Peter Steinberger的一条推文引爆了整个AI编程时间线。但什么是Loop?为什么它这么重要?
传统方式:你发一条prompt → AI回复 → 你再发一条 → AI再回复 → 如此循环
>
Loop Engineering:你设计一个循环系统 → AI自动执行、评估、改进 → 直到完成目标
核心区别:人类不再参与中间过程,而是设计一个能自我迭代的系统。
从Prompt到Loop的演进
单次Prompt模式(2022-2024)
`
用户 → Prompt → AI → 结果
`
特点:
- 一次性交互
- 人类需要手动调整
- 无法处理复杂任务
类比:你告诉厨师”做一道菜”,厨师做完给你,你说”太咸了”,厨师再做一道…
多轮对话模式(2024-2025)
`
用户 → Prompt1 → AI → 结果1
用户 → Prompt2 → AI → 结果2
用户 → Prompt3 → AI → 结果3
`
特点:
- 人类参与每一轮
- 可以根据结果调整
- 但效率低、成本高
类比:你一直在厨房盯着,每一步都要你确认。
Loop Engineering模式(2026+)
`
用户 → 目标 → [Loop: 执行→评估→改进] → 最终结果
`
特点:
- 人类只设定目标
- AI自动迭代
- 自我修复和改进
类比:你告诉厨师”做一道满意的菜”,厨师自己尝试、品尝、调整,直到做出满意的菜。
什么是Loop?
定义
Loop(循环):AI Agent的迭代执行过程,包含执行、评估、反馈、改进四个阶段。
AI PRO·Loop 循环工程):设计、构建和优化这些循环的工程学科。
Loop的四个阶段
`
┌─────────────────────────────────────────────┐
│ │
│ ┌──────────┐ ┌──────────┐ │
│ │ 执行 │───→│ 评估 │ │
│ │ Execute │ │ Evaluate │ │
│ └──────────┘ └──────────┘ │
│ ↑ │ │
│ │ ↓ │
│ ┌──────────┐ ┌──────────┐ │
│ │ 改进 │←───│ 反馈 │ │
│ │ Improve │ │ Feedback │ │
│ └──────────┘ └──────────┘ │
│ │
└─────────────────────────────────────────────┘
`
四个阶段:
| 阶段 | 作用 | 类比 |
|---|
|——|——|——|
| 执行(Execute) | AI完成任务 | 厨师做菜 |
|---|---|---|
| 评估(Evaluate) | 检查结果是否满意 | 品尝菜 |
| 反馈(Feedback) | 分析问题在哪里 | 说出哪里不好 |
| 改进(Improve) | 调整策略再试 | 调整做法 |
Loop的三种类型
1. 简单Loop
`
执行 → 评估 → 结束
`
适用于:一次性任务,不需要改进
2. 反馈Loop
`
执行 → 评估 → 反馈 → 改进 → 再执行
`
适用于:需要迭代优化的任务
3. 自我修复Loop
`
执行 → 评估 → 发现错误 → 自动修复 → 再执行
`
适用于:需要高可靠性的任务
Loop的核心组件
执行器(Executor)
职责:完成具体任务
示例:
- 写代码
- 生成文章
- 分析数据
关键设计:
- 明确的输入输出
- 可控的执行环境
- 错误处理机制
评估器(Evaluator)
职责:检查执行结果
评估维度:
- 正确性:结果是否正确?
- 完整性:是否遗漏了什么?
- 质量:结果质量如何?
- 效率:是否用了最优方法?
评估方式:
- 自动化测试
- LLM评估
- 人工抽查
反馈器(Feedback)
职责:分析问题并生成改进建议
反馈内容:
- 问题描述
- 原因分析
- 改进建议
反馈格式:
`json
{
“issue”: “代码有语法错误”,
“cause”: “缺少括号”,
“suggestion”: “在第10行添加右括号”
}
`
改进器(Improver)
职责:根据反馈调整执行策略
改进方式:
- 修改提示词
- 调整参数
- 更换方法
大厂实践
Anthropic的实践
核心理念:”构建循环,而非单次提示”
实践案例:
- Claude Code:自动编码、测试、修复循环
- 长时间运行Agent:可以运行数小时的循环系统
关键设计:
`
目标 → Claude执行 → 测试 → 失败 → 分析错误 → 修复 → 再测试
`
Boris Cherny(Anthropic工程师):
“生产环境的AI编码需要Harness Engineering——构建系统,而不是写提示词。”
OpenAI的实践
核心理念:”设计让AI可靠工作的环境”
实践案例:
- Codex:自动代码生成和修复
- 百万行代码实验:0%人工编码
关键设计:
`
需求 → AI生成代码 → 自动测试 → 失败 → AI分析 → 修复 → 再测试
`
LangChain的实践
核心理念:”Agent Engineering是迭代过程”
实践案例:
- LangGraph:可视化构建Agent循环
- LangSmith:监控和调试循环
关键设计:
`
定义状态 → 设计转换 → 构建循环 → 监控执行
`
Loop vs 传统工作流
| 维度 | 传统工作流 | Loop Engineering |
|---|
|——|———–|——————|
| 执行方式 | 线性执行 | 循环迭代 |
|---|---|---|
| 错误处理 | 人工介入 | 自动修复 |
| 优化方式 | 手动调整 | 自动改进 |
| 适用场景 | 简单任务 | 复杂任务 |
| 人类角色 | 参与每一步 | 设计循环 |
Loop设计原则
明确终止条件
问题:Loop什么时候停止?
终止条件:
- 达到目标
- 超过最大迭代次数
- 成本超限
- 质量达标
示例:
`python
while not goal_achieved and iterations < max_iterations:
result = execute()
if evaluate(result) >= quality_threshold:
break
feedback = analyze(result)
improve(feedback)
iterations += 1
`
避免无限循环
问题:AI可能一直在改进但永远不达标
解决方案:
- 设置最大迭代次数
- 监控改进幅度
- 人工介入机制
保持可追溯性
问题:循环多次后,不知道做了什么
解决方案:
- 记录每轮执行
- 保存评估结果
- 追踪改进历史
控制成本
问题:循环多次会消耗大量token
解决方案:
- 设置成本上限
- 监控token使用
- 优化循环效率
简单示例:代码修复Loop
场景
AI写了一个Python函数,但有bug,需要自动修复。
Loop设计
`python
def code_fix_loop(initial_code, max_attempts=5):
code = initial_code
for attempt in range(max_attempts):
# 执行:运行代码
result = run_code(code)
# 评估:检查是否有错误
if result.success:
return code # 成功,退出循环
# 反馈:分析错误
error_analysis = analyze_error(result.error)
# 改进:修复代码
code = fix_code(code, error_analysis)
return code # 达到最大尝试次数
`
执行过程
`
第1轮:
执行:运行代码
评估:SyntaxError: missing parenthesis
反馈:第10行缺少右括号
改进:添加右括号
第2轮:
执行:运行修复后的代码
评估:NameError: undefined variable
反馈:第15行变量名拼写错误
改进:修正变量名
第3轮:
执行:运行修复后的代码
评估:测试通过 ✓
结束:返回修复后的代码
`
常见Loop模式
生成-测试Loop
`
生成 → 测试 → 失败 → 重新生成
`
适用于:代码生成、内容创作
搜索-优化Loop
`
搜索 → 评估 → 选择更好的 → 继续搜索
`
适用于:参数调优、方案选择
规划-执行Loop
`
规划 → 执行 → 检查 → 调整规划
`
适用于:项目管理、任务分解
学习-应用Loop
`
学习 → 应用 → 反馈 → 改进学习
`
适用于:技能训练、知识积累
下一讲预告
下一讲:《AI PRO·Loop Day 2:设计你的第一个Loop》
我们将:
- 设计一个简单的文本改进Loop
- 实现执行器、评估器、反馈器、改进器
- 测试循环效果
- 分析优化策略
参考资料
官方文档
中文资料
视频教程
💡 一句话总结:Loop Engineering不是让AI更聪明,而是让AI能自我改进。
发表回复