当前位置:首页>java>让 AI 自己写代码、自己测试、自己改 bug

让 AI 自己写代码、自己测试、自己改 bug

  • 2026-08-27 07:30:38
让 AI 自己写代码、自己测试、自己改 bug
昨天,我让 Claude Code 跑了 2 个多小时。
不是我在写代码,是它在写。我只是偶尔看一眼进度,确认方向没跑偏。
而今天,它学会了自己测试 —— 自己启动服务,自己打开浏览器,自己发现 bug,自己调试修复。
这不是胡扯,这是我正在用的开发工作流。
---

为什么需要"长程任务"工作流

用 AI 写代码,最常见的方式是对话:你问一句,它答一句,你再问,它再答。
但这种方式有几个问题:
1. 上下文会丢失
聊着聊着,它就忘了前面说过什么,开始重复或者矛盾。
2. 方向容易跑偏
没有明确的计划,写着写着就偏离了最初的目标。
3. 没有检查点
出了问题不知道从哪里开始出错的,只能从头再来。
所以我设计了一套"长程任务"工作流,核心思想很简单:
拆分 + 记录 + 审核
把大任务拆成小步骤,每一步都有记录,关键节点让多个模型交叉审核。
---

我的工作流

先放三个关键资源,后面会用到:
  • superpowers — Claude Code 技能增强库
  • GuDaStudio/skills — Codex 和 Gemini 的桥接接口
  • autonomous-coding — Anthropic 官方的长程开发思想
我的工作流分四个阶段:
---

阶段一:需求讨论

不要上来就让 AI 写代码。
先用 `/superpowers:brainstorm` 和它讨论需求:你要做什么、边界在哪、有哪些约束。
讨论完一轮后,把结果交给 Codex 和 Gemini 做多模型审核。不同模型有不同的盲区,交叉审核能发现单一模型看不到的问题。
这一步的产出是:一份经过多轮审核的需求文档
---

阶段二:计划拆分

需求确定后,用 `/superpowers:write-plan` 生成开发计划。
关键点:计划不能太长
我的做法是拆成两层:
  • 第一层:overview(整体架构和模块划分)
  • 第二层:每个模块的具体步骤
一次给太长的计划,AI 容易丢失细节或者跑偏。分层拆解,每次只关注一小块。
过程中还发现要仔细的审查一下AI制作的计划,可能会有部分和我们想要的有歧义,有冲突,及时的调整和审核。
---

阶段三:执行开发

使用 `/superpowers:execute-plan` 让 AI 按计划一步步写代码。
我做了两个改进:
1. 引入 `.workflow/state.json` 记录进度
这个思路来自 Anthropic 官方的 autonomous-coding 方案。每完成一步就更新状态,任务中断后可以恢复,不用从头再来。
2. 每三步自动多模型审核
每完成三步,自动调用 Codex 和 Gemini 进行审核,直到两个模型都没有重大意见为止。
昨天跑了 2 个多小时,产出了一个完整的 MVP pipeline。
---

阶段四:自动测试

这是今天的新尝试。
让 Claude 自己:
  1. 启动 Next.js 前端服务
  2. 启动后端 API 服务
  3. 通过 chrome devtools MCP 打开浏览器
  4. 按测试计划执行全流程测试
  5. 发现 bug → 定位问题 → 修复 → 再测试
我之前试过 Claude 自带的 chrome 插件,发现不能自动上传文件,后来换成了 chrome devtools MCP,体验好很多。
---

关键心得

用了几天这套工作流,有三个感受比较深:
1. 多模型审核真的有用
单一模型有盲区。Claude 觉得没问题的代码,Codex 可能会指出潜在 bug;Gemini 可能会提出更好的架构建议。
交叉审核不是为了"投票",是为了看到更多视角
2. 状态记录让长任务成为可能
以前让 AI 写复杂功能,最怕的就是中途出错要从头再来。
有了 `.workflow/state.json`,任务可以中断、可以恢复、可以追溯。哪一步出了问题,回滚到那一步就行。
3. AI 的"闭环能力"超出预期
让它自己启动服务、自己测试、自己改 bug——我本来以为会很拉胯,结果它真的能跑通整个流程。
当然不是 100% 完美,但已经能帮我省掉大量重复劳动。
---

最后

这套工作流还在迭代中,我也在边用边改。
后续会继续分享:
  • 具体的 superpowers 配置方法
  • 多模型审核的细节设置
  • 更多实战踩坑记录
如果你也在用 AI 辅助开发,欢迎交流,一起探索这条路能走多远。

最新文章

随机文章