用 AI 审核 AI 的代码,踩了一堆坑之后我的方法
AI 生成的代码量越来越大,人工审查早已跟不上节奏。作者分享一套用 AI 审 AI 代码的实战方法:质量门控打底、给 Agent 完整代码库上下文、真实环境验证、对抗式审查测试、安全扫描以及本地环境信息清理,兼顾审查效率与可靠性,避免被 AI 的完美推理链带偏。
ARCHIVE / INDEX
按时间与主题浏览长期积累的技术文章。
AI 生成的代码量越来越大,人工审查早已跟不上节奏。作者分享一套用 AI 审 AI 代码的实战方法:质量门控打底、给 Agent 完整代码库上下文、真实环境验证、对抗式审查测试、安全扫描以及本地环境信息清理,兼顾审查效率与可靠性,避免被 AI 的完美推理链带偏。
用了一年多 Claude Code 后,作者被 TUI 的刷屏和消息审查体验逼到极限,转而使用多 Agent 控制台 Paseo。它不重造 Harness,原生兼容 Claude Code、Codex 等主流 Agent,支持跨设备远程操控和多 Agent 跨 Provider 协作。
Claude Code 官方把 loop 分成四层:交出验证步骤、停止条件、触发时机和整个决策流程,分别对应 Skill、/goal、/loop 与 /schedule 以及 Proactive 流水线,并给出控制 token 消耗的实操建议。
Claude Code 忽略指令的根因是上下文膨胀。本文编译 Anthropic 官方指南,讲清 CLAUDE.md、Rules、Skills、Subagents、Hooks、Output Styles 这 7 种引导方法的加载时机、压缩行为与上下文成本,并给出四层分级的实践顺序。
Loop Engineering 火了,但它到底是什么?本文梳理从 ReAct、Ralph loop 到 Codex /goal 的演进,讲清它与定时任务的区别、独立验证为何是关键,以及上 loop 前你必须想清楚的那个朴素问题:能不能把「做完了」写清楚。
Claude Code 现在能针对具体任务自己写调度脚本,实时生成动态工作流。本文编译自 Anthropic 官方博客,讲清分类路由、扇出合并、对抗验证、锦标赛等六种调度模式,以及大规模重构、深度验证、根因分析等实战场景,还有什么时候完全不需要动用工作流。
Anthropic 官方博客系统讲解在大型代码库里用好 Claude Code 的方法论:agentic search、CLAUDE.md 分层、Hooks、Skills、Plugins、LSP、MCP、Subagent 七件套,以及配置随模型升级瘦身与组织落地。
OpenAI 发布 Codex Mobile 预览版,让 ChatGPT 手机端远程接管本地 Codex 桌面客户端。本文详解连接配置流程,并对比 Claude Code Remote Control 的架构与用量差异,聊聊移动端异步编程的真正价值。
Claude Code 新增 /goal 命令,靠一个独立小模型评估任务是否真的完成,从而实现无人值守跑长任务。本文详细拆解它的实现原理和 Stop hook 机制,并与 Ralph Loop、Codex /goal 做对比,附具体使用技巧和踩坑经验。
Anthropic 系统梳理了 Agent 连接外部系统的三条路:直接调 API、CLI 和 MCP 协议。本文详解生产级 MCP 服务器的设计模式、认证标准化、Tool Search 上下文优化,以及 Skills 与 MCP 的互补定位。