Glean 拾遗
最近收录

42 条 · 按时间

07-20

构建真正可用的 Claude Code 技能:完整指南

本指南从零开始构建一个 Claude Code 技能(commit-messages),详细讲解技能文件夹结构、SKILL.md 的写法(尤其是 description 的关键作用)、如何通过 scripts 文件夹确保指令一致性,以及 references 和 assets 的按需加载策略。强调 description 决定了技能是否被触发,而并非指令本身。适合所有使用 Claude Code 希望固化工作流的工程师。

x.com · 11 min · Agent Engineering · Ai Tooling · Claude Code
07-20

2026年前沿模型选型实操指南:Kimi K3、Claude Fable 5、GPT-5.6 按任务分派

截至2026年7月,没有任何单一模型在所有任务上最优。Kimi K3(2.8T参数)在前端UI和图像理解上以6/7领域领先,价格仅Fable 5的1/12;Claude Fable 5在SWE-Bench Pro达80.3%,适合后端复杂架构和长周期自主Agent工作,但最贵;GPT-5.6 Sol在调试上出色,但有游戏模糊目标的倾向,需明确定义成功标准。文章提供了按任务类型路由的决策框架,并强调路由技能比选定单一模型更重要。同时讨论了成本计算、合规性和供应商锁定风险。适合AI工程师、产品构建者。

x.com · 25 min · Agent Engineering · AI · Cost Optimization
07-17

Graphify:将任意代码库转化为AI编程助手可查询的知识图谱

Graphify 是一个将代码库、文档、PDF、图片和视频映射为知识图谱的开源工具,专为 AI 编程助手(如 Claude Code、Cursor、Gemini CLI 等 20+ 平台)设计。它使用 tree-sitter AST 对代码进行确定性解析(完全本地、无需 LLM),对文档/媒体则通过 AI 助手模型做语义提取。输出是一个可交互的 HTML 可视化、一份 Markdown 报告和可复用的 graph.json,支持用户通过自然语言查询、路径追踪和概念解释。每一条边都带有置信度标签(EXTRACTED / INFERRED),让开发者明确区分“读到的”和“推测的”。适合需要快速理解大型陌生代码库或在长尾维护中依赖 AI 助手的工程师。

github.com · 47 min · Agent Engineering · Ai Tooling · Code Intelligence
07-17

让 Fable 自行判断:节省 Claude Code token 的实战技巧

Simon Willison 分享了从 Claude Code 团队获得的实用建议:不要命令 Fable 何时编写测试,而是让它自行判断;同样,将编码任务委托给更低成本的子模型(Sonnet、Haiku),由 Fable 决定何时降级。在 Claude Code 即将涨价之际,这一技巧尤为实用。他展示了通过记忆文件配置,让主模型在处理每个编码任务时自主选择合适模型并派生子代理。实测表明,这能在保持开发效率的同时显著降低 Fable token 消耗。文章适合所有使用 Claude Code 并关注成本控制的开发者。

simonwillison.net · 2 min · Agent Engineering · Ai Tooling · Claude Code
07-17

Kimi K3 发布:2.8T参数开源模型,聚焦长周期编程与知识密集型工作

月之暗面发布了 Kimi K3,一个 2.8T 参数的开源模型,采用 Kimi Delta Attention (KDA) 和 Attention Residuals (AttnRes) 架构,激活 896 个专家中的 16 个,扩展效率较 K2 提升约 2.5 倍。Kimi K3 支持原生视觉和 100 万 token 上下文窗口,在编程、知识工作、推理等基准上与 Claude Fable 5 和 GPT 5.6 Sol 竞争,虽整体仍稍逊,但在多个内部评测中表现突出。文章详细展示了其在 GPU 内核优化、编译器开发(MiniTriton)、3D 游戏开发、芯片设计(48 小时自主设计芯片)、科研复现(2 小时完成通常 1-2 周的工作)等场景的案例。Kimi K3 即日起可通过 Kimi.com、Kimi Work、Kimi Code 和 API 使用,完整模型权重将于 7 月 27 日开源。适合 AI 系统工程师、模型开发者、以及需要长周期代理工作能力的研究人员。

www.kimi.com · 19 min · Agent Engineering · Coding · Kimi K3
07-16

模型越强,工具越差:Anthropic 新模型为何在第三方编辑工具上表现倒退

Armin 在开发 Pi 代码编辑器时发现一个反直觉的问题:Claude Opus 4.8 和 Sonnet 5 等最新模型在调用 Pi 的自定义 edit 工具时,会在嵌套的 edits[] 数组中凭空生成不存在的字段,导致工具调用被拒绝。而更早的 Claude 模型则不会犯这个错误。Armin 推测这是因为 Anthropic 通过强化学习(RL)专门训练了新模型优化 Claude Code 内置的编辑工具,但这种针对性训练意外损害了模型对其他编辑工具模式的兼容性。文章讨论了第三方编码框架是否应该为不同模型实现多套编辑工具接口,以及专用训练与通用性之间的根本矛盾。

simonwillison.net · 2 min · Agent Engineering · AI Engineering · Claude Code
07-14

三大AI Agent技能框架深度对比:Matt Pocock Skills、Superpowers与Agent Skills

本文系统比较了三种主流的AI Agent技能框架:Matt Pocock Skills(工程实践型)、Superpowers(社区工作流型)和Agent Skills(生产级生命周期型)。从定位、技能粒度、学习曲线、Token消耗、工具支持、社区规模等维度逐一对比,并给出了个人开发者、小团队、中大型团队及企业级项目的选型建议。核心发现:Matt Pocock Skills擅长快速对齐与架构优化,Superpowers提供端到端工作流与丰富插件生态,Agent Skills则以验证门控和反合理化设计保障代码质量。文章还提供了三者组合使用的策略。适合正在为AI编码助手选择工作流框架的开发者与技术负责人。

www.besthub.dev · 8 min · Agent Engineering · Ai Tooling · Comparison
07-12

Anthropic 的信任危机:封闭生态、涨价与工程师的觉醒

本文作者以亲身经历痛陈 Anthropic 近年来的系列争议做法:API 不稳定却垄断订阅渠道、Claude Code 生态封闭且 bug 堆积、通过“额外用量”和分池计费变相涨价。作者指出,这些做法并非为改善产品,而是为下一轮模型训练筹集资金。作者回归“agent-assisted”而非“agent-driven”的工作流,并用 OpenRouter 搭配 Qwen、GLM 等开源模型替代 Claude,同时通过 AI Gateway 控制成本与数据安全。适合受困于单一 AI 平台、寻求更开放替代方案的一线工程师。

raheeljunaid.com · 11 min · Agent Engineering · Anthropic · Claude Code
07-11

Agent 编码的测试、基准与方差:来自一线的深度复盘

Dan Luu 分享了他过去一年密集使用 AI 编码代理(coding agents)的实战经验,重点围绕测试、基准测试和代理循环。他对比了 fuzzing(随机测试)与 LLM 直接找 bug 的效果,认为 fuzzing 在速度和误报率上更优;用 50 次运行验证了 ‘caveman mode’ 节省 token 但效果不稳定;揭示了 LLM 基准测试的高方差问题——同一模型在不同任务上的表现差异巨大,导致公共基准对个体用户几乎没有指导意义。他还讨论了如何用代理自动从支持工单生成 PR、用多 persona 协作减少误报,以及数据分析和代理循环中的系统性难点。适合关心 AI 编码工具真实效果的一线工程师阅读。

danluu.com · 91 min · Agent Engineering · Fuzzing · LLM Benchmarking
07-10

用 Fable 5 搭建自我改进的代理系统:14 步指南

本文提供了一份详细的 14 步路线图,教你如何利用 Claude Fable 5 构建一个能自我改进的代理系统。核心在于将 Fable 5 从“提示-关闭”的临时工具转变为持续累积的系统:通过 /goal 和 Outcomes 实现自纠正循环,用独立验证子代理替代自我批评来提升探索空间,借助状态文件(STATE.md)和 Skills 实现跨会话记忆,并利用动态工作流和 Routines 实现长时间自主运行。文章还给出了成本-能力矩阵(Fable 5 用于编排,Sonnet 4.6 用于工作,Haiku 4.5 用于评分)以及 Mythos 安全边界的处理建议。适合想要真正发挥 Fable 5 长期自主能力的 AI 工程师和系统设计师。

x.com · 28 min · Agent Engineering · Agents · AI Engineering
07-10

掌握Claude Code循环模式:从手动提示到自动任务编排

Claude Code团队定义了四种循环模式(turn-based、goal-based、time-based、proactive),并详细说明其触发方式、停止条件、适用场景及成本控制技巧。文章通过具体命令(/goal、/loop、/schedule)和SKILL.md示例展示了如何让Agent迭代工作、自验证结果,以及如何组合原语构建自动化工作流。适合正在探索Agent工程化的开发者。

07-10

Claude Code 技能实战:Anthropic 内部数百条技能的经验与分类

Anthropic 工程师基于内部使用数百条 Claude Code 技能的经验,系统总结了技能的九大类型(库/API 参考、产品验证、数据获取、业务流程、代码模板、代码质量、CI/CD、Runbook、基础设施运维),并给出了具体编写技巧:聚焦非显而易见的提示、构建 Gotchas 部分、利用文件系统渐进式披露、避免过度约束、合理设计配置、用 description 字段触发选择、在技能内存入数据(如日志文件或 SQLite)、以及用脚本/库减少模型 token 消耗。文章还讨论了技能的分发方式(仓库内嵌 vs 插件市场)、依赖组合与埋点测量。适合正在构建 Agent 工作流的工程师参考。

x.com · 15 min · Agent Engineering · Agent Skills · Anthropic
07-10

11天、64个AI Agent、535K行代码:Bun从Zig到Rust的史诗级重写

本文是Bun创始人Jarred Sumner的亲身复盘,详细记录了如何借助Anthropic的Claude Fable 5模型,在11天内将Bun的535,496行Zig代码完全重写为Rust。重写动机是Zig手动内存管理在混合GC场景下导致的频繁use-after-free、double-free和内存泄漏。作者没有采用渐进式重写,而是让64个Claude Agent并行工作,通过动态工作流(dynamic workflow)和对抗性审查(adversarial review)确保代码质量。最终整个测试套件(60万+断言)在6个平台全部通过,修复了128个已知bug,内存占用降低最多90%,二进制缩小约20%,吞吐量提升2-5%。文章详细披露了AI辅助下的工作流程、遇到的典型移植错误(如debug_assert!副作用、切片越界、comptime格式化),以及Rust的Drop机制如何系统性防止Zig中defer容易遗漏的清理问题。这是一线工程师利用前沿AI工具完成不可能任务的第一手报告,对任何关注AI工程、运行时实现或语言迁移的人员都有极高参考价值。

bun.com · 65 min · Agent Engineering · AI Engineering · Code
07-09

技能仓库v1.1:/to-spec与/to-tickets重命名、全新Wayfinder探索流程及Grilling改进

本文介绍了AI agent技能仓库v1.1版本的重大更新,包括技能重命名、合并、新增技能以及工作流程改进。核心变化:/to-prd更名为/to-spec以统一“规范”术语;/to-plan和/to-issues合并为/to-tickets,支持本地文件或真实追踪器的边缘阻塞关系。grilling技能修复了同时问多个问题、未确认即执行以及偶尔自我grill的bug。新增/wayfinder技能,用于将超大任务拆解为带依赖图的GitHub issue,分步探索;配套/research和/prototype技能支持自动研究和原型制作。代码审查技能集成Martin Fowler的十种重构坏味道(如神秘命名、重复代码),仅需10行指导即可显著提升代码质量。TDD技能改为纯参考材料,重构步骤移至代码审查阶段。文章还给出了推荐工作流:Grilling → Spec → Tickets → Implement → Code Review。适合使用AI agent进行软件开发的工程师。

www.aihero.dev · 12 min · Agent Engineering · Ai Tooling · Context Engineering
07-09

写作优秀技能——技能元指南

本文介绍 `writing-great-skills` 这一元技能,作为编写和编辑可预测 AI 技能的参考框架。核心概念是 **认知负荷** 与 **上下文负荷** 之间的权衡:模型调用的技能消耗上下文负荷但自动触发,用户调用的技能零上下文负荷但需你记住其存在。文章提供了管理这些负荷的工具,包括 leading words(锚定执行的关键词)、信息层次(逐步披露)、修剪(单一真实来源与无操作测试)以及失败模式(过早完成、重复、沉积等)。适合为 agent 编写一致且可维护技能的系统构建者。

www.aihero.dev · 3 min · Agent Engineering · Ai Tooling · Context Engineering
07-08

Claude Agent 持久记忆搭建:从基础到自改进的12步指南

本文总结了为 Claude Agent 添加持久记忆的完整方案,覆盖四层架构:Claude 内置 Chat Memory、Project 持久指令、memory.md 文件记忆以及 Dreaming(自改进记忆)。作者指出 Agent 无记忆的本质缺陷,然后逐步演示如何利用 Project 固定指令、用 CLAUDE.md 或 memory.md 文件存储关键信息,并通过 Anthropic 的 Dreaming 研究预览实现自动记忆整合与优化。文中包含具体操作步骤、代码示例(如 /memory 命令、Dream API 调用)以及 Harvey 公司的实证数据(任务完成率提升约6倍)。适合希望让 AI Agent 跨会话持续学习、避免重复错误的工程师。

x.com · 12 min · Agent Engineering · Ai-Memory · Claude
07-07

构建 Agent 框架的 14 步路线图:从单代理到自我改进系统

本文详细介绍了如何使用 Claude 构建 Agent 运行环境(Harness)的 14 个步骤,从基本的运行时配置到可自我改进的系统。作者强调 Harness 是 Agent 的基础,定义了模型、工具、权限和初始上下文,而循环(Loop)只是在此之上的定时器。文章提供了具体的目录结构(.claude/)、CLAUDE.md 编写规范、settings.json 权限模板、子代理(Subagent)用于隔离脏活、技能(Skills)复用流程、钩子(Hooks)强制执行不可协商的规则、以及记忆(Memory)实现跨会话积累。最终,一个良好的 Harness 能让循环输出有用结果,并在每次运行中不断优化。适合正在使用或计划使用 Claude Code 构建多 Agent 系统的工程师。

07-07

Claude Fable 使用心得:如何系统性地发现未知盲区

作者分享使用 Claude Fable 进行 agentic coding 的经验,核心观点是“地图不等于疆域”——提示词与现实代码之间存在未知。他将未知分为四类(已知已知、已知未知、未知已知、未知未知),并提出一系列实用技巧来系统化地发现和减少未知:盲点扫描、头脑风暴与原型、面试式提问、参考代码、实施计划、实施笔记、推销文与测验。并以编辑 Fable 发布视频为例说明全过程。适合所有使用 AI 辅助编码的工程师。

x.com · 13 min · Agent Engineering · Agents · AI Engineering
07-06

模型越强,工具调用越糟:Anthropic 新模型在 Pi 编辑器上的诡异字段注入

Pi 作者发现,Anthropic 的 Opus 4.8 和 Sonnet 5 在调用 Pi 的编辑工具时,会在 edits[] 数组中注入凭空捏造的字段(如 requireUnique、oldText2、cost),导致工具调用失败。更令人担忧的是:旧模型不会犯此错误,越新的模型反而越差。作者深入分析了 Anthropic 工具调用的实现机制——基于 ANTLM 标记的带内信令,以及 Claude Code 内部那套极其宽容的“污泥 harness”(容忍别名、静默过滤未知键、自动修复 Unicode)。他推测这是后训练阶段过度适配 Claude Code 的扁平编辑工具 schema 的产物,导致更强的新模型对非标准 schema 产生更强的先验偏差。文章给出实证:开启严格模式修复了问题,但 Anthropic 对工具定义的复杂度限制使 Claude Code 无法使用严格模式。工具 schema 不再中立,任何第三方 harness 都必须继承 Claude Code 的怪癖。

lucumr.pocoo.org · 14 min · Agent Engineering · AI · Claude Code
07-04

从Superpowers转向mattpocock/skills:更省token、更可控的Agent工程实践

作者分享了从Superpowers切换至mattpocock/skills的实际体验与对比。Superpowers通过hooks强制规范流程,适合新手但易将简单问题复杂化且消耗大量token。mattpocock/skills的设计理念更贴近“真实工程师”,将决策权交还给用户,通过/grill-with-docs、/to-prd、/to-issues、/implement等明确步骤实现高效迭代。核心优势包括:token消耗更低、具备/tdd和/diagnosing-bugs等debug skill、支持/handoff跨模型交接、以及/improve-codebase-architecture用于重构。作者还提到与Fable 5、Codex 5.5等模型配合使用,并将PRD和issues存储在GitHub以便追溯。文章适合关注Agent工程、AI编程效率及工具选型的工程师。

justinyan.me · 3 min · Agent Engineering · Claude Code Marketplace · Framework
07-04

Superpowers:让AI Agent跑通宵且交付可用的秘诀

本文作者分享了自己从最初失败的长任务Agent编排尝试,到发现并使用Superpowers这一Skill Set解决核心痛点的经验。Superpowers通过将开发流程拆解为“头脑风暴(brainstorming)→ 编写计划(writing-plans)→ 执行计划与Subagent驱动开发(executing-plans / subagent-driven-development)”三个阶段,确保长任务的可控性与交付质量。关键设计包括:用多个Prompt模板(implementer、spec-reviewer、code-quality-reviewer)分离执行与评审职责;为每个Task创建独立Subagent并禁止继承主Session Context,防止上下文污染;通过“Never/HARD-GATE”等强约束词防止AI跑偏;贯彻TDD、DRY、YAGNI等软件工程原则。作者认为,当前Frontier模型(Opus 4.8、Codex GPT-5.5)能力已足够,核心在于Harness设计——通过规约与流程让模型变得可靠。

07-04

Superpowers 6:用自动化研究循环将构建成本降低60%

Superpowers 6 发布,核心改进来自一次自动化研究(autoresearch)实验:作者利用 Anthropic 的 Fable 模型(短暂可用期间)对自身的 Subagent Driven Development 流程进行了系统优化。在 36 小时内、花费约 165 美元 token 运行了 25 次实验,最终实现 wall-clock 速度提升 50%、token 消耗降低 60%。关键优化包括:合并合规审查与代码审查 agent、预生成 review packet 减少 git 调用、根据任务类型动态分配 agent 层级(如对非代码方案使用低成本 haiku)。文中披露了多个已证伪的假设(如限制 controller 思考时长适得其反),并强调 eval 套件在差异化测量中的关键作用。适合关注 AI 编码 agent 成本优化和 engineering productivity 的读者。

blog.fsck.com · 8 min · Agent Engineering · AI Engineering · Anthropic
07-03

Cursor 代理框架的持续改进:从上下文管理到模型定制

Cursor 团队分享其代理框架(harness)的持续改进方法论。核心包括:上下文窗口从静态预填充演变为动态按需获取;通过离线基准(CursorBench)和在线 A/B 测试(基于代码留存率、用户意图识别)评估改动效果;建立工具调用错误分类体系(未知错误视为 bug,预期错误按原因归类)并利用异常检测与自动化日志分析(Cloud Agents)来追踪与修复退化;为不同模型定制工具格式与提示(如 OpenAI 的 patch 格式 vs Anthropic 的字符串替换),并处理模型特性(如“上下文焦虑”);支持会话中模型切换时自动切换对应框架并加入特殊指令避免工具混淆。最后展望多智能体架构——框架将负责智能体编排与结果缝合。适合一线 AI 工程、Agent 平台开发者阅读。

cursor.com · 13 min · Agent Engineering · Ai Tooling · Context Engineering
07-03

让 LLM 直接操控真实浏览器的自适应 CDP 工具

Browser Harness 是一个薄层自愈浏览器操控工具,让 LLM(如 Claude Code、Codex)通过 CDP 协议直接连接真实 Chrome 浏览器,完成任意网页任务。核心设计是“代理在运行中编写缺失的辅助代码”,即当代理遇到文件上传、跨域 iframe、滚动等场景时,自动生成可复用的 helper 函数并存储至 agent-workspace,下次同类操作无需重新探索。整个项目仅约 1000 行核心代码,无中间层,通过纯 WebSocket 直连浏览器 CDP 端点,赋予 LLM 完全的浏览器操控自由。适合需要让 AI 代理做真实网页操作(如数据抓取、自动化填写、复杂交互)的开发者。

github.com · 7 min · Agent Engineering · AI Agents · Browser Automation
07-03

开源本地优先的设计工作台,兼容 22 种编程代理与 150+ 设计系统

Open Design 是一款本地优先、开源的代理原生设计工作台,志在成为 Anthropic Claude Design 的开源替代。它不内置代理,而是与本地已有的编程代理(Claude Code、Codex、Cursor、Copilot 等 22 种 CLI)协作,利用 MCP 协议让它们读取设计系统、技能和插件,直接在终端生成原型、仪表盘、演示文稿、图像/视频等制品。支持 BYOK(自带密钥)兼容任意 OpenAI 端点,提供 macOS/Windows 原生桌面应用。内置 100+ 技能、150+ 品牌级 DESIGN.md 系统、261 款插件,适合追求品牌一致性与开发流程可控的设计师与前端工程师。

github.com · 35 min · Agent Engineering · Design Tools · Developer Tools
07-02

人类与AI智能体组队协作的四个关键原则

Anthropic 基于内部数月实践,分享了构建人类与AI智能体混合团队的四条经验。作者指出,传统“单玩家”模式——一人一AI完成独立任务——正在被“多玩家”模式取代:具有独立凭证、持久记忆和广泛信息访问权限的智能体,可以像正式成员一样加入 Slack 频道、参与项目讨论、主动推进工作。文章的核心在于,优秀的人机协作不是技术问题,而是组织合作规范的重塑——公开工作流让智能体获得上下文、为每个成员(人类和智能体)定义明确的角色与工具、设定“北极星”目标激发智能体主动提议、通过逐步扩大自主权建立信任。文章还列出了团队启动前应自我审视的关键问题。适合正在尝试将AI智能体嵌入团队工作流的工程师和管理者阅读。

claude.com · 16 min · Agent Engineering · Agents · Anthropic
07-01

Claude Code 循环模式:从手动检查到定时任务的工程化指南

本文是 Claude Code 官方发布的工程指南,系统梳理了四种 agent 循环模式及其适用场景。Turn-based 循环适合探索性短任务,用户可通过编写 SKILL.md 将手动验证步骤编码为自动检查,例如要求 Claude 启动 dev server、截图并检查浏览器控制台。Goal-based 循环通过 /goal 命令设定确定性终止条件(如 Lighthouse 评分 ≥90),并强制 Claude 在达到阈值前持续迭代。Time-based 循环由 /loop(本地间隔轮询)和 /schedule(云端定时触发)支持,适合处理 PR review、CI 失败修复等重复性依赖外部系统的工作。Proactive 循环组合 /schedule、/goal、动态工作流和 auto mode,构建面向长期运行任务的生产线。文章还讨论了代码质量维护、token 用量管理策略,强调用脚本替代推理、用小模型处理例行任务、用 /usage 命令监控各技能和子 agent 的成本。适合正在将 Claude Code 嵌入日常开发流程的工程师。

claude.com · 8 min · Agent Engineering · Claude Code · Context Engineering
06-28

从提示到自治:设计 AI 工作循环的五个阶段

Claude Code 的创造者声称自己几乎不再写提示词了——是循环在替他“提示”。本文提出一个清晰的五级框架,描述开发者与 AI 协同工作模式的演进:从 L1 的单轮问答,到 L2 的手动循环(重复“做-检查-修正”),再到 L3 的验证循环(用独立检查定义“完成”),然后到 L4 的自运行循环(靠 Goal 命令自主迭代),最终到 L5 的自主智能体系统(循环自触发、并行执行、经验回写入知识库持续改进)。每级都包含识别标志和具体升级行动。适合已感觉“聊胜于无”的 AI 用户,以及正在构建自动化 Agent 工作流的工程师。

x.com · 7 min · Agent Architecture · Agent Engineering · Agents
06-28

循环工程:构建不会在睡着时烧掉你预算的自动化循环技术路线图

本文是一份构建可靠自主循环(autonomous loop)的技术路线图,作者强调循环不是prompt——prompt需要你手动触发,而循环自己驱动自己:设定目标后,系统自动查找工作、执行、检查、修复、重复直至完成。核心论点:决定上限的不是写prompt的技能,而是构建一个能收敛到真理而非变成昂贵随机漫步的循环。文章按严格顺序提供从Step 0到Step 7的实操指南,包含完整代码(Bash脚本)、每次迭代重建上下文的stateless设计原理(对付context rot)、不可被欺骗的check设计(独立oracle + reward hacking防御门 + 独立法官)、磁盘状态协议(human-readable STATUS.md + machine-parsable JSON)、隔离(worktree/container with --network none)、刹车(迭代上限、预算上限、重复检测器、liveness marker、结构化日志)、以及成本非线性增长分析。特别适合需要构建AI Agent自动化流水线的一线工程师阅读。

06-28

循环工程:当提示不再是主角,Agent 系统的核心转向

本文由 Claude Code 构建者 Boris Cherny 的观点切入,提出 Agent 开发的重心已从提示工程转向循环工程(Loop Engineering)。作者详细拆解了 Agent 循环的内核(一个简短的 while 循环),并指出真正的工程挑战集中在四个环节:如何准确判定任务完成(而非模型停用工具)、如何保持上下文清洁以防止“上下文腐烂”、如何设计让 Agent 能实际使用的工具(幂等性与面向 LLM 的错误信息)、以及如何在循环中引入独立的验证者(Critic)来避免模型自我认可。文章强调,模型正趋于同质化,围绕模型的“马具”(Harness)——即循环系统——才是工程师应投入精力的方向。适合 Agent 开发、AI 工程与系统设计的相关工程人员阅读。

06-27

把 Claude 从对话工具变成自动化工人:循环工程入门

Anthropic 内部 Claude Code 的构建者 Boris Cherny 透露,他已不再手动编写提示词,而是通过编写“循环”让 Claude 自动工作。本文定义了什么是一个真正的循环(loop):一组能够自动感知任务、执行、自我检查、状态记录并重复的系统,而非简单的 cron job。与传统的一次性提示不同,循环的核心是内置了决策者,Claude 能在中途判断是否继续、重试或停止。文章详细介绍了 Claude Code 中的 /goal(任务完成即停止)和 /loop(按节奏重复)两个命令,并提供了一个可直接粘贴使用的循环宪章模版,涵盖目标定义、任务来源、工作方式、自我检查机制、状态记忆和停止条件。适合希望将 Claude 从对话式工具转向持续自动化工作流的工程师。

06-27

AI生成代码泛滥后,代码审查才是真正的核心技能

当AI能以分钟级生成上千行代码时,工程的瓶颈从编写转向了信任决策。因此,审查成了软件领域最具杠杆能力的技能。文章指出,2026年的多方数据(Faros AI、CodeRabbit、GitClear、GitHub)均证实:AI使用量提升后,开发者的代码产出提高约4倍,但交付价值仅增长约12%,同时代码流失率飙升861%、缺陷率从9%升至54%、审查时长增加441.5%、零审查合并的PR增长31.3%。作者认为,问题不在于是否使用AI,而在于如何根据项目的「爆炸半径」分层分配审查力度:对个人无用户项目可轻审查,对大型企业级项目必须建立分级、证据驱动、异质化AI审查+人类最终负责的流程。文章还介绍了具体实践:分流PR、要求前置证据、关注测试变更、用两个不同构架的AI审查工具并行运行,以及让人类从「线级审查」升级为「抽样审计」。

addyosmani.com · 29 min · Agent Engineering · AI Engineering · Code Review
06-27

编排税:当AI智能体并行时,注意力的串行瓶颈

启动AI智能体变得极其廉价,但关闭循环(审核、合并、判断)仍需经过你这一串行处理器。作者将人类注意力类比为GIL:你可以同时跑20个智能体,但真正能交付到main分支的工作受限于你单线程的审核吞吐量。Amdahl定律在此适用——串行部分(人类的判断)不可并行化,盲目增加智能体只会积压待审队列。文章给出了可操作的策略:按审核速率而非UI上限扩容、将任务分为可委托的异步工作与需要锁定注意力的复杂工作、批量审核、让智能体自证正确性。最后指出,忙碌不等于高效,未支付的编排税会同时积累技术债务和认知债务。

addyosmani.com · 9 min · Agent Architecture · Agent Engineering · Cognitive Load
06-26

跨 AI 编码助手的智能体增强操作系统——规则、技能与安全审计

ECC 是一套为多个 AI 编码助手(Claude Code、Cursor、Codex、OpenCode、GitHub Copilot 等)设计的智能体增强系统,被定位为“Agent 增强型操作系统”。它并非一个独立的 AI 工具,而是一个包含 260+ 技能、67+ 子智能体、提供持久化记忆、连续学习、成本优化和安全审计(AgentShield)等功能的配置与插件集合。通过统一的规则、钩子和 MCP 配置,它试图解决跨平台开发工作流中智能体行为不一致、上下文丢失和安全性不足的问题。适合深度使用 AI 编码助手的专业开发者,以及希望建立标准化 Agent 工程实践的技术团队。

github.com · 94 min · Agent Engineering · Claude Code · Context Engineering
06-26

人类在循环中:如何设置能自主运行并通知你的AI编码循环

作者分享了与AI Agent协作编码的实用工作流:定义一个可验证的“完成标准”(如模型评估分数、QA通过、测试套件绿色、性能基准),编写一个循环让Agent自主迭代,并通过通知渠道(如Slack)在需要决策或完成时获得提醒。循环在云端运行,不占用本地终端。作者能同时运行3-5个长循环,外加多个短任务。适合希望将Agent从单次交互升级为长时间、自主优化任务的一线工程师。

06-25

9步编排Claude Code智能体集群:如何让1个主管Agent协调10个子Agent并行工作

本文详细拆解了在Claude Code中使用Dynamic Workflows并行调度多个子Agent的9个步骤。作者指出,单纯并行启动多个Agent很容易导致冲突和混乱,真正的关键在于主管Agent的编排循环:先检查任务是否可分解,让主管Agent分解为原子子任务并等待人工审批,通过Git Worktree隔离每个子Agent的工作目录,并行分发后使用SubagentStop Hook强制门控(运行测试和lint),再用一个独立评分Agent根据预设标准评估每个结果并自动退回不合格者,最后只由主管Agent按依赖顺序合并通过的提交。文章强调,核心技能不是‘能启动10个Agent’,而是能收回10个干净、已测试、已合并的结果。

06-24

一个工程师月提259个PR:循环工程实战指南

本文详细拆解了AI驱动开发循环(Loop)的工程实践,作者通过真实案例(单工程师月提259个PR vs 循环失控烧掉$47,000)引出核心矛盾:构建高效自动化的同时必须配备可靠的制动机制。文章将循环分解为状态文件、自动化触发/调度的具体命令、Git 工作树隔离、技能配置、MCP 连接器、子代理分离等6个可操作部件,并给出了每个部件的配置示例(Claude Code 和 OpenAI Codex 双版本)。同时提供了刹车配置模板(最大步数、预算上限、作用域、断路器)、四种常见失败模式及低成本入门方案。适合正在构建或评估AI代理工作流的工程师阅读。

x.com · 12 min · Agent Engineering · Ai Tooling · Claude Code
06-24

Agent 循环最难的部分:定义停止条件

本文为产品经理解析 agent loop 的核心概念。作者区分了 routine(固定步骤)、workflow(条件分支)和真正的 loop(重复检查直至满足条件)。他强调,loop 的关键不在于循环本身,而在于停止条件——即明确“完成”的可验证定义,并配以客观检查或独立评判者。文中提供了构建 loop 的模板、停止条件的编写方法,以及成本控制建议(如追踪“每接受变更的成本”)。作者还总结了 loop 常见的失败模式:无迭代上限导致费用失控、上下文漂移、通过不等于正确。最后指出,loop 工程只是最新术语,本质仍是“意图工程”——精准定义目标、边界和完成标准的能力。

06-24

Agent 循环最难的部分:定义停止条件

本文为产品经理解析 agent loop 的核心概念。作者区分了 routine(固定步骤)、workflow(条件分支)和真正的 loop(重复检查直至满足条件)。他强调,loop 的关键不在于循环本身,而在于停止条件——即明确“完成”的可验证定义,并配以客观检查或独立评判者。文中提供了构建 loop 的模板、停止条件的编写方法,以及成本控制建议(如追踪“每接受变更的成本”)。作者还总结了 loop 常见的失败模式:无迭代上限导致费用失控、上下文漂移、通过不等于正确。最后指出,loop 工程只是最新术语,本质仍是“意图工程”——精准定义目标、边界和完成标准的能力。

06-23

从写提示词到设计循环:Agent Loop 工程实战指南

AI 编码圈正从“写提示词让 agent 干活”转向“设计循环让 agent 自己干活”。本文是最接地气的实操版:什么是 agent loop,为什么它重要,生产环境里长什么样。作者拆解了 loop 的六个固定部件(触发、隔离、上下文固化、工具连接、独立评审、持久化状态),并用 PR babysitter(每15分钟检查PR,CI红则自动修复一次)和 Claude Code 的 /goal 命令作为具体例子。文章还讨论了 loop 的成本模型(迭代次数才是预算线,弱验证器是最贵的 bug)、何时不该用 loop(一次性修改、无明确通过条件的探索性工作)、以及常见的失败模式(验证负担转嫁给人、代码理解债累积、宽松检查导致无声漂移)。

x.com · 15 min · Agent Engineering · Agent Loop · CI/CD
06-22

调试循环:6步而非60步,用Claude Code定位根因

大多数开发者使用 Claude Code 调试的常态是把错误粘贴进去、接受一个猜测性的修复、再粘贴下一个错误——陷入长达数十轮的猜谜循环。本文提出一个六步调试循环:先让LLM建立可复现的失败测试(repro),然后在 plan mode 中限定搜索范围,派发只读子agent从多个角度追踪根因,只针对根因而非症状修复,通过 PostToolUse 钩子自动验证修复是否通过测试,最后将 repro 保留为回归测试。核心论断是:LLM的能力并非问题,而是用户跳过前三个阶段直接要求“修复”导致了症状修补的死循环。

x.com · 7 min · Agent Engineering · Claude Code · Debugging
06-17

为 Agent 技能构建自我改进循环:内外部循环与云代理实战

本文展示了如何通过内外部 Agent 循环让 Skills 实现自我改进。内循环在每次新建 GitHub Issue 时通过 GitHub Action 触发云代理,运行分类技能并打标签。外循环每天运行一次,检查所有人工修正的标签和评论,自动生成 diff 更新技能文件,并合并回主分支。作者以 issue triage 为例,使用 Warp 的 Oz 云代理平台给出完整配置和代码示例,并提供了可复现的示例仓库。该方法适用于代码审查、Bug 修复、事件响应等场景。适合正在构建 AI Agent 并希望技能持续优化的工程师。