Glean 拾遗
日刊 · 时间线

每天拾几条。

2026-07-11 · 周六 5 条
← 07-10
日历 ▾
2026 · 07
MoTuWeThFrSaSu ··12345678910111213141516171819202122232425262728293031
有日刊 今天
07-12 →
06:00

用 Fable 5 搭建自我改进的代理系统:14 步指南

Build self-improving agent system with Fable 5 in 14 steps : loops, dynamic workflows, routines

本文提供了一份详细的 14 步路线图,教你如何利用 Claude Fable 5 构建一个能自我改进的代理系统。核心在于将 Fable 5 从“提示-关闭”的临时工具转变为持续累积的系统:通过 /goal 和 Outcomes 实现自纠正循环,用独立验证子代理替代自我批评来提升探索空间,借助状态文件(STATE.md)和 Skills 实现跨会话记忆,并利用动态工作流和 Routines 实现长时间自主运行。文章还给出了成本-能力矩阵(Fable 5 用于编排,Sonnet 4.6 用于工作,Haiku 4.5 用于评分)以及 Mythos 安全边界的处理建议。适合想要真正发挥 Fable 5 长期自主能力的 AI 工程师和系统设计师。

06:00

掌握Claude Code循环模式:从手动提示到自动任务编排

Getting started with loops in Claude Code

Claude Code团队定义了四种循环模式(turn-based、goal-based、time-based、proactive),并详细说明其触发方式、停止条件、适用场景及成本控制技巧。文章通过具体命令(/goal、/loop、/schedule)和SKILL.md示例展示了如何让Agent迭代工作、自验证结果,以及如何组合原语构建自动化工作流。适合正在探索Agent工程化的开发者。

06:00

不更新权重的持续学习:Replit Agent的评估与自改进实践

Continual Learning for Agents: Eval, A/B, and Self-Improvement at Replit

文章提出代理持续学习不限于更新模型权重,对于使用闭源前沿模型的代理,可通过 harness 和 context 两个可控层进行改进。以 Replit Agent 为例,详细介绍了其评估系统:包括针对 vibe coding 的离线基准 ViBench(从零构建应用,用自然语言测试计划评分)、线上 A/B 测试,以及生产追踪分析系统 Telescope(聚类失败模式)。三者构成闭环:离线基准防回归,A/B 测试验证用户行为变化,Telescope 发现隐藏问题,最终通过自改进循环自动提出补丁,但仍需工程师审查方向。适合 AI 系统工程师、代理开发者和关注评估体系建设的技术团队。

01:37

Claude Code 技能实战:Anthropic 内部数百条技能的经验与分类

Lessons from Building Claude Code: How We Use Skills

Anthropic 工程师基于内部使用数百条 Claude Code 技能的经验,系统总结了技能的九大类型(库/API 参考、产品验证、数据获取、业务流程、代码模板、代码质量、CI/CD、Runbook、基础设施运维),并给出了具体编写技巧:聚焦非显而易见的提示、构建 Gotchas 部分、利用文件系统渐进式披露、避免过度约束、合理设计配置、用 description 字段触发选择、在技能内存入数据(如日志文件或 SQLite)、以及用脚本/库减少模型 token 消耗。文章还讨论了技能的分发方式(仓库内嵌 vs 插件市场)、依赖组合与埋点测量。适合正在构建 Agent 工作流的工程师参考。

01:36

11天、64个AI Agent、535K行代码:Bun从Zig到Rust的史诗级重写

Rewriting Bun in Rust: 535K Lines, 11 Days, 64 AI Agents

本文是Bun创始人Jarred Sumner的亲身复盘,详细记录了如何借助Anthropic的Claude Fable 5模型,在11天内将Bun的535,496行Zig代码完全重写为Rust。重写动机是Zig手动内存管理在混合GC场景下导致的频繁use-after-free、double-free和内存泄漏。作者没有采用渐进式重写,而是让64个Claude Agent并行工作,通过动态工作流(dynamic workflow)和对抗性审查(adversarial review)确保代码质量。最终整个测试套件(60万+断言)在6个平台全部通过,修复了128个已知bug,内存占用降低最多90%,二进制缩小约20%,吞吐量提升2-5%。文章详细披露了AI辅助下的工作流程、遇到的典型移植错误(如debug_assert!副作用、切片越界、comptime格式化),以及Rust的Drop机制如何系统性防止Zig中defer容易遗漏的清理问题。这是一线工程师利用前沿AI工具完成不可能任务的第一手报告,对任何关注AI工程、运行时实现或语言迁移的人员都有极高参考价值。