Glean 拾遗
最近收录

2 条 · 按时间

07-11

智能体编码中的测试哲学:从芯片设计到AI工作流

本文作者以在芯片公司Centaur的测试经验为背景,探讨了LLM驱动的智能体(agent)在软件工程中的测试与编码实践。核心观点包括:Centaur的无代码审查、模糊测试为主的工作流在AI时代依然高效,每年仅出现<1个重大用户可见bug;LLM直接生成的测试质量较差,但通过定向提示进行模糊测试可在数分钟内发现真实漏洞;LLM方差极大,同一模型在不同任务上表现迥异,使得公共基准测试的单一排名缺乏实际指导意义;作者还分享了在构建超人类棋盘游戏AI时的系统性方法——基于数据和分析而非盲目提示。文章适用于对AI辅助软件工程、测试自动化及高效agent工作流感兴趣的工程师。

danluu.com · 91 min · AI Engineering · Benchmarks · Developer Tools
06-30

如何让代码库成为AI代理的“理想家园”——深模块设计实践

本文作者提出,代码库的结构远比提示词或AGENTS.md文件更能影响AI代理的输出质量。核心观点是采用《软件设计哲学》中的“深模块”原则:每个模块通过简单接口暴露大量实现逻辑,AI代理只需理解接口,无需深入内部。作者进一步提出“灰盒模块”概念——开发者定义并锁定接口行为(通过测试),AI负责实现内部细节。这种方式能改善AI的反馈循环(测试即反馈)、导航效率(文件系统直接映射心智模型)并降低认知负担(开发者只需关注7-8个模块边界)。文章也指出TypeScript中强制边界不易,推荐使用Effect库。适合正在优化AI编码工作流的工程师阅读。

www.aihero.dev · 5 min · Agent Architecture · AI Engineering · Code