Glean 拾遗
最近收录

2 条 · 按时间

09-20

380 亿美元基金的模型评测与 Agent 治理:Balyasny 访谈

Anthropic 与 Balyasny Asset Management(BAM)首席 AI 官 Charlie Flanagan 的访谈,记录这家管理约 380 亿美元资产的机构如何把前沿模型接入生产。BAM 用数千条有可验证答案的真实金融任务(股票、宏观、大宗商品)做评测,既测模型单体表现,也测它在自建 agentic 环境中的表现。相关子集上 Fable 5 得 89.4%,上一代生产模型 86.1%;有一组经济学题此前没有任何模型通过,团队先怀疑评测本身出错,独立复核任务与评分逻辑后才确认提升为真。并购套利分析由 3-5 天缩短到 1 天以内,agent 单次运行约 30 分钟,实质输出前仍需人工复核。安全被当作产品与运营模型问题:已批准的数据边界、最小权限、工具级授权、日志与人工审批;模型更强不会自动获得更大权限。自建 BAMAgent 平台已承载数千个 7×24 agent。适合关注企业级模型评测、agent 治理与部署的工程师,需注意全文出自厂商客户访谈。

claude.com · 8 min · Agent Evaluation · Agent Harness · Agent Infrastructure
07-08

Claude Agent 持久记忆搭建:从基础到自改进的12步指南

本文总结了为 Claude Agent 添加持久记忆的完整方案,覆盖四层架构:Claude 内置 Chat Memory、Project 持久指令、memory.md 文件记忆以及 Dreaming(自改进记忆)。作者指出 Agent 无记忆的本质缺陷,然后逐步演示如何利用 Project 固定指令、用 CLAUDE.md 或 memory.md 文件存储关键信息,并通过 Anthropic 的 Dreaming 研究预览实现自动记忆整合与优化。文中包含具体操作步骤、代码示例(如 /memory 命令、Dream API 调用)以及 Harvey 公司的实证数据(任务完成率提升约6倍)。适合希望让 AI Agent 跨会话持续学习、避免重复错误的工程师。

x.com · 12 min · Agent Engineering · Ai-Memory · Claude