09-20
380 亿美元基金的模型评测与 Agent 治理:Balyasny 访谈
Anthropic 与 Balyasny Asset Management(BAM)首席 AI 官 Charlie Flanagan 的访谈,记录这家管理约 380 亿美元资产的机构如何把前沿模型接入生产。BAM 用数千条有可验证答案的真实金融任务(股票、宏观、大宗商品)做评测,既测模型单体表现,也测它在自建 agentic 环境中的表现。相关子集上 Fable 5 得 89.4%,上一代生产模型 86.1%;有一组经济学题此前没有任何模型通过,团队先怀疑评测本身出错,独立复核任务与评分逻辑后才确认提升为真。并购套利分析由 3-5 天缩短到 1 天以内,agent 单次运行约 30 分钟,实质输出前仍需人工复核。安全被当作产品与运营模型问题:已批准的数据边界、最小权限、工具级授权、日志与人工审批;模型更强不会自动获得更大权限。自建 BAMAgent 平台已承载数千个 7×24 agent。适合关注企业级模型评测、agent 治理与部署的工程师,需注意全文出自厂商客户访谈。