Glean 拾遗
最近收录

2 条 · 按时间

09-20

380 亿美元基金的模型评测与 Agent 治理:Balyasny 访谈

Anthropic 与 Balyasny Asset Management(BAM)首席 AI 官 Charlie Flanagan 的访谈,记录这家管理约 380 亿美元资产的机构如何把前沿模型接入生产。BAM 用数千条有可验证答案的真实金融任务(股票、宏观、大宗商品)做评测,既测模型单体表现,也测它在自建 agentic 环境中的表现。相关子集上 Fable 5 得 89.4%,上一代生产模型 86.1%;有一组经济学题此前没有任何模型通过,团队先怀疑评测本身出错,独立复核任务与评分逻辑后才确认提升为真。并购套利分析由 3-5 天缩短到 1 天以内,agent 单次运行约 30 分钟,实质输出前仍需人工复核。安全被当作产品与运营模型问题:已批准的数据边界、最小权限、工具级授权、日志与人工审批;模型更强不会自动获得更大权限。自建 BAMAgent 平台已承载数千个 7×24 agent。适合关注企业级模型评测、agent 治理与部署的工程师,需注意全文出自厂商客户访谈。

claude.com · 8 min · Agent Evaluation · Agent Harness · Agent Infrastructure
08-21

DeepSeek 开源的 Agent 运行容器:一切皆插件

DeepSeek Harness(dsh)是 DeepSeek AI 开源的智能体运行框架(agent harness),核心设计是“一切皆插件”:整个 harness 的能力都通过插件组装,底层由 Cordis 驱动,强调时空可组合性。当前处于 developer preview 阶段,迭代频繁且可能有不兼容变更。提供本地 Web UI(默认 127.0.0.1:3080),可从 npm 安装或从源码构建运行,适合需要自托管、可扩展 agent 运行环境的工程师评估试用。

github.com · 2 min · Agent Harness · Agent Infrastructure · Agents