根据Pulse Beating 的监测,谷歌 DeepMind 发布了 AI 共同数学家,这是供数学家使用的多 Agent 交互式研究工作台。该系统在当前最困难的研究级数学基准 FrontierMath Tier 4 上取得了 47.9% 的准确率(解答了 23/48 题),直接超过了之前最高纪录的 GPT-5.5 Pro,后者为 39.6%。
该系统没有使用新一代基础架构,直接使用的是 Gemini 3.1 Pro。这个模型单独运行 Tier 4 时只有 19% 的准确率,加入 Agent 框架后成绩增长了一倍多。DeepMind 为其构建了一个多层架构:顶层是一个“项目协调人”,将研究任务拆分为多个工作流,然后分配给文献检索、编写代码和推理负责的子 Agent。编写的证明还需要经过一轮由多个“审稿 Agent” 组成的审查会议,只有通过才能提交。这套复杂的框架证明了:在顶尖数学推理领域,组织能够挤取的能力增量可能比更新模型还要大。
盲测由 Epoch AI 执行,为了防止作弊,DeepMind 团队始终无法看到问题,每个问题允许运行 48 小时。结果不仅登顶,该系统还解决了之前所有模型未能解决的三道问题。
尽管称为共同数学家,它更像是一个能够进行头脑风暴的同事。群论专家 Marc Lackenby 在实际研究中使用它解开了 Kourovka 笔记本中的一个公开猜想。有趣的是,系统最初给出的策略被其自身的审查 Agent 标记为“有缺陷”,但 Lackenby 发现了废案中隐藏的巧妙思路,填补了漏洞,最终完成了证明。
目前,AI 共同数学家仅对少数数学家进行内测开放。
