Ana Sayfa
AI AI
Flaş
Derinlik
Etkinlikler
BlockBeats Pro
Daha Fazla
Finans
Özel
Blok Zinciri Ekosistemi
Giriş
Podkastlar
Veri
OPRR
#
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe

DeepMind, AI Matematik Araştırma Asistanını Yayınladı: Çoklu Etki Tabanlı Mimari, GPT-5.5Pro'yu Yendi ve Daha Önce Çözülemeyen Bu Zor Problemi Çözdü

根据Pulse Beating 的监测,谷歌 DeepMind 发布了 AI 共同数学家,这是供数学家使用的多 Agent 交互式研究工作台。该系统在当前最困难的研究级数学基准 FrontierMath Tier 4 上取得了 47.9% 的准确率(解答了 23/48 题),直接超过了之前最高纪录的 GPT-5.5 Pro,后者为 39.6%。

该系统没有使用新一代基础架构,直接使用的是 Gemini 3.1 Pro。这个模型单独运行 Tier 4 时只有 19% 的准确率,加入 Agent 框架后成绩增长了一倍多。DeepMind 为其构建了一个多层架构:顶层是一个“项目协调人”,将研究任务拆分为多个工作流,然后分配给文献检索、编写代码和推理负责的子 Agent。编写的证明还需要经过一轮由多个“审稿 Agent” 组成的审查会议,只有通过才能提交。这套复杂的框架证明了:在顶尖数学推理领域,组织能够挤取的能力增量可能比更新模型还要大。

盲测由 Epoch AI 执行,为了防止作弊,DeepMind 团队始终无法看到问题,每个问题允许运行 48 小时。结果不仅登顶,该系统还解决了之前所有模型未能解决的三道问题。

尽管称为共同数学家,它更像是一个能够进行头脑风暴的同事。群论专家 Marc Lackenby 在实际研究中使用它解开了 Kourovka 笔记本中的一个公开猜想。有趣的是,系统最初给出的策略被其自身的审查 Agent 标记为“有缺陷”,但 Lackenby 发现了废案中隐藏的巧妙思路,填补了漏洞,最终完成了证明。

目前,AI 共同数学家仅对少数数学家进行内测开放。

举报 Düzeltme/Rapor
Düzeltme/Rapor
Gönder
Kütüphane Ekle
Sadece kendime görünür
Herkese Açık
Kaydet
Kütüphane Seç
Kütüphane Ekle
İptal
Tamamla