Ana Sayfa
AI AI
Flaş
Derinlik
Etkinlikler
BlockBeats Pro
Daha Fazla
Finans
Özel
Blok Zinciri Ekosistemi
Giriş
Podkastlar
Veri
OPRR
#
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe

AI Gerçek Zamanlı Yeniden Değerlendirme Maalesef Başarısız Oldu: GPT-5.4 Soruyu Tam Puanla Çözebilme Yeteneğini Yalnızca %54'e Düşürdü

根据Beat Oracle 的监测,伊利诺伊大学计算机科学博士生 Dylan Zhang 进行了一项 Agent 记忆实验,结果指向一个反常的结论:让模型反复总结经验,可能会导致其记忆能力下降。

最引人注目的结果之一来自 ARC-AGI:研究人员选择了 19 道 GPT-5.4 在无记忆状态下全部正确回答的问题,然后将这些问题的真实解法馈送给模型,让其在观察的同时进行「经验总结」。理论上,这相当于开卷复习;然而经过多轮记忆压缩后,同一模型的准确率从 100% 下降到了 54%。原始路径是正确的,真正出问题的是模型将正确路径改写为通用经验的那一步。

更糟糕的是,这种记忆退化并非个例。在 WebShop 网购任务中,AWM 记忆方法在吸收 8 条专家路径时获得的分数为 0.64,路径增加到 128 条后下降至 0.20,恰好回到无记忆基准线。换句话说,随着记忆的积累,收益反而被抵消。

问题不在于「经验不足」,而在于「总结过于频繁」。大型模型记录的经验并非客观日志,每次总结都是一次重新生成。最终,具体的前提条件会被删除,不同任务的规则会被混为一谈,本来可以指导操作的细节会变成「优先采取最直接行动」、「使用正确工具」等看似正确但实际无益的废话。原文展示了一个极端示例,其中 50 条结构化记忆被一次合并为 1 条,多个任务之间的差异被压缩为同一通用流程,下一轮评估中直接丢弃了 6 到 13 个成功样本。

作者提供的建议非常谨慎:不要着急让 Agent 在每轮都写「错题本」。更加稳妥的做法是保留经过筛选的原始操作路径,只在确实需要时进行抽象总结。在实验中,仅保留原始 episode 并关闭抽象总结的方案,使多个 Agent 在基准测试中达到或超过了经过测试的压缩式记忆方法。对开发人员来说,这个结论非常清晰:让模型看见真实操作过的内容,通常比让其背诵一堆抽象规则更为有效。

举报 Düzeltme/Rapor
Popüler Makaleler
Düzeltme/Rapor
Gönder
Kütüphane Ekle
Sadece kendime görünür
Herkese Açık
Kaydet
Kütüphane Seç
Kütüphane Ekle
İptal
Tamamla