根据动察 Beating 的监测,腾讯混元和 SSV 数字文化实验室与中科院信工所等机构联合推出了首个覆盖「七体之变」的古文字感知评估基准 Chronicles-OCR。该基准包含了 2800 张由专家交叉标注的图像,首次对甲骨文到草书等七种字体的识别难度进行了统一量化。
研究团队评估了 28 个主流多模态大语言模型,结果显示它们在古代字体上几乎全面失败。在跨时代字符检测任务中,GPT-5 和 Gemini 2.5 Pro 的核心指标接近 0,表现最出色的模型也仅为 16.5。即使直接在图像上绘制边界框以跳过定位步骤,最高准确率也仅为 27.1%,其中 Gemini 3.1 Pro 在甲骨文的准确率仅为 14.0%。
这证实了现代模型严重依赖规整的现代版式先验。面对无约束、强噪声的古代物理媒介,模型的文本分割机制直接失效。字体分类结果进一步表明,模型通常是在识别载体纹理(如龟甲或青铜锈)而非真实字符笔画。
实验还揭示了一个违反直觉的现象:进入思考模式实际上会导致古文字识别率下降。对比显示,几乎所有支持该模式的模型在进入思考模式后性能下降。当底层视觉感知缺失时,思维链不仅无法校正错误,反而会成为幻觉放大器,输出高自信度的错误答案。
