动察 Beating tarafından yapılan izlemeye göre OpenAI, ARC-AGI-3 genel değerlendirme çerçevesinin GPT-5.6 Sol'un önceki çıkarımlarını kaydetmediğini ve bağlam çok uzun olduğunda erken kayıtları sildiğini belirtti. Bu nedenle model, daha önce keşfettiği oyun kurallarını sık sık unutuyor ve her adımda yeniden düşünmek zorunda kalıyor.
OpenAI daha sonra kendi Responses API'sini kullanarak değerlendirme çerçevesini yeniden oluşturdu, geçmiş çıkarımları korudu ve aşırı uzun bağlamları sıkıştırdı. Sonuç olarak, GPT-5.6 Sol'un puanı %13,3'ten %38,3'e yükselirken, çıktı Token miktarı yaklaşık altıda birine düştü.
Ancak sorun şu ki, Opus 5 de aynı genel çerçeveyi kullanıyor. Yüksek çıkarım seviyesinde %30,2 puan alırken, GPT-5.6 Sol en yüksek Max seviyesinde bile yalnızca %13,3 puan alabiliyor. Çerçeve gerçekten GPT-5.6'yı yavaşlattı, ancak Opus 5'i aynı şekilde etkilemedi.
OpenAI ne kadar mazeret üretirse üretsin, bu dünyanın en zor AI değerlendirmesinde Opus 5, GPT-5.6'dan açıkça daha güçlüdür.
