动察 Beating tarafından yapılan izlemeye göre, açık kaynak model GLM-5.2, özel ince ayar kıyaslaması PostTrainBench'te zirveye yerleşti. Eleştirmen scaling01, bunun gerçek dünyada bir değeri olmadığını belirtti. Modelin birkaç ay içinde 22. sıradan birinci sıraya yükselmesinin son derece olağandışı olduğunu ve testin gizli bir veri kümesi içermemesi nedeniyle, ajanların sıralamayı manipüle etmek için hedefli optimizasyon yapmasının kolaylaştığını, bunun da gerçek dünyada uygulanması zor modeller ortaya çıkardığını söyledi.
Ancak destekçiler, tek bir H100 GPU ile 10 saatlik kısıtlama altında, ajanların genel bir ince ayar sürecini tamamlamasının gerçekçi olmadığını ve hedefli optimizasyonun makine öğreniminde olağan bir durum olduğunu savundu. Kamuya açık günlükler, GLM-5.2'nin net bir deneysel mantığa sahip olduğunu, farklı örnekleme hipotezlerinden veri topladığını, performans taban çizgisi oluşturma, ince ayar yapma ve reddetme örneklemesi ile veri filtreleme gibi eksiksiz bir zinciri otonom olarak planladığını ve düşünce zincirinde aşırı uyumu önlemeye çalıştığını gösterdi.
Bu tartışmanın daha büyük değeri, ince ayar yeteneklerini değerlendirmek için kullanılan kamuya açık çalışma izlerinin, yerel büyük modellerin "ağır Claude damıtması" yaptığına dair sektör söylentilerini beklenmedik bir şekilde çürütmesidir. Kıyaslama yazarı Maksym Andriushchenko, GLM-5.2'nin günlüklerini inceledikten sonra, modelin veri toplama, strateji kombinasyonu ve karar yollarında Claude'dan temel farklılıklar gösterdiğini ve herhangi bir taklit veya damıtma belirtisi olmadığını belirtti. Üçüncü taraf kıyaslamalarının şeffaflığı, açık kaynak büyük modellerin özgün araştırma ve geliştirme yeteneklerini kanıtlaması için en doğrudan pencere haline geldi.
