动察 Beating AI hızlı haber: Jev yayınlanalı henüz bir hafta olmadan, açık kaynak topluluğu bu "cevap yazmayan, doğrudan olasılık veren" modeli kopyalamaya başladı bile.
Hepsi aynı şeyi yapmak istiyor: token token üretimi ortadan kaldırıp doğrudan seçenekleri ve olasılıkları vermek. Ancak bunu nasıl yapacakları konusunda birbirinden tamamen farklı birkaç yol oluşmuş durumda.
1. SemIf en basiti, modelin yeniden eğitilmesine bile gerek yok. Doğrudan hazır Qwen'i alıyor, model A, B, C'yi yanıtlamaya hazırlanırken onu durduruyor, yazmaya devam etmesine izin vermiyor, her seçeneğin puanını doğrudan okuyup olasılığa çeviriyor.
2. Simple Jev de hazır büyük modeli kullanıyor, ancak tekrarlı hesaplamayı daha da ortadan kaldırıyor. Aynı materyal yalnızca bir kez okunuyor, sonraki birden fazla soru bu sonucu paylaşıyor ve yanıtlar ayrı ayrı değerlendiriliyor. Yazar da açıkça belirtiyor: kopyaladığı şey Jev'in kullanım biçimi; doğruluk, hız ve olasılık kalibrasyonu açısından denkliği sağlayamadı.
3. Laya ise metin üreten büyük modeli hiç kullanmıyor, daha çok geleneksel sınıflandırıcıya benzeyen bir kodlama modeline geçiyor. Avantajı küçük ve hızlı olması, zayıf noktası da çok belirgin. Tek seferde 77 seçenek arasından seçim yaparken Laya'nın doğruluğu yalnızca %42,5, Jev ise %87,0.
4. Von da özel karar modeli yolunu izliyor. Yalnızca yaklaşık 400 milyon parametresi var, metin üretmiyor, tek bir ileri geçişte doğrudan Choice, Noul ve Score'u tamamlıyor; daha çok doğal dili okuyabilen yeni nesil bir sınıflandırıcı gibi.
5. Verdict daha da küçük, yalnızca yaklaşık 150 milyon parametresi var. Yazar iki soruna odaklanmış: yanlış yanıtladığında hâlâ yüksek güven bildirmesi ve seçeneklerin sırası değiştirildiğinde sonucun da değişmesi. Olasılıkların ve kararların nasıl istikrarlı hale getirileceğine daha çok önem veriyor.
6. Kev büyük modeli korumayı seçiyor. Qwen'i temel olarak alıyor, üzerine özel karar yapısı ekliyor; aynı girdinin yalnızca bir kez okunmasını, birden fazla sorunun kendi olasılıklarını ayrı ayrı hesaplamasını sağlıyor. Üçüncü taraflar daha önce Jev'i tersine mühendislikle incelerken benzer bir tasarım kullanmış olabileceğini tahmin etmişti.
Kev'in kendi testinde, eğitim sırasında görülmemiş yeni sorularla test edildiğinde 8B sürümünün doğruluğu yaklaşık %78, Jev ise yaklaşık %86. Daha belirgin fark güven düzeyinde: Kev'de hâlâ yanlış yanıtladığı bazı sorularda %90'ın üzerinde emin olduğunu belirtiyor.
7. Nimble ise odağını eğitime koyuyor. Qwen3.5-9B kullanıyor, ardından "yalnızca bir olguyu değiştir, doğru cevap tersine dönsün" mantığıyla hazırlanan bir veri kümesiyle sonradan eğitim yapıyor. Eğitime katılmayan 324 test örneğinde Nimble %90,1 oranında referans cevabı seçti, Jev ise %93,2. Ancak yazar da uyarıyor: şu an için modelin "yüzde 90 bildirdiğinde gerçekten yüzde 90 doğru olması" garanti edilemiyor.
8. OpenJev en uzağa gitti ve doğrudan DiffusionGemma'ya geçti. Önce birkaç cevap konumunu boş bırakıyor, sonra bir difüzyon modelinin görüntüyü tamamlaması gibi hepsini tek seferde dolduruyor. RTX PRO 6000 üzerinde, tek istek için medyan gecikme yaklaşık 94ms.
Birkaç gün içinde OpenJEV dört kola ayrıldı: hazır modellerin cevap puanlarını doğrudan okumak, özel karar modelleri eğitmek, büyük modelleri karar modellerine dönüştürmek ve difüzyon modelleriyle doğrudan cevapları doldurmak.
Jev'in bu rotası kopyalanması kolay görünüyor. Gerçek farkı yaratan hâlâ doğruluk, genelleme ve olasılık kalibrasyonu. Model %90 bildirmeye cesaret ediyor; bu %90'ın ne kadar güvenilir olduğu en zor kısım.
