动察 Beating tarafından yapılan izlemeye göre, Sina Weibo ekibi yakın zamanda 30 milyar parametreli çıkarım modeli VibeThinker-3B'yi açık kaynak olarak yayınladı.
Model, matematik ve programlama gibi görevlerde öncü seviyelere ulaştı ve bazı metriklerde DeepSeek V3.2, GLM-5 ve Gemini 3 Pro gibi büyük ölçekli amiral gemisi modellerine yaklaştı veya onları geçti.
VibeThinker-3B, Qwen2.5-Coder-3B tabanlı olup, Spectrum-to-Signal süreci kullanılarak ikincil eğitimden geçirildi: Model önce kolaydan zora doğru problem çözerek bir çözüm spektrumu biriktiriyor, ardından pekiştirmeli öğrenme ile doğru çözüm sinyallerini güçlendiriyor. Eğitim boyunca, çıkarım adımlarının kesintiye uğramasını önlemek için 64K büyük düşünme alanı kullanılıyor.
Matematik ve programlama için model, bir yandan kendi doğru çözüm adımlarını toplayarak kendi kendine damıtma taklidi yaparken, diğer yandan cevap verme sırasında adım bazlı değerlendirme ile kendi kendini kontrol ediyor. Bu kendi kendini kontrol mekanizması, AIME26 matematik test puanını 94,3'ten 97,1'e yükseltti.
Araştırma ekibi raporda "Parametre Sıkıştırma-Kapsama Hipotezi"ni öne sürdü. Buna göre, mantıksal akıl yürütme oldukça sıkıştırılabilir bir yetenektir ve esas olarak kurallar ve hata düzeltmeye dayanır; 3B gibi küçük bir modelle üst düzey sonuçlar elde edilebilir. Buna karşılık, açık alan bilgisi, ezberleme için büyük miktarda parametre gerektirir. Parametre ölçeği sınırlamaları nedeniyle VibeThinker-3B, genel bilgi kapsamında büyük modellere kıyasla hala zayıftır.
Ekip, araştırmanın amacının küçük modellerle büyük modellerin yerini almak olmadığını, aksine kompakt modellerin net doğrulama mekanizmaları altındaki yetenek sınırlarını keşfetmek olduğunu vurguladı.
