动察 Beating AI hızlı haber: Büyük model çıkarım/dağıtım çerçevesi SGLang, yerel karar API'si ekledi; bu sayede Qwen3.8-27B gibi hazır LLM'ler ve çok modlu modeller, ağırlıkları değiştirmeden veya yeniden ince ayar yapmadan doğrudan seçim, yargı ve puanlama yapabiliyor. Geliştiriciler mevcut durumu ve birkaç aday yanıtı veriyor, model her seçeneğin olasılığını doğrudan döndürüyor; artık önce bir metin oluşturup sonra ayrıştırmaya gerek yok.
Bu, büyük modellerin zaten hesapladığı "sonraki token olasılığı"nı kullanıyor. Örneğin aday yanıtlar A, B, C ise, normal sohbet modeli metin üretmeye devam eder; SGLang ise modelin A, B, C için olasılıklarını doğrudan okuyarak hangi yanıta daha yatkın olduğunu görür. Modelin kendisi değişmez, sadece sonuçları okuma şekli değişir.
SGLang, Qwen3.8-27B ile bir 《Pokémon FireRed》 demosu yaptı. Model, gerçek zamanlı oyun durumuna göre saldırı, Pokémon değiştirme veya iyileştirme kararı veriyor; tek karar 100ms'nin altında ve dört Büyük Usta ile şampiyonu tek seferde geçti. Qwen3.8-27B görüntü girişini desteklediği için bu yöntem çok modlu kararları da işleyebiliyor.
SGLang ayrıca /v1/systemone arayüzünü ekledi ve Jev'in kullandığı TypeSafe SDK ile uyumlu. Bu SDK'yı zaten kullanan uygulamalar, servis adresini kendi SGLang örneklerine değiştirerek çağrılara devam edebilir. Yeni özellikler nightly sürümüne girdi ve v0.5.21 ile resmi olarak yayınlanması planlanıyor.
