动察 Beating AI hızlı haber: DeepSeek modeli yine büyütmeye hazırlanıyor. CEO Liang Wenfeng yatırımcılara şirketin 2 trilyon parametreli bir model eğittiğini, ardından 8 trilyon parametreli bir model geliştirmeyi planladığını açıkladı. Mevcut amiral gemisi V4-Pro yalnızca 1,6 trilyon parametreye sahip.
8 trilyon ne demek? Şu anda ağırlıkları açık kaynak olarak yayımlanmış süper büyük modeller arasında Moonshot AI'ın Kimi K3'ü 2,8 trilyon parametreye ulaşarak dünyanın en büyük açık kaynak modeli oldu. DeepSeek'in planladığı 8 trilyon parametreli model ise neredeyse 3 kat daha büyük olacak.
Ancak toplam parametre sayısının fazla olması, her çalıştırmada tüm parametrelerin kullanılacağı anlamına gelmez. Kimi K3 de MoE mimarisine sahip; 2,8 trilyon toplam parametrenin her Token için yalnızca 104 milyarı aktive ediliyor.

