Ana Sayfa
AI AI
Flaş
Derinlik
Etkinlikler
BlockBeats Pro
Daha Fazla
Finans
Özel
Blok Zinciri Ekosistemi
Giriş
Podkastlar
Veri
OPRR
#
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe

智谱唐杰,Scaling Law'un muhasebesini yapıyor: Trilyon parametre, tüm sektörün birlikte yürüdüğü dolambaçlı bir yoldu.

动察 Beating AI hızlı haberi: Zhipu'nun kurucu ortağı Tang Jie, Scaling Law üzerine uzun bir yazı yayınlayarak bir değerlendirme yaptı. Son birkaç yıldır, büyük modeller piyasaya sürüldüğünde herkesin ilk sorduğu şey "kaç parametre" oluyor. Ancak Tang Jie'ye göre, parametreler artık tek başına model yeteneğini açıklayamaz. Verinin ne kadar olduğu, hesaplama gücünün nereye harcandığı ve modelin gelecekte nasıl kullanılacağı da aynı derecede önemli.

Sektör bu konuda zaten bir kez yanlış yola sapmıştı. 2020'de Kaplan ve diğerlerinin Scaling Law'u, hesaplama gücü arttığında parametrelerin eğitim verisinden daha hızlı büyümesi gerektiğini öne sürüyordu. GPT-3, Gopher ve MT-NLG bu yönde giderek büyüdü ve sektör trilyon parametreye doğru ilerledi.

2022'de Chinchilla deneyleri yeniden yaptı ve sorunun tam da burada olduğunu buldu. Birçok büyük model çok büyük yapıldı, ancak yeterince veri beslenmedi. Hesaplama gücü artırılmaya devam edildiğinde, parametreler ve veri birlikte büyümeli. Tang Jie geriye baktığında, o trilyon parametre yarışının, tüm sektörün birlikte yaşadığı ve sonra geri döndüğü bir yanlış yol olduğunu görüyor.

Ancak Chinchilla yalnızca eğitim hesabını yapıyordu. Model gerçekten devreye girdiğinde tekrar tekrar çağrılır ve uzun vadeli çıkarım maliyeti giderek daha önemli hale gelir. Bu kısmı da hesaba katarsanız, en uygun çözüm yine değişir. Model daha küçük olabilir ve daha fazla veriyle daha iyi eğitilebilir. Daha sonra Llama-2-7B, Gemma-2-9B gibi modeller zaten bu yöne gidiyor.

Daha sonra MoE, sorunu daha da karmaşık hale getirdi. Toplam parametrelerin daha fazla olması genellikle daha fazla bilgi depolayabileceği anlamına gelir; her seferinde gerçekten hesaplamaya katılan parametreler ve hesaplama derinliği ise çıkarım yeteneğini daha çok etkiler. İkisi birbirine karıştırılmamalıdır. 2025'e gelindiğinde, yeni araştırmalar farklı görevler için en uygun Scaling yönteminin bile farklı olduğunu buldu. Bellek daha çok parametreye dayanır, çıkarım daha çok veriye dayanır; MoE'de, toplam parametreleri körü körüne artırmak çıkarımı bile yavaşlatabilir, gerçekten hesaplamaya katılan uzman sayısını artırmak ise daha etkilidir.

Güvenlik açığı keşfi bunun çok somut bir örneğidir. Yeni bir açık bulmak, birkaç CVE ezberlemekle bitmez. Asıl zor olan, yirmi adımlık çıkarımı baştan sona kesintisiz sürdürmektir. Parametrelerin çok olması, daha derin düşünmeyi garanti etmez.

GLM-5.3, Tang Jie'nin bu sefer sunduğu doğrulamadır. GLM-5.2 ile aynı temel ve aynı mimariyi kullanır; toplam parametreler ve aktif parametreler değişmemiştir. Ekip yalnızca bir ay daha eğitim yaptı, uzun vadeli görev ortamını ve pekiştirmeli öğrenmeyi genişletmeye odaklandı ve yetenek yine de belirgin şekilde arttı. Bu sefer eklenen parametre değil, sonradan eğitimdir.

Tang Jie'nin son değerlendirmesi çok net. Scaling kesinlikle bitmedi. Model ölçeği, ön eğitim verisi, her hesaplamaya yatırılan hesaplama gücü ve sonradan eğitimin derinliği için hâlâ alan var. Ancak her nesil modelin darboğazı farklıdır ve en çok güç eklenmesi gereken yer de değişecektir.

Büyük modellerin bir sonraki rekabet turunda, kimin en fazla parametreye sahip olduğu değil, kimin hesaplama gücünü nereye harcayacağını daha iyi bildiği belirleyici olabilir.

举报 Düzeltme/Rapor
Düzeltme/Rapor
Gönder
Kütüphane Ekle
Sadece kendime görünür
Herkese Açık
Kaydet
Kütüphane Seç
Kütüphane Ekle
İptal
Tamamla