Ana Sayfa
AI AI
Flaş
Derinlik
Etkinlikler
BlockBeats Pro
Daha Fazla
Finans
Özel
Blok Zinciri Ekosistemi
Giriş
Podkastlar
Veri
OPRR
#
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe

Büyük modeller artık kendi "taslaklarını" yazmaya başlıyor: NCP, sonraki kelimeyi tahmin etmeyi modelin içine yerleştiriyor

动察 Beating AI hızlı haber: Şanghay AI Lab ve Şanghay Jiao Tong Üniversitesi, 8,9 milyar parametreli NCP-ArchPreview modelini yayınladı. Sıradan büyük modeller esas olarak "bir sonraki token'ı tahmin etme" üzerine eğitilirken, NCP ayrıca sonraki kısa bir bölümün karşılık geldiği içsel kavram sinyalini de tahmin eder ve bunu token üretimine yardımcı olmak için kullanır. Sonuçta yine token token çıktı verilir, ancak model içsel olarak sonraki metni önceden tahmin edebilir.


Bu sinyal aynı zamanda spekülatif kod çözümünü hızlandırmak için de kullanılabilir. DFlash, DSpark gibi çözümler önce küçük bir modelin sonraki metni tahmin etmesini sağlar, ardından büyük modelin bunu toplu olarak kontrol etmesine verir. NCP ekibi içsel kavram sinyalini de bu küçük modele verir; bu da ona önce "sonrasının yaklaşık nasıl yazılacağı" konusunda bir ipucu vermek ve ardından bir seferde paralel olarak 16 token tahmin etmesini sağlamak anlamına gelir.


Böylece küçük modelin doğru tahmin ettiği içerik artar. Dört testte, büyük model her doğrulama yaptığında ortalama geçen token sayısı 5,933'ten 6,180'e yükseldi; bu %4,17'lik bir artıştır; HumanEval'de artış %7,59 oldu. Bu sinyali entegre etmek taslak modele yalnızca yaklaşık 40 bin parametre ekler.


Aynı 8,9 milyar parametreyle NCP, sıradan Transformer'ın yaklaşık %85'lik eğitim hesaplama maliyetiyle eğitim hatasını benzer bir seviyeye düşürebilir.

举报 Düzeltme/Rapor
Düzeltme/Rapor
Gönder
Kütüphane Ekle
Sadece kendime görünür
Herkese Açık
Kaydet
Kütüphane Seç
Kütüphane Ekle
İptal
Tamamla