Ana Sayfa
AI AI
Flaş
Derinlik
Etkinlikler
BlockBeats Pro
Daha Fazla
Finans
Özel
Blok Zinciri Ekosistemi
Giriş
Podkastlar
Veri
OPRR
#
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe

小红书, sıfır örnek ses klonlamayı destekleyen tam sürekli otoregresif TTS modeli dots.tts'yi açık kaynak olarak yayınladı.

Beating tarafından yapılan izlemeye göre, Xiaohongshu'nun hi lab'ı, 2 milyar parametreli uçtan uca otoregresif metin-ses (TTS) modeli dots.tts'yi açık kaynak olarak yayınladı ve Apache 2.0 lisansı altında tam çıkarım ve ince ayar kodlarını kamuya açtı. Yayınlanan ağırlıklar arasında temel ön eğitim sürümü, kendi kendini düzeltme hizalama (SCA) ince ayar sürümü ve düşük gecikmeli çıkarım distilasyon sürümü bulunuyor.

Geleneksel olarak ayrık ses kod çözücü token'larına (Discrete Codec Tokens) dayanan TTS mimarilerinden (VALL-E, CosyVoice, ChatTTS gibi) farklı olarak dots.tts, tamamen sürekli, uçtan uca otoregresif akış eşleme mimarisi uyguluyor ve tüm süreçte hiçbir ayrık token kullanmıyor. dots.tts, 48 kHz örnekleme hızındaki AudioVAE tarafından çıkarılan sürekli özellikleri, bir anlamsal kodlayıcı, bir omurga dil modeli (Qwen2.5-1.5B-Base'den başlatılmış, doğrudan BPE metnini işler, pinyin girişi gerektirmez) ve otoregresif akış eşleme akustik başlığı ile birleştirerek sürekli gizli değişkenleri tahmin eder ve bunlar bir üreteç tarafından sese dönüştürülür. Doğrudan sürekli özellikleri tahmin ettiği için dots.tts, ayrık nicelemenin neden olduğu ses kalitesi kaybını önler, telaffuz ayrıntılarını, ses tınısı benzerliğini ve duygusal ifadeyi korur.

dots.tts, yaklaşık 1,5 milyon saatlik ses verisi üzerinde ön eğitim almıştır. Seed-TTS-Eval değerlendirmesinde dots.tts, Çince, İngilizce ve zorlu Çince test setlerinde sırasıyla %0,94 / %1,30 / %6,60 kelime hata oranı (WER) ve 81,0 / 77,1 / 79,5 benzerlik puanı (SIM) elde ederek açık kaynak SOTA seviyesine ulaşmıştır. 24 dildeki MiniMax Multilingual kıyaslama testinde ortalama konuşmacı benzerliği 83,9'a ulaşmıştır. Xiaohongshu, Hugging Face'de kullanıcıların sıfır atışlı ses klonlamayı çevrimiçi test edebilmesi için bir Gradio deneyim alanı sağlamıştır.

举报 Düzeltme/Rapor
Düzeltme/Rapor
Gönder
Kütüphane Ekle
Sadece kendime görünür
Herkese Açık
Kaydet
Kütüphane Seç
Kütüphane Ekle
İptal
Tamamla