Beating tarafından yapılan izlemeye göre, Xiaohongshu'nun hi lab'ı, 2 milyar parametreli uçtan uca otoregresif metin-ses (TTS) modeli dots.tts'yi açık kaynak olarak yayınladı ve Apache 2.0 lisansı altında tam çıkarım ve ince ayar kodlarını kamuya açtı. Yayınlanan ağırlıklar arasında temel ön eğitim sürümü, kendi kendini düzeltme hizalama (SCA) ince ayar sürümü ve düşük gecikmeli çıkarım distilasyon sürümü bulunuyor.
Geleneksel olarak ayrık ses kod çözücü token'larına (Discrete Codec Tokens) dayanan TTS mimarilerinden (VALL-E, CosyVoice, ChatTTS gibi) farklı olarak dots.tts, tamamen sürekli, uçtan uca otoregresif akış eşleme mimarisi uyguluyor ve tüm süreçte hiçbir ayrık token kullanmıyor. dots.tts, 48 kHz örnekleme hızındaki AudioVAE tarafından çıkarılan sürekli özellikleri, bir anlamsal kodlayıcı, bir omurga dil modeli (Qwen2.5-1.5B-Base'den başlatılmış, doğrudan BPE metnini işler, pinyin girişi gerektirmez) ve otoregresif akış eşleme akustik başlığı ile birleştirerek sürekli gizli değişkenleri tahmin eder ve bunlar bir üreteç tarafından sese dönüştürülür. Doğrudan sürekli özellikleri tahmin ettiği için dots.tts, ayrık nicelemenin neden olduğu ses kalitesi kaybını önler, telaffuz ayrıntılarını, ses tınısı benzerliğini ve duygusal ifadeyi korur.
dots.tts, yaklaşık 1,5 milyon saatlik ses verisi üzerinde ön eğitim almıştır. Seed-TTS-Eval değerlendirmesinde dots.tts, Çince, İngilizce ve zorlu Çince test setlerinde sırasıyla %0,94 / %1,30 / %6,60 kelime hata oranı (WER) ve 81,0 / 77,1 / 79,5 benzerlik puanı (SIM) elde ederek açık kaynak SOTA seviyesine ulaşmıştır. 24 dildeki MiniMax Multilingual kıyaslama testinde ortalama konuşmacı benzerliği 83,9'a ulaşmıştır. Xiaohongshu, Hugging Face'de kullanıcıların sıfır atışlı ses klonlamayı çevrimiçi test edebilmesi için bir Gradio deneyim alanı sağlamıştır.
