动察 Beating AI hızlı haber: Tencent Hunyuan, 1,5 milyar parametreli ses üretimi ve düzenleme modeli AuK'yu açık kaynak olarak yayınladı; resmi olarak buna doğrudan "ses versiyonu Nano Banana" diyorlar. Ses klonlama, kelime değiştirme, duygu değiştirme, aksan giderme, konuşma hızı ve perde ayarlama, gürültü azaltma, çoklu kişi ve müzik ayrıştırma gibi özelliklerin tümü aynı modele sığdırıldı ve doğal dille kontrol edilebiliyor.
AuK mevcut kayıtları doğrudan değiştirebiliyor. Birkaç kelime yanlış söylendiyse, yalnızca o kelimeleri değiştirmek yeterli, tüm bölümü yeniden kaydetmeye gerek yok; içerik aynı kalırken duygu, tını veya aksan da değiştirilebiliyor. Şarkı sözlerini değiştirme, gülüşme ve öksürük seslerini çıkarma, normal konuşmayı fısıltıya çevirme de destekleniyor. Ses klonlama için önce referans kayda metin dökümü vermeye de gerek yok; yalnızca bir ses parçası ve yeni metinle üretim yapılabiliyor.
Resmi testlerde AuK, ses üretimi ve genel ses düzenleme alanındaki birçok değerlendirmede önde. SpeechEditBench'te 49,73 puan alırken ikinci sıradaki Ming-UniAudio 28,70 puan aldı. Hızlı sürüm AuK-Flash, damıtma sonrası yalnızca 4 adımda çıkarım yapabiliyor ve yaklaşık 4,5 kat daha hızlı. Ancak makale, AuK'nun şu anda tüm gelişigüzel doğal dil komutlarını istikrarlı biçimde anlayamadığını, hâlâ görevi belirlemek, parametreleri düzenlemek ve komutları yeniden yazmak için Prompt Enhancer'a ihtiyaç duyduğunu kabul ediyor. Kod ve model ağırlıkları zaten kamuya açıldı ve MIT lisansıyla sunuluyor.
