动察 Beating AI hızlı haber: Jieyue Xingchen, StepAudio 3'ü yayınladı ve Realtime, ASR, TTS, Gen ile Music olmak üzere beş ses modelini birden kullanıma sundu.
Artificial Analysis'in iki ses değerlendirmesinde StepAudio 3 Realtime birinci sırada yer aldı. Conversational Dynamics'te %98,9 puanla Qwen Audio 3.0 Realtime Plus'ın %98,4'ünün ve GPT-Realtime-2 High'ın %95,3'ünün önüne geçti; Speech Reasoning'de ise %99,7 puanla yine birinci oldu. İlki esas olarak modelin duraklamaları, sırayla konuşmayı, kullanıcı kesintilerini ve "hı hı", "evet" gibi onaylamaları işleyip işleyemediğini ölçerken, ikincisi modelin sesi doğrudan anlayıp akıl yürütmeyi tamamlayıp tamamlayamadığını test ediyor.
ASR de Artificial Analysis'in akışsız ses tanıma listesinde %1,7 WER (kelime hata oranı) ile Fun-Realtime-ASR-preview ile birlikte birinci sırada yer aldı. Ayrıca StepAudio 3 Gen, insan sesi, ses efektleri, ortam sesleri ve müziği tek seferde üretebiliyor ve senaryoya göre bir bütün halinde düzenleyebiliyor.
Beş model şu anda Jieyue'nin ses ürün hattına dahil edilmiş durumda.
