Xiaomi merilis dan membuka kode Xiaomi-CocktailASR-1, model pengenalan suara yang dirancang untuk menangani salah satu masalah tersulit dalam transkripsi audio.
Tantangan utamanya adalah memilih suara satu orang ketika beberapa orang berbicara pada waktu yang sama.
Xiaomi menyebut kondisi ini sebagai “cocktail party problem”.
Sebagian besar model pengenalan suara bekerja baik saat hanya satu orang berbicara, tetapi menjadi jauh lebih sulit ketika beberapa suara saling tumpang tindih.
Kondisi itu dapat menghasilkan teks kacau, kalimat tergabung, atau bagian percakapan yang salah ditetapkan ke pembicara lain.
Tantangan ini mirip dengan yang pernah ditangani Xiaomi melalui model text-to-speech OmniVoice, meski CocktailASR-1 bekerja pada arah sebaliknya.
Model ini mengisolasi dan mentranskripsikan ucapan, bukan menghasilkan suara.
Cara kerja CocktailASR-1
Untuk menggunakan CocktailASR-1, pengguna perlu memberikan klip audio singkat dari orang yang ingin dilacak.
Model memakai klip itu sebagai referensi suara, lalu menelusuri rekaman dengan banyak pembicara untuk mengidentifikasi dan mentranskripsikan hanya ucapan orang tersebut.
Xiaomi membangun CocktailASR-1 dengan arsitektur LLM end-to-end.
Perusahaan mengklaim model ini mencapai hasil state-of-the-art pada sejumlah benchmark pengenalan suara multi-pembicara, melampaui pendekatan yang ada untuk tugas serupa.
Model ini juga tidak terbatas pada percakapan kelompok yang bising.
Dengan hanya satu pembicara, Xiaomi menyatakan CocktailASR-1 tampil pada level yang kurang lebih sama dengan model automatic speech recognition (ASR) standar.
Artinya, pengguna tidak perlu mengorbankan performa satu pembicara demi hasil yang lebih baik pada audio ramai.
Model ini juga dapat menghindari tebakan yang tidak perlu.
Jika pembicara yang dipilih tidak muncul dalam rekaman, model mengembalikan teks kosong alih-alih mencoba mentranskripsikan suara orang lain.
CocktailASR-1 turut menyertakan mode penalaran chain-of-thought, sehingga pengguna dapat memeriksa penalaran yang terkait dengan transkripsi, bukan hanya melihat teks akhir.
Xiaomi-CocktailASR-1 menjadi rilis terbaru dalam daftar model AI yang dibuka Xiaomi.
Model ini menyusul rilis seperti MiMo-V2-Flash dan Xiaomi Robotics-0.
CocktailASR-1 kini tersedia di GitHub dan Hugging Face untuk dicoba dan dijelajahi pengembang.
