Perusahaan teknologi Meta resmi memperkenalkan Muse Voice Transcribe, model kecerdasan buatan (AI) pengenalan suara terbaru yang dirancang khusus untuk melakukan proses transkripsi secara real-time.
Pihak pengembang mendefinisikan Muse Voice Transcribe sebagai model persepsi audio waktu nyata pertama dari lini ekosistem mereka.
Perangkat lunak cerdas ini dibekali kapabilitas mumpuni untuk mengenali lebih dari 20 pembicara sekaligus dan telah dilatih menggunakan lebih dari 70 bahasa berbeda, dengan 25 bahasa di antaranya telah melalui tahap verifikasi ekstensif.
Tidak hanya itu, Muse Voice Transcribe dirancang secara adaptif untuk menangani percakapan multibahasa, termasuk mendeteksi peralihan bahasa secara instan di tengah dialog serta memproses rekaman berdurasi lebih dari satu jam.
Dalam sejumlah benchmark pemrosesan suara waktu nyata, Muse Voice Transcribe diklaim sukses mengungguli deretan model pesaing. Berdasarkan pengujian benchmark AA-WER Streaming speech-to-text dari Artificial Analysis, Muse Voice Transcribe mencatatkan tingkat kesalahan kata (word error rate/WER) sebesar 3,1 persen untuk percakapan berbahasa inggris.
Angka tersebut jauh lebih rendah dibanding kompetitor sejenis seperti Cartesia Ink-2 (3,4 persen), ElevenLabs Scribe v2 Real-time (3,6 persen), GPT Live Transcribe (3,9 persen), hingga Gemini 3.5 Transcribe Live yang berada di angka 4 persen.
Cara Kerja Muse Voice Transcribe

Secara arsitektural, Muse Voice Transcribe merupakan model multimodal autoregresif yang diturunkan dari keluarga besar Muse Spark. Sistem kerjanya memecah aliran audio ke dalam potongan-potongan berdurasi 80 milidetik (12,5 potongan per detik), di mana setiap bagian dikompresi menjadi satu soft token.
Sistem cerdas ini secara mandiri menentukan apakah sebuah potongan audio harus langsung diterjemahkan menjadi token teks atau ditahan sejenak guna menunggu konteks lanjutan dari segmen berikutnya.
Pendekatan inovatif yang disebut sebagai adaptive delay ini dipelajari oleh model melalui metode reinforcement learning.
Meta menyematkan dua faktor penilai utama berupa akurasi transkripsi dan rendahnya latensi, sehingga sistem terdorong untuk menghasilkan teks secara cepat tanpa mengorbankan ketepatan arti.
Mekanisme serupa juga diterapkan untuk mengoptimalkan tingkat akurasi pemisahan suara antar-pembicara (diarization).
Ketersediaan di Mac
Bagi pengguna ekosistem Apple, Muse Voice Transcribe kini sudah dapat diakses melalui Meta Model API, aplikasi Meta AI untuk macOS, dan Muse Code.
Pada perangkat Mac, pengguna cukup menekan dan menahan tombol Fn untuk mendiktekan teks langsung ke berbagai aplikasi, atau memberikan instruksi suara interaktif pada antarmuka Muse Code. Kehadiran fitur ini juga sempat dipamerkan langsung oleh Spencer Barnett melalui akun resminya di platform X.
Sementara itu, untuk kebutuhan pengembangan aplikasi komersial, Meta menetapkan tarif penggunaan API sebesar 3 dolar AS (sekitar Rp 53.310) per 1.000 menit audio atau setara dengan 0,18 dolar AS (sekitar Rp 3.199) per jam.
Berbeda perlakukan dengan model Muse Glimmer sebelumnya, Meta memutuskan untuk tidak merilis bobot model terbuka (open weights) untuk Muse Voice Transcribe ke publik, sebagaimana dihimpun dari laporan The New Stack.
Kehadiran model transkripsi mutakhir ini dipastikan akan semakin mempertajam persaingan industri kecerdasan buatan dalam hal pengenalan suara tingkat lanjut.
Untuk terus memantau perkembangan fitur terbaru Muse Voice Transcribe, pembaruan ekosistem perangkat melintang, hingga ulasan teknologi global paling mendalam, pastikan untuk selalu menelusuri artikel pilihan lainnya hanya di Dafunda Tekno.
FAQ
1. Apa itu Muse Voice Transcribe?
Muse Voice Transcribe adalah model kecerdasan buatan (AI) pengenalan suara real-time pertama dari Meta yang dilatih menggunakan lebih dari 70 bahasa dan mampu mengenali lebih dari 20 pembicara sekaligus.
2. Bagaimana sistem menentukan kecepatan transkripsi teks?
Sistem menggunakan pendekatan adaptive delay berbasis reinforcement learning untuk menakar apakah suatu potongan audio perlu ditahan sejenak guna mendapatkan konteks kalimat yang lebih utuh.
3. Platform apa saja yang mendukung penggunaan model ini?
Layanan ini dapat diakses melalui Meta Model API, platform pengembangan Muse Code, serta terintegrasi secara langsung di dalam aplikasi Meta AI untuk perangkat macOS.
4. Berapa biaya akses API untuk model pengenalan suara ini?
Meta menetapkan tarif sebesar 3 dolar AS (sekitar Rp 53.310) per 1.000 menit audio atau sekitar 0,18 dolar AS per jam untuk penggunaan melalui jalur API.


Bales ke