Hari ini Fable 5.1 dirilis, Atlas dari World Labs juga dirilis, semua orang sibuk melihat seberapa pintar model-model ini menjadi dan seberapa jauh model dunia telah maju. Di sudut yang hampir tidak diperhatikan, Meta merilis sesuatu yang menurut saya sangat layak dibahas: Muse Voice Transcribe, model persepsi audio real-time pertama dari Meta Superintelligence Labs. Secara tampak luar, ini hanyalah model transkripsi suara ke teks, tetapi fungsinya jauh lebih banyak daripada sistem ASR tradisional seperti Whisper. Transkripsi real-time, speaker diarization—yaitu menentukan siapa yang sedang berbicara—dan endpointing—menentukan kapan seseorang benar-benar selesai berbicara—ketiga hal ini diselesaikan secara native dalam satu model streaming. Tidak perlu lagi menyusun pipeline dengan menggabungkan ASR, VAD, dan model speaker terpisah. Ini sebenarnya sangat penting. Salah satu masalah utama yang memengaruhi pengalaman Voice Agent saat ini bukan lagi hanya kesalahan mendengar, tetapi juga kapan harus diam dan mendengarkan, kapan giliran berbicara, serta siapa yang benar-benar berbicara kepada agent ketika banyak orang berbicara sekaligus. Pendekatan Muse juga cukup menarik. Audio dipotong menjadi chunk setiap 80ms, dan model sendiri memutuskan apakah akan terus mendengarkan atau mulai menghasilkan teks. Meta juga melatih dengan RL untuk menghasilkan apa yang disebut adaptive delay—kata-kata sederhana dikonfirmasi cepat, sementara kata-kata sulit menunggu lebih banyak konteks. Hasilnya pun cukup luar biasa. Di peringkat pengenalan suara streaming dari Artificial Analysis, Muse Voice Transcribe mencapai WER 3,1% dengan latensi transkripsi akhir sekitar 160ms, saat ini peringkat pertama; pelatihan mencakup lebih dari 70 bahasa, dengan 25 bahasa telah diverifikasi di peluncuran perdana, mampu melakukan code-switching antara bahasa Mandarin dan Inggris dalam satu kalimat; serta mampu memproses audio lebih dari satu jam dengan lebih dari 20 pembicara tanpa memerlukan pemrosesan lanjutan tambahan. Dan harganya hanya $0,18 per jam. Justru saya merasa ini adalah rilis model yang sangat “Meta” dari Meta hari ini. Selama setahun terakhir, semua orang berlomba-lomba menambah kecerdasan pada AI, tetapi sekarang Meta mulai memperbaiki indera.
sleepy.mdBagikan
Sumber:Tampilkan versi asli
Penafian: Informasi pada halaman ini mungkin telah diperoleh dari pihak ketiga dan tidak mencerminkan pandangan atau opini KuCoin. Konten ini disediakan hanya untuk tujuan informasi umum, tanpa representasi atau jaminan apa pun, dan tidak dapat ditafsirkan sebagai saran keuangan atau investasi. KuCoin tidak bertanggung jawab terhadap segala kesalahan atau kelalaian, atau hasil apa pun yang keluar dari penggunaan informasi ini.
Berinvestasi di aset digital dapat berisiko. Harap mengevaluasi risiko produk dan toleransi risiko Anda secara cermat berdasarkan situasi keuangan Anda sendiri. Untuk informasi lebih lanjut, silakan lihat Ketentuan Penggunaan dan Pengungkapan Risiko.