本日、Fable 5.1 がリリースされ、World Labs の Atlas も公開された。誰もがモデルがどれだけ賢くなったか、世界モデルがどれだけ進化したかを注目している。 しかし、ほとんど注目されない一角で、Meta が私が非常に価値のある話だと感じたものを発表した: Muse Voice Transcribe — Meta Superintelligence Labs の初のリアルタイム音声認識モデル。 表面上は音声をテキストに変換するモデルに見えるが、従来の ASR システムである Whisper よりもはるかに多くの機能を果たしている。 リアルタイム転写、話者分離(現在誰が話しているかを判別)、およびエンドポイント検出(誰かが話しおわったかを判断)——この3つの機能が、1つのストリーミングモデル内でネイティブに実装されている。ASR、VAD、話者モデルを組み合わせてパイプラインを構築する必要がない。 これは非常に重要だ。 ボイスエージェントの体験を大きく損なう問題は、今や「聞き取りミス」だけではない。いつ黙って聞くべきか、いつ話す順番が来るか、そして複数人が話している中で、誰がエージェントに話しかけているのかという点だ。 Muse のアプローチも興味深い。音声は80msごとにチャンクに分割され、モデル自身が継続して聴くか、文字出力を開始するかを決定する。Meta はRLを用いて「アダプティブディレイ」を訓練し、単純な単語は迅速に確定し、複雑な単語はより多くのコンテキストを待つようにした。 現在の成果も非常に驚異的だ。 Artificial Analysis のストリーミング音声認識ランキングで、Muse Voice Transcribe はWER 3.1%を達成し、最終的な転写遅延は約160msで現在第1位。70以上の言語をカバーするトレーニングを行い、25言語を最初に検証済み。1文の中で中国語と英語を自由に切り替えるコードスイッチングも可能。1時間以上の連続音声と20人以上の話者を処理しても、追加の後処理は不要。 さらに価格はたったの0.18ドル/時間。 むしろ、これはMetaが今日行った、非常にMetaらしいモデルの発表だと私は思う。過去1年間、誰もがAIに知性を加えることに必死だったが、Metaは今や感覚機能の補完に着手している。
