今天 Fable 5.1 發佈了,World Labs 的 Atlas 也發佈了,大家都在忙著看模型又變多聰明、世界模型又前進了多少。 但在一個幾乎無人問津的角落,Meta 發佈了一個我覺得非常值得聊聊的東西: Muse Voice Transcribe,Meta Superintelligence Labs 的首款實時音頻感知模型。 表面上看,它只是一個語音轉文字模型,但它所做的事比 Whisper 那套傳統 ASR 多得多。 實時轉寫、說話者分離(speaker diarization),也就是判斷現在到底誰在說話,以及端點檢測(endpointing),判斷一個人究竟說完沒有——這三件事都在一個流式模型中原生完成,無需再將 ASR、VAD、說話者模型拼成一條流水線。 這其實非常重要。 目前 Voice Agent 最影響體驗的問題,已不只是聽沒聽錯,而是什麼時候該閉嘴聽、什麼時候輪到自己說話,以及當一屋子人同時講話時,到底誰在對它說話。 Muse 的做法也很有意思:音頻每 80ms 切成一個 chunk,模型自行決定是繼續聽還是開始輸出文字。Meta 又用強化學習訓練出所謂的自適應延遲(adaptive delay)——簡單詞迅速確認,複雜詞則多等一點上下文。 目前的成績也相當驚人。 在 Artificial Analysis 的流式語音識別排行榜上,Muse Voice Transcribe 達到 3.1% WER,最終轉寫延遲約為 160ms,目前排名第一;訓練涵蓋 70 多種語言,首發驗證了 25 種,可在一句話中中英文自由切換(code-switch);連續處理一小時以上音頻與 20 多位說話者時,也無需額外後處理。 而價格僅為 0.18 美元/小時。 我反而覺得,這才是 Meta 今天最「Meta」的一次模型發佈——過去一年大家拼命給 AI 加智商,Meta 現在開始補感官了。
