source avatarsleepy.md

分享

今天 Fable 5.1 發佈了,World Labs 的 Atlas 也發佈了,大家都在忙著看模型又變多聰明、世界模型又前進了多少。 但在一個幾乎無人問津的角落,Meta 發佈了一個我覺得非常值得聊聊的東西: Muse Voice Transcribe,Meta Superintelligence Labs 的首款實時音頻感知模型。 表面上看,它只是一個語音轉文字模型,但它所做的事比 Whisper 那套傳統 ASR 多得多。 實時轉寫、說話者分離(speaker diarization),也就是判斷現在到底誰在說話,以及端點檢測(endpointing),判斷一個人究竟說完沒有——這三件事都在一個流式模型中原生完成,無需再將 ASR、VAD、說話者模型拼成一條流水線。 這其實非常重要。 目前 Voice Agent 最影響體驗的問題,已不只是聽沒聽錯,而是什麼時候該閉嘴聽、什麼時候輪到自己說話,以及當一屋子人同時講話時,到底誰在對它說話。 Muse 的做法也很有意思:音頻每 80ms 切成一個 chunk,模型自行決定是繼續聽還是開始輸出文字。Meta 又用強化學習訓練出所謂的自適應延遲(adaptive delay)——簡單詞迅速確認,複雜詞則多等一點上下文。 目前的成績也相當驚人。 在 Artificial Analysis 的流式語音識別排行榜上,Muse Voice Transcribe 達到 3.1% WER,最終轉寫延遲約為 160ms,目前排名第一;訓練涵蓋 70 多種語言,首發驗證了 25 種,可在一句話中中英文自由切換(code-switch);連續處理一小時以上音頻與 20 多位說話者時,也無需額外後處理。 而價格僅為 0.18 美元/小時。 我反而覺得,這才是 Meta 今天最「Meta」的一次模型發佈——過去一年大家拼命給 AI 加智商,Meta 現在開始補感官了。

免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露