Hôm nay, Fable 5.1 và Atlas của World Labs đều đã ra mắt, mọi người đều bận rộn xem các mô hình trở nên thông minh hơn bao nhiêu, và mô hình thế giới đã tiến bộ được bao xa. Tại một góc nhỏ gần như không ai để ý, Meta đã công bố một thứ tôi cho rằng đáng để bàn luận: Muse Voice Transcribe, mô hình nhận thức âm thanh thời gian thực đầu tiên của Meta Superintelligence Labs. 表面上看,它只是一个语音转文字模型,但它所完成的任务远超传统的 ASR 模型如 Whisper。 实时转写、说话人分离(speaker diarization)——即判断当前是谁在说话,以及端点检测(endpointing)——即判断一个人是否已说完,这三项功能都在一个流式模型中原生完成,无需再将 ASR、VAD 和说话人模型拼接成一条流水线。 这其实非常重要。 目前 Voice Agent 体验中一个关键问题,已不再仅仅是“听没听错”,而是:何时该闭嘴倾听,何时轮到自己发言,以及当多人同时讲话时,它究竟该响应谁。 Muse 的做法也很有意思:音频每 80ms 切分一个 chunk,模型自行决定是继续听还是开始输出文字。Meta 还利用强化学习训练出所谓的“自适应延迟”——简单词汇快速确认,复杂词汇则多等待一些上下文。 目前的成绩也相当惊人。 在 Artificial Analysis 的流式语音识别排行榜上,Muse Voice Transcribe 实现了 3.1% 的 WER,最终转写延迟约为 160ms,位居第一;训练覆盖 70 多种语言,首发验证了 25 种,可在一句话内自由中英文混用;连续处理超过一小时的音频和 20 多个说话人时,也无需额外后处理。 而价格仅为 0.18 美元/小时。 我反而觉得,这正是 Meta 至今最“Meta”的一次模型发布。过去一年,大家都在拼命给 AI 增加智商,而 Meta 现在开始补感官了。
sleepy.mdChia sẻ
Nguồn:Hiển thị bản gốc
Tuyên bố miễn trừ trách nhiệm: Thông tin trên trang này có thể được lấy từ bên thứ ba và không nhất thiết phản ánh quan điểm hoặc ý kiến của KuCoin. Nội dung này chỉ được cung cấp cho mục đích thông tin chung, không có bất kỳ đại diện hay bảo đảm nào dưới bất kỳ hình thức nào và cũng không được hiểu là lời khuyên tài chính hay đầu tư. KuCoin sẽ không chịu trách nhiệm về bất kỳ sai sót hoặc thiếu sót nào hoặc về bất kỳ kết quả nào phát sinh từ việc sử dụng thông tin này.
Việc đầu tư vào tài sản kỹ thuật số có thể tiềm ẩn nhiều rủi ro. Vui lòng đánh giá cẩn thận rủi ro của sản phẩm và khả năng chấp nhận rủi ro của bạn dựa trên hoàn cảnh tài chính của chính bạn. Để biết thêm thông tin, vui lòng tham khảo Điều khoản sử dụng và Tiết lộ rủi ro của chúng tôi.