source avatarsleepy.md

Partager

Aujourd’hui, Fable 5.1 et Atlas de World Labs ont été publiés, et tout le monde s’affaire à observer à quel point les modèles sont devenus plus intelligents et à quelle vitesse les modèles mondiaux progressent. Dans un coin presque ignoré, Meta a publié quelque chose que je trouve particulièrement méritant d’être discuté : Muse Voice Transcribe, le premier modèle d’analyse audio en temps réel des Meta Superintelligence Labs. À première vue, il s’agit simplement d’un modèle de reconnaissance vocale, mais il effectue bien plus que les systèmes traditionnels d’ASR comme Whisper. La transcription en temps réel, la diarisation des locuteurs — c’est-à-dire déterminer qui parle actuellement — ainsi que l’endpointing — déterminer quand une personne a terminé de parler — sont toutes trois réalisées nativement au sein d’un seul modèle en flux. Plus besoin de concaténer une pipeline composée d’ASR, de VAD et de modèles de diarisation. C’est en réalité très important. Un problème majeur qui affecte actuellement l’expérience des agents vocaux n’est plus seulement de savoir s’ils ont bien compris ce qui a été dit, mais aussi quand ils doivent se taire pour écouter, quand c’est à eux de répondre, et surtout, lorsqu’il y a plusieurs personnes qui parlent en même temps, qui leur adresse réellement la parole. La méthode de Muse est également intéressante. L’audio est découpé en morceaux de 80 ms, et le modèle décide lui-même s’il doit continuer à écouter ou commencer à générer du texte. Meta a également utilisé l’apprentissage par renforcement pour développer ce qu’il appelle un « délai adaptatif » : les mots simples sont confirmés rapidement, tandis que les mots complexes bénéficient d’un peu plus de contexte. Les résultats sont déjà impressionnants. Sur le classement de reconnaissance vocale en flux d’Artificial Analysis, Muse Voice Transcribe atteint un WER de 3,1 % avec une latence finale de transcription d’environ 160 ms, ce qui le place en première position. Il a été entraîné sur plus de 70 langues, avec 25 vérifiées en lancement initial ; il peut gérer des changements de langue en cours de phrase, comme le code-switching entre anglais et chinois ; il traite sans difficulté des durées supérieures à une heure et plus de 20 locuteurs, sans nécessiter de post-traitement supplémentaire. Et le prix ? Seulement 0,18 $/heure. Je trouve que c’est une publication typiquement Meta : alors que tout le monde s’efforce ces derniers mois d’augmenter l’intelligence des IA, Meta commence à combler ses sens.

Clause de non-responsabilité : les informations sur cette page peuvent avoir été obtenues auprès de tiers et ne reflètent pas nécessairement les points de vue ou opinions de KuCoin. Ce contenu est fourni à titre informatif uniquement, sans aucune représentation ou garantie d’aucune sorte, et ne doit pas être interprété comme un conseil en investissement. KuCoin ne sera pas responsable des erreurs ou omissions, ni des résultats résultant de l’utilisation de ces informations. Les investissements dans les actifs numériques peuvent être risqués. Veuillez évaluer soigneusement les risques d’un produit et votre tolérance au risque en fonction de votre propre situation financière. Pour plus d’informations, veuillez consulter nos conditions d’utilisation et divulgation des risques.