source avatarsleepy.md

Compartir

Hoy se lanzó Fable 5.1 y Atlas de World Labs, y todos están ocupados viendo cuánto más inteligentes se han vuelto los modelos y cuánto ha avanzado el modelo del mundo. En un rincón casi ignorado, Meta lanzó algo que considero muy digno de discutir: Muse Voice Transcribe, el primer modelo de percepción de audio en tiempo real de Meta Superintelligence Labs. A primera vista, parece solo un modelo de transcripción de voz a texto, pero hace mucho más que los tradicionales sistemas ASR como Whisper. La transcripción en tiempo real, la diarización de hablantes —es decir, determinar quién está hablando en cada momento— y el endpointing —identificar cuándo una persona ha terminado de hablar— se realizan nativamente dentro de un único modelo en flujo. Ya no es necesario ensamblar una tubería con ASR, VAD y modelos de hablantes separados. Esto es realmente importante. Uno de los problemas más críticos que afectan la experiencia de los agentes de voz hoy en día ya no es solo si escuchó correctamente, sino cuándo debe callarse para escuchar, cuándo le toca hablar, y quién exactamente le está hablando cuando hay varias personas en la habitación. La aproximación de Muse también es interesante. El audio se divide en fragmentos de 80 ms, y el modelo decide por sí mismo si continuar escuchando o comenzar a generar texto. Meta entrenó con RL lo que llama "retardo adaptativo": palabras simples se confirman rápidamente, mientras que las más complejas esperan un poco más de contexto. Los resultados hasta ahora son bastante impresionantes. En la tabla de reconocimiento de voz en flujo de Artificial Analysis, Muse Voice Transcribe logra un WER del 3.1% con una latencia final de aproximadamente 160 ms, ocupando el primer lugar; fue entrenado con más de 70 idiomas, y ya se validaron 25 en el lanzamiento inicial, permitiendo code-switching entre chino e inglés dentro de una misma frase; puede procesar continuamente más de una hora de audio y más de 20 hablantes sin necesidad de procesamiento posterior adicional. Y su precio es solo de $0.18 por hora. De hecho, creo que este es uno de los lanzamientos más "Meta" que ha hecho Meta hoy. Durante el último año, todos se han esforzado por aumentar la inteligencia de la IA; Meta ahora comienza a completar sus sentidos.

Descargo de responsabilidad: La información contenida en esta página puede proceder de terceros y no refleja necesariamente los puntos de vista u opiniones de KuCoin. Este contenido se proporciona solo con fines informativos generales, sin ninguna representación o garantía de ningún tipo, y tampoco debe interpretarse como asesoramiento financiero o de inversión. KuCoin no es responsable de ningún error u omisión, ni de ningún resultado derivado del uso de esta información. Las inversiones en activos digitales pueden ser arriesgadas. Evalúa con cuidado los riesgos de un producto y tu tolerancia al riesgo en función de tus propias circunstancias financieras. Para más información, consulta nuestras Condiciones de uso y la Declaración de riesgos.