source avatarsleepy.md

I-share

Ngayon ay inilabas ang Fable 5.1, at ang Atlas ng World Labs ay inilabas din, at lahat ay nagtatrabaho upang tingnan kung gaano katalino ang mga modelo at gaano kalayo ang mga mundo model na naging mas maunawaan. Sa isang maliit na sulok na walang maraming tao ang pinapansin, inilabas ni Meta ang isang bagay na sa tingin ko ay值得 talakayin: Muse Voice Transcribe, ang unang real-time audio-aware na modelo ng Meta Superintelligence Labs. Sa paningin nito, ito ay isang modelo na nagpapalit ng boses sa teksto, ngunit mas marami itong ginagawa kaysa sa tradisyonal na ASR ng Whisper. Ang real-time transcription, speaker diarization—o pagtukoy kung sino ang nagsasalita sa kasalukuyan—at endpointing—pagtukoy kung kumpleto na ang isang tao sa pagsasalita—ay lahat ay natatapos sa loob ng isang streamlining na modelo. Hindi na kailangan mag-imbak ng ASR, VAD, at speaker model upang lumikha ng isang pipeline. Ito ay napakahalaga. Ang isang malaking problema sa voice agents ngayon ay hindi lamang kung tama o mali ang narinig, kundi kailan dapat maghintay at kailan naman ang panahon para mag-salita, at kung sino sa isang kuwartong puno ng mga tao ang nagsasalita sa iyo. Ang paraan ni Muse ay interesante rin. Ang bawat 80ms ng audio ay kinukupas bilang isang chunk, at ang modelo mismo ang nagpapasya kung magpapatuloy pa ba sa pagdinig o magsisimula na maglabas ng teksto. Gumamit din si Meta ng RL upang matuto ang tinatawag na adaptive delay—mabilis na i-verify ang mga simpleng salita, habang hinihintay ang karagdagang konteksto para sa mga mahirap na salita. Ang resulta ay medyo nakakagulat din. Sa Artificial Analysis’s streaming speech recognition leaderboard, natamo ng Muse Voice Transcribe ang 3.1% WER, na may huling transcribe delay na halos 160ms—kasalukuyang numero uno; kinabibilangan ng 70+ wika sa pagtuturo, at 25 wika ay napatunayan sa unang pagkakataon, at maaari itong mag-switch sa pagitan ng Ingles at Tsino sa isang pangungusap; maaari itong magtrabaho nang tuloy-tuloy sa higit sa isang oras ng audio at 20+ speaker nang walang karagdagang post-processing. At ang presyo ay lamang $0.18/kalibre. Sa tingin ko, ito ay isang napakameta na paglalabas ng Meta. Sa nakaraang taon, lahat ay tumutok sa pagdaragdag ng IQ sa AI, ngunit ngayon ay nagsisimula na si Meta na punan ang kanyang mga pandama.

Disclaimer: Ang information sa page na ito ay maaaring nakuha mula sa mga third party at hindi necessary na nagre-reflect sa mga pananaw o opinyon ng KuCoin. Ibinigay ang content na ito para sa mga pangkalahatang informational purpose lang, nang walang anumang representation o warranty ng anumang uri, at hindi rin ito dapat ipakahulugan bilang financial o investment advice. Hindi mananagot ang KuCoin para sa anumang error o omission, o para sa anumang outcome na magreresulta mula sa paggamit ng information na ito. Maaaring maging risky ang mga investment sa mga digital asset. Pakisuri nang maigi ang mga risk ng isang produkto at ang risk tolerance mo batay sa iyong sariling kalagayang pinansyal. Para sa higit pang information, mag-refer sa aming Terms ng Paggamit at Disclosure ng Risk.