source avatarMinty

Поділитися

Чи може швидша токенізація усунути основний обмежувальний фактор у навчанні великих моделей ШІ? Gigatoken — це відкритий токенізатор, розроблений для значного прискорення цього процесу шляхом прямого читання навчальних даних з файлів та розподілу завдань між кількома ядрами CPU. Перш ніж сирі тексти можна використовувати для навчання, їх потрібно перетворити на токени, які модель може обробляти. Це зазвичай не має значення для невеликих наборів даних, але токенізація великих наборів даних вимагає більше часу та ресурсів CPU. Gigatoken обробив приблизно 2,7 мільярда токенів GPT-2 за близько півсекунди на високопродуктивному сервері — майже в 1000 разів швидше, ніж токенізатор Hugging Face у тестах проекту. Для великих навчальних лабораторій та постачальників даних це може означати менше CPU, виділених на підготовку даних, та швидше ітерування при будь-якій зміні набору даних або токенізатора.

No.0 picture
Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації. Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.