A tokenização mais rápida pode remover um gargalo importante no treinamento de grandes modelos de IA? O Gigatoken é um tokenizador de código aberto projetado para tornar esse processo muito mais rápido, lendo os dados de treinamento diretamente de arquivos e distribuindo o trabalho entre várias cores de CPU. Antes que o texto bruto possa ser usado para treinamento, ele precisa ser convertido em tokens que o modelo possa processar. Isso geralmente não é um problema para conjuntos de dados pequenos, mas tokenizar conjuntos de dados maiores exige mais tempo e recursos de CPU. O Gigatoken processou aproximadamente 2,7 bilhões de tokens GPT-2 em cerca de meio segundo em um servidor de alto desempenho, sendo quase 1.000 vezes mais rápido que o tokenizador da Hugging Face no benchmark do projeto. Para grandes laboratórios de treinamento e provedores de dados, isso pode significar menos CPUs dedicadas à preparação de dados e iterações mais rápidas sempre que um conjunto de dados ou tokenizador for alterado.
MintyCompartilhar

Fonte:Mostrar original
Aviso legal: as informações nesta página podem ter sido obtidas de terceiros e não refletem necessariamente os pontos de vista ou opiniões da KuCoin. Este conteúdo é fornecido apenas para fins informativos gerais, sem qualquer representação ou garantia de qualquer tipo, nem deve ser interpretado como aconselhamento financeiro ou de investimento. A KuCoin não é responsável por quaisquer erros ou omissões, ou por quaisquer resultados do uso destas informações.
Os investimentos em ativos digitais podem ser arriscados. Avalie cuidadosamente os riscos de um produto e a sua tolerância ao risco com base nas suas próprias circunstâncias financeiras. Para mais informações, consulte nossos termos de uso e divulgação de risco.