Lo más loco es que no tengo ninguna experiencia en aprendizaje automático, no conozco el proceso estándar de entrenamiento de modelos ni muchos detalles técnicos. Lo que hice fue básicamente pedirle constantemente a Sol que resuelva problemas, proporcionarle retroalimentación sobre los resultados, y dejar que ella misma identifique los problemas, diseñe experimentos y siga iterando.Autor del artículo: Anshu
Artículo compilado, fuente: ME News
Es la primera vez que realmente siento que la AGI ya ha llegado.
Entrené un modelo de corrección automática propio con GPT-5.6 Sol. Finalmente, este modelo local con solo 1.7 mil millones de parámetros superó ligeramente a GPT-5.6 Sol en el conjunto de pruebas.
Lo más loco es que no tengo ninguna experiencia en aprendizaje automático, no conozco el proceso estándar de entrenamiento de modelos ni muchos detalles técnicos. Lo que hice fue básicamente pedirle constantemente a Sol que resuelva problemas, proporcionarle retroalimentación sobre los resultados, y dejar que ella misma identifique los problemas, diseñe experimentos y siga iterando.
El proceso tiene un costo cero.
Todo comenzó con un problema de escritura cada vez más grave
Después de chatear durante mucho tiempo con IA, noté que mi habilidad para teclear se ha vuelto cada vez peor.
Ya me he acostumbrado a escribir rápidamente y ya no reviso cuidadosamente los errores de ortografía, el orden de las letras o las letras omitidas. En lugar de volver a entrenar mi habilidad para escribir, he decidido adoptar una solución más adecuada para la era de la IA: seguir usando más IA para resolver los problemas.
La corrección automática tradicional modifica constantemente el texto durante la entrada, lo que fácilmente interrumpe el flujo de pensamiento. Mi idea es permitir que el usuario ingrese rápidamente sin distracciones, incluso si contiene muchos errores, y que la IA limpie todo de forma unificada una vez finalizada la entrada.
Al mismo tiempo,我希望这个模型尽可能小。
Cuanto más pequeño sea el modelo, más rápido será su funcionamiento, menor será su consumo de energía y más adecuado será para ejecutarse completamente en el dispositivo local. Ya sea por eficiencia, duración de la batería o simplemente por interés experimental, quiero ver hasta qué punto un modelo local lo suficientemente pequeño puede lograr la corrección automática.
Entonces, decidí entrenar uno yo mismo.
Haz que Sol sea un investigador que realiza experimentos automáticamente.
La inspiración para este proyecto proviene del experimento "autoresearch" de Andrej Karpathy.
I used Codex's /goal mode to design a cyclic workflow for Sol:
Selecciona un experimento, ejecútalo y registra los resultados en el documento; si falla, descarta esta vía; luego planea el siguiente experimento, evitando repetir errores ya verificados.
Solo proporcioné algunos ejemplos de entrada obligatorios, objetivos estrictos de latencia y el efecto final deseado, luego dejé que Sol se ejecutara por sí solo.
Lo que sucedió a continuación superó mis expectativas.
Sol primero recuperó y comparó varios modelos base candidatos, incluidos Qwen 3.5, Gemma 4 y Liquid LFM 2.5. Luego, encontró en Hugging Face un conjunto de datos relacionado con texto de escritura real.
Pero los datos reales aún no son suficientes.
Para generar errores de escritura más cercanos a las entradas reales de los usuarios, Sol escribió un simulador de "dedos golpeando un teclado Mac". Utiliza una distribución gaussiana para simular el punto de caída de los dedos según la disposición física del teclado y genera varios errores comunes, como:
- Presione las teclas adyacentes;
- Letters reversed;
- Repeat input;
- Faltan caracteres;
- Toque varios botones al mismo tiempo con los dedos.
Con el modelo base, los datos de texto y el simulador de errores de teclado, Sol se ajustó directamente en mi MacBook con MLX.
En menos de una hora, creó un prototipo funcional.
El problema es que la precisión de la primera versión no fue ideal.
Primer cuello de botella: el Tokenizer no entiende los errores de ortografía
Sol leyó los artículos relacionados y diseñó una serie de pruebas, concluyendo finalmente que el cuello de botella principal del modelo no estaba en los datos de entrenamiento, sino en el Tokenizer, es decir, el tokenizador.
Los modelos de lenguaje grandes generalmente no comprenden el texto letra por letra, sino que primero lo dividen en tokens. Las palabras normales pueden descomponerse en unidades semánticas estables, pero los errores ortográficos suelen alterar la estructura original de los tokens.
Esto significa que un error tipográfico muy evidente para los humanos puede convertirse, para el modelo, en un conjunto de tokens completamente desconocidos.
El modelo tiene dificultades para "comprender" realmente los errores; solo puede memorizar mecánicamente las correspondencias entre las ortografías incorrectas y las correctas. Hacer esto no solo reduce la capacidad de generalización, sino que tampoco permite aprovechar plenamente el conocimiento lingüístico original del modelo.
Sol primero probó ByT5 de Google.
ByT5 es un modelo que no depende de un tokenizer tradicional y procesa secuencias de bytes directamente. Este intento trajo mejoras notables, pero como ByT5 se lanzó hace tiempo, el modelo tiene conocimientos lingüísticos limitados, por lo que su rendimiento final aún no alcanza el nivel de GPT-5.6 Sol.
Tras una investigación adicional, Sol se dio cuenta de que el problema no necesariamente requería resolverse mediante la "cancelación total del Tokenizer".
En su lugar, eligió T5Gemma, un modelo de arquitectura Encoder-Decoder.
A diferencia de los modelos que solo predicen el siguiente token, el modelo Encoder-Decoder puede primero comprender completamente la entrada mediante el codificador y luego generar el texto corregido mediante el decodificador. Más importante aún, Sol también puede realizar un entrenamiento adicional sobre el codificador para que el modelo reconozca mejor las entradas con errores ortográficos.
This route significantly raises the model's performance ceiling.
Segundo cuello de botella: las funciones de pérdida tradicionales fomentan que el modelo "no modifique"
Después de cambiar la arquitectura del modelo, surgió un nuevo problema.
El modelo ya puede corregir con precisión algunos errores, pero a menudo ignora otros errores de ortografía evidentes. Incluso cuando hay errores en la entrada, tiende a copiarlos tal cual.
Sol finalmente descubrió que el problema provenía de la función de pérdida de entropía cruzada más común.
En los datos de corrección automática, la mayoría de los caracteres ya son correctos, y solo una pequeña proporción requiere modificación. Si se entrena directamente con entropía cruzada estándar, la estrategia más segura para el modelo es "no modificar lo más posible".
Porque copiar el texto original puede obtener la respuesta correcta en la mayoría de los lugares, mientras que modificarlo activamente podría generar errores.
En otras palabras, los objetivos de entrenamiento tradicionales están recompensando al modelo por mantenerse inalterado.
Para resolver este problema, Sol desarrolló una función de pérdida personalizada.
Primero alinea el texto original con el texto objetivo a nivel de bytes, luego calcula la ruta de edición mínima entre ambos textos mediante un algoritmo de programación dinámica, identificando qué posiciones corresponden a copias y cuáles a inserciones, eliminaciones o sustituciones reales.
Sobre esta base, Sol aumentó significativamente el peso de entrenamiento correspondiente a la "modificación correcta", mientras que redujo los beneficios derivados de la simple copia de caracteres.
Después de múltiples ajustes de parámetros, la precisión de corrección del modelo mejoró significativamente.
Tercer cuello de botella: una vez que el modelo se equivoca, no puede retroceder
El último problema principal proviene del mecanismo de generación autoregresiva.
El modelo, al generar texto, solo puede predecir el siguiente token basándose en el contenido ya generado. Una vez que se produce un error en algún paso anterior, las generaciones posteriores se construyen sobre ese resultado erróneo, y el modelo no puede volver atrás para corregirlo.
Teóricamente, se puede entrenar un modelo para que primero "piense" antes de responder, como un modelo de razonamiento, pero esto aumentaría significativamente la latencia y no sería adecuado para escenarios de corrección automática que requieren respuestas inmediatas.
Sol finalmente encontró una solución más elegante: Beam Search, también conocido como búsqueda por haz.
El modelo ya no selecciona solo la ruta única con la mayor probabilidad en cada paso, sino que mantiene simultáneamente múltiples ramas de generación posibles y explora en paralelo diferentes resultados de corrección. Al finalizar la búsqueda, se elige la ruta completa con la mayor probabilidad logarítmica acumulada.
Esto equivale a reemplazar la inferencia lineal con búsqueda paralela.
Beam Search mejora claramente el resultado final, pero introduce un problema de experiencia: el usuario no ve ninguna salida hasta que se complete toda la búsqueda.
Sol luego hizo una observación muy inteligente.
Después de cada ronda de búsqueda, se pueden comparar todos los ramificaciones conservadas. Siempre que estas ramificaciones compartan el mismo inicio, ese "prefijo común más largo" aparecerá necesariamente en el resultado final.
Por lo tanto, el sistema puede mostrar inmediatamente este contenido al usuario.
A medida que la búsqueda continúa, las rutas más débiles se van eliminando progresivamente, y el prefijo común de las ramas restantes también se vuelve cada vez más largo. Finalmente, el usuario no ve resultados que aparezcan de repente de una sola vez, sino texto de corrección que se genera continuamente hacia adelante.
Sol convirtió todo el proceso en una tubería de inferencia MLX personalizada, utilizando la GPU de la MacBook para la decodificación paralela.
Finalmente, la latencia de salida del primer token fue de solo aproximadamente 40 milisegundos, lo suficientemente rápida, y todo el proceso se completó completamente de forma local.
Resultado final: modelo de 1.7 mil millones de parámetros supera a GPT-5.6 Sol
La evaluación final utiliza la "tasa de reducción de errores" como métrica; un valor más alto indica que el modelo corrige más errores de entrada.
Los resultados de la evaluación son los siguientes:
- Corrección automática de Apple: 49.66%
- GPT-5.6 Luna: 82.47%
- GPT-5.6 Terra: 87.64%
- GPT-5.6 Sol: 90.56%
- Nuestro modelo de 1.7 mil millones de parámetros entrenado: 91.02%
Este modelo local finalmente superó a GPT-5.6 Sol por una ventaja muy mínima.
También revisé cuidadosamente si existían fugas de datos o “trampas” del modelo. Durante las pruebas, excluimos activamente palabras que aparecían en los datos de entrenamiento para verificar que el modelo no esté simplemente memorizando mapeos entre errores y respuestas.
El costo final del proyecto es:
Un restablecimiento de cuota de modelo y gasto en efectivo de 0 dólares.
Lo que realmente me impresionó no fue solo la puntuación final
Durante el proyecto, hubo muchos experimentos no desarrollados, incluyendo diferentes enfoques como el aprendizaje por comparación, GRPO, DPO y enmascaramiento dinámico.
No todos los intentos tuvieron éxito, pero Sol pudo leer activamente la documentación, identificar problemas, formular hipótesis, diseñar experimentos, analizar resultados y planificar el próximo intento basándose en las lecciones aprendidas de los fracasos.
Para mí, lo que realmente es impactante no es el hecho de que un modelo de 1.7 mil millones de parámetros haya superado a GPT-5.6 Sol.
Más importante aún, una persona sin ninguna experiencia en aprendizaje automático ya puede utilizar la IA para llevar a cabo experimentos que anteriormente requerían un equipo de investigación profesional.
No poseo todos los conocimientos subyacentes ni diseñé previamente una ruta técnica completa. Simplemente definí claramente qué problema quería resolver y continué impulsando a Sol a buscar respuestas.
No solo escribe código, sino que también asume los roles de investigador, ingeniero y diseñador de experimentos.
Este podría ser el momento en que por primera vez realmente “sentí la AGI”.
Don't let inexperience stop you from starting to experiment.
Cuando la IA puede ayudar a personas comunes a superar las barreras profesionales, muchos proyectos tecnológicos que antes parecían inalcanzables podrían ya no estar tan lejos.
