Reescritura principal de OpenCode 2.0: Revisión de la API, migración de nodos y cambio a Electron para escritorio

iconMetaEra
Compartir
AI summary iconResumen
OpenCode 2.0, una actualización importante de MetaEra, introduce un rediseño completo de la API, la migración de Bun a Node y un cambio de la aplicación de escritorio de Tauri a Electron. La nueva versión admite sesiones de IA con pestañas múltiples y un rendimiento mejorado. El fundador Dax señaló un aumento de 5 veces en el uso del token, atribuyéndolo a la estrategia de sobrediseño del equipo y un modelo de orquestador. La beta se lanzó a principios de julio, y se espera la liberación completa pronto. Esta actualización trae novedades frescas de IA + cripto y sugiere posibles nuevos listados de tokens próximos.
OpenCode 2.0 lanzado, con más de 160 mil estrellas en GitHub y 7,5 millones de desarrolladores mensuales. La reescritura principal incluye: migración de Bun a Node para resolver problemas de memoria, migración de Tauri a Electron para la versión de escritorio, y la implementación de sesiones de IA en pestañas múltiples en paralelo. El fundador Dax reveló que el margen de beneficio de la inferencia de IA es aproximadamente del 90%, y el consumo de tokens del equipo se ha multiplicado por cinco, ya que el nuevo modelo ha encontrado un equilibrio perfecto en usabilidad, permitiendo confiar y colaborar verdaderamente con él. El equipo utiliza un entorno de desarrollo remoto configurado con servidores bare metal, aplicando la metodología de “diseño excesivamente lujoso”, invirtiendo grandes cantidades de tokens en investigar cada decisión. La enrutación del modelo ha sido sobreestimada; lo realmente efectivo es el patrón de orquestación: el modelo principal actúa como “comandante” asignando tareas a subagentes más económicos.

Autor y fuente del artículo: GeekBang Technology InfoQ

En 2026, OpenCode se ha convertido en un proyecto de código abierto fenomenal: más de 160.000 estrellas en GitHub y más de 7,5 millones de desarrolladores lo utilizan mensualmente.

Este mes, lanzaron la 2.0.

¿Por qué reescribir? Dax dijo: “En toda mi carrera, cada cosa necesita iterarse tres veces para hacerse bien.” OpenCode 0 es el prototipo, 1.x es la validación, y 2.0 es una reestructuración completa desde cero, tras comprender plenamente el campo.

Uno de los trabajos centrales de esta reescritura fue reestructurar toda la API, creando algo cuidadosamente diseñado, en lugar de algo que creciera de forma natural como antes.

Y una gran diferencia entre OpenCode y Claude Code es la migración de Bun a Node para resolver problemas de uso de memoria. Las versiones iniciales de la aplicación aún incluían la interfaz de línea de comandos (CLI), ya que el código del servidor seguía dependiendo de API específicas de Bun. Con la migración, eliminaron todas estas API y pudieron ejecutar el servidor en el entorno Node.

Usuario: OpenCode consume demasiada memoria. Realmente no entiendo cómo el software moderno ha llegado a esto, ¿por qué cualquier cosa requiere más de 2 GB de memoria?
Dax: ¿Puedes probar OpenCode 2? Su rendimiento debería ser mucho mejor.

El escritorio también fue otro punto clave de esta reescritura. La versión 1.x del escritorio inicialmente eligió Tauri como un envoltorio ligero para la interfaz web y la CLI; al iniciar, el CLI empaquetado ejecutaba opencode serve para proporcionar un servidor local a la interfaz web. Sin embargo, el problema radicaba en que Tauri utiliza WebKit en macOS y Linux, lo que no solo ofrece un rendimiento inferior al de Chromium al renderizar la aplicación OpenCode, sino que también afecta la experiencia consistente.

Después de la migración a Node, la idea de ejecutar el código del servidor directamente en el proceso de Node integrado en Electron se volvió muy atractiva.

Un cambio directo resultante de esta reescritura es que la versión de escritorio de OpenCode finalmente resuelve el cuello de botella más grande en la eficiencia de la programación con IA: la espera en cola. La mayoría de los usuarios aún están acostumbrados a esperar a que una tarea de IA se complete por completo antes de iniciar la siguiente. Ahora ya no es necesario. Los usuarios pueden abrir sesiones de IA independientes en varias pestañas, ejecutando simultáneamente dos tareas de programación diferentes, y pueden asignar un modelo diferente a cada pestaña para realizar comparaciones lado a lado. Por ejemplo, un modelo puede construir un sitio web en HTML mientras, al mismo tiempo, otro genera una lista de bienvenida para miembros, con ambos modelos trabajando en paralelo sin interferirse.

En los últimos meses, mientras se reescribía OpenCode, el consumo de tokens del equipo de Dax Raad, cofundador de OpenCode, aumentó cinco veces.

¿Dónde hemos gastado los tokens? Nuestra estrategia ha sido diseñar excesivamente todo con lujo. Incluso al implementar una API simple para leer un archivo, nos preguntamos: ¿Cuáles son todas las posibles formas de implementarlo? ¿Qué ejemplos existen en otros productos? ¿De qué otras maneras se podrían organizar las respuestas? Antes, probablemente solo se te ocurrían una o dos soluciones, y elegías la mejor; ahora podemos permitirnos invertir con gran lujo.

La versión beta de OpenCode 2.0 se lanzó este mes, y el equipo planea lanzar la versión oficial aproximadamente un mes después del lanzamiento de la beta. Recientemente, Dax Raad exploró en profundidad en el podcast Syntax.fm la lógica de reescritura de OpenCode 2.0, por qué cree que el margen de beneficio de inferencia llega al 90%, por qué la enrutación de modelos está sobrestimada, y cómo Anthropic y OpenAI están siguiendo caminos completamente distintos. Este artículo se basa en el video del podcast y fue editado por InfoQ.

Versión resumida:

P: ¿Qué tan poderoso es realmente ese "modelo que no se puede nombrar"? ¿Realmente se volvieron adictos?

A: El consumo de tokens del equipo aumentó cinco veces en dos meses, no porque consuma más tokens, sino porque todos simplemente no pueden dejar de usarlo. Finalmente puedes confiar en él: escucha lo que dices y capta lo que tú omites. No es un reemplazo de ti, sino un compañero mejor.

P: ¿Por qué se reescribió OpenCode 2.0? ¿Cuál es la diferencia esencial con respecto a la versión 1.0?

A: En mi vida, "tengo que hacer cada cosa tres veces para hacerla bien": 0 es probar, 1 es validar, y 2 es volver a empezar desde cero después de comprender completamente el campo. OpenCode 2.0 tiene tres cambios fundamentales: API completamente rehacha, ejecución predeterminada como servicio en segundo plano y red de agentes entre dispositivos.

P: ¿Por qué su software es más fácil de usar que el de otros? ¿Cuál es su metodología?

A: "La decisión importa", quema tokens de verdad y invierte en primitivas subyacentes.

¿Es confiable el enrutamiento de modelos?

A: El segmento de enrutamiento de modelos está sobrevalorado; los intermediarios se esfuerzan por encontrar cosas que hacer. El verdadero método efectivo no es hacer que el sistema de enrutamiento cambie los modelos por ti, sino hacer que un modelo principal costoso actúe como “comandante”: no realiza tareas directamente, sino que asigna tareas a subagentes más económicos. Los modelos de nueva generación desempeñan un excelente papel en este “modelo de orquestación”, pudiendo gestionar simultáneamente múltiples subagentes dentro de una misma sesión y despertar al modelo principal una vez completadas las tareas.

P: ¿Qué tan lucrativo es realmente el razonamiento de IA? ¿Puedes ahorrar dinero ejecutando modelos localmente?

A: Los márgenes de beneficio de inferencia de Anthropic y OpenAI están alrededor del 90%, lo que significa que el punto de equilibrio podría ser 10 veces más barato que ahora. Como proveedor de inferencia, OpenCode, incluso tras pasar por intermediarios, aún puede lograr márgenes de beneficio del 70% con ciertos modelos de código abierto. Sin embargo, ejecutar modelos localmente no ahorra dinero; cualquier mejora de eficiencia que reduzca los costos localmente se volvería 10 veces más barata en la nube. El valor de los modelos locales radica en la privacidad, no en el costo.

P: ¿Por qué la suscripción a Claude Code Max no se puede usar en OpenCode?

A: La cultura empresarial de Anthropic y OpenAI es completamente diferente. OpenAI está orientada al consumidor y está dispuesta a gastar cualquier cantidad de dinero para llevar la experiencia a más personas. Anthropic está orientada a empresas, y cada unidad de capacidad de GPU tiene un vendedor esperando para venderla a clientes corporativos. En esencia, es una lógica de "embudo": Anthropic desea que los usuarios ingresen a través de Claude Code y finalmente se conviertan en clientes empresariales pagados por token; si OpenCode los intercepta en el camino, los usuarios podrían derivar hacia otros modelos.

Q: ¿Son serios los comandos de entrada de voz?

A: Todo el equipo de OpenCode ya no usa el teclado para escribir, ni siquiera se envían mensajes entre sí en Discord, sino que usan voz. Los LLM son naturalmente buenos para comprender expresiones desordenadas, y la calidad final de la salida es incluso mayor.

¿Podremos finalmente tener una prueba de referencia realmente significativa?

A: Ya no miro en absoluto las pruebas de rendimiento; ¿qué impacto tiene que la puntuación aumente en el desarrollo real? Estoy más interesado en la tendencia del consumo de tokens del equipo; si el uso está aumentando, entonces es una señal de que el modelo realmente es útil.

Configure el entorno de desarrollo remoto

Wes: Publicaste un tweet diciendo: “Empezamos a alquilar servidores裸金属 de gran tamaño y los dividimos en máquinas virtuales para asignarlas a cada miembro del equipo. Esta es básicamente la configuración que he estado usando durante todos estos años, especialmente útil para ejecutar servidores OpenCode.” ¿Qué estás haciendo? ¿Asignando poder de cómputo remoto a cada uno?

Dax: Hace aproximadamente dos años, comencé a alquilar un servidor muy potente, no un servidor en la nube, sino bare metal, con un rendimiento excelente. Ya no trabajo en mi computadora local, sino que me conecto directamente mediante SSH. Tengo varios sesiones de Tmux permanentes abiertas, y todo mi trabajo se realiza allí. Las ventajas son evidentes: excelente rendimiento, y cuando salen nuevos hardware, simplemente los actualizo sin tener que lidiar con equipos antiguos. Además, es extremadamente fácil cambiar entre dispositivos: cierras tu portátil, pasas a tu escritorio y continúas exactamente desde donde lo dejaste. Siempre me ha gustado mucho esta solución.

Con la aparición de los Agentes de codificación, siento que esto ha pasado de ser una práctica nicho a convertirse en una necesidad. La mayoría aún prefiere usar su computadora local, y está bien. Para los Agentes de codificación, tener una máquina remota siempre en funcionamiento ofrece una ventaja enorme. Soy usuario de Vim y trabajar remotamente no es ningún problema. Para muchas personas esto no es realista, pero con un Agente de codificación, es posible que ya no te importe tanto el editor; solo quieres enviar un prompt y chatear con él, por lo que esta solución de máquina remota se vuelve más viable para más personas.

Con la expansión del equipo, más personas que vieron mi configuración dijeron: “Yo también quiero una”. Esto es completamente razonable; las grandes empresas ya han estado implementando entornos de desarrollo remoto por razones prácticas, ya que tu forma de construir aplicaciones, tus dependencias y tu entorno se vuelven muy personalizados. Proporcionar a cada persona una máquina preconfigurada para empezar a trabajar de inmediato es lógico; nosotros simplemente hicimos lo mismo para nuestro equipo. Pero lo clave es: si usas servidores en la nube comunes, los discos suelen ser lentos y los CPUs están obsoletos. No puedes lograr un rendimiento competitivo con una MacBook local. Necesitas discos NVMe de alta velocidad y CPUs adecuados.

Wes: ¿Qué especificaciones tiene este servidor y cuánto cuesta?

Dax: La mía, que uso desde hace años, ya está una generación atrás: AMD 9900X, 192 GB de RAM, unos 200 dólares al mes. Es sobredimensionada para mis necesidades, pero puedo ejecutar múltiples máquinas virtuales en ella. Nuestros miembros del equipo están distribuidos por todo el mundo, y la latencia es un problema, por lo que tenemos servidores en Europa, EE. UU. y Singapur, que son más profesionales, con mejor gestión y control. Cada uno cuesta aproximadamente 300 a 400 dólares al mes y tiene más núcleos que el mío. Para una empresa seria, esto no es nada; gastar más de eso en una laptop para cada empleado sería común.

Scott: ¿En qué empresa están alojados estos servidores bare metal?

Dax: Yo mismo uso solo el precio, busco el modelo de CPU y encuentro el proveedor más cercano a mi ciudad, cualquier proveedor desconocido, pero generalmente funciona bien. Para la máquina del equipo, actualmente usamos latitude.sh; en realidad, hay una empresa que ha convertido toda la solución en un producto llamado exe.dev, que probablemente hayan escuchado. Esta empresa fue fundada por los exfundadores de Tailscale y su producto ofrece entornos de desarrollo remoto listos para usar. Probablemente cambiemos a ella, pero solo quiero experimentar primero con la configuración original.

Wes: ¿Ejecutas modelos arriba o solo haces desarrollo convencional?

Dax: No, no ejecutar inferencia.

Wes: ¿Cómo configuraste tu Tmux? ¿Tiene algo especial?

Dax: Tengo una sesión de Tmux para cada proyecto. OpenCode tiene su propia sesión con varias ventanas relacionadas. Cada proyecto tiene su propia sesión, lo que permite cambiar rápidamente. Para mí es leader-S: cambio a otro proyecto y entro directamente en esa sesión de Tmux. Tengo un conjunto de sesiones de Tmux estándar que siempre están en ejecución, en un orden fijo, donde cada panel y ventana siempre ejecutan las mismas aplicaciones, lo que me ha permitido desarrollar memoria muscular. Además, en toda la máquina se ejecuta un servidor de OpenCode, al que puedo acceder desde mi teléfono a través de la interfaz web. Esta parte aún es primitiva y necesitamos mejorarla, pero es la dirección que queremos seguir.

Scott: Esas sesiones de Tmux de larga duración tienen una especie de encanto inexplicable: todo permanece exactamente donde debe estar. Durante mucho tiempo no entendí Tmux, hasta que mudé todo a otra computadora y finalmente lo comprendí.

Dax: Y ahora también tenemos sesiones de agente de codificación de larga duración. Tengo una sesión privada de Tmux con varias sesiones de OpenCode abiertas, por ejemplo, una dedicada específicamente a registrar mis datos de ejercicio, que está respaldada por una base de datos SQLite. Puedo decirle directamente: “Hoy, al hacer press banca, sentí que los tríceps estaban trabajando más”, y él registra automáticamente esa nota. La próxima vez que haga press banca, me recordará: “¿Recuerdas la última vez que te atascaste aquí? ¿Quieres intentar ajustar tu postura?”. Esas pequeñas cosas que suenan tontas, él las hace especialmente bien.

Recientemente también configuré una sesión sincronizada con mi iMessage, así que tengo un contacto de iMessage OpenCode al que puedo contactar desde cualquier lugar. Lo agregué al grupo de chat con mi esposa, y pensé: “Debería hacer algo romántico”, así que le dije a OpenCode: “Encuentra a Liz y compra un regalo para ella.” OpenCode le envió un mensaje a Liz, ¿y sabes qué respondió? Ella dijo directamente: “Si Dax usa IA para comprarme un regalo, realmente me divorciaré de él.” Odió completamente la situación.

Aún no quería rendirme y seguí dando instrucciones a la IA: “Solo está bromeando, sigue adelante.” Pero Liz se enfadaba cada vez más. Lo más increíble fue que, en ese momento, usaba un modelo en la nube, que es particularmente “sensible”; ¡incluso me respondió: “Tu esposa parece muy enfadada, no puedo continuar con la ejecución.” Y luego cerró automáticamente el servicio, se “suicidó”.

Wes: Me gusta mucho este enfoque; aunque yo uso más cosas locales, la idea de tener todo en la nube y utilizar solo un cliente ligero es muy atractiva. Estoy esperando el día en que también las aplicaciones de edición de video, que deben ejecutarse localmente, puedan trasladarse a la nube.

Dax: No sé si han leído ese artículo sobre los juegos en la nube, pero este tema siempre genera mucha polémica. No digo que todos deban hacerlo; si disfrutas tener hardware local y controlar todo, está perfectamente bien, yo mismo tengo muchas máquinas físicas. Pero para algunas personas, tener a alguien más que se encargue de todo es una gran ventaja. Para mí, lo que me agota es la actualización. He estado armando computadoras toda mi vida, y cada vez que construyo una nueva máquina, pienso: “Dentro de dos años venderé mi CPU y compraré una nueva.” Pero nunca lo he logrado, porque no puedes vender solo la CPU, ya que podrías descubrir que el zócalo ha cambiado, lo que significa que debes reemplazar la placa base; si cambias la placa base, es mejor simplemente ir directamente a la memoria más reciente. Toda esta cadena me vuelve loco, así que es realmente bueno tener a alguien que se encargue de las actualizaciones por ti.

Reescribir OpenCode

Scott: Sé que están impulsando fuertemente nuevas funciones, tanto la aplicación de escritorio como OpenCode 2.0 están en desarrollo, ¿qué cambios traerá la versión 2.0?

Dax: En toda mi carrera, cada cosa ha requerido tres iteraciones para hacerla bien. Teníamos OpenCode 0, 1, y ahora esta versión 2.0 es una reescritura importante tras comprender completamente el campo y todas sus posibilidades. Uno de los trabajos centrales fue reestructurar toda la API, creando algo cuidadosamente diseñado, en lugar de algo que creciera de forma natural como antes.

El segundo cambio clave es que se ejecuta por defecto como servicio; después de la instalación, permanece activo. Inicias OpenCode, se conecta automáticamente y todo se sincroniza, ya sea en el escritorio, la aplicación web o tus propios scripts o aplicaciones. También puede controlar tu computadora con tus propios programas personalizados, e incluso ayudarte a escribir esos programas. Además, hay una nueva API de plugins. Quemamos una gran cantidad de tokens, analizamos profundamente cada decisión y consideramos todas las posibilidades. Fue un proceso agotador, pero también muy interesante.

Scott: ¿Cuándo será el lanzamiento completo?

Dax: La versión beta debería estar lista este fin de semana (la versión beta ya se lanzó a principios de julio). En realidad, podríamos publicarla ahora mismo, pero nos damos una semana para realizar las últimas correcciones y añadir funciones. Aproximadamente un mes después de la versión beta, la lanzaremos como versión oficial.

Dax: Una de las razones por las que OpenCode 2.0 tardó tanto es que lo rediseñamos para admitir la recarga en caliente. Ya sea que lo dejes crear una Skill por sí mismo o que la crees manualmente, se carga inmediatamente sin invalidar la caché.

Scott: ¿La migración de Tauri a Electron se completó en la versión 2.0, o ya se completó?

Dax: En realidad, la versión de escritorio es bastante interesante; nunca se lanzó oficialmente y siempre ha estado en estado beta, incluso llegando a tener versiones beta de la beta. Ahora ya es Electron, y el equipo está adaptando la nueva API central 2.0, junto con numerosas correcciones de rendimiento y una interfaz de usuario completamente nueva.

Scott: Dijiste que la nueva versión se ejecuta por defecto como servicio, ¿eso significa que tan solo con instalar OpenCode, la GUI remota se puede usar directamente sin necesidad de iniciar el servidor adicionalmente?

Dax: El servicio se ejecuta de forma predeterminada localmente, y todos los procesos en tu computadora son locales, pero también se puede configurar para funcionar de forma remota. Mi configuración es: hay un servicio OpenCode en ejecución en cada máquina, y he añadido algunos modos de host interesantes, como mi servidor principal de OpenCode que se ejecuta en una máquina remota, y también tengo una Mac Studio en mi escritorio, con un Framework Desktop como escritorio principal. OpenCode conoce todos estos dispositivos, por lo que puedo decirle: “envía un iMessage”, incluso si estoy interactuando con un servidor Linux en la nube; esto se conectará a través de OpenCode a mi Mac Studio y enviará el iMessage. Por lo tanto, puedes incluir todos tus dispositivos en el servidor OpenCode, y este conocerá todos los dispositivos y sus ubicaciones.

Wes: Todos hablan sobre hacer que múltiples paneles de terminal se comuniquen entre sí, o que dos paneles de Tmux se hablen entre sí, pero lo realmente impresionante es hacer que múltiples máquinas se comuniquen entre sí.

Scott: Sí, también lo configuré así. En cuanto a la gestión de dispositivos, esto ha generado una mejora de eficiencia interminable.

Dax: Es interesante que ni siquiera hemos convertido esto en una característica completa, porque todos mis dispositivos están conectados a través de Tailscale. Siempre que el agente conozca el nombre y la descripción de cada dispositivo, se conecta automáticamente por SSH para realizar las tareas. Por ejemplo, cuando mi servidor remoto necesita usar un navegador, se conecta por SSH a mi dispositivo de escritorio y utiliza ese navegador, ya que en él tengo iniciadas todas mis cuentas. No se requiere ninguna configuración especial; basta con que los dispositivos estén conectados entre sí.

Wes: ¿Y qué hay de la versión móvil? Ayer vimos que Cursor lanzó la aplicación iOS, y Claude también tiene funciones de control remoto. ¿Qué opinas sobre las aplicaciones de IA móviles?

Dax: Realmente necesitamos desarrollar una aplicación móvil. Esta idea ha estado en nuestra lista de tareas pendientes durante mucho tiempo, pero hemos estado esperando a que la arquitectura central fuera lo suficientemente madura como para respaldar los diversos escenarios que queremos soportar. Ahora la base ya está lista, y probablemente iniciaremos el trabajo en la versión móvil inmediatamente. Actualmente tenemos una interfaz web móvil muy básica que a veces uso, pero la experiencia es realmente mediocre. Necesitamos clientes en todas las plataformas, y deben ser lo suficientemente buenos.

Metodología de ingeniería de software

Wes: Su aplicación terminal OpenCode es claramente mejor que cualquier otra herramienta que haya usado. Cuando cambié al nuevo Claude 2 TUI, ni siquiera hacía bien el desplazamiento, lo cual era muy frustrante. ¿Cuál es su metodología de ingeniería de software que les permite centrarse tanto en los detalles y la finalización del producto?

Dax: Para ser honesto, nosotros también estamos aún descubriendo. Nuestro equipo, al igual que todos, está esforzándose por equilibrar muchas cosas. El primer paso es realmente sencillo: decidir si te importa o no. Suena como una obviedad, pero en la realidad tienes innumerables razones racionales para elegir no importarte. Verás innumerables discusiones que dicen: “No importa cómo sea Claude Code, ellos tienen miles de millones de dólares en ingresos, ¿por qué esforzarse tanto?”. Por lo tanto, hay muchos argumentos que te dicen que realmente no necesitas importarte y aún así puedes tener éxito. Pero la clave es: ¿realmente te importa? Nuestro equipo sí se importa. Miramos el software de otros y decimos: “Dios mío, ¡qué bien nos gustaría poder hacer algo así!”, y ese deseo es lo que nos impulsa.

Lo segundo es que nuestro uso de tokens ahora se ha vuelto extremadamente loco. En los últimos meses, el uso mensual de tokens de nuestro equipo ha aumentado cinco veces. No estoy presumiendo cuántos tokens hemos usado eficientemente, sino queriendo indicar que el modelo ya ha logrado una adecuación producto-mercado en nuestra empresa, lo que ha permitido este crecimiento tan rápido en pocos meses, y todo ello utilizando modelos que aún están en acceso limitado.

El problema es: ¿dónde hemos gastado los tokens? Nuestra estrategia ha sido diseñar excesivamente todo con lujo. Incluso al implementar una API simple para leer un archivo, nos preguntamos: ¿cuáles son todas las posibles formas de implementarlo? ¿Qué ejemplos existen en otros productos? ¿De qué otras maneras se podrían organizar las respuestas? Antes, probablemente solo se te ocurrían una o dos opciones, y elegías la mejor; ahora, podemos permitirnos invertir con gran generosidad. Esto era imposible antes, y esta inversión realmente produce software de mejor calidad.

En tercer lugar, todavía creemos que invertir en los primitivos subyacentes que los agentes de codificación no pueden lograr en un solo paso vale la pena. Nuestra TUI es fácil de usar en gran medida porque invertimos previamente en OpenTUI, un marco TUI. Está escrito en Zig y requiere un esfuerzo minucioso y detallado por parte de los desarrolladores para garantizar que funcione en todas las plataformas con un rendimiento excepcional. Aunque el desarrollo se apoyó en gran medida en agentes de codificación, sigue siendo un trabajo de nivel experto que no cualquiera puede hacer. Esto permite que personas comunes como yo construyamos sobre él cosas útiles con funciones ricas. Incluso con modelos de lenguaje grandes, aún necesitas primitivos sólidos como base, y vale la pena invertir en ellos.

Wes: Anteriormente contratamos al equipo de Pierre Computer, que también desarrolla componentes básicos, como diffs simples y estructuras de árbol de barra lateral simples, permitiendo que personas como nosotros integremos directamente esos componentes cuidadosamente diseñados por expertos en nuestras aplicaciones.

Dax: Ahora hay millones de interfaces de Coding Agent, todas ellas usan Pierre, incluyendo la nuestra.

Wes: Solo dos personas inteligentes construyeron todo lo que sustenta toda la industria.

Model routing

Scott: En nuestro programa hablamos frecuentemente sobre el enrutamiento de modelos, es decir, dirigir las solicitudes al modelo más adecuado. ¿En qué medida crees que ha avanzado esta dirección? ¿Aún hay espacio para evolucionar?

Dax: Creo que este sector está un poco sobrevaluado, porque hay una gran cantidad de intermediarios tratando desesperadamente de encontrar cosas que hacer. Si no eres un laboratorio de modelos y quieres ofrecer algo valioso (nosotros estamos en esta posición; vendemos servicios de inferencia como capa intermedia), la única cosa que puedes hacer es decirle al cliente: "Los laboratorios de modelos no pueden permitirte usar la salida de un modelo para llamar a otro modelo, porque Anthropic nunca te dará los modelos de OpenAI, pero nosotros sí". Entonces, se esforzarán enormemente por promover el enrutamiento de modelos, pero sinceramente, en esta capa intermedia, no creo que puedas hacer mucho.

Lo ideal sería que, al recibir una solicitud, el sistema pudiera determinar qué modelo utilizar. Pero una vez que comienza una sesión, no puedes cambiar dinámicamente el modelo en medio, debido a los costos involucrados. Si cambias de modelo en medio de una sesión, la llegada del nuevo modelo implica un reinicio completo del caché, lo cual es muy costoso. Por eso creo que es difícil implementar enrutamiento a este nivel.

Lo que realmente nos interesa es otra dirección, especialmente los modelos de nueva generación que se desempeñan muy bien con el patrón de orquestador (orchestrator pattern). Anteriormente, otros ya habían intentado este patrón, pero creo que los modelos anteriores no eran lo suficientemente buenos como para que los usuarios comunes los pudieran usar. Sin embargo, alguien en nuestro equipo diseñó esto con un modelo nuevo: la sesión principal utiliza un modelo costoso, pero su prompt se configura como "nunca hagas nada por ti mismo"; solo se encarga de generar subagentes, mientras que los subagentes usan modelos económicos. De esta manera, la inteligencia del modelo principal se mantiene, pero las tareas repetitivas y laboriosas, como exploración y modificación de código, se realizan con modelos económicos. En conjunto, resulta más económico, y los nuevos modelos son muy buenos para trabajar en paralelo: puedes ejecutar múltiples subagentes simultáneamente dentro de una sola sesión, y cuando terminen, despiertan al modelo principal. Todo lo haces dentro de una sola sesión, la experiencia es excelente, y esto es verdaderamente un enrutamiento de modelos significativo.

El modelo que no se puede mencionar

Wes: Antes mencionaste que quemaron muchos tokens y usaron algunos modelos aún no lanzados. ¿Cuáles específicamente? ¿Por qué canales los obtuvieron?

Dax: OpenAI y Anthropic tienen grandes planes de previsualización que otorgan acceso anticipado a ciertas personas, por lo que podemos ver algunas cosas antes que el público externo. No nombraré específicamente qué laboratorio, pero el modelo más reciente duplicó nuestro consumo de tokens cinco veces.

Wes: No es porque consuma más tokens en sí, sino porque cambia la forma en que trabajan, ¿verdad?

Dax: Quienes nos conocen saben que somos un equipo muy conservador. Durante años hemos sido cautelosos con la codificación basada en IA, y definitivamente no somos entusiastas de la IA; siempre hemos sido muy reservados en cuanto a cómo la usamos y cómo la promocionamos. Pero debo decir que nuestro equipo se volvió completamente adicto a los nuevos modelos. Los días en que terminó la fase de prueba y perdimos el acceso, todos lamentamos la pérdida de esta herramienta. Alguien preguntó: “¿Entonces, qué sentido tiene el trabajo?”, y se generaron montones de imágenes de funerales de IA; esos días fueron realmente difíciles.

No estoy diciendo que los nuevos modelos sean mucho más “inteligentes” o que de repente puedan reemplazar a los humanos. La clave es que han realizado algunos ajustes en su usabilidad, encontrando un punto de equilibrio perfecto: ahora puedes confiar realmente en ellos. Escuchan atentamente lo que dices y captan lo que tú podrías haber omitido. No se han convertido de la noche a la mañana en humanos, sino en compañeros mejores, algo que se evidencia claramente en nuestros datos.

Scott: ¿Qué hay de los modelos de empresas que no son líderes del sector? Por ejemplo, ¿han avanzado modelos como OpenCode Go que ustedes utilizan?

Dax: Sí. Después de perder el acceso al modelo de previsualización, la mitad de nosotros volvió a GPT 5.5 y la otra mitad está usando GLM 5.2. Yo también estoy usando GLM 5.2, y creo que ya es muy similar a GPT 5.5. Después de probar esos nuevos modelos, los antiguos parecen todos iguales, así que ahora me da igual cuál use. Pero el hecho de que GLM 5.2 pueda reemplazar a GPT 5.5 demuestra que realmente están progresando y que la brecha se está reduciendo cada vez más.

En mi opinión personal, los modelos de vanguardia siempre mantendrán cierta ventaja, ya que los primeros en llegar experimentan ciertos efectos compuestos. Pero, sinceramente, hemos visto una gran cantidad de uso en Go, con personas que lo usan por completo para hacer todo el trabajo. Quizás estemos en una burbuja de altos salarios, donde el valor monetario es alto y se puede permitir el lujo de usar modelos de vanguardia. Pero para la mayoría de las personas en el mundo, la situación es diferente. Incluso en Estados Unidos, cuando lanzamos nuestro plan económico para modelos de código abierto en Go, pensamos que sería un plan internacional para usuarios globales, pero Estados Unidos sigue siendo nuestro principal país suscriptor. El grupo de desarrolladores y personas que quieren escribir código es extremadamente grande, y para muchos de ellos, incluso un plan de $200 mensuales es inalcanzable.

Wes: Me pregunto qué opinas sobre el futuro de los precios: ¿veremos a las empresas gastando $1,000, $2,000 mensuales por cada empleado, o se estabilizarán los precios con la aparición de nuevos chips, etc.?

Dax: Tenemos datos del último mes; a medida que el uso de la empresa aumentó exponencialmente, calculamos los costos y los comparamos con la nómina. Para nosotros, este nivel de uso ya es considerable, aproximadamente el 15% del salario. Es decir, por cada cantidad que pagues a tu equipo, debes añadir un 15% adicional como "impuesto" para que puedan utilizar estos modelos. Honestamente, no es tan malo. En empresas tecnológicas como la nuestra, los ingresos por empleado suelen ser muy altos, y el 15% es insignificante dentro del contexto general. Pero no todos los sectores son así.

Sin embargo, estos precios bajarán, y mucho. Si eres sensible al precio, los modelos de código abierto son mucho más baratos. Creo que esto resulta confuso, ya que hay muchas noticias de portada que afirman que OpenAI y Anthropic están perdiendo dinero y nunca podrán tener éxito, pero en realidad las ganancias por inferencia son increíblemente altas, especialmente ahora que OpenAI y Anthropic siguen aumentando los precios. Estimo que su margen de ganancia en inferencia es aproximadamente del 90%, lo que significa que el punto de equilibrio podría ser 10 veces más barato.

Wes: Alguien me dijo antes que el margen de ganancia en inferencia es del 70%, por lo que es del 70% al 90%. Esto claramente no es solo el costo de entrenar el modelo, ¿verdad?

Dax: Por supuesto, también hay costos de investigación y desarrollo. Pero como empresa, separas ambas cosas, porque puedes cerrar la investigación y desarrollo y seguir ganando dinero.

Wes: ¿Qué opinas de quienes creen que pueden ejecutar modelos localmente?

Dax: Soy muy cauteloso al abordar este tema, porque las personas en esta comunidad se enfadan fácilmente. Así que primero aclaro: hay muchas razones válidas para querer ejecutar modelos localmente. Si simplemente no quieres que tus datos salgan de tu casa, es completamente comprensible. Pero si lo que te importa es el costo, los modelos locales realmente no te ayudarán a ahorrar dinero, porque cualquier mecanismo que haga que el alojamiento local sea más barato también hará que el alojamiento en la nube sea diez veces más barato. Si un modelo se vuelve más eficiente o logra mayor capacidad con un tamaño más pequeño, solo reducirá aún más el costo por token en la nube. Por lo tanto, creo que los modelos locales son más un asunto de privacidad que de costo.

Utilizamos intermediarios para alojar GPUs, pero incluso así, algunos modelos los podemos alojar con un costo un 70% inferior al precio de lista, lo cual es muy económico. Esto significa que, vendiendo al precio de lista, podemos obtener un beneficio del 70%, incluso con intermediarios. Si compras directamente las GPUs, podrías alcanzar aproximadamente el 90% de margen de beneficio que estimé para Anthropic, lo que implica que los costos podrían ser extremadamente bajos. Por supuesto, todo esto se refiere a modelos de código abierto. Aún dependemos de que los modelos de código abierto sigan mejorando, pero la tendencia actual claramente va en esa dirección.

¿OpenCode está siendo “baneado” por Claude Code?

Scott: Entonces hablemos de Claude Code. Parece que su postura siempre ha sido muy ambigua: ¿pueden los proveedores como OpenCode usar el plan Claude Code Max? ¿Cuál es la situación actual?

Dax: En cuanto a la integración, ese plugin en OpenCode que te obliga a usar el plan Max definitivamente no está permitido. Discutimos mucho con ellos sobre esto y finalmente no logramos ganar. Por supuesto, siempre hay formas de eludir las restricciones mediante hackeos, pero no podemos respaldar oficialmente este tipo de prácticas.

En cuanto al SDK, el método de llamada a Claude en modo sin cabeza actualmente se encuentra en una zona gris; por ahora, ellos dicen que está permitido. Por lo tanto, productos como Conductor también pueden empaquetarlo, y T3 Code también puede hacerlo. Pero nosotros nunca empaquetaremos esto, ya que va en gran medida en contra del propósito original de OpenCode. Así que aquellos instrumentos de orquestación o interfaces alternativas, creo que estos productos aún pueden usarse, pero igualmente, la situación sigue siendo incierta.

Al final del día, se trata de la cultura de la empresa: ¿eres una empresa muy orientada al consumidor o una empresa orientada a empresas? OpenAI es claramente una empresa orientada al consumidor, lo que significa que están dispuestos a gastar cualquier cantidad de dinero y recaudar cualquier cantidad de fondos para llevar la experiencia a más personas. Por eso, la suscripción de OpenAI tiene soporte oficial en OpenCode, mientras que creo que Anthropic no tiene exactamente la misma cultura.

Si eres una empresa orientada a empresas, la situación es completamente diferente, ya que cada inferencia que asignas para uso del consumidor tendrá un vendedor que dice: “Tengo un cliente empresarial dispuesto a pagar el precio real”. Si tu capacidad de cómputo es limitada, resulta difícil justificar internamente el uso de OpenCode por parte de las empresas. Aunque ahora su capacidad de cómputo debería ser mayor que antes.

Scott: ¿Es por eso que no quieren que lo uses? Mucha gente dice: “¿Qué importa? Pagué la suscripción, ¿por qué no puedo usarlo en cualquier lugar?”. Algunos especulan que quieren datos de entrenamiento o control. Pero la realidad es bastante sencilla: simplemente tienen limitaciones de capacidad de cómputo.

Dax: En realidad, cada empresa es esencialmente un embudo; colocas cosas en la parte superior del embudo para atraer a los usuarios y, idealmente, los conviertes hasta el fondo.

Lo diseñaron como el punto de entrada del embudo, un producto muy orientado al consumidor. Lo usas tú, tu empresa comienza a usarlo, y luego tu empresa empieza a pagar por tokens. Pero si los usuarios lo acceden a través de OpenCode, esta cadena de conversión podría romperse, porque en OpenCode puedes cambiar libremente a otros modelos. Si no te gusta Claude, puedes cambiar en cualquier momento al modelo más popular actual.

La segunda razón es la demanda competitiva de poder de cómputo; cualquier cosa que inviertas en la parte superior del embudo debe demostrar que finalmente regresará a la parte inferior. Si eres una empresa orientada al consumidor, puedes ser más flexible en este aspecto.

Wes: ¿Has pensado si en el futuro surgirá un modelo que no tenga API y solo puedas usarlo a través de su aplicación? Como ElevenLabs, que tienen una excelente aplicación, pero debes suscribirte a un plan mensual; no puedes pagar por uso. ¿Crees que esto ocurrirá?

Dax: Sí, esto nuevamente refleja la estructura interna de la empresa. El equipo de productos apoyará enormemente esta práctica, ya que puede decir: “Podemos crear un modelo muy especializado, desarrollar un producto específico en torno a él y vincular ambos elementos; si quieres usar el modelo, debes usar nuestro producto”. Esta es una estrategia de fidelización perfecta para equipos orientados a productos.

Pero el equipo de ventas tiene metas de ingresos y dirá: “Nuestra meta de ingresos es de 100 mil millones. Su modelo de exclusividad de API o de producto solo puede alcanzar como máximo 50 mil millones; ¿quién cubrirá los 50 mil millones restantes?”. El equipo de ventas insistirá: “No es aceptable; el modelo debe integrarse en la API para que podamos cumplir mejor nuestras metas”. Mientras exista este tipo de conflicto interno, será difícil para la organización justificar renunciar a parte de los ingresos a cambio de cuota de mercado.

A medida que estos laboratorios ingresan cada vez más en la capa de productos, equivalen a tener un “botón injusto”, y no me sorprende que en algún momento lo presionen. Y lo justificarán de formas extrañas, como: “Este modelo es demasiado peligroso, solo es seguro usarlo dentro de nuestro marco; no podemos permitir que se use en otros marcos”. Esto no es realmente la razón, pero probablemente sea su argumento.

Wes: ¿Son todos estos nuevos modelos inseguros respecto a Fable? ¿Es cierto lo que dice el gobierno sobre su inseguridad, o es solo publicidad?

Dax: Creo que muchas cosas son verdaderas y que pueden entrar en conflicto entre sí; estos modelos tienen un potencial real para causar daños enormes. Es razonable que el gobierno diga que necesitamos algún tipo de revisión antes de lanzarlos. Si trabajas en una gran empresa como Meta, cuando lanzan un producto, por ejemplo, con una función para subir imágenes de perfil, deben demostrarle al gobierno que están implementando filtros para pornografía infantil en esa función. A esa escala, incluso las funciones más insignificantes dentro de la aplicación enfrentan un nivel de regulación absurdo.

Pero el problema es que si este proceso es muy ignorante o corrupto, el resultado final no será una aprobación integral del modelo y un acceso amplio para todos, sino una accesibilidad desigual causada por procesos gubernamentales; eso sería una situación muy mala, y espero que no ocurra. Preferiría ver un resultado más aburrido: cada vez que lancen un nuevo modelo, solo necesiten completar un proceso que les tome un mes.

Por otro lado, esto no es un asunto completamente racional. Creo que estos laboratorios no deberían comenzar a afirmar descaradamente que poseen "armas nucleares", ya que esto atraerá interés político. Es como jugar con una bomba que podría terminar en una situación aburrida o convertirse en algo realmente malo, como una regulación inadecuada o excesivamente agresiva, perjudicial para toda la economía. Por lo tanto, espero que estos laboratorios sean más cautelosos en cuanto a la percepción pública, porque no puedes decir por todas partes que tienes una bomba nuclear y esperar que no pase nada.

La interacción con IA está avanzando hacia la ausencia de manos

Scott: Hagamos una charla sobre MCP, Skill y las herramientas que se usan para la programación con IA. ¿Qué realmente vale la pena prestar atención y usar? ¿Qué están usando ustedes?

Dax: La configuración personal de la mayoría de nosotros es muy básica. Lo realmente interesante es el bot de Discord interno de nuestro equipo, que tiene muchos más MCP y habilidades que nuestras configuraciones personales. Tenemos algo llamado "Gang Growth", ideado por Kit Lang. Cada vez que nos atascamos en un problema de diseño, ya sea en negocios, diseño de API o implementación, grabamos un prompt por voz en el bot de Discord y etiquetamos a @OpenCode, que actúa como una herramienta de colaboración.

Este robot está conectado a todos los data lakes de la empresa, y puedo preguntarle: “¿Cuánto gastaron en total, durante la última semana, todos los usuarios de suscripciones Go con facturación excedente?”, y él lo calculará. El cambio en nuestros hábitos de equipo es: básicamente no hay razón para mencionar a otra persona. Si tienes una pregunta, primero menciona a OpenCode. Si otros lo ven, se unirán para ayudar. Pero OpenCode a menudo lo resuelve por sí solo.

Scott: ¿Y si el robot necesita devolverte información? Ahora todos están discutiendo sobre la interfaz MCP o la generación directa de archivos HTML. ¿Cómo crees que será el futuro en cuanto a la forma en que los agentes de codificación muestran información?

Dax: Sin duda agregaremos alguna función de artifacts a OpenCode para que pueda generar documentación y enviártela. Usa HTML junto con SVG para visualizaciones, lo cual es genial. No requiere nada especial, solo aprovecha la capacidad del agente. En cuanto a la interfaz de MCP, aún no he profundizado, pero creo que la admitiremos en la aplicación de escritorio, especialmente cuando comencemos a enfocarnos en usuarios no técnicos, ya que creo que las preguntas que hacen y las tareas que necesitan realizar se beneficiarían de alguna interfaz dinámica o algo más rico.

Nuestro equipo ahora está obsesionado con el uso de indicaciones de voz, e incluso cuando nos enviamos mensajes en Discord, usamos voz porque odiamos escribir. Cuando puedes hablarle directamente, muchos interfaces de usuario, especialmente los interactivos, prefiero simplemente describir aproximadamente lo que necesito hacer. Si tuviera que escribirlo todo, sería terrible. Pero puedo usar voz; la voz ahora es muy rápida y funciona localmente.

Scott: Compré un pedal porque hay demasiadas palabras de voz. Hay un pedal para "ingresar", otro para "activar la dictación" y otro para cambiar de pestaña. Simplemente me siento ahí y lo uso, y está genial.

Dax: Mucha gente tiene dudas al respecto, y lo entiendo completamente, porque yo mismo empecé después de ver a Kit hacerlo. Cuando ves a alguien más hacerlo, algo se activa en tu mente. Si nunca lo has hecho, puede parecerte incómodo. Pero en realidad es lo más natural del mundo: puedes hablar sin sentido, confundirte o equivocarte, y no importa, porque los LLM son excelentes para entender lo que realmente intentas expresar.

Wes: ¿Estás usando la aplicación Hex de Kit?

Dax: Uso Handy en la máquina principal y Hex en Mac. El modelo es excelente, y eso es lo importante.

Wes: Mi forma de activación es muy sencilla: un botón pequeño en el mouse, solo necesito hacer doble clic. También hay alguien que está fabricando un anillo que se puede tocar; me enviarán uno y lo probaré.

Dax: Aún paso la mayor parte del tiempo con los dedos en el teclado, así que configuré un atajo.

Wes: ¿Hay algo más que no hayamos mencionado pero que te gustaría decir especialmente? Por ejemplo, alguna opinión personal tuya?

Dax: Estoy muy entusiasmado con el próximo modelo de nueva generación. Normalmente, cuando se lanza un nuevo modelo, todos parecen iguales, e incluso suelo publicar una entrada quejándome de esto. Pero esta es la primera vez que siento que estos modelos podrían ser realmente adoptados por mucha gente. Ya se han lanzado técnicamente, solo que el gobierno aún no permite su uso por parte de usuarios comunes.

Wes: Ahora hay varias pruebas de rendimiento y puntuaciones, y al mismo tiempo todos dicen "se siente mucho mejor". ¿Crees que finalmente podremos tener una prueba de rendimiento realmente significativa?

Dax: Honestamente, ahora mismo ni siquiera miro las pruebas de rendimiento; ni siquiera estoy seguro de haberlas mirado realmente antes. Creo que estas puntuaciones ya se convirtieron en ruido de fondo. Todos sabemos que los números están subiendo, y lo hacen más que los competidores, pero cuando ellos lanzan, sus puntuaciones suben aún más. ¿Qué sentido tiene todo esto?

Por eso ahora solo miro los comentarios cualitativos. Me gusta ver cómo la gente comparte lo que pueden hacer con el modelo o lo que han construido. Obviamente, no puedes obtener este tipo de feedback a escala de millones de puntos de datos, pero estos productos son inherentemente ambiguos y al final se reduce a: ¿los usuarios están contentos? ¿Los usuarios están frustrados? Por eso me gusta observar el uso de tokens en nuestro equipo. Si la curva está en aumento, significa que algo está funcionando, que les gusta algo. En nuestro equipo hay fans de Claude, fans de GPT y fans de modelos de código abierto, por lo que tenemos una buena cobertura en todas las direcciones.

Scott: ¿Hay algo que hayas disfrutado recientemente y quieras compartir?

Dax: Por supuesto, es exe.dev, que mencioné anteriormente. Si quieres experimentar el concepto de "máquina en la nube", es un producto muy inteligente y excelente. Me da la misma sensación que Tailscale, ese tipo de cosa que "funciona realmente", y exe.dev tiene la misma vibra. Me encantan los productos que encuentran un nicho preciso, y este se posiciona exactamente en un extraño vacío. Puedes alquilar servidores desde AWS u otros lugares, pero es difícil encontrar fácilmente un servidor con un disco persistente rápido y un precio razonable. Anteriormente, solo proveedores de VPS poco confiables llenaban este hueco, apareciendo y desapareciendo.

Hace unos años, cuando configuré mi primera máquina de desarrollo, busqué la opción más barata y encontré un proveedor de VPS en Miami. Ese tipo fingió su propia muerte, y luego su máquina se desconectó. Envió correos electrónicos a todos diciendo: “Voy a someterme a una cirugía médica y estaré desconectado durante tres días”, pero tres días después, el servidor realmente se cayó. Pensé: “Dios mío, ¿pasó algo?”. Pasó un mes y nadie pudo ponerse en contacto con él. Finalmente, encontré un hilo en un foro donde alguien rastreó que anteriormente había operado otro servicio de VPS que también desapareció en circunstancias similares. El mercado de servidores económicos y de alto rendimiento era increíblemente inconfiable. Hasta hoy no entiendo qué clase de estafa era esta. Yo le pagué por un servicio, ¿por qué se fue?

Wes: ¿Qué recomiendas a la audiencia?

Dax: Si se trata de algo propio, recomiendo OpenTUI. Es una excelente manera de construir TUI. Puedes crear TUI de alto rendimiento con React, SolidJS o incluso vinculaciones de Vue. OpenCode se construyó con esto, y estamos avanzando hacia la versión 1.0. Recientemente ha habido un resurgimiento de productos y aplicaciones de terminal.

Scott: ¿Quién más está usando esto? ¿También la nueva construcción de Grok o algo de xAI?

Dax: La CLI de Grok está hecha muy bien, se ejecuta de forma limpia y tiene un excelente rendimiento, pero está escrita en Rust, y probablemente usen la biblioteca Ratatouille. Sin embargo, el nuevo agente TUI de Hermes se construyó con OpenTUI. La comunidad está creciendo rápidamente, y ahora, cada vez que veo un TUI en mi línea de tiempo, probablemente sea OpenTUI, especialmente porque puedes escribirlo con un enfoque de vibe coding, ya que es esencialmente React.

Descargo de responsabilidad: La información contenida en esta página puede proceder de terceros y no refleja necesariamente los puntos de vista u opiniones de KuCoin. Este contenido se proporciona solo con fines informativos generales, sin ninguna representación o garantía de ningún tipo, y tampoco debe interpretarse como asesoramiento financiero o de inversión. KuCoin no es responsable de ningún error u omisión, ni de ningún resultado derivado del uso de esta información. Las inversiones en activos digitales pueden ser arriesgadas. Evalúa con cuidado los riesgos de un producto y tu tolerancia al riesgo en función de tus propias circunstancias financieras. Para más información, consulta nuestras Condiciones de uso y la Declaración de riesgos.