El espejismo de los tokens: por qué la inteligencia artificial debe dejar de pensar en palabras by Rafael Julivert Ramírez

Estimated read time 4 min read

En la actual «era de la inteligencia», el uso masivo de tokens se ha convertido, absurdamente, en un nuevo símbolo de estatus en laboratorios de IA como Meta y OpenAI. Hoy en día, los ingenieros alardean de procesar decenas de billones de palabras, al punto de que los gastos en llamadas a API ya compiten directamente con los presupuestos salariales de las empresas. Sin embargo, esta obsesión de la industria con generar secuencias interminables de texto oculta lo que podría ser su error más caro y fundamental: forzar a los modelos a «pensar» palabra por palabra antes de responder. Es hora de reconocer que los modelos de lenguaje grande (LLM) tienen limitaciones arquitectónicas insuperables y que el verdadero futuro de la inteligencia artificial reside en los «modelos de mundo» (world models).
Los LLM de última generación, como GPT-4 o Claude, operan bajo un principio netamente autorregresivo: estiman la probabilidad estadística del siguiente token basándose en la secuencia anterior. Aunque escriben con una fluidez que imita la inteligencia, carecen de un modelo interno y de una comprensión real de la causalidad física. Estudios recientes demuestran que, al intentar resolver tareas de planificación autónoma que requieren mero sentido común (como el problema clásico de «Blocksworld»), los LLM fracasan estrepitosamente, logrando un éxito promedio de apenas el 12 % en sus versiones más avanzadas. Peor aún, cuando los investigadores ofuscan los nombres de las acciones, el rendimiento de los modelos colapsa a casi cero, revelando que no razonan en absoluto, sino que simplemente hacen coincidir patrones estadísticos preexistentes. Son excelentes para la manipulación lingüística, pero su incapacidad para la planificación a largo plazo los hace vulnerables a alucinaciones constantes.
La gran ironía es que nosotros, los humanos, tampoco pensamos principalmente en palabras. Tal como demostró el matemático Jacques Hadamard al analizar las mentes de científicos como Albert Einstein, el razonamiento profundo ocurre a nivel prelingüístico, a través de imágenes o sensaciones topológicas. El lenguaje es una pérdida de resolución, una herramienta secundaria que nuestro cerebro utiliza exclusivamente para comunicar o exportar ese pensamiento al exterior. Al obligar a la IA a narrar cada paso cognitivo en «tokens», estamos implementando un andamiaje ineficiente. Las obligamos a ser conversadoras elocuentes en lugar de pensadoras abstractas.
La solución a este estancamiento técnico está siendo impulsada por pioneros disidentes como Yann LeCun, científico jefe de IA y premio Turing, quien ha declarado que los LLM son un «callejón sin salida». LeCun propone una alternativa radical: la arquitectura predictiva de incrustación conjunta (JEPA). En lugar de malgastar recursos intentando reconstruir cada píxel o predecir la próxima palabra exacta, modelos como VL-JEPA operan en un espacio latente, prediciendo representaciones abstractas y continuas. Al ignorar el «ruido» superficial y centrarse en la semántica de las escenas, el modelo desarrolla un «sentido común» físico, lo que le permite simular el entorno y anticipar las consecuencias de sus acciones de manera altamente eficiente.
Esta visión no es una mera teoría de nicho. La necesidad de un cambio de paradigma es tan urgente que LeCun abandonó Meta a finales de 2025, tras presenciar el fracaso de los enfoques tradicionales, para fundar Advanced Machine Intelligence Labs (AMI). En marzo de 2026, AMI cerró una histórica ronda de inversión inicial de 1030 millones de dólares, demostrando que los inversores más importantes del mundo apuestan por una IA que comprenda la realidad. Esta arquitectura híbrida o basada puramente en simulación será imprescindible para el desarrollo de la robótica, los agentes autónomos y la optimización industrial, entornos donde un error de planificación tiene consecuencias reales y costosas.
En conclusión, el debate en la industria ya no debe centrarse en cómo generar billones de tokens con menos poder de cómputo, sino en cómo diseñar arquitecturas que no requieran tokens en absoluto para razonar. Los LLM seguirán siendo motores fantásticos para la orquestación de la productividad y la interfaz conversacional. Sin embargo, si verdaderamente aspiramos a alcanzar una inteligencia de máquina autónoma (AMI), debemos atrevernos a derribar el andamiaje lingüístico que hemos construido alrededor de nuestras IA. Ha llegado el momento de enseñar a las máquinas a entender nuestro mundo, en lugar de conformarnos con que simplemente sepan hablar sobre él.


Descubre más desde Masticadores

Suscríbete y recibe las últimas entradas en tu correo electrónico.

You May Also Like

+ There are no comments

Add yours

Deja un comentario