Lo que sabe hacer y lo que parece que sabe hacer
Superar un test automatizado no demuestra que la máquina razone. La pregunta de si hemos llegado a una inteligencia general sigue abierta.
David Pereira Paz · Primera edición, octubre de 2026
A los consejos llegan a menudo titulares sobre modelos que ya superan a las personas en distintas pruebas. Merece la pena leerlos con espíritu crítico.
98,5 %
Resultado en ARC-AGI-1, una prueba diseñada para que no se pudiera aprobar de memoria. Hoy está prácticamente superada.
62,7 %
Mejor resultado en ARC-AGI-3 en septiembre de 2026. En marzo, al estrenarse, era del 0,51 %. Las personas llegan al 100 %.
82 %
Mejor modelo en SimpleBench, frente al 83,7 % de referencia humana.
Tres motivos para desconfiar de los titulares
Esa capacidad tiene un precio
Llegar al 87,5 % en ARC-AGI-1 costó unos 4.560 dólares por tarea. Un grupo de personas puede obtener un 98 % por 17 dólares.
El resultado depende de cómo se prepare la prueba
El mismo modelo pasó del 62,7 % al 99,95 % en ARC-AGI-3 con solo cambiar dos ajustes. Si la nota cambia sin que cambie el modelo, lo que se mide es todo lo que lo rodea (por ejemplo, cómo se aprovecha el conocimiento previo del negocio o cómo se conectan procesos aparentemente independientes). Para una empresa es una buena noticia, porque ese entorno (conocido en inglés como harness) sí puede construirlo y hacerlo suyo.
Cualquier distracción lo desorienta
En un estudio de Apple, añadir a un problema de matemáticas una sola frase irrelevante para el cálculo redujo los aciertos hasta un 65,7 %, y ni ocho ejemplos resueltos lo compensaron. En una empresa abunda la información irrelevante.
Una definición útil
François Chollet, creador de la prueba ARC, define la inteligencia como la facilidad para aprender tareas nuevas. Una prueba mide lo bien que se hacen unas tareas concretas; la inteligencia se ve en cómo se afrontan las siguientes.
Otras familias de modelos
Un modelo de lenguaje predice cuál es la palabra siguiente en un texto. No tiene una representación del mundo físico ni puede demostrar que lo que dice sea correcto. Por eso están apareciendo tres familias que lo complementan, sin sustituirlo:
| Familia | Qué aporta | En qué punto está |
|---|---|---|
| Modelos de decisión | Devuelven decisiones con un formato que otro programa puede ejecutar, junto con su grado de confianza. | Entre la investigación y las primeras pruebas. |
| Modelos neurosimbólicos | Combinan aprendizaje con reglas y lógica explícitas, de modo que cada paso del razonamiento se puede revisar. | Primeros productos. |
| Modelos del mundo | Representan un entorno físico de forma estable para simular antes de actuar. | Incipientes, pero ya con usos reales. |
Hay una cuarta familia, más antigua y ya madura: el aprendizaje automático clásico. En muchos problemas con datos estructurados, como una previsión de ventas o la detección de fraude, ocupa el lugar del modelo de lenguaje en vez de complementarlo.
Para un consejo, la pregunta deja de ser qué modelo de lenguaje usar y pasa a ser qué tipo de sistema conviene a cada problema de negocio y qué harness propio le dará una ventaja que la competencia no pueda copiar.