Los puzles y los juegos han sido fundamentales para el desarrollo de la IA desde sus inicios. Al igual que a los humanos nos gusta poner a prueba nuestra inteligencia con crucigramas o rompecabezas de lógica, los desarrolladores pueden comprobar cuánto han avanzado los modelos con un conjunto de pruebas lúdicas. El término “aprendizaje automático” se popularizó en un artículo de 1959 del científico informático de IBM Arthur Samuel sobre un algoritmo que aprendió a jugar a las damas. El ajedrez y el juego de mesa chino Go también son famosos bancos de pruebas para la IA.
Juzgada únicamente por sus habilidades para resolver puzles, la IA está mejorando mucho —y rápidamente. A finales de 2024, un equipo de científicos de la Universidad de Columbia demostró que incluso los mejores modelos solo podían resolver el 18% de los infames puzles Connections del New York Times; para principios de 2025, algunos modelos ya podían resolverlos casi a la perfección en todo momento.
Pero los rompecabezas hacen más que solo poner de manifiesto el avance inexorable de las capacidades de la inteligencia artificial. Observar dónde los modelos tienen éxito y fracasan —y dónde los humanos aún los superamos— puede ofrecer una útil perspectiva de las fortalezas y debilidades de la tecnología. A pesar de los avances, los modelos actuales todavía tropiezan: cambios sutiles en los acertijos clásicos a menudo los desorientan, y los rompecabezas visuales son un punto débil particular.
Aquí tendrá la oportunidad de poner a prueba su ingenio con rompecabezas que en algún momento han desconcertado a los modelos. Algunos pueden resultarle tan difíciles como lo fueron para la IA; otros son tan simples que le harán dudar si la IA es realmente inteligente. Cada uno destaca al menos una forma en la que difieren la cognición maquinal y la humana. Si supera la prueba, habrá demostrado que puede superar a una IA en ingenio —al menos por ahora.
Razonamiento espacial
Empecemos por un dominio donde los humanos tienen una enorme ventaja: el razonamiento espacial. Si alguna vez has hecho un test de CI, es posible que hayas resuelto un problema de rotación mental. Estos puzles te piden que determines si diferentes imágenes representan los mismos objetos desde ángulos distintos. Aunque los modelos de lenguaje actuales suelen tener la capacidad de analizar entradas visuales, siguen fracasando estrepitosamente en estos puzles. A pesar de todo lo que se habla de cómo los modelos de mundo pueden ayudar a la IA a comprender entornos físicos, los LLM aún no parecen ser capaces de manipular objetos 3D de la misma forma que lo hacen pensadores espaciales como los arquitectos y los ingenieros mecánicos.
Rotación Mental
Instrucciones: Elija la respuesta que muestre el objeto del enunciado, pero desde un ángulo diferente. En cada caso, ¡solo hay una respuesta correcta!
Memoria & Adaptabilidad
Los LLMs de vanguardia poseen una memoria extraordinaria; fueron expuestos a un volumen ingente de hechos durante su entrenamiento y pueden reproducir muchos de ellos con fidelidad. Esto es un activo para superar a los humanos en preguntas de cultura general, pero también puede ser un pasivo. Cuando un enigma se asemeja en gran medida a uno con el que el modelo se encontró durante su entrenamiento, este puede pasar por alto las diferencias clave y responder con lo que memorizó.
Esto se confirmó en un estudio de 2024 en el que investigadores de Google y la Universidad de Illinois Urbana-Champaign entrenaron y probaron modelos con ligeras variaciones de un tipo clásico de acertijo llamado Caballeros y Mentirosos. En estos problemas, algunos personajes siempre dicen la verdad y otros siempre mienten, y hay que averiguar quién es quién. El mismo principio podría aplicarse en una prueba llamada SimpleBench. Estas preguntas se asemejan a problemas más complejos que los modelos probablemente encontraron durante el entrenamiento. Los humanos detectan el truco, pero incluso los modelos de primer nivel fallan.
Caballeros y Mentirosos
Instrucciones: Lo único que debe saber para resolver estos rompecabezas es que los caballeros siempre dicen la verdad y los bribones siempre mienten. Determine quién es quién basándose en lo que dice cada personaje.
SimpleBench
Instrucciones: Lea detenidamente estos problemas de SimpleBench, y le resultará sencillo encontrar las respuestas rápidamente.
Abstracto & Razonamiento Visual
La IA no solo se equivoca en problemas visuales en 3D; dos dimensiones también pueden confundirla. Este es un factor importante en el rendimiento de los modelos en el benchmark basado en puzles más famoso, ARC-AGI. Estos problemas exigen inferir reglas abstractas y generales a partir de un conjunto de ejemplos. Los modelos obtienen mejores resultados en los puzles de ARC cuando reciben cada cuadrícula no como una imagen, sino como una cadena de números que codifica el color de cada celda.
La investigación sugiere que, incluso cuando los modelos responden correctamente a las preguntas ARC-AGI, a menudo lo hacen utilizando reglas bizantinas y no generalizables, mientras que los humanos recurren a conceptos visuales simples. A pesar de estas desventajas, los modelos han mejorado bastante en ARC-AGI durante el último año, pero algunos rompecabezas —como el que se muestra aquí— todavía los desconciertan.
ARC-AGI
Instrucciones: Estudie los tres pares de cuadrículas que se muestran a continuación para determinar la regla que rige la transformación de las de la izquierda en las de la derecha. Luego, saque sus rotuladores o lápices de colores y rellene la cuarta cuadrícula aplicando esa regla. (La solución es la misma independientemente de la orientación de las cuadrículas.)
Intuición
No son únicamente los modelos de IA los que caen en trampas. Los humanos tenemos nuestras propias flaquezas cognitivas, muchas de las cuales la IA no comparte. Los psicólogos han diseñado conjuntos de problemas que invierten el fenómeno SimpleBench: Para estas preguntas, los humanos a menudo dan respuestas instintivas, mientras que los modelos responden de forma deliberada. Algunos de estos problemas explotan errores en la forma en que hacemos matemáticas de manera intuitiva; otros están formulados para sugerir respuestas obvias que se desmoronan si la pregunta se lee con atención.
Ronda relámpago
Instrucciones: Responda a las preguntas siguientes lo más rápido posible.
Creciente Complejidad
En algunos casos, si un LLM puede completar un rompecabezas es cuestión de escala. Un estudio de investigadores de Apple reveló que los LLM pueden resolver con éxito versiones sencillas del problema de la Torre de Hanói, que implica mover una pila de discos uno a uno sin colocar nunca un disco más grande encima de uno más pequeño, y rompecabezas de cruce de río, en los que un grupo de personas debe cruzar un río siguiendo ciertas reglas. Pero solo hasta cierto punto: cuando el número de discos o personas alcanza los seis o más, los modelos empezaron a flaquear.
En otro estudio, investigadores de la Universidad de Washington, la Universidad de Stanford y el Allen Institute for AI observaron que los LLM tienen dificultades similares con los rompecabezas de cuadrícula lógica, que requieren deducir los atributos de un conjunto de individuos a partir de una lista de pistas. El artículo de Apple se hizo viral, pero los comentaristas cuestionaron si los resultados revelaban una limitación única del razonamiento de los LLM —o simplemente que es normal cometer errores a medida que la complejidad aumenta.
El Río
Instrucciones: Utilizando el escenario proporcionado, planifique los viajes necesarios para que todos crucen el río.
Cuadrícula Lógica
Instrucciones: Utilizando la lista de pistas, determine quién vive en cada casa y qué estilo de música disfruta cada persona. Solo hay una solución posible. Puede resultarle útil rellenar la cuadrícula inferior para llevar un registro de sus deducciones.
Grace Huckins es reportera de IA en MIT Technology Review. Tiene un doctorado en neurociencia.
Créditos:
Rotación Mental: CC BY 4.0. Stogiannidis, Ilias, Steven McDonagh, Sotirios A. Tsaftaris. Mind the Gap: Benchmarking Spatial Reasoning in Vision-Language Models (copyright 2025); ilustraciones de John MacNeill. Caballeros y mentirosos: Cortesía de Dan MacKinnon. Simplebench: CC BY 4.0. SimpleBench Team. El benchmark de texto en el que el rendimiento humano no especializado supera al de los modelos frontera actuales (copyright 2024). ARC-AGI: Cortesía de ARC Prize Foundation. Ronda relámpago: CC BY 4.0. Hagendorff, Thilo, Sarah Fabi, Michal Kosinski. Comportamiento intuitivo similar al humano y sesgos de razonamiento surgieron en grandes modelos de lenguaje, pero desaparecieron en ChatGPT. Nat Comput Sci 3, 833–838 (copyright 2023). El río: Adaptado de Propositiones ad Acuendos Juvenes, Alcuin of York (ca. 800 d. C.). Rejilla lógica: Apache License 2.0. Lin, Bill Y., Ronan Le Bras, Kyle Richardson, et al. ZebraLogic: On the Scaling Limits of LLMs for Logical Reasoning (copyright 2025)

