Las diferencias entre configuraciones, criterios y ámbitos evaluados explican por qué un mismo modelo recibe conclusiones distintas sobre su grado de inteligencia general.
OpenAI presentó GPT-6 Astra el 3 de septiembre de 2026. En su anuncio de lanzamiento, destacó mejoras en razonamiento, programación, investigación, uso de computadoras y trabajo profesional. Sus capacidades reactivaron una discusión que exige separar los resultados medidos de las interpretaciones sobre qué constituye inteligencia artificial general, o AGI.
Greg Brockman, presidente de OpenAI, reconoció en una entrevista con Stratechery que las definiciones de AGI difieren y que no se ha producido el momento de acuerdo general que inicialmente imaginaban. Su enfoque pone el acento en el comportamiento del sistema y su capacidad para aprender y adaptarse, más que en una arquitectura determinada.
Los resultados dependen de la configuración
Los resultados verificados de ARC Prize muestran un máximo de 62,71 % en ARC-AGI-3 con el entorno estándar y razonamiento máximo. Con el adaptador del proveedor y razonamiento alto, la tabla registra un 99,95 %, presentado como 99,9 % en el resumen de la fundación.
El entorno estándar permite conservar notas elegidas por el modelo. El adaptador, además, preserva el estado interno de razonamiento entre solicitudes y utiliza compactación para gestionar conversaciones prolongadas. Por tanto, los máximos citados corresponden a condiciones de evaluación distintas.
En su análisis de Astra, ARC Prize explica que la prueba exige explorar entornos desconocidos, inferir sus reglas y planificar acciones. También señala una limitación fundamental: son escenarios acotados, con mecanismos y objetivos definidos, que no reproducen toda la complejidad del mundo real. La organización afirma expresamente que saturar el benchmark no constituye una prueba de AGI.
Una misma evidencia, diferentes criterios
Forrester clasifica a Astra como una forma inicial de AGI competente. Brian Hopkins y Mike Gualtieri fundamentan esa interpretación en tres criterios: aprendizaje, colaboración y construcción de herramientas.
Los propios analistas reconocen límites: el aprendizaje observado se circunscribe a una sesión y la colaboración continúa siendo poco fiable. Su clasificación contempla supervisión estrecha y distingue esta etapa de una AGI independiente o una superinteligencia. Es una conclusión dentro del marco de Forrester, no un acuerdo general entre evaluadores.
La AGI Society llega a una conclusión más cauta: considera que la evidencia publicada todavía no permite afirmar que Astra haya alcanzado AGI. Su revisión distingue las evaluaciones directas del modelo, los resultados de sistemas anteriores, las estimaciones y las capacidades para las que no identifica pruebas comparables.
Esta distinción evita confundir falta de evaluación con incapacidad demostrada. También impide atribuir automáticamente a Astra logros obtenidos por otros modelos o interpretar una clasificación analítica como si fuera un ensayo experimental.
Generalidad, rendimiento y autonomía
El estudio Levels of AGI, de Google DeepMind, propone clasificar los sistemas según la amplitud de sus capacidades y su nivel de rendimiento. También examina cómo esas dimensiones se relacionan con la autonomía y los riesgos del despliegue.
Este enfoque permite formular preguntas más precisas: qué tareas puede realizar un sistema, con qué fiabilidad, bajo qué condiciones y con cuánta intervención humana. Un resultado sobresaliente en un ámbito no resuelve automáticamente esas preguntas para todos los demás.
La propia presentación de OpenAI advierte que sus evaluaciones se ejecutaron en entornos de investigación o mediante la API y pueden diferir del comportamiento en ChatGPT debido a las instrucciones y herramientas disponibles. Esa salvedad resulta relevante al trasladar una puntuación de laboratorio a expectativas de uso cotidiano.
La seguridad requiere una evaluación separada
En su resumen de seguridad, OpenAI identifica a Astra como su primer modelo en alcanzar el nivel Critical de capacidad de ciberseguridad dentro de su Preparedness Framework. Según la empresa, con herramientas y acceso adecuados puede encontrar vulnerabilidades desconocidas y desarrollar formas de explotarlas sin supervisión humana en cada paso.
La capacidad evaluada debe distinguirse de las funciones habilitadas al público. En el lanzamiento, OpenAI indicó que la versión distribuida rechazaría determinadas tareas avanzadas, como crear pruebas de concepto para explotar vulnerabilidades, mientras permitiría actividades defensivas como revisar código y corregir fallos.
La compañía también describe mecanismos de vigilancia del razonamiento y las acciones para detectar conductas no autorizadas. Estas medidas responden a riesgos concretos del despliegue; la clasificación de ciberseguridad no determina por sí misma si el sistema constituye AGI.
La conclusión editorial más prudente es que Astra aporta resultados relevantes al debate sobre inteligencia general. Presentar su llegada como un hecho demostrado excedería lo que permiten concluir las fuentes consultadas.
Fuentes
- OpenAI: presentación de GPT-6 Astra.
- OpenAI: resumen de seguridad.
- ARC Prize: resultados verificados.
- ARC Prize: análisis y límites de ARC-AGI-3.
- Stratechery: entrevista con Greg Brockman.
- Forrester: clasificación de AGI competente.
- AGI Society: evaluación de las afirmaciones sobre AGI.
- Google DeepMind: Levels of AGI.
Ilustación creada por IA
📬 Newsletter gratuito