Diario TI

OpenAI atribuye a la memoria de contexto una mejora de 13,3% a 38,3% en ARC-AGI-3

OpenAI atribuye a la memoria de contexto una mejora de 13,3% a 38,3% en ARC-AGI-3

OpenAI informó que conservar el estado de razonamiento entre turnos y compactar el contexto elevó el resultado de GPT-5.6 Sol en el conjunto público de ARC-AGI-3, al tiempo que redujo los tokens de salida.

OpenAI informó el 29 de julio de 2026 que el desempeño de GPT-5.6 Sol en el conjunto público de ARC-AGI-3 aumentó de 13,3% a 38,3% tras modificar el entorno usado para ejecutar la prueba. Los cambios consistieron en conservar el estado de razonamiento entre acciones y sustituir el recorte progresivo del historial por un mecanismo de compactación del contexto.

Según la compañía, la nueva configuración también redujo en torno a seis veces la cantidad de tokens de salida. Los resultados proceden de una evaluación realizada por OpenAI y no constan, por ahora, como una validación independiente de ARC Prize. Por ello deben leerse como evidencia del efecto del entorno de ejecución, no como una puntuación oficial directamente comparable con todas las entradas del benchmark.

Qué mide ARC-AGI-3

ARC-AGI-3 evalúa agentes en juegos bidimensionales desconocidos y sin instrucciones en lenguaje natural. El sistema debe explorar, inferir reglas, planificar y transferir lo aprendido entre niveles. ARC Prize describe una colección de 135 entornos y ofrece 25 juegos como demostración pública.

La puntuación emplea Relative Human Action Efficiency, o RHAE. Esta métrica combina los niveles completados y la eficiencia de las acciones frente a una referencia humana. El 48% humano citado por OpenAI es una estimación de la empresa a partir de registros públicos y no debe confundirse con la referencia por nivel definida en la metodología oficial.

Por qué cambió el resultado

En el entorno genérico, cada acción descartaba el razonamiento privado del turno anterior. Aunque el modelo conservaba un registro de movimientos y notas breves, debía reconstruir repetidamente parte de su interpretación del juego. Además, cuando crecía el historial, el sistema eliminaba las interacciones más antiguas, lo que podía borrar observaciones y estrategias previas.

La API Responses permite enlazar turnos y mantener internamente el estado de razonamiento. La compactación reduce el tamaño del contexto y conserva la información considerada necesaria para continuar. En la prueba de OpenAI, la combinación permitió al agente mantener estrategias durante secuencias más largas y dedicar menos salida a rehacer análisis anteriores.

Una advertencia para los benchmarks

El experimento no demuestra por sí solo que un modelo sea tres veces más capaz. Sí indica que la puntuación puede variar de forma sustancial cuando cambian la memoria, el manejo del contexto y la interfaz entre el modelo y la prueba. Esa sensibilidad resulta especialmente relevante en evaluaciones de agentes, donde una tarea puede extenderse durante cientos o miles de acciones.

ARC Prize diseñó un entorno genérico para facilitar comparaciones y hacer visibles las limitaciones de los modelos. OpenAI sostiene, en cambio, que las evaluaciones también deberían considerar configuraciones cercanas a las utilizadas en productos reales. Son enfoques que responden a preguntas distintas: uno busca condiciones uniformes y el otro, medir el mejor rendimiento posible de cada sistema.

Para los desarrolladores, la conclusión práctica es evitar que un agente pierda su estado útil entre turnos y gestionar los contextos largos sin borrar indiscriminadamente el historial. Para quienes comparan modelos, la lección es exigir que cada resultado detalle el modelo, el conjunto de tareas, el entorno de ejecución, las opciones de API y el consumo de tokens.

Fuentes

📬 Newsletter gratuito

Últimos artículos