← Volver a notas
nvidia,ia,claude-opus,investigacion,agentes

Nvidia demuestra que el harness de IA, no el modelo, es el verdadero héroe

Nvidia publicó investigación mostrando que el harness, el software envoltorio alrededor de un modelo de IA, es más importante que el modelo en sí para tareas de largo horizonte, logrando 100% en el benchmark ARC-AGI-3 con Claude Opus 5.

RRedacción Sandia Tech·22 de agosto de 2026·3 min

Nvidia publicó investigación interesante el viernes sugiriendo que es el harness, más que el modelo subyacente, lo que es mucho más importante al pedir a una IA que realice tareas de largo horizonte. Un harness es el envoltorio de software alrededor de un modelo de IA: las herramientas, gestión de memoria y reglas que convierten un modelo en bruto en algo que puede actuar por su cuenta.

Resultados del estudio

El resumen: Simplemente usando un harness personalizado ajustado para manejar memoria bien e incluyendo un componente "supervisor" tipo jefe, los investigadores lograron que Claude Opus 5 alcanzara una puntuación del 100% en el benchmark de razonamiento interactivo ARC-AGI-3, un conjunto de juegos 2D sin instrucciones, donde el modelo tiene que descubrir cómo jugar y ganar, similar a cómo lo haría un humano. (Ese es un benchmark que ha irritado particularmente al laboratorio fronterizo rival OpenAI.) Sin el harness, Opus 5 obtuvo un 30%, que fue el resultado superior entre todos los modelos probados.

La investigación de Nvidia es otro indicador de que, aunque la elección del modelo sí importa, el modelo en sí, la parte que actúa como el "cerebro" del agente, es una parte más pequeña de un sistema agéntico que muchos usuarios de IA se dan cuenta, especialmente para tareas de largo horizonte. El harness es lo que hace que un modelo sea un agente: maneja memoria, contexto y retroalimentación.

Definición del concepto de harness

"Generalmente hablando, el mundo interpreta un agente casi como una API del modelo", dice Adel El Hallak, vicepresidente de producto en la unidad de IA de Nvidia (en la foto arriba) a TechCrunch. Pero un agente es en realidad más que eso. "Es el modelo. Es el andamiaje alrededor del modelo, que llamamos harness, es decir, el conjunto de herramientas que utiliza. Es el tiempo de ejecución y las habilidades asociadas y bibliotecas a las que le damos acceso".

Tareas de largo horizonte

Las tareas de largo horizonte son aquellas que requieren encadenar muchas decisiones juntas, a veces durante días, para producir trabajo completado. Esto contrasta con una IA simplemente escupiendo una respuesta a una pregunta. Descubrir cómo hacer que una IA realice tareas de largo horizonte sin distraerse y desviarse en la tierra de la fantasía es uno de los objetivos finales en investigación agéntica.

Por ejemplo: Microsoft publicó investigación en abril que probó 19 LLMs en tareas de largo horizonte que involucraban edición de documentos, filtrado de bases de datos y análisis de cifras, de acuerdo con el investigador de Nvidia Adel El Hallak. De los 19 modelos probados en esa investigación de Microsoft, el mejor solo obtuvo una tasa de éxito del 20%. En los mismos tipos de tareas, pero con un harness mejorado, Nvidia alcanzó un 95% de tasa de éxito.

Implicaciones para el futuro de la IA

Este hallazgo tiene implicaciones significativas para cómo pensamos sobre el desarrollo de IA. Sugiere que en lugar de enfocarse únicamente en entrenar modelos más grandes y más poderosos, deberíamos invertir al menos tanta energía en mejorar los sistemas que rodean estos modelos: los harnesses que les permiten ser efectivos agentes autónomos.

La investigación también implica que el verdadero diferenciador en sistemas de IA avanzados puede no ser el modelo fundamental, sino la ingeniería de sistemas que lo rodea. Para las organizaciones que usan IA, esto sugiere que el valor puede estar no solo en seleccionar el modelo correcto, sino en invertir en la infraestructura y los procesos adecuados para hacerlo funcionar efectivamente.

Fuente: TechCrunch

Ver más notas →