La evolución hacia agentes de inteligencia artificial capaces de realizar tareas complejas enfrenta un obstáculo fundamental: el comportamiento del mundo real no se ajusta a los estándares de los entornos de prueba convencionales. Un agente que simplemente completa texto o utiliza herramientas de forma limitada sin capacidad de recuperación ante fallos en flujos de trabajo desconocidos no cumple con su propósito. La transición hacia sistemas verdaderamente autónomos depende de resolver desafíos de datos, tales como el seguimiento de ingeniería de software, la gestión de errores en herramientas, el razonamiento en múltiples pasos y la interacción con el entorno físico. En este contexto, la disponibilidad de datos abiertos se vuelve un pilar esencial para el desarrollo de la industria.

NVIDIA ha enfatizado que, si bien los pesos de los modelos son importantes, la reproducibilidad y la transparencia en el comportamiento de los agentes dependen de los conjuntos de datos, las recetas de entrenamiento y los métodos de evaluación utilizados. Al hacer que los datos sean accesibles, los desarrolladores pueden inspeccionar y comprender los factores que moldean las decisiones de un modelo, especialmente cuando este interactúa con sistemas externos. La transparencia es, por tanto, un requisito para lograr modelos explicables y seguros, permitiendo que la comunidad investigadora colabore en la mejora de estas capacidades.

El uso de datos sintéticos surge como una estrategia clave para escalar el entrenamiento de estos agentes. Esta metodología permite a las organizaciones preservar información valiosa, como flujos de trabajo internos o patrones de clientes, sin exponer fuentes confidenciales que podrían comprometer su ventaja competitiva. Al generar datos sintéticos, las empresas pueden contribuir a un ecosistema compartido más rico sin necesidad de revelar sus secretos comerciales, facilitando así la colaboración entre diversos actores, desde gobiernos hasta investigadores, que de otro modo no compartirían información sensible por razones de privacidad o seguridad.

Para facilitar la exploración de estos recursos, se han implementado herramientas como el "Prompt Atlas" de Nemotron, un mapa visual interactivo que permite visualizar muestras de datos de post-entrenamiento. Esta herramienta organiza los datos según dominios, etapas de tuberías o tipos de uso de herramientas, permitiendo a los desarrolladores identificar clústeres semánticos y comprender mejor cómo se comportan los modelos en áreas específicas como la seguridad o el razonamiento matemático. Esta capacidad de inspección es fundamental para curar conjuntos de datos de alta calidad y ajustar el rendimiento de los agentes.

Asimismo, la calidad de los datos debe ser local y contextual. Por ejemplo, la detección de toxicidad o el entendimiento de matices culturales requieren enfoques específicos que las herramientas genéricas a menudo pasan por alto. Iniciativas como Nemotron-Personas utilizan datos sintéticos para reflejar la diversidad demográfica y lingüística de diversas regiones, permitiendo a los desarrolladores evaluar si sus sistemas son inclusivos y precisos para las poblaciones a las que sirven. Este esfuerzo colaborativo subraya que el avance de la inteligencia artificial no solo depende de la cantidad de tokens, sino de la construcción de confianza y la integración de juicios humanos en el ciclo de desarrollo.