Benchmarks
Publicamos los resultados de Esan para que puedas juzgarlos por ti mismo, con la metodología incluida y no solo una cifra de titular.
GAIA, en pocas palabras
GAIA es un benchmark independiente que evalúa si un agente puede resolver tareas reales como lo haría una persona: buscar en la web, leer PDF, analizar imágenes y hacer cálculos para llegar a una respuesta verificada. Se corrige frente a una respuesta correcta conocida para cada pregunta, a lo largo de tres niveles de dificultad.
Los resultados de Esan
En el conjunto de validación de GAIA, Esan rinde por encima de la referencia humana en los Niveles 1 y 2, y empata en el Nivel 3.
Media ajustada entre niveles: 92,3 %; total ponderado: 93,8 %.
Cómo leer estas cifras
Un benchmark solo tiene sentido con su método adjunto, así que aquí está el nuestro:
- El conjunto. Los resultados corresponden al conjunto de validación de GAIA.
- La referencia. La «referencia humana» es la cifra de rendimiento humano publicada por la propia GAIA para cada nivel: el mismo listón contra el que se mide cada sistema.
- Exclusiones. Se excluye un pequeño número de preguntas porque no pueden responderse tal como están redactadas: una página de origen ha dejado de existir, la respuesta publicada tiene un error conocido o un sitio bloquea activamente el acceso automatizado. Se excluyen de forma transparente en lugar de contarse como fallos o darse por buenas en silencio.
- Qué mide. GAIA premia terminar correctamente una tarea real, no sonar plausible, que es justo el tipo de trabajo que delegarías en Esan.
Por qué encabezamos con esto
Muchas herramientas afirman ser capaces. Un resultado de benchmark público y respaldado por una metodología que supera la referencia humana es una afirmación que puedes comprobar. Si te importa si un agente realmente saca el trabajo adelante —y no solo cómo suena—, esta es la cifra que importa.