Benchmark
Pubblichiamo i risultati di Esan così puoi giudicarli tu stesso — con la metodologia, non solo un numero da titolo.
GAIA, in parole semplici
GAIA è un benchmark indipendente che verifica se un agente sa risolvere compiti reali come farebbe una persona: cercare sul web, leggere PDF, analizzare immagini ed eseguire calcoli per arrivare a una risposta verificata. Viene valutato rispetto a una risposta corretta nota per ogni domanda, su tre livelli di difficoltà.
I risultati di Esan
Sul set di validazione GAIA, Esan si comporta al di sopra della baseline umana ai Livelli 1 e 2, e pareggia al Livello 3.
Media aggiustata tra i livelli: 92,3%; risultato complessivo ponderato: 93,8%.
Come leggere questi numeri
I benchmark hanno senso solo con il loro metodo allegato, quindi ecco il nostro:
- Il set. I risultati sono sul set di validazione GAIA.
- La baseline. La "baseline umana" è la cifra di prestazione umana pubblicata da GAIA stesso per ogni livello — la stessa asticella con cui viene misurato ogni sistema.
- Esclusioni. Un piccolo numero di domande viene escluso perché non può essere risolto così com'è scritto — una pagina di origine non è più raggiungibile, la risposta pubblicata contiene un errore noto, oppure un sito blocca attivamente l'accesso automatizzato. Vengono escluse in modo trasparente anziché conteggiate come fallimenti o superate in silenzio.
- Cosa misura. GAIA premia il portare a termine correttamente un compito reale, non il sembrare plausibile — che è esattamente il tipo di lavoro che delegheresti a Esan.
Perché apriamo con questo
Molti strumenti sostengono di essere capaci. Un risultato di benchmark pubblico, supportato da una metodologia e che batte la baseline umana, è un'affermazione che puoi verificare. Se ti interessa se un agente porta davvero a termine il lavoro — non solo come suona — questo è il numero che conta.