Benchmarks
Publicamos os resultados do Esan para que os possas julgar por ti — com a metodologia, não apenas um número de destaque.
O GAIA, em termos simples
O GAIA é um benchmark independente que testa se um agente consegue resolver tarefas reais como uma pessoa faria: pesquisando na web, lendo PDF, analisando imagens e fazendo cálculos até chegar a uma resposta verificada. É avaliado contra uma resposta correta conhecida para cada pergunta, em três níveis de dificuldade.
Os resultados do Esan
No conjunto de validação do GAIA, o Esan tem um desempenho acima da linha de base humana nos Níveis 1 e 2, e empata no Nível 3.
Média ajustada entre níveis: 92,3%; total ponderado: 93,8%.
Como ler estes números
Um benchmark só vale pelo método que tem por trás, por isso aqui está o nosso:
- O conjunto. Os resultados dizem respeito ao conjunto de validação do GAIA.
- A linha de base. A "linha de base humana" é o valor de desempenho humano publicado pelo próprio GAIA para cada nível — a mesma régua com que se mede qualquer sistema.
- Exclusões. Um pequeno número de perguntas é excluído por não poder ser respondido tal como está escrito — uma página de origem saiu do ar, a resposta publicada tem um erro conhecido ou um site bloqueia ativamente o acesso automatizado. São excluídas de forma transparente, em vez de contarem como falhas ou passarem em silêncio.
- O que mede. O GAIA premeia concluir corretamente uma tarefa real, não parecer plausível — que é exatamente o tipo de trabalho que delegarias ao Esan.
Porque destacamos isto
Muitas ferramentas dizem-se capazes. Um resultado público de benchmark, sustentado por metodologia, que supera a linha de base humana é uma afirmação que podes verificar. Se te importa que um agente conclua mesmo o trabalho — e não apenas que pareça bem — é este o número que conta.