Benchmarks
Publicamos os resultados do Esan para que você mesmo possa julgá-los — com a metodologia, não apenas um número de destaque.
O GAIA, em termos simples
O GAIA é um benchmark independente que testa se um agente consegue resolver tarefas reais do jeito que uma pessoa faria: pesquisando na web, lendo PDFs, analisando imagens e realizando cálculos para chegar a uma resposta verificada. Ele é avaliado contra uma resposta correta conhecida para cada questão, em três níveis de dificuldade.
Os resultados do Esan
No conjunto de validação do GAIA, o Esan tem desempenho acima da linha de base humana nos Níveis 1 e 2, e empata no Nível 3.
Média ajustada entre os níveis: 92,3%; total ponderado: 93,8%.
Como ler esses números
Benchmarks só têm valor com o método por trás, então aqui está o nosso:
- O conjunto. Os resultados são sobre o conjunto de validação do GAIA.
- A linha de base. A "linha de base humana" é o número de desempenho humano publicado pelo próprio GAIA para cada nível — a mesma régua contra a qual todo sistema é medido.
- Exclusões. Um pequeno número de questões é excluído porque não pode ser respondido como está escrito — uma página de origem saiu do ar, a resposta publicada tem um erro conhecido ou um site bloqueia ativamente o acesso automatizado. Elas são excluídas de forma transparente, em vez de serem contadas como falhas ou aprovadas silenciosamente.
- O que ele mede. O GAIA recompensa concluir uma tarefa real corretamente, não parecer plausível — que é exatamente o tipo de trabalho que você delegaria ao Esan.
Por que destacamos isto
Muitas ferramentas afirmam ser capazes. Um resultado de benchmark público, respaldado por metodologia, que supera a linha de base humana é uma afirmação que você pode conferir. Se você se importa com o fato de um agente realmente concluir o trabalho — não apenas com o quanto ele parece bom — este é o número que importa.