Experimenta o Esan

Benchmarks

Publicamos os resultados do Esan para que os possas julgar por ti — com a metodologia, não apenas um número de destaque.

O GAIA, em termos simples

O GAIA é um benchmark independente que testa se um agente consegue resolver tarefas reais como uma pessoa faria: pesquisando na web, lendo PDF, analisando imagens e fazendo cálculos até chegar a uma resposta verificada. É avaliado contra uma resposta correta conhecida para cada pergunta, em três níveis de dificuldade.

Os resultados do Esan

No conjunto de validação do GAIA, o Esan tem um desempenho acima da linha de base humana nos Níveis 1 e 2, e empata no Nível 3.

Média ajustada entre níveis: 92,3%; total ponderado: 93,8%.

Como ler estes números

Um benchmark só vale pelo método que tem por trás, por isso aqui está o nosso:

  • O conjunto. Os resultados dizem respeito ao conjunto de validação do GAIA.
  • A linha de base. A "linha de base humana" é o valor de desempenho humano publicado pelo próprio GAIA para cada nível — a mesma régua com que se mede qualquer sistema.
  • Exclusões. Um pequeno número de perguntas é excluído por não poder ser respondido tal como está escrito — uma página de origem saiu do ar, a resposta publicada tem um erro conhecido ou um site bloqueia ativamente o acesso automatizado. São excluídas de forma transparente, em vez de contarem como falhas ou passarem em silêncio.
  • O que mede. O GAIA premeia concluir corretamente uma tarefa real, não parecer plausível — que é exatamente o tipo de trabalho que delegarias ao Esan.

Porque destacamos isto

Muitas ferramentas dizem-se capazes. Um resultado público de benchmark, sustentado por metodologia, que supera a linha de base humana é uma afirmação que podes verificar. Se te importa que um agente conclua mesmo o trabalho — e não apenas que pareça bem — é este o número que conta.

Esta página foi útil?