Experimente o Esan

Benchmarks

Publicamos os resultados do Esan para que você mesmo possa julgá-los — com a metodologia, não apenas um número de destaque.

O GAIA, em termos simples

O GAIA é um benchmark independente que testa se um agente consegue resolver tarefas reais do jeito que uma pessoa faria: pesquisando na web, lendo PDFs, analisando imagens e realizando cálculos para chegar a uma resposta verificada. Ele é avaliado contra uma resposta correta conhecida para cada questão, em três níveis de dificuldade.

Os resultados do Esan

No conjunto de validação do GAIA, o Esan tem desempenho acima da linha de base humana nos Níveis 1 e 2, e empata no Nível 3.

Média ajustada entre os níveis: 92,3%; total ponderado: 93,8%.

Como ler esses números

Benchmarks só têm valor com o método por trás, então aqui está o nosso:

  • O conjunto. Os resultados são sobre o conjunto de validação do GAIA.
  • A linha de base. A "linha de base humana" é o número de desempenho humano publicado pelo próprio GAIA para cada nível — a mesma régua contra a qual todo sistema é medido.
  • Exclusões. Um pequeno número de questões é excluído porque não pode ser respondido como está escrito — uma página de origem saiu do ar, a resposta publicada tem um erro conhecido ou um site bloqueia ativamente o acesso automatizado. Elas são excluídas de forma transparente, em vez de serem contadas como falhas ou aprovadas silenciosamente.
  • O que ele mede. O GAIA recompensa concluir uma tarefa real corretamente, não parecer plausível — que é exatamente o tipo de trabalho que você delegaria ao Esan.

Por que destacamos isto

Muitas ferramentas afirmam ser capazes. Um resultado de benchmark público, respaldado por metodologia, que supera a linha de base humana é uma afirmação que você pode conferir. Se você se importa com o fato de um agente realmente concluir o trabalho — não apenas com o quanto ele parece bom — este é o número que importa.

Esta página foi útil?