Esan 사용해보기

벤치마크

우리는 헤드라인 수치만이 아니라 방법론과 함께 Esan의 결과를 공개합니다. 그래야 당신이 직접 판단할 수 있기 때문입니다.

GAIA를 쉽게 설명하면

GAIA는 에이전트가 사람처럼 실제 작업을 해결할 수 있는지 테스트하는 독립적인 벤치마크입니다. 웹 검색, PDF 읽기, 이미지 분석, 계산 수행을 통해 검증된 답에 도달하는 능력을 봅니다. 각 질문마다 알려진 정답과 대조해 채점되며, 세 가지 난이도 수준으로 구성됩니다.

Esan의 결과

GAIA 검증 세트에서 Esan은 레벨 1과 레벨 2에서 인간 기준선을 상회하며, 레벨 3에서는 동률을 기록합니다.

레벨 전체의 조정 평균: 92.3%, 가중 종합: 93.8%.

이 수치를 읽는 법

벤치마크는 방법론이 함께 있어야만 의미가 있으므로, 우리의 방법론은 다음과 같습니다:

  • 세트. 결과는 GAIA 검증 세트를 기준으로 합니다.
  • 기준선. "인간 기준선"은 각 레벨에 대해 GAIA가 자체적으로 공개한 인간 성능 수치로, 모든 시스템이 동일하게 측정되는 잣대입니다.
  • 제외 항목. 소수의 질문은 작성된 그대로 답할 수 없어 제외됩니다. 출처 페이지가 사라졌거나, 공개된 정답에 알려진 오류가 있거나, 사이트가 자동 접근을 적극적으로 차단하는 경우입니다. 이런 항목은 실패로 계산하거나 조용히 통과 처리하는 대신 투명하게 제외됩니다.
  • 측정하는 것. GAIA는 그럴듯하게 들리는 것이 아니라 실제 작업을 올바르게 완수하는 것에 보상합니다. 바로 당신이 Esan에게 위임할 만한 종류의 일입니다.

우리가 이 수치를 앞세우는 이유

많은 도구가 유능하다고 주장합니다. 인간 기준선을 능가하는, 공개되고 방법론이 뒷받침된 벤치마크 결과는 당신이 직접 확인할 수 있는 주장입니다. 에이전트가 말솜씨가 아니라 실제로 일을 해내는지 신경 쓴다면, 바로 이 수치가 중요합니다.

이 페이지가 도움이 되었나요?