Esanを試す

ベンチマーク

Esanの結果は、見出しの数字だけでなく方法論も添えて公開しています。ご自身で判断できるようにするためです。

GAIAをわかりやすく言うと

GAIAは、エージェントが人と同じように現実のタスクを解けるかを試す独立したベンチマークです。ウェブ検索、PDFの読み取り、画像の分析、計算の実行を通じて、検証済みの答えにたどり着けるかを問います。各問いには既知の正解があり、それに照らして採点され、3つの難易度レベルにわたって評価されます。

Esanの結果

GAIAの検証セットにおいて、Esanはレベル1とレベル2で人間のベースラインを上回り、レベル3では並んでいます。

レベル全体の調整平均: 92.3%、加重全体スコア: 93.8%

この数値の読み方

ベンチマークは方法論が添えられて初めて意味を持ちます。私たちの方法論は次のとおりです。

  • セット。 結果はGAIAの検証セットに基づきます。
  • ベースライン。 「人間のベースライン」は、GAIA自身が公開している各レベルの人間の成績値であり、すべてのシステムが測られるのと同じ基準です。
  • 除外。 ごく一部の問いは、記載どおりには回答できないため除外しています。出典ページが消滅している、公開された答えに既知の誤りがある、サイトが自動アクセスを積極的に遮断している、といった場合です。これらは失敗として数えたり黙って通したりせず、透明に除外しています。
  • 測っているもの。 GAIAは、もっともらしく聞こえることではなく、現実のタスクを正しく完遂することを評価します。まさにあなたがEsanに委任するような種類の作業です。

なぜこれを前面に出すのか

多くのツールが有能だと主張します。人間のベースラインを上回る、公開され方法論に裏づけられたベンチマーク結果は、あなた自身が検証できる主張です。エージェントがどう聞こえるかではなく、実際に仕事を成し遂げるかどうかを重視するなら、これこそ大切な数値です。

このページは役に立ちましたか?