基準測試
我們公開 Esan 的成績,讓你可以自行判斷——連同 方法論,而不只是一個標題數字。
用白話說明 GAIA
GAIA 是一個獨立的基準,測試代理能否像人一樣 解決真實任務:搜尋網路、閱讀 PDF、 分析圖片,以及執行計算以得出經過驗證的答案。 每一道題目都以已知的正確答案評分,橫跨 三個難度等級。
Esan 的成績
在 GAIA 驗證集上,Esan 在等級 1 與等級 2 的表現 高於人類基準,並在等級 3 上與之持平。
各等級調整後平均:92.3%;加權整體:93.8%。
如何解讀這些數字
基準只有附上方法才有意義,因此以下是 我們的方法:
- **測試集。**成績來自 GAIA 驗證集。
- 基準線。「人類基準」是 GAIA 自己公布的 各等級人類表現數字——每個系統都以同一條標準 衡量。
- **排除項。**有少數題目被排除,因為它們 無法照原題作答——來源頁面已失效、 公布的答案有已知錯誤,或某個網站主動封鎖 自動化存取。這些題目會透明地排除,而不是 計為失敗或悄悄放行。
- **它衡量什麼。**GAIA 獎勵正確地完成一項真實任務, 而不是聽起來合理——這正是你會 委派給 Esan 的那種工作。
我們為何以此為先
許多工具聲稱自己很有能力。一個公開、有方法論支撐、 勝過人類基準的基準成績,是你可以查證的 主張。如果你在乎的是代理是否真的把工作完成—— 而不只是它聽起來如何——這就是最重要的數字。
這個頁面有幫助嗎?