Esan आज़माएँ

बेंचमार्क

हम Esan के नतीजे प्रकाशित करते हैं ताकि आप उन्हें खुद परख सकें — केवल एक सुर्खी वाले आँकड़े के साथ नहीं, बल्कि पद्धति के साथ।

GAIA, सरल शब्दों में

GAIA एक स्वतंत्र बेंचमार्क है जो यह जाँचता है कि क्या कोई एजेंट असली कामों को उसी तरह हल कर सकता है जैसे कोई व्यक्ति करता: वेब पर खोजना, PDF पढ़ना, छवियों का विश्लेषण करना, और एक सत्यापित उत्तर तक पहुँचने के लिए गणनाएँ चलाना। इसे हर सवाल के लिए एक ज्ञात सही उत्तर के मुकाबले, तीन कठिनाई स्तरों पर आँका जाता है।

Esan के नतीजे

GAIA validation set पर, Esan Level 1 और 2 में मानव आधार-रेखा से ऊपर प्रदर्शन करता है, और Level 3 पर बराबरी करता है।

स्तरों में समायोजित औसत: 92.3%; भारित कुल: 93.8%

इन आँकड़ों को कैसे पढ़ें

बेंचमार्क तभी सार्थक होते हैं जब उनकी पद्धति साथ जुड़ी हो, तो यह रही हमारी:

  • सेट। नतीजे GAIA validation set पर हैं।
  • आधार-रेखा। "मानव आधार-रेखा" GAIA की अपनी प्रकाशित मानव-प्रदर्शन संख्या है, हर स्तर के लिए — वही मानदंड जिसके मुकाबले हर सिस्टम को मापा जाता है।
  • अपवर्जन। कुछ थोड़े से सवालों को बाहर रखा जाता है क्योंकि उन्हें जैसा लिखा गया है वैसे उत्तर नहीं दिया जा सकता — कोई स्रोत पेज बंद हो गया है, प्रकाशित उत्तर में कोई ज्ञात गलती है, या कोई साइट स्वचालित पहुँच को सक्रिय रूप से रोकती है। इन्हें पारदर्शिता के साथ बाहर रखा जाता है, न कि विफलता के रूप में गिना जाता है या चुपचाप पास किया जाता है।
  • यह क्या मापता है। GAIA किसी असली काम को सही ढंग से पूरा करने के लिए इनाम देता है, न कि प्रशंसनीय लगने के लिए — यानी ठीक उसी तरह का काम जो आप Esan को सौंपेंगे।

हम इसे सबसे आगे क्यों रखते हैं

बहुत से टूल सक्षम होने का दावा करते हैं। एक सार्वजनिक, पद्धति-समर्थित बेंचमार्क नतीजा जो मानव आधार-रेखा को मात देता है, ऐसा दावा है जिसे आप जाँच सकते हैं। अगर आपको इससे फ़र्क पड़ता है कि कोई एजेंट सचमुच काम पूरा करता है या नहीं — न कि केवल यह कि वह कैसा सुनाई देता है — तो यही वह आँकड़ा है जो मायने रखता है।

क्या यह पेज मददगार रहा?