Esan'ı dene

Kıyaslamalar

Esan'ın sonuçlarını, kendiniz değerlendirebilesiniz diye yayımlıyoruz — yalnızca bir manşet rakamıyla değil, yöntemiyle birlikte.

Sade bir dille GAIA

GAIA, bir ajanın gerçek görevleri bir insanın yapacağı gibi çözüp çözemeyeceğini test eden bağımsız bir kıyaslamadır: web'de arama yapma, PDF okuma, görselleri analiz etme ve doğrulanmış bir yanıta ulaşmak için hesaplamalar çalıştırma. Her soru için bilinen doğru bir yanıta göre, üç zorluk düzeyinde puanlanır.

Esan'ın sonuçları

GAIA doğrulama setinde Esan, 1. ve 2. Düzeylerde insan taban çizgisinin üzerinde performans gösterir ve 3. Düzeyde eşitler.

Düzeyler arası ayarlanmış ortalama: %92,3; ağırlıklı genel: %93,8.

Bu rakamlar nasıl okunur

Kıyaslamalar ancak yöntemleriyle birlikte anlamlıdır; işte bizimki:

  • Set. Sonuçlar GAIA doğrulama setine dayanır.
  • Taban çizgisi. "İnsan taban çizgisi", GAIA'nın her düzey için yayımladığı kendi insan-performansı rakamıdır — her sistemin karşısında ölçüldüğü aynı çıta.
  • Hariç tutmalar. Az sayıda soru, yazıldığı hâliyle yanıtlanamadığı için hariç tutulur — bir kaynak sayfası artık erişilemez durumda, yayımlanan yanıtta bilinen bir hata var ya da bir site otomatik erişimi etkin biçimde engelliyor. Bunlar başarısızlık sayılmak veya sessizce geçirilmek yerine şeffaf biçimde hariç tutulur.
  • Neyi ölçer. GAIA, kulağa makul gelmeyi değil, gerçek bir görevi doğru şekilde bitirmeyi ödüllendirir — ki bu tam da Esan'a devredeceğiniz türden bir iştir.

Neden bununla öne çıkıyoruz

Pek çok araç yetenekli olduğunu iddia eder. İnsan taban çizgisini geçen, kamuya açık ve yöntemle desteklenen bir kıyaslama sonucu ise doğrulayabileceğiniz bir iddiadır. Bir ajanın kulağa nasıl geldiğiyle değil, gerçekten iş bitirip bitirmediğiyle ilgileniyorsanız, önemli olan rakam budur.

Bu sayfa yardımcı oldu mu?