AI BENCHY
Advertise here

AI BENCHY श्रेणी अपयशे

डेटा पार्सिंग आणि निष्कर्षण: चुकीचे उत्तर

डेटा पार्सिंग आणि निष्कर्षण
चुकीचे उत्तर

डेटा पार्सिंग आणि निष्कर्षण मध्ये कोणत्या AI मॉडेल्सना चुकीचे उत्तर येण्याची शक्यता जास्त आहे ते पाहा, म्हणजे कमकुवत बाजू लवकर ओळखता येतील.

दाखवलेली मॉडेल्स

15

एकूण अपयशे

35

सर्वाधिक प्रभावित मॉडेल

GPT-5 Nano 2
क्रमांक मॉडेल कंपनी चुकीचे उत्तर संख्या श्रेणी स्कोअर बरोबर चाचण्या प्रतिसाद वेळ (सरासरी)
#94 GPT-5 Nano medium OpenAI 2 3.7 0/2 21.4s
#129 MiniMax M2.5 medium Minimax 2 4.6 0/2 7.48s
#160 LFM2-24B-A2B none Liquid 2 3.0 0/2 714ms
#162 Nemotron 3 Nano Omni 30b A3b Reasoning none NVIDIA 2 3.8 0/2 1.42s
#163 Granite 4.1 8B none IBM Granite 2 3.0 0/2 575ms
#10 Claude Opus 4.8 medium Anthropic 1 7.1 1/2 12.3s
#43 MiMo-V2.5-Pro medium Xiaomi 1 7.3 1/2 18.8s
#51 Mimo V2 PRO medium Xiaomi 1 7.3 1/2 17.2s
#56 MiMo-V2.5 medium Xiaomi 1 2.7 0/2 6.33s
#57 Step 3.7 Flash low Stepfun 1 7.3 1/2 2.29s
#68 Claude Opus 4.8 none Anthropic 1 7.3 1/2 1.77s
#75 Ring-2.6-1T medium Inclusionai 1 6.5 1/2 37.4s
#81 Mercury 2 medium Inception 1 7.3 1/2 1.11s
#96 Ring-2.6-1T none Inclusionai 1 3.0 0/2 45.9s
#99 gpt-oss-120b medium OpenAI 1 6.4 1/2 1.98s

चुकीचे उत्तर संख्या नुसार शीर्ष मॉडेल्स

चुकीचे उत्तर संख्या वि स्कोअर

प्रतिसाद वेळ (सरासरी) नुसार शीर्ष मॉडेल्स

अंदाजित वाया गेलेला खर्च नुसार शीर्ष मॉडेल्स