AI BENCHY
Advertise here

AI BENCHY زمرہ ناکامیاں

ڈیٹا پارسنگ اور استخراج: غلط جواب

ڈیٹا پارسنگ اور استخراج
غلط جواب

دیکھیں کہ ڈیٹا پارسنگ اور استخراج میں کن AI ماڈلز کو غلط جواب پیش آنے کا سب سے زیادہ امکان ہے، تاکہ آپ کمزوریاں جلدی پہچان سکیں۔

دکھائے گئے ماڈلز

15

کل ناکامیاں

35

سب سے زیادہ متاثر ماڈل

GPT-5 Nano 2
درجہ ماڈل کمپنی غلط جواب کی تعداد زمرہ اسکور درست ٹیسٹس ردِعمل کا وقت (اوسط)
#100 Grok Build 0.1 none X AI 1 3.8 0/2 9.33s
#118 Qwen3.6 27B none Qwen 1 7.3 1/2 2.06s
#119 Cobuddy medium Baidu 1 6.3 1/2 17.4s
#122 GLM 4.7 Flash none Z.ai 1 7.3 1/2 4.82s
#130 MiniMax M2.7 medium Minimax 1 6.3 1/2 21.9s
#133 DeepSeek V3.2 none DeepSeek 1 6.3 1/2 9.42s
#135 Kimi K2.5 none Moonshot AI 1 7.3 1/2 42.1s
#136 Elephant Alpha medium Openrouter 1 6.5 1/2 979ms
#137 Elephant Alpha none Openrouter 1 6.5 1/2 1.04s
#138 Ling-2.6-flash none Inclusionai 1 6.5 1/2 8.48s
#140 Qwen3 Coder Next none Qwen 1 6.5 1/2 1.32s
#148 GPT-5.4 Nano none OpenAI 1 6.5 1/2 1.11s
#149 Nemotron 3 Nano Omni 30b A3b Reasoning medium NVIDIA 1 7.3 1/2 2.72s
#150 Qwen3 Coder Next medium Qwen 1 6.5 1/2 81.8s
#155 Mercury 2 none Inception 1 7.3 1/2 667ms

غلط جواب کی تعداد کے لحاظ سے سرفہرست ماڈلز

غلط جواب کی تعداد بمقابلہ اسکور

ردِعمل کا وقت (اوسط) کے لحاظ سے سرفہرست ماڈلز

تخمینی ضائع لاگت کے لحاظ سے سرفہرست ماڈلز