AI BENCHY
Advertise here

AI BENCHY زمرہ ناکامیاں

ہدایات کی پیروی: غلط جواب

ہدایات کی پیروی
غلط جواب

دیکھیں کہ ہدایات کی پیروی میں کن AI ماڈلز کو غلط جواب پیش آنے کا سب سے زیادہ امکان ہے، تاکہ آپ کمزوریاں جلدی پہچان سکیں۔

دکھائے گئے ماڈلز

15

کل ناکامیاں

53

سب سے زیادہ متاثر ماڈل

Gemini 3.5 Flash 1
درجہ ماڈل کمپنی غلط جواب کی تعداد زمرہ اسکور درست ٹیسٹس ردِعمل کا وقت (اوسط)
#115 Qwen3.5-27B none Qwen 1 6.3 1/2 1.03s
#116 Hunter Alpha none OpenRouter 1 6.4 1/2 2.82s
#117 Qwen3.5-35B-A3B none Qwen 1 6.3 1/2 809ms
#118 Qwen3.6 27B none Qwen 1 6.2 1/2 1.92s
#120 Mimo V2 PRO none Xiaomi 1 6.5 1/2 2.51s
#121 Owl Alpha none Openrouter 1 6.4 1/2 2.63s
#122 GLM 4.7 Flash none Z.ai 1 6.5 1/2 888ms
#123 MiMo-V2.5-Pro none Xiaomi 1 6.4 1/2 1.03s
#124 Kimi K2.6 none Moonshot AI 1 6.5 1/2 1.64s
#125 GPT-5.4 none OpenAI 1 6.5 1/2 1.07s
#127 Grok 4.20 none X AI 1 6.3 1/2 445ms
#128 Qwen3.6 Flash none Qwen 1 6.3 1/2 1.10s
#130 MiniMax M2.7 medium Minimax 1 3.8 0/2 12.8s
#131 Qwen3.5-122B-A10B none Qwen 1 6.3 1/2 513ms
#132 Mistral Small 4 medium Mistral 1 7.3 1/2 1.38s

غلط جواب کی تعداد کے لحاظ سے سرفہرست ماڈلز

غلط جواب کی تعداد بمقابلہ اسکور

ردِعمل کا وقت (اوسط) کے لحاظ سے سرفہرست ماڈلز

تخمینی ضائع لاگت کے لحاظ سے سرفہرست ماڈلز