AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY زمرہ ناکامیاں

ہدایات کی پیروی: غلط جواب

ہدایات کی پیروی
غلط جواب

دیکھیں کہ ہدایات کی پیروی میں کن AI ماڈلز کو غلط جواب پیش آنے کا سب سے زیادہ امکان ہے، تاکہ آپ کمزوریاں جلدی پہچان سکیں۔ ترتیب دیں حسب: ردِعمل کا وقت (اوسط) ↓.

دکھائے گئے ماڈلز

15

کل ناکامیاں

53

سب سے زیادہ متاثر ماڈل

MiniMax M2.7 1
درجہ ماڈل کمپنی غلط جواب کی تعداد زمرہ اسکور درست ٹیسٹس ردِعمل کا وقت (اوسط)
#130 MiniMax M2.7 medium Minimax 1 3.8 0/2 12.8s
#111 Owl Alpha medium Openrouter 1 6.5 1/2 10.2s
#108 Qwen3.5-Flash none Qwen 1 6.3 1/2 8.81s
#113 DeepSeek V4 Pro none DeepSeek 1 6.3 1/2 8.23s
#140 Qwen3 Coder Next none Qwen 1 6.3 1/2 7.78s
#150 Qwen3 Coder Next medium Qwen 1 6.3 1/2 7.49s
#55 GLM 5.1 medium Z.ai 1 6.4 1/2 7.47s
#159 Ling-2.6-1T none Inclusionai 1 6.4 1/2 5.36s
#101 Mimo V2 Omni none Xiaomi 1 6.5 1/2 4.26s
#158 GLM 4.7 Flash medium Z.ai 1 6.2 1/2 2.97s
#85 Gemma 4 31B none Google 1 6.5 1/2 2.84s
#116 Hunter Alpha none OpenRouter 1 6.4 1/2 2.82s
#135 Kimi K2.5 none Moonshot AI 1 6.5 1/2 2.67s
#121 Owl Alpha none Openrouter 1 6.4 1/2 2.63s
#120 Mimo V2 PRO none Xiaomi 1 6.5 1/2 2.51s

غلط جواب کی تعداد کے لحاظ سے سرفہرست ماڈلز

غلط جواب کی تعداد بمقابلہ اسکور

ردِعمل کا وقت (اوسط) کے لحاظ سے سرفہرست ماڈلز

تخمینی ضائع لاگت کے لحاظ سے سرفہرست ماڈلز