AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY زمرہ ناکامیاں

کوڈنگ: غلط جواب

کوڈنگ
غلط جواب

دیکھیں کہ کوڈنگ میں کن AI ماڈلز کو غلط جواب پیش آنے کا سب سے زیادہ امکان ہے، تاکہ آپ کمزوریاں جلدی پہچان سکیں۔

دکھائے گئے ماڈلز

9

کل ناکامیاں

120

سب سے زیادہ متاثر ماڈل

Qwen3.6 Flash 2
درجہ ماڈل کمپنی غلط جواب کی تعداد زمرہ اسکور درست ٹیسٹس ردِعمل کا وقت (اوسط)
#137 Qwen3.6 35B A3B none Qwen 1 6.8 1/2 12.3s
#139 MiMo-V2.5 none Xiaomi 1 6.8 1/2 3.74s
#140 Trinity Large Preview none Arcee AI 1 4.9 0/1 14.3s
#141 Qwen3 Coder Next medium Qwen 1 4.1 0/2 1.17s
#144 Hy3 preview none Tencent 1 2.3 0/1 4.56s
#146 Ling-2.6-1T none Inclusionai 1 5.5 0/1 10.6s
#149 MiMo-V2-Flash none Xiaomi 1 4.9 0/2 2.04s
#150 Grok 4.1 Fast none X AI 1 5.3 0/1 1.79s
#153 Granite 4.1 8B none IBM Granite 1 5.2 0/2 706ms

غلط جواب کی تعداد کے لحاظ سے سرفہرست ماڈلز

غلط جواب کی تعداد بمقابلہ اسکور

ردِعمل کا وقت (اوسط) کے لحاظ سے سرفہرست ماڈلز

تخمینی ضائع لاگت کے لحاظ سے سرفہرست ماڈلز