AI BENCHY
Advertise here

AI BENCHY ناکامیاں

اضافی فارمیٹنگ ناکامیاں

دیکھیں کہ کن AI ماڈلز میں اضافی فارمیٹنگ سب سے زیادہ ہوتا ہے، تاکہ آپ انتخاب سے پہلے قابلِ اعتماد ہونے کے خطرات سمجھ سکیں۔ ترتیب دیں حسب: ردِعمل کا وقت (اوسط) ↑.

دکھائے گئے ماڈلز

14

کل ناکامیاں

48

سب سے زیادہ متاثر ماڈل

Granite 4.1 8B 1
درجہ ماڈل کمپنی اضافی فارمیٹنگ کی تعداد اسکور درست ٹیسٹس ردِعمل کا وقت (اوسط)
#64 MiMo-V2-Flash medium Xiaomi 1 7.2 12/21 20.1s
#51 Mimo V2 PRO medium Xiaomi 1 7.4 12/21 22.2s
#69 Claude Opus 4.6 medium Anthropic 5 7.0 12/21 25.9s
#43 MiMo-V2.5-Pro medium Xiaomi 3 7.5 12/21 26.1s
#139 DeepSeek V4 Flash none DeepSeek 2 5.0 5/21 26.8s
#56 MiMo-V2.5 medium Xiaomi 2 7.3 12/21 27.1s
#65 Grok 4.20 medium X AI 1 7.1 12/21 27.7s
#55 GLM 5.1 medium Z.ai 1 7.3 12/21 33.7s
#80 Mimo V2 Omni medium Xiaomi 1 6.7 10/21 41.2s
#38 Grok 4.3 medium X AI 1 7.6 13/21 47.5s
#47 Grok Build 0.1 medium X AI 3 7.4 13/21 49.9s
#67 MiniMax M3 medium Minimax 1 7.1 11/21 68.2s
#30 Qwen3.5-27B medium Qwen 1 7.8 13/21 68.4s
#161 Qwen3.5-9B medium Qwen 1 4.2 3/21 82.2s

اضافی فارمیٹنگ کی تعداد کے لحاظ سے سرفہرست ماڈلز

اضافی فارمیٹنگ کی تعداد بمقابلہ اسکور

ردِعمل کا وقت (اوسط) کے لحاظ سے سرفہرست ماڈلز