AI BENCHY زمرہ ناکامیاں
پہیلی حل کرنا: ہدایات پر عمل نہیں کیا
پہیلی حل کرنا
ہدایات پر عمل نہیں کیا
دیکھیں کہ پہیلی حل کرنا میں کن AI ماڈلز کو ہدایات پر عمل نہیں کیا پیش آنے کا سب سے زیادہ امکان ہے، تاکہ آپ کمزوریاں جلدی پہچان سکیں۔ ترتیب دیں حسب: درست ٹیسٹس ↓.
ناکامی کی وجوہات
| درجہ | ماڈل | کمپنی | ہدایات پر عمل نہیں کیا کی تعداد | زمرہ اسکور | درست ٹیسٹس | ردِعمل کا وقت (اوسط) |
|---|---|---|---|---|---|---|
| #6 | Seed-2.0-Lite medium | Bytedance Seed | 1 | 9.0 | 2/3 | 11.0s |
| #7 | GPT-5.3-Codex medium | OpenAI | 1 | 9.0 | 2/3 | 5.12s |
| #10 | Qwen3.5-27B medium | Qwen | 1 | 8.2 | 2/3 | 64.6s |
| #14 | Gemma 4 31B medium | 1 | 8.8 | 2/3 | 27.6s | |
| #16 | GPT-5.4 medium | OpenAI | 1 | 8.2 | 2/3 | 9.13s |
| #24 | Gemma 4 26B A4B medium | 1 | 7.9 | 2/3 | 8.52s | |
| #25 | Grok 4.20 Beta medium | X AI | 1 | 8.2 | 2/3 | 3.85s |
| #31 | GLM 5V Turbo medium | Z.ai | 1 | 7.7 | 2/3 | 10.9s |
| #40 | GPT-5.2 medium | OpenAI | 1 | 7.7 | 2/3 | 5.47s |
| #55 | MiMo-V2-Omni none | Xiaomi | 1 | 8.0 | 2/3 | 2.71s |
| #18 | GLM 5 Turbo medium | Z.ai | 2 | 7.3 | 1/3 | 5.44s |
| #23 | MiMo-V2-Pro medium | Xiaomi | 1 | 7.0 | 1/3 | 4.71s |
| #30 | Step 3.5 Flash medium | Stepfun | 1 | 5.3 | 1/3 | 7.72s |
| #35 | MiMo-V2-Omni medium | Xiaomi | 1 | 6.5 | 1/3 | 3.88s |
| #44 | GPT-5.4 Mini medium | OpenAI | 2 | 6.8 | 1/3 | 4.33s |