پہیلی حل کرنا: ہدایات پر عمل نہیں کیا
پہیلی حل کرنا
ہدایات پر عمل نہیں کیا
دیکھیں کہ پہیلی حل کرنا میں کن AI ماڈلز کو ہدایات پر عمل نہیں کیا پیش آنے کا سب سے زیادہ امکان ہے، تاکہ آپ کمزوریاں جلدی پہچان سکیں۔ ترتیب دیں حسب: ناکامیوں کی تعداد ↑.
ناکامی کی وجوہات
86/86
ماڈلز فلٹر کریں
موجودہ تلاش اور فلٹرز سے کوئی ماڈل مطابقت نہیں رکھتا۔
| درجہ | ماڈل | کمپنی | ہدایات پر عمل نہیں کیا کی تعداد | زمرہ اسکور | کل لاگت | درست ٹیسٹس | ردِعمل کا وقت (اوسط) |
|---|---|---|---|---|---|---|---|
| #13 | GPT-5.3-Codex medium | OpenAI | 1 | 9.0 | $0.920 | 2/3 | 5.05s |
| #16 | Muse Spark 1.1 medium | Meta | 1 | 7.9 | $1.357 | 2/3 | 42.5s |
| #18 | GPT-5.4 medium | OpenAI | 1 | 8.2 | $1.533 | 2/3 | 9.14s |
| #21 | GPT-5.2 medium | OpenAI | 1 | 7.5 | $0.951 | 2/3 | 5.80s |
| #24 | Muse Spark 1.1 low | Meta | 1 | 8.3 | $0.647 | 2/3 | 6.60s |
| #26 | GPT-5 Mini medium | OpenAI | 1 | 5.6 | $0.237 | 1/3 | 15.2s |
| #28 | Inkling high | Thinkingmachines | 1 | 6.9 | $1.006 | 1/3 | 10.7s |
| #31 | GLM 5.2 high | Z.ai | 1 | 6.0 | $0.970 | 1/3 | 33.7s |
| #35 | Seed-2.0-Lite medium | Bytedance Seed | 1 | 9.0 | $0.234 | 2/3 | 10.2s |
| #45 | DeepSeek V4 Flash high | DeepSeek | 1 | 8.2 | $0.042 | 2/3 | 26.1s |
| #46 | DeepSeek V4 Pro high | DeepSeek | 1 | 6.9 | $0.200 | 1/3 | 56.8s |
| #49 | GLM 5 Turbo medium | Z.ai | 1 | 8.7 | $0.323 | 2/3 | 5.23s |
| #52 | Kimi K2.7 Code medium | Moonshot AI | 1 | 5.9 | $0.751 | 1/3 | 41.0s |
| #53 | GPT-5.4 Nano medium | OpenAI | 1 | 4.1 | $0.138 | 0/3 | 3.79s |
| #56 | GPT-5.4 Mini medium | OpenAI | 1 | 7.8 | $0.756 | 2/3 | 4.37s |