کوڈنگ: ہدایات پر عمل نہیں کیا
کوڈنگ
ہدایات پر عمل نہیں کیا
دیکھیں کہ کوڈنگ میں کن AI ماڈلز کو ہدایات پر عمل نہیں کیا پیش آنے کا سب سے زیادہ امکان ہے، تاکہ آپ کمزوریاں جلدی پہچان سکیں۔ ترتیب دیں حسب: کل لاگت ↓.
ناکامی کی وجوہات
25/25
ماڈلز فلٹر کریں
موجودہ تلاش اور فلٹرز سے کوئی ماڈل مطابقت نہیں رکھتا۔
| درجہ | ماڈل | کمپنی | ہدایات پر عمل نہیں کیا کی تعداد | زمرہ اسکور | کل لاگت | درست ٹیسٹس | ردِعمل کا وقت (اوسط) |
|---|---|---|---|---|---|---|---|
| #74 | Claude Opus 4.6 medium | Anthropic | 1 | 5.7 | $2.961 | 1/3 | 30.1s |
| #95 | Qwen3.8 2.4T A95B high | Qwen | 1 | 5.9 | $2.357 | 1/3 | 160.5s |
| #126 | Seed-2.0-Code high | Bytedance Seed | 1 | 6.2 | $1.273 | 1/3 | 266.7s |
| #104 | Claude Opus 4.8 none | Anthropic | 1 | 5.5 | $1.166 | 1/3 | 3.29s |
| #176 | Trinity Large Thinking medium | Arcee AI | 1 | 7.5 | $0.798 | 2/3 | 179.0s |
| #18 | Gemini 3.5 Flash medium | 1 | 7.9 | $0.665 | 2/3 | 12.6s | |
| #252 | Trinity Large Thinking high | Arcee AI | 1 | 3.7 | $0.624 | 0/3 | 245.0s |
| #133 | DeepSeek V4 Pro none | DeepSeek | 1 | 5.6 | $0.351 | 1/3 | 13.4s |
| #141 | Gemini 3.5 Flash minimal | 1 | 5.6 | $0.300 | 1/3 | 2.75s | |
| #42 | Qwen3.8 27B high | Qwen | 1 | 8.1 | ~$0.287 | 2/3 | 248.6s |
| #203 | Kimi K2.6 none | Moonshot AI | 1 | 5.5 | $0.230 | 1/3 | 82.6s |
| #138 | GLM 5.2 none | Z.ai | 1 | 3.7 | $0.153 | 0/3 | 7.55s |
| #54 | DeepSeek V4 Flash 0731 high | DeepSeek | 1 | 6.3 | $0.134 | 1/3 | 252.7s |
| #179 | Qwen3.5 Plus 2026-04-20 none | Qwen | 1 | 3.9 | $0.122 | 0/3 | 1.69s |
| #258 | Grok 4.1 Fast medium | X AI | 1 | 7.8 | $0.069 | 0/1 | 23.6s |