کوڈنگ: ہدایات پر عمل نہیں کیا
کوڈنگ
ہدایات پر عمل نہیں کیا
دیکھیں کہ کوڈنگ میں کن AI ماڈلز کو ہدایات پر عمل نہیں کیا پیش آنے کا سب سے زیادہ امکان ہے، تاکہ آپ کمزوریاں جلدی پہچان سکیں۔ ترتیب دیں حسب: کل لاگت ↓.
ناکامی کی وجوہات
38/38
ماڈلز فلٹر کریں
موجودہ تلاش اور فلٹرز سے کوئی ماڈل مطابقت نہیں رکھتا۔
| درجہ | ماڈل | کمپنی | ہدایات پر عمل نہیں کیا کی تعداد | زمرہ اسکور | کل لاگت | درست ٹیسٹس | ردِعمل کا وقت (اوسط) |
|---|---|---|---|---|---|---|---|
| #243 | Claude Fable 5.1 low | Anthropic | 2 | 0.3 | $3.395 | 0/3 | 6.75s |
| #232 | Claude Opus 4.6 medium | Anthropic | 1 | 0.6 | $2.961 | 1/3 | 30.1s |
| #108 | Qwen3.8 2.4T A95B high | Qwen | 1 | 0.6 | $2.949 | 1/3 | 160.5s |
| #178 | Claude Opus 4.8 none | Anthropic | 1 | 0.5 | $2.334 | 1/3 | 3.29s |
| #131 | Seed-2.0-Code high | Bytedance Seed | 1 | 0.6 | $1.448 | 1/3 | 266.7s |
| #130 | Mistral Large 4 high | Mistral | 1 | 0.3 | $1.391 | 0/3 | 1277.8s |
| #107 | Gemini 3.5 Flash medium | 1 | 0.8 | $1.316 | 2/3 | 12.6s | |
| #204 | Claude Sonnet 5.5 medium | Anthropic | 2 | 0.3 | $1.100 | 0/3 | 6.07s |
| #177 | Claude Sonnet 5.5 low | Anthropic | 2 | 0.3 | $0.909 | 0/3 | 5.81s |
| #245 | Trinity Large Thinking medium | Arcee AI | 1 | 0.8 | $0.862 | 2/3 | 179.0s |
| #269 | Trinity Large Thinking high | Arcee AI | 1 | 0.4 | $0.794 | 0/3 | 245.0s |
| #77 | DeepSeek V4 Flash 0731 high | DeepSeek | 1 | 0.6 | $0.576 | 1/3 | 252.7s |
| #219 | Gemini 3.5 Flash minimal | 1 | 0.6 | $0.508 | 1/3 | 2.75s | |
| #282 | Kimi K2.6 none | Moonshot AI | 1 | 0.6 | $0.486 | 1/3 | 82.6s |
| #266 | DeepSeek V4.1 Flash none | DeepSeek | 1 | 0.6 | $0.391 | 1/3 | 83.7s |