عمومی ذہانت: ہدایات پر عمل نہیں کیا
عمومی ذہانت
ہدایات پر عمل نہیں کیا
دیکھیں کہ عمومی ذہانت میں کن AI ماڈلز کو ہدایات پر عمل نہیں کیا پیش آنے کا سب سے زیادہ امکان ہے، تاکہ آپ کمزوریاں جلدی پہچان سکیں۔ ترتیب دیں حسب: کل لاگت ↑.
ناکامی کی وجوہات
78/78
ماڈلز فلٹر کریں
موجودہ تلاش اور فلٹرز سے کوئی ماڈل مطابقت نہیں رکھتا۔
| درجہ | ماڈل | کمپنی | ہدایات پر عمل نہیں کیا کی تعداد | زمرہ اسکور | کل لاگت | درست ٹیسٹس | ردِعمل کا وقت (اوسط) |
|---|---|---|---|---|---|---|---|
| #146 | Owl Alpha medium | Openrouter | 1 | 4.3 | $0.000 | 0/1 | 58.6s |
| #148 | Owl Alpha none | Openrouter | 1 | 4.3 | $0.000 | 0/1 | 4.61s |
| #184 | Hunter Alpha medium | OpenRouter | 1 | 7.0 | $0.000 | 0/1 | 6.44s |
| #188 | Cobuddy medium | Baidu | 1 | 4.2 | $0.000 | 0/1 | 23.2s |
| #193 | Elephant Alpha none | Openrouter | 1 | 4.0 | $0.000 | 0/1 | 854ms |
| #195 | Elephant Alpha medium | Openrouter | 1 | 4.3 | $0.000 | 0/1 | 920ms |
| #196 | Hunter Alpha none | OpenRouter | 1 | 6.1 | $0.000 | 0/1 | 2.71s |
| #210 | LFM2-24B-A2B none | Liquid | 1 | 4.0 | $0.001 | 0/1 | 395ms |
| #199 | Hy3 preview none | Tencent | 1 | 4.1 | $0.003 | 0/1 | 16.1s |
| #203 | Grok 4.1 Fast none | X AI | 1 | 4.4 | $0.008 | 0/1 | 1.08s |
| #183 | Trinity Large Preview none | Arcee AI | 1 | 4.5 | $0.008 | 0/1 | 873ms |
| #156 | Gemma 4 26B A4B none | 1 | 4.0 | $0.015 | 0/1 | 3.54s | |
| #162 | Ling-2.6-1T none | Inclusionai | 1 | 5.0 | $0.016 | 0/1 | 20.3s |
| #121 | gpt-oss-120b medium | OpenAI | 1 | 4.3 | $0.019 | 0/1 | 7.90s |
| #209 | Step 3.5 Flash none | Stepfun | 1 | 4.0 | $0.020 | 0/1 | 14.4s |