عمومی ذہانت: ہدایات پر عمل نہیں کیا
عمومی ذہانت
ہدایات پر عمل نہیں کیا
دیکھیں کہ عمومی ذہانت میں کن AI ماڈلز کو ہدایات پر عمل نہیں کیا پیش آنے کا سب سے زیادہ امکان ہے، تاکہ آپ کمزوریاں جلدی پہچان سکیں۔ ترتیب دیں حسب: ردِعمل کا وقت (اوسط) ↑.
ناکامی کی وجوہات
78/78
ماڈلز فلٹر کریں
موجودہ تلاش اور فلٹرز سے کوئی ماڈل مطابقت نہیں رکھتا۔
| درجہ | ماڈل | کمپنی | ہدایات پر عمل نہیں کیا کی تعداد | زمرہ اسکور | کل لاگت | درست ٹیسٹس | ردِعمل کا وقت (اوسط) |
|---|---|---|---|---|---|---|---|
| #210 | LFM2-24B-A2B none | Liquid | 1 | 4.0 | $0.001 | 0/1 | 395ms |
| #191 | Grok 4.20 Beta none | X AI | 1 | 5.0 | $0.087 | 0/1 | 541ms |
| #169 | Qwen3.5-9B none | Qwen | 1 | 4.4 | $0.021 | 0/1 | 552ms |
| #189 | Mercury 2 none | Inception | 1 | 4.8 | $0.030 | 0/1 | 628ms |
| #106 | Gemini 3.1 Flash Lite Preview none | 1 | 4.0 | $0.052 | 0/1 | 741ms | |
| #120 | Gemini 3.1 Flash Lite minimal | 1 | 4.0 | $0.047 | 0/1 | 791ms | |
| #78 | Mercury 2 medium | Inception | 1 | 4.8 | $0.093 | 0/1 | 821ms |
| #193 | Elephant Alpha none | Openrouter | 1 | 4.0 | $0.000 | 0/1 | 854ms |
| #183 | Trinity Large Preview none | Arcee AI | 1 | 4.5 | $0.008 | 0/1 | 873ms |
| #195 | Elephant Alpha medium | Openrouter | 1 | 4.3 | $0.000 | 0/1 | 920ms |
| #152 | Qwen3.6 27B none | Qwen | 1 | 5.2 | $0.087 | 0/1 | 1.07s |
| #203 | Grok 4.1 Fast none | X AI | 1 | 4.4 | $0.008 | 0/1 | 1.08s |
| #142 | Qwen3.5-122B-A10B none | Qwen | 1 | 5.0 | $0.247 | 0/1 | 1.12s |
| #127 | Qwen3.5-35B-A3B none | Qwen | 1 | 6.5 | $0.106 | 0/1 | 1.19s |
| #180 | GPT-5.4 Nano none | OpenAI | 1 | 3.8 | $0.041 | 0/1 | 1.31s |