عمومی ذہانت: ہدایات پر عمل نہیں کیا
عمومی ذہانت
ہدایات پر عمل نہیں کیا
دیکھیں کہ عمومی ذہانت میں کن AI ماڈلز کو ہدایات پر عمل نہیں کیا پیش آنے کا سب سے زیادہ امکان ہے، تاکہ آپ کمزوریاں جلدی پہچان سکیں۔
ناکامی کی وجوہات
115/115
ماڈلز فلٹر کریں
موجودہ تلاش اور فلٹرز سے کوئی ماڈل مطابقت نہیں رکھتا۔
| درجہ | ماڈل | کمپنی | ہدایات پر عمل نہیں کیا کی تعداد | زمرہ اسکور | کل لاگت | درست ٹیسٹس | ردِعمل کا وقت (اوسط) |
|---|---|---|---|---|---|---|---|
| #24 | Grok 4.5 high | X AI | 1 | 4.7 | $2.252 | 0/1 | 9.82s |
| #25 | GPT-5.3-Codex medium | OpenAI | 1 | 4.6 | $0.988 | 0/1 | 4.87s |
| #27 | Seed 2.1 Turbo high | Bytedance Seed | 1 | 6.5 | $1.797 | 0/1 | 25.7s |
| #37 | Muse Spark 1.2 medium | Meta | 1 | 6.1 | $1.339 | 0/1 | 10.7s |
| #41 | Qwen3.8 Max low | Qwen | 1 | 6.5 | $0.702 | 0/1 | 5.29s |
| #42 | GPT-5.4 medium | OpenAI | 1 | 4.7 | $1.560 | 0/1 | 4.92s |
| #44 | Muse Spark 1.2 low | Meta | 1 | 5.0 | $0.655 | 0/1 | 8.46s |
| #47 | GPT-5.2 medium | OpenAI | 1 | 3.7 | $1.182 | 0/1 | 4.32s |
| #48 | Qwen3.8 27B high | Qwen | 1 | 5.0 | ~$0.287 | 0/1 | 8.45s |
| #49 | Seed 2.1 Turbo medium | Bytedance Seed | 1 | 6.1 | $1.951 | 0/1 | 40.6s |
| #53 | Gemini 2.5 Flash medium | 1 | 4.8 | $0.644 | 0/1 | 4.86s | |
| #55 | Claude Sonnet 5 medium | Anthropic | 1 | 4.8 | $0.922 | 0/1 | 4.32s |
| #57 | GPT-5 Mini medium | OpenAI | 1 | 4.5 | $0.241 | 0/1 | 13.5s |
| #67 | GPT-5.2 Chat none | OpenAI | 1 | 4.4 | $0.594 | 0/1 | 3.20s |
| #69 | Qwen3.8 27B low | Qwen | 1 | 5.0 | ~$0.071 | 0/1 | 5.37s |