ہدایات کی پیروی: غلط جواب
ہدایات کی پیروی
غلط جواب
دیکھیں کہ ہدایات کی پیروی میں کن AI ماڈلز کو غلط جواب پیش آنے کا سب سے زیادہ امکان ہے، تاکہ آپ کمزوریاں جلدی پہچان سکیں۔
ناکامی کی وجوہات
61/61
ماڈلز فلٹر کریں
موجودہ تلاش اور فلٹرز سے کوئی ماڈل مطابقت نہیں رکھتا۔
| درجہ | ماڈل | کمپنی | غلط جواب کی تعداد | زمرہ اسکور | کل لاگت | درست ٹیسٹس | ردِعمل کا وقت (اوسط) |
|---|---|---|---|---|---|---|---|
| #126 | Qwen3.5 Plus 2026-04-20 none | Qwen | 1 | 6.2 | $0.122 | 1/2 | 1.17s |
| #127 | Qwen3.5-35B-A3B none | Qwen | 1 | 6.3 | $0.106 | 1/2 | 809ms |
| #136 | GPT-5.4 Mini none | OpenAI | 1 | 6.3 | $0.095 | 1/2 | 728ms |
| #138 | Kimi K2.6 none | Moonshot AI | 1 | 6.5 | $0.184 | 1/2 | 1.64s |
| #139 | GPT-5.4 none | OpenAI | 1 | 6.5 | $0.397 | 1/2 | 1.07s |
| #142 | Qwen3.5-122B-A10B none | Qwen | 1 | 6.3 | $0.247 | 1/2 | 513ms |
| #145 | GLM 5V Turbo none | Z.ai | 1 | 6.5 | $0.052 | 1/2 | 1.97s |
| #146 | Owl Alpha medium | Openrouter | 1 | 6.5 | $0.000 | 1/2 | 10.2s |
| #147 | Mimo V2 PRO none | Xiaomi | 1 | 6.5 | $0.045 | 1/2 | 2.51s |
| #148 | Owl Alpha none | Openrouter | 1 | 6.4 | $0.000 | 1/2 | 2.63s |
| #152 | Qwen3.6 27B none | Qwen | 1 | 6.2 | $0.087 | 1/2 | 1.92s |
| #154 | MiMo-V2.5-Pro none | Xiaomi | 1 | 6.4 | $0.068 | 1/2 | 1.03s |
| #155 | Kimi K2.5 none | Moonshot AI | 1 | 6.5 | $0.127 | 1/2 | 2.67s |
| #156 | Gemma 4 26B A4B none | 1 | 6.3 | $0.015 | 1/2 | 690ms | |
| #157 | Mimo V2 Omni none | Xiaomi | 1 | 6.5 | $0.021 | 1/2 | 4.26s |