ہدایات کی پیروی: غلط جواب
ہدایات کی پیروی
غلط جواب
دیکھیں کہ ہدایات کی پیروی میں کن AI ماڈلز کو غلط جواب پیش آنے کا سب سے زیادہ امکان ہے، تاکہ آپ کمزوریاں جلدی پہچان سکیں۔
ناکامی کی وجوہات
82/82
ماڈلز فلٹر کریں
موجودہ تلاش اور فلٹرز سے کوئی ماڈل مطابقت نہیں رکھتا۔
| درجہ | ماڈل | کمپنی | غلط جواب کی تعداد | زمرہ اسکور | کل لاگت | درست ٹیسٹس | ردِعمل کا وقت (اوسط) |
|---|---|---|---|---|---|---|---|
| #104 | LongCat 2.0 medium | Meituan | 1 | 6.5 | $0.499 | 1/2 | 7.38s |
| #108 | Claude Sonnet 4.6 none | Anthropic | 1 | 6.5 | $0.661 | 1/2 | 1.96s |
| #113 | Qwen3.7 Plus none | Qwen | 1 | 6.3 | $0.106 | 1/2 | 929ms |
| #129 | GLM 5.1 medium | Z.ai | 1 | 6.4 | $0.727 | 1/2 | 7.47s |
| #130 | GPT-5.5 none | OpenAI | 1 | 6.2 | $0.544 | 1/2 | 1.15s |
| #137 | Qwen3.7 Flash medium | Qwen | 1 | 5.8 | $0.065 | 0/2 | 9.27s |
| #145 | DeepSeek V4 Pro none | DeepSeek | 1 | 6.3 | $0.226 | 1/2 | 4.12s |
| #148 | Gemini 3 Flash Preview none | 1 | 6.4 | $0.085 | 1/2 | 1.58s | |
| #152 | LongCat 2.0 low | Meituan | 1 | 6.5 | $0.412 | 1/2 | 6.39s |
| #153 | Gemini 3.5 Flash minimal | 1 | 6.4 | $0.300 | 1/2 | 893ms | |
| #155 | LongCat 2.0 high | Meituan | 1 | 6.5 | $0.492 | 1/2 | 6.96s |
| #158 | Qwen3.5-27B none | Qwen | 1 | 6.3 | $0.058 | 1/2 | 1.03s |
| #172 | LongCat 2.0 none | Meituan | 1 | 6.5 | $0.044 | 1/2 | 2.82s |
| #185 | Qwen3.7 Flash none | Qwen | 1 | 6.3 | $0.019 | 1/2 | 892ms |
| #189 | Trinity Large Thinking medium | Arcee AI | 1 | 4.4 | $0.756 | 0/2 | 3.99s |