معلومات عامہ: غلط جواب
معلومات عامہ
غلط جواب
دیکھیں کہ معلومات عامہ میں کن AI ماڈلز کو غلط جواب پیش آنے کا سب سے زیادہ امکان ہے، تاکہ آپ کمزوریاں جلدی پہچان سکیں۔ ترتیب دیں حسب: درست ٹیسٹس ↑.
ناکامی کی وجوہات
197/197
ماڈلز فلٹر کریں
موجودہ تلاش اور فلٹرز سے کوئی ماڈل مطابقت نہیں رکھتا۔
| درجہ | ماڈل | کمپنی | غلط جواب کی تعداد | زمرہ اسکور | کل لاگت | درست ٹیسٹس | ردِعمل کا وقت (اوسط) |
|---|---|---|---|---|---|---|---|
| #6 | GPT-5.6 Sol medium | OpenAI | 1 | 4.7 | $1.316 | 0/1 | 4.94s |
| #7 | GPT-5.6 Sol high | OpenAI | 1 | 4.7 | $1.234 | 0/1 | 6.97s |
| #8 | GPT-5.5 low | OpenAI | 1 | 3.0 | $1.253 | 0/1 | 10.1s |
| #12 | Qwen3.7 Max medium | Qwen | 1 | 3.0 | $1.116 | 0/1 | 33.4s |
| #14 | Qwen3.8 Max medium | Qwen | 1 | 3.0 | $0.728 | 0/1 | 11.5s |
| #15 | GPT-5.5 medium | OpenAI | 1 | 2.8 | $4.137 | 0/1 | 37.9s |
| #18 | GPT-5.3-Codex medium | OpenAI | 1 | 2.8 | $0.920 | 0/1 | 14.4s |
| #20 | Muse Spark 1.2 high | Meta | 1 | 3.0 | $1.632 | 0/1 | 15.0s |
| #21 | Gemini 3.5 Flash Lite high | 1 | 3.0 | $0.538 | 0/1 | 9.68s | |
| #23 | Claude Opus 4.7 medium | Anthropic | 1 | 3.0 | $1.477 | 0/1 | 2.25s |
| #24 | Qwen3.8 Max low | Qwen | 1 | 3.0 | $0.687 | 0/1 | 12.4s |
| #25 | Muse Spark 1.2 medium | Meta | 1 | 3.0 | $1.227 | 0/1 | 12.8s |
| #26 | Muse Spark 1.1 medium | Meta | 1 | 3.0 | $1.357 | 0/1 | 18.5s |
| #28 | Claude Opus 5 low | Anthropic | 1 | 3.0 | $1.121 | 0/1 | 6.48s |
| #29 | GPT-5.4 medium | OpenAI | 1 | 3.0 | $1.533 | 0/1 | 14.0s |