عمومی ذہانت: غلط جواب
عمومی ذہانت
غلط جواب
دیکھیں کہ عمومی ذہانت میں کن AI ماڈلز کو غلط جواب پیش آنے کا سب سے زیادہ امکان ہے، تاکہ آپ کمزوریاں جلدی پہچان سکیں۔
ناکامی کی وجوہات
90/90
ماڈلز فلٹر کریں
موجودہ تلاش اور فلٹرز سے کوئی ماڈل مطابقت نہیں رکھتا۔
| درجہ | ماڈل | کمپنی | غلط جواب کی تعداد | زمرہ اسکور | کل لاگت | درست ٹیسٹس | ردِعمل کا وقت (اوسط) |
|---|---|---|---|---|---|---|---|
| #43 | Grok 4.5 medium | X AI | 1 | 6.5 | $2.042 | 0/1 | 12.8s |
| #45 | Grok 4.6 medium | X AI | 1 | 4.1 | $1.713 | 0/1 | 17.3s |
| #46 | Grok 4.5 low | X AI | 1 | 6.1 | $0.945 | 0/1 | 4.88s |
| #50 | Inkling Small high | Thinkingmachines | 1 | 5.3 | $0.398 | 0/1 | 3.62s |
| #56 | Qwen3.8 2.4T A95B low | Qwen | 1 | 6.1 | $2.672 | 0/1 | 23.0s |
| #58 | Muse Glimmer 30B xhigh | Meta | 1 | 5.5 | $0.510 | 0/1 | 7.41s |
| #61 | DeepSeek V4 Flash 0731 low | DeepSeek | 1 | 6.5 | $0.044 | 0/1 | 7.63s |
| #65 | GPT-5.6 Terra high | OpenAI | 1 | 5.1 | $0.836 | 0/1 | 3.03s |
| #68 | Step 3.7 Flash medium | Stepfun | 1 | 4.0 | $0.495 | 0/1 | 6.85s |
| #74 | GPT-5.6 Terra medium | OpenAI | 1 | 5.5 | $0.523 | 0/1 | 2.37s |
| #79 | Qwen3.7 Flash high | Qwen | 1 | 5.1 | $0.052 | 0/1 | 10.7s |
| #85 | GLM 5 Turbo medium | Z.ai | 1 | 6.1 | $0.323 | 0/1 | 10.1s |
| #86 | GPT-5.6 Luna high | OpenAI | 1 | 5.0 | $0.179 | 0/1 | 3.65s |
| #91 | GPT-5.6 Terra low | OpenAI | 1 | 4.8 | $0.420 | 0/1 | 3.52s |
| #98 | Grok Build 0.1 medium | X AI | 1 | 4.4 | $1.130 | 0/1 | 18.4s |