عمومی ذہانت: غلط جواب
عمومی ذہانت
غلط جواب
دیکھیں کہ عمومی ذہانت میں کن AI ماڈلز کو غلط جواب پیش آنے کا سب سے زیادہ امکان ہے، تاکہ آپ کمزوریاں جلدی پہچان سکیں۔
ناکامی کی وجوہات
59/59
ماڈلز فلٹر کریں
موجودہ تلاش اور فلٹرز سے کوئی ماڈل مطابقت نہیں رکھتا۔
| درجہ | ماڈل | کمپنی | غلط جواب کی تعداد | زمرہ اسکور | کل لاگت | درست ٹیسٹس | ردِعمل کا وقت (اوسط) |
|---|---|---|---|---|---|---|---|
| #122 | Gemini 3.1 Flash Lite none | 1 | 4.0 | $0.046 | 0/1 | 992ms | |
| #129 | Nemotron 3 Ultra none | NVIDIA | 1 | 5.0 | $0.095 | 0/1 | 13.5s |
| #132 | GPT-5.6 Terra none | OpenAI | 1 | 5.0 | $0.349 | 0/1 | 1.03s |
| #134 | Mimo V2 Omni medium | Xiaomi | 1 | 5.4 | $0.683 | 0/1 | 3.61s |
| #137 | North Mini Code medium | Cohere | 1 | 5.1 | $0.000 | 0/1 | 25.1s |
| #139 | GPT-5.4 none | OpenAI | 1 | 4.4 | $0.397 | 0/1 | 1.78s |
| #144 | KAT-Coder-Air V2.5 high | Kwaipilot | 1 | 5.1 | $0.077 | 0/1 | 7.10s |
| #150 | DeepSeek V4 Flash none | DeepSeek | 1 | 4.2 | $0.044 | 0/1 | 23.7s |
| #151 | GLM 5.1 none | Z.ai | 1 | 5.0 | $0.164 | 0/1 | 790ms |
| #154 | MiMo-V2.5-Pro none | Xiaomi | 1 | 4.0 | $0.068 | 0/1 | 2.58s |
| #157 | Mimo V2 Omni none | Xiaomi | 1 | 4.1 | $0.021 | 0/1 | 2.33s |
| #159 | GPT-5.6 Luna none | OpenAI | 1 | 5.0 | $0.142 | 0/1 | 1.00s |
| #160 | Laguna XS 2.1 none | Poolside | 1 | 5.0 | $0.008 | 0/1 | 529ms |
| #161 | Qwen3.6 35B A3B none | Qwen | 1 | 4.4 | $0.061 | 0/1 | 3.51s |
| #164 | Inkling none | Thinkingmachines | 1 | 5.0 | $0.147 | 0/1 | 859ms |