مشترکہ: غلط جواب
مشترکہ
غلط جواب
دیکھیں کہ مشترکہ میں کن AI ماڈلز کو غلط جواب پیش آنے کا سب سے زیادہ امکان ہے، تاکہ آپ کمزوریاں جلدی پہچان سکیں۔
ناکامی کی وجوہات
63/63
ماڈلز فلٹر کریں
موجودہ تلاش اور فلٹرز سے کوئی ماڈل مطابقت نہیں رکھتا۔
| درجہ | ماڈل | کمپنی | غلط جواب کی تعداد | زمرہ اسکور | کل لاگت | درست ٹیسٹس | ردِعمل کا وقت (اوسط) |
|---|---|---|---|---|---|---|---|
| #61 | Gemini 3 Flash Preview low | 2 | 3.0 | $0.177 | 0/2 | 10.2s | |
| #139 | GPT-5.4 none | OpenAI | 2 | 3.0 | $0.397 | 0/2 | 9.26s |
| #165 | Mistral Small 4 none | Mistral | 2 | 3.0 | $0.022 | 0/2 | 7.44s |
| #177 | Nemotron 3 Super none | NVIDIA | 2 | 3.0 | $0.008 | 0/2 | 18.2s |
| #189 | Mercury 2 none | Inception | 2 | 3.0 | $0.030 | 0/2 | 2.56s |
| #20 | Grok 4.5 low | X AI | 1 | 6.5 | $0.935 | 1/2 | 12.8s |
| #52 | Kimi K2.7 Code medium | Moonshot AI | 1 | 7.3 | $0.751 | 1/2 | 66.0s |
| #59 | Qwen3.7 Max none | Qwen | 1 | 6.5 | $0.197 | 1/2 | 37.2s |
| #83 | GPT-5.6 Sol none | OpenAI | 1 | 6.5 | $0.524 | 1/2 | 8.37s |
| #87 | GPT-5.5 none | OpenAI | 1 | 6.5 | $0.544 | 1/2 | 8.90s |
| #89 | Gemini 3 Flash Preview none | 1 | 3.8 | $0.085 | 0/2 | 12.4s | |
| #92 | KAT-Coder-Pro V2.5 none | Kwaipilot | 1 | 4.1 | $0.476 | 0/2 | 183.1s |
| #98 | Qwen3.6 Max Preview none | Qwen | 1 | 6.5 | $0.231 | 1/2 | 61.6s |
| #103 | Qwen3.5-27B none | Qwen | 1 | 6.4 | $0.090 | 1/2 | 39.4s |
| #104 | Gemini 3.1 Flash Lite Preview low | 1 | 3.0 | $0.646 | 0/2 | 160.6s |