مشترکہ: غلط جواب
مشترکہ
غلط جواب
دیکھیں کہ مشترکہ میں کن AI ماڈلز کو غلط جواب پیش آنے کا سب سے زیادہ امکان ہے، تاکہ آپ کمزوریاں جلدی پہچان سکیں۔ ترتیب دیں حسب: درست ٹیسٹس ↓.
ناکامی کی وجوہات
63/63
ماڈلز فلٹر کریں
موجودہ تلاش اور فلٹرز سے کوئی ماڈل مطابقت نہیں رکھتا۔
| درجہ | ماڈل | کمپنی | غلط جواب کی تعداد | زمرہ اسکور | کل لاگت | درست ٹیسٹس | ردِعمل کا وقت (اوسط) |
|---|---|---|---|---|---|---|---|
| #20 | Grok 4.5 low | X AI | 1 | 6.5 | $0.935 | 1/2 | 12.8s |
| #52 | Kimi K2.7 Code medium | Moonshot AI | 1 | 7.3 | $0.751 | 1/2 | 66.0s |
| #59 | Qwen3.7 Max none | Qwen | 1 | 6.5 | $0.197 | 1/2 | 37.2s |
| #83 | GPT-5.6 Sol none | OpenAI | 1 | 6.5 | $0.524 | 1/2 | 8.37s |
| #87 | GPT-5.5 none | OpenAI | 1 | 6.5 | $0.544 | 1/2 | 8.90s |
| #98 | Qwen3.6 Max Preview none | Qwen | 1 | 6.5 | $0.231 | 1/2 | 61.6s |
| #103 | Qwen3.5-27B none | Qwen | 1 | 6.4 | $0.090 | 1/2 | 39.4s |
| #107 | Qwen3.5 Plus 2026-02-15 none | Qwen | 1 | 6.5 | $0.073 | 1/2 | 64.8s |
| #111 | LongCat 2.0 none | Meituan | 1 | 6.5 | $0.044 | 1/2 | 28.4s |
| #126 | Qwen3.5 Plus 2026-04-20 none | Qwen | 1 | 6.4 | $0.122 | 1/2 | 109.7s |
| #136 | GPT-5.4 Mini none | OpenAI | 1 | 6.5 | $0.095 | 1/2 | 6.22s |
| #162 | Ling-2.6-1T none | Inclusionai | 1 | 6.5 | $0.016 | 1/2 | 23.8s |
| #61 | Gemini 3 Flash Preview low | 2 | 3.0 | $0.177 | 0/2 | 10.2s | |
| #89 | Gemini 3 Flash Preview none | 1 | 3.8 | $0.085 | 0/2 | 12.4s | |
| #92 | KAT-Coder-Pro V2.5 none | Kwaipilot | 1 | 4.1 | $0.476 | 0/2 | 183.1s |