संयुक्त: गलत उत्तर
संयुक्त
गलत उत्तर
देखें कि संयुक्त में किन AI मॉडलों में गलत उत्तर आने की सबसे अधिक संभावना है, ताकि आप कमजोरियाँ जल्दी पहचान सकें।
विफलता के कारण
63/63
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | गलत उत्तर संख्या | श्रेणी स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #61 | Gemini 3 Flash Preview low | 2 | 3.0 | $0.177 | 0/2 | 10.2s | |
| #139 | GPT-5.4 none | OpenAI | 2 | 3.0 | $0.397 | 0/2 | 9.26s |
| #165 | Mistral Small 4 none | Mistral | 2 | 3.0 | $0.022 | 0/2 | 7.44s |
| #177 | Nemotron 3 Super none | NVIDIA | 2 | 3.0 | $0.008 | 0/2 | 18.2s |
| #189 | Mercury 2 none | Inception | 2 | 3.0 | $0.030 | 0/2 | 2.56s |
| #20 | Grok 4.5 low | X AI | 1 | 6.5 | $0.935 | 1/2 | 12.8s |
| #52 | Kimi K2.7 Code medium | Moonshot AI | 1 | 7.3 | $0.751 | 1/2 | 66.0s |
| #59 | Qwen3.7 Max none | Qwen | 1 | 6.5 | $0.197 | 1/2 | 37.2s |
| #83 | GPT-5.6 Sol none | OpenAI | 1 | 6.5 | $0.524 | 1/2 | 8.37s |
| #87 | GPT-5.5 none | OpenAI | 1 | 6.5 | $0.544 | 1/2 | 8.90s |
| #89 | Gemini 3 Flash Preview none | 1 | 3.8 | $0.085 | 0/2 | 12.4s | |
| #92 | KAT-Coder-Pro V2.5 none | Kwaipilot | 1 | 4.1 | $0.476 | 0/2 | 183.1s |
| #98 | Qwen3.6 Max Preview none | Qwen | 1 | 6.5 | $0.231 | 1/2 | 61.6s |
| #103 | Qwen3.5-27B none | Qwen | 1 | 6.4 | $0.090 | 1/2 | 39.4s |
| #104 | Gemini 3.1 Flash Lite Preview low | 1 | 3.0 | $0.646 | 0/2 | 160.6s |