संयुक्त: गलत उत्तर
संयुक्त
गलत उत्तर
देखें कि संयुक्त में किन AI मॉडलों में गलत उत्तर आने की सबसे अधिक संभावना है, ताकि आप कमजोरियाँ जल्दी पहचान सकें।
विफलता के कारण
90/90
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | गलत उत्तर संख्या | श्रेणी स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #112 | Gemini 3 Flash Preview low | 2 | 3.0 | $0.185 | 0/2 | 10.2s | |
| #214 | GPT-5.4 none | OpenAI | 2 | 3.0 | $0.397 | 0/2 | 9.26s |
| #256 | Mistral Small 4 none | Mistral | 2 | 3.0 | $0.022 | 0/2 | 7.44s |
| #272 | Nemotron 3 Super none | NVIDIA | 2 | 3.0 | $0.008 | 0/2 | 18.2s |
| #286 | Mercury 2 none | Inception | 2 | 3.0 | $0.030 | 0/2 | 2.56s |
| #38 | Gemini 3.6 Flash low | 1 | 7.3 | $0.251 | 1/2 | 19.8s | |
| #51 | Grok 4.5 low | X AI | 1 | 6.5 | $0.945 | 1/2 | 12.8s |
| #104 | Gemini 3.8 Flash low | 1 | 3.8 | $0.239 | 0/2 | 19.6s | |
| #106 | Qwen3.7 Max none | Qwen | 1 | 6.5 | $0.197 | 1/2 | 37.2s |
| #107 | Kimi K2.7 Code medium | Moonshot AI | 1 | 7.3 | $0.687 | 1/2 | 66.0s |
| #111 | Grok 4.6 low | X AI | 1 | 6.5 | $0.449 | 1/2 | 23.3s |
| #114 | GLM 5.3 high | Z.ai | 1 | 6.4 | $0.403 | 1/2 | 64.0s |
| #132 | GPT-5.6 Sol none | OpenAI | 1 | 6.5 | $0.201 | 1/2 | 8.37s |
| #135 | GPT-5.5 none | OpenAI | 1 | 6.5 | $0.544 | 1/2 | 8.90s |
| #151 | GLM 5.3 low | Z.ai | 1 | 3.8 | $0.257 | 0/2 | 53.0s |