संयुक्त: गलत उत्तर
संयुक्त
गलत उत्तर
देखें कि संयुक्त में किन AI मॉडलों में गलत उत्तर आने की सबसे अधिक संभावना है, ताकि आप कमजोरियाँ जल्दी पहचान सकें।
विफलता के कारण
90/90
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | गलत उत्तर संख्या | श्रेणी स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #252 | Dots 3 Note Preview none | Dots Studio | 1 | 3.0 | $0.000 | 0/2 | 14.8s |
| #253 | Inkling none | Thinkingmachines | 1 | 2.9 | $0.147 | 0/2 | 25.7s |
| #257 | Mistral Small 4 medium | Mistral | 1 | 3.0 | $0.097 | 0/2 | 32.4s |
| #259 | Qwen3 Coder Next none | Qwen | 1 | 3.0 | $0.026 | 0/2 | 30.9s |
| #260 | MiMo-V2.5 none | Xiaomi | 1 | 3.0 | $0.025 | 0/2 | 28.9s |
| #262 | GLM 5 Turbo none | Z.ai | 1 | 1.5 | $0.047 | 0/1 | 4.89s |
| #265 | Mercury 2.5 Preview low | Inception | 1 | 3.0 | $0.011 | 0/2 | 4.77s |
| #266 | Laguna S 2.1 low | Poolside | 1 | 3.2 | $0.082 | 0/2 | 412.5s |
| #268 | GPT-4o-mini none | OpenAI | 1 | 3.0 | $0.010 | 0/2 | 6.32s |
| #270 | Mercury 2.5 Preview none | Inception | 1 | 3.0 | $0.018 | 0/2 | 31.3s |
| #273 | Hy4 preview none | Tencent | 1 | 3.0 | $0.041 | 0/2 | 75.1s |
| #276 | GPT-5.4 Nano none | OpenAI | 1 | 3.0 | $0.041 | 0/2 | 14.7s |
| #279 | KAT-Coder-Air V2.5 none | Kwaipilot | 1 | 3.8 | $0.070 | 0/2 | 73.0s |
| #281 | Trinity Large Preview none | Arcee AI | 1 | 1.5 | $0.008 | 0/1 | 8.91s |
| #288 | Qwen3 Coder Next medium | Qwen | 1 | 3.0 | $0.034 | 0/2 | 14.6s |