संयुक्त: गलत उत्तर
संयुक्त
गलत उत्तर
देखें कि संयुक्त में किन AI मॉडलों में गलत उत्तर आने की सबसे अधिक संभावना है, ताकि आप कमजोरियाँ जल्दी पहचान सकें।
विफलता के कारण
90/90
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | गलत उत्तर संख्या | श्रेणी स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #153 | Gemini 3 Flash Preview none | 1 | 3.8 | $0.085 | 0/2 | 12.4s | |
| #156 | KAT-Coder-Pro V2.5 none | Kwaipilot | 1 | 4.1 | $0.487 | 0/2 | 183.1s |
| #162 | Gemini 3.5 Flash Lite low | 1 | 3.8 | $0.138 | 0/2 | 11.0s | |
| #163 | Qwen3.5-27B none | Qwen | 1 | 6.4 | $0.058 | 1/2 | 39.4s |
| #164 | Gemini 3.1 Flash Lite Preview low | 1 | 3.0 | $0.646 | 0/2 | 160.6s | |
| #166 | Gemini 3.1 Flash Lite low | 1 | 3.2 | $0.621 | 0/2 | 161.2s | |
| #168 | Mercury 2.5 Preview high | Inception | 1 | 3.8 | $0.030 | 0/2 | 14.4s |
| #169 | Qwen3.5 Plus 2026-02-15 none | Qwen | 1 | 6.5 | $0.073 | 1/2 | 64.8s |
| #173 | Gemini 3.1 Flash Lite Preview none | 1 | 3.0 | $0.052 | 0/2 | 6.23s | |
| #174 | Qwen3.6 Max Preview none | Qwen | 1 | 6.5 | $0.228 | 1/2 | 61.6s |
| #177 | LongCat 2.0 none | Meituan | 1 | 6.5 | $0.044 | 1/2 | 28.4s |
| #181 | Mimo V2 PRO medium | Xiaomi | 1 | 2.3 | $0.333 | 0/1 | 64.7s |
| #183 | Seed-2.0-Lite none | Bytedance Seed | 1 | 3.0 | $0.066 | 0/2 | 25.6s |
| #185 | GPT-5.6 Luna low | OpenAI | 1 | 2.8 | $0.051 | 0/2 | 13.7s |
| #187 | Gemini 3.1 Flash Lite minimal | 1 | 3.0 | $0.047 | 0/2 | 7.75s |