डोमेन-विशिष्ट: गलत उत्तर
डोमेन-विशिष्ट
गलत उत्तर
देखें कि डोमेन-विशिष्ट में किन AI मॉडलों में गलत उत्तर आने की सबसे अधिक संभावना है, ताकि आप कमजोरियाँ जल्दी पहचान सकें।
विफलता के कारण
198/198
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | गलत उत्तर संख्या | श्रेणी स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #101 | MiMo-V2.5 medium | Xiaomi | 1 | 5.3 | $0.082 | 1/3 | 34.5s |
| #109 | Mimo V2 PRO medium | Xiaomi | 1 | 5.3 | $0.333 | 1/3 | 8.82s |
| #110 | Gemma 4 31B medium | 1 | 7.7 | $0.163 | 2/3 | 38.5s | |
| #114 | Qwen3.5-Flash medium | Qwen | 1 | 5.3 | $0.139 | 1/3 | 146.5s |
| #115 | Gemma 4 31B none | 1 | 7.7 | $0.035 | 2/3 | 3.22s | |
| #119 | Qwen3.5-35B-A3B medium | Qwen | 1 | 4.1 | $0.837 | 0/3 | 88.3s |
| #125 | Qwen3.5-Flash none | Qwen | 1 | 7.7 | $0.073 | 2/3 | 905ms |
| #127 | Qwen3.5-35B-A3B none | Qwen | 1 | 7.7 | $0.106 | 2/3 | 485ms |
| #128 | GPT-5 Nano medium | OpenAI | 1 | 5.2 | $0.114 | 1/3 | 204.0s |
| #134 | Mimo V2 Omni medium | Xiaomi | 1 | 3.0 | $0.683 | 0/3 | 47.9s |
| #144 | KAT-Coder-Air V2.5 high | Kwaipilot | 1 | 2.9 | $0.077 | 0/3 | 7.47s |
| #152 | Qwen3.6 27B none | Qwen | 1 | 7.7 | $0.087 | 2/3 | 3.03s |
| #167 | Mistral Small 4 medium | Mistral | 1 | 5.3 | $0.096 | 1/3 | 6.11s |
| #172 | MiniMax M2.7 medium | Minimax | 1 | 3.0 | $0.163 | 0/3 | 19.0s |
| #176 | GLM 4.7 Flash none | Z.ai | 1 | 7.7 | $0.016 | 2/3 | 744ms |