डेटा पार्सिंग और निष्कर्षण: गलत उत्तर
डेटा पार्सिंग और निष्कर्षण
गलत उत्तर
देखें कि डेटा पार्सिंग और निष्कर्षण में किन AI मॉडलों में गलत उत्तर आने की सबसे अधिक संभावना है, ताकि आप कमजोरियाँ जल्दी पहचान सकें।
विफलता के कारण
36/36
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | गलत उत्तर संख्या | श्रेणी स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #109 | Mimo V2 PRO medium | Xiaomi | 1 | 7.3 | $0.333 | 1/2 | 17.2s |
| #121 | gpt-oss-120b medium | OpenAI | 1 | 6.4 | $0.019 | 1/2 | 1.98s |
| #144 | KAT-Coder-Air V2.5 high | Kwaipilot | 1 | 6.5 | $0.077 | 1/2 | 3.59s |
| #149 | KAT-Coder-Air V2.5 medium | Kwaipilot | 1 | 6.5 | $0.048 | 1/2 | 3.65s |
| #152 | Qwen3.6 27B none | Qwen | 1 | 7.3 | $0.087 | 1/2 | 2.06s |
| #155 | Kimi K2.5 none | Moonshot AI | 1 | 7.3 | $0.127 | 1/2 | 42.1s |
| #158 | KAT-Coder-Air V2.5 low | Kwaipilot | 1 | 6.5 | $0.041 | 1/2 | 2.82s |
| #166 | Qwen3 Coder Next none | Qwen | 1 | 6.5 | $0.025 | 1/2 | 1.32s |
| #172 | MiniMax M2.7 medium | Minimax | 1 | 6.3 | $0.163 | 1/2 | 21.9s |
| #173 | DeepSeek V3.2 none | DeepSeek | 1 | 6.3 | $0.054 | 1/2 | 9.42s |
| #176 | GLM 4.7 Flash none | Z.ai | 1 | 7.3 | $0.016 | 1/2 | 4.82s |
| #178 | Ling-2.6-flash none | Inclusionai | 1 | 6.5 | $0.002 | 1/2 | 8.48s |
| #179 | Ring-2.6-1T none | Inclusionai | 1 | 3.0 | $0.026 | 0/2 | 45.9s |
| #180 | GPT-5.4 Nano none | OpenAI | 1 | 6.5 | $0.041 | 1/2 | 1.11s |
| #187 | Qwen3 Coder Next medium | Qwen | 1 | 6.5 | $0.032 | 1/2 | 81.8s |