डेटा पार्सिंग और निष्कर्षण: गलत उत्तर
डेटा पार्सिंग और निष्कर्षण
गलत उत्तर
देखें कि डेटा पार्सिंग और निष्कर्षण में किन AI मॉडलों में गलत उत्तर आने की सबसे अधिक संभावना है, ताकि आप कमजोरियाँ जल्दी पहचान सकें।
विफलता के कारण
59/59
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | गलत उत्तर संख्या | श्रेणी स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #199 | GPT-5 Nano medium | OpenAI | 2 | 3.7 | $0.118 | 0/2 | 21.4s |
| #284 | MiniMax M2.5 medium | Minimax | 2 | 4.6 | $0.327 | 0/2 | 7.48s |
| #291 | Granite 4.2 8B none | IBM Granite | 2 | 2.9 | $0.026 | 0/2 | 1.05s |
| #298 | Granite 4.1 8B none | IBM Granite | 2 | 3.0 | $0.007 | 0/2 | 575ms |
| #301 | Ling 3.0 Tiny high | Inclusionai | 2 | 2.8 | $0.000 | 0/2 | 4.16s |
| #309 | Nemotron 3 Nano Omni 30b A3b Reasoning none | NVIDIA | 2 | 3.8 | $0.000 | 0/2 | 1.42s |
| #311 | LFM2-24B-A2B none | Liquid | 2 | 3.0 | $0.001 | 0/2 | 714ms |
| #31 | Claude Opus 4.8 medium | Anthropic | 1 | 7.1 | $1.983 | 1/2 | 12.3s |
| #76 | Qwen3.8 27B medium | Qwen | 1 | 6.5 | ~$0.058 | 1/2 | 8.76s |
| #78 | Claude Opus 4.8 low | Anthropic | 1 | 6.3 | $2.089 | 1/2 | 2.27s |
| #115 | Claude Opus 4.8 none | Anthropic | 1 | 7.3 | $1.166 | 1/2 | 1.77s |
| #118 | Muse Glimmer 30B high | Meta | 1 | 7.3 | $0.430 | 1/2 | 14.9s |
| #121 | Muse Glimmer 30B medium | Meta | 1 | 7.3 | $0.227 | 1/2 | 7.20s |
| #124 | Step 3.7 Flash low | Stepfun | 1 | 7.3 | $0.390 | 1/2 | 2.29s |
| #131 | Mercury 2 medium | Inception | 1 | 7.3 | $0.094 | 1/2 | 1.11s |