डेटा पार्सिंग और निष्कर्षण: गलत उत्तर
डेटा पार्सिंग और निष्कर्षण
गलत उत्तर
देखें कि डेटा पार्सिंग और निष्कर्षण में किन AI मॉडलों में गलत उत्तर आने की सबसे अधिक संभावना है, ताकि आप कमजोरियाँ जल्दी पहचान सकें। क्रमबद्ध करें: कुल लागत ↑.
विफलता के कारण
36/36
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | गलत उत्तर संख्या | श्रेणी स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #188 | Cobuddy medium | Baidu | 1 | 6.3 | $0.000 | 1/2 | 17.4s |
| #193 | Elephant Alpha none | Openrouter | 1 | 6.5 | $0.000 | 1/2 | 1.04s |
| #195 | Elephant Alpha medium | Openrouter | 1 | 6.5 | $0.000 | 1/2 | 979ms |
| #207 | Nemotron 3 Nano Omni 30b A3b Reasoning medium | NVIDIA | 1 | 7.3 | $0.000 | 1/2 | 2.72s |
| #208 | Nemotron 3 Nano Omni 30b A3b Reasoning none | NVIDIA | 2 | 3.8 | $0.000 | 0/2 | 1.42s |
| #210 | LFM2-24B-A2B none | Liquid | 2 | 3.0 | $0.001 | 0/2 | 714ms |
| #178 | Ling-2.6-flash none | Inclusionai | 1 | 6.5 | $0.002 | 1/2 | 8.48s |
| #201 | Granite 4.1 8B none | IBM Granite | 2 | 3.0 | $0.007 | 0/2 | 575ms |
| #176 | GLM 4.7 Flash none | Z.ai | 1 | 7.3 | $0.016 | 1/2 | 4.82s |
| #121 | gpt-oss-120b medium | OpenAI | 1 | 6.4 | $0.019 | 1/2 | 1.98s |
| #166 | Qwen3 Coder Next none | Qwen | 1 | 6.5 | $0.025 | 1/2 | 1.32s |
| #179 | Ring-2.6-1T none | Inclusionai | 1 | 3.0 | $0.026 | 0/2 | 45.9s |
| #189 | Mercury 2 none | Inception | 1 | 7.3 | $0.030 | 1/2 | 667ms |
| #187 | Qwen3 Coder Next medium | Qwen | 1 | 6.5 | $0.032 | 1/2 | 81.8s |
| #180 | GPT-5.4 Nano none | OpenAI | 1 | 6.5 | $0.041 | 1/2 | 1.11s |