डोमेन-विशिष्ट: गलत उत्तर
डोमेन-विशिष्ट
गलत उत्तर
देखें कि डोमेन-विशिष्ट में किन AI मॉडलों में गलत उत्तर आने की सबसे अधिक संभावना है, ताकि आप कमजोरियाँ जल्दी पहचान सकें।
विफलता के कारण
303/303
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | गलत उत्तर संख्या | श्रेणी स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #297 | Hunter Alpha none | OpenRouter | 2 | 5.3 | $0.000 | 1/3 | 2.33s |
| #298 | Grok 4.20 none | X AI | 2 | 3.0 | $0.057 | 0/3 | 687ms |
| #299 | Laguna Xs.2 medium | Poolside | 2 | 4.1 | $0.015 | 0/3 | 11.1s |
| #300 | Hy3 preview none | Tencent | 2 | 3.6 | $0.007 | 0/3 | 17.6s |
| #301 | MiMo-V2-Flash none | Xiaomi | 2 | 5.3 | $0.025 | 1/3 | 564ms |
| #302 | Ling 3.0 Tiny none | Inclusionai | 2 | 3.0 | $0.000 | 0/3 | 880ms |
| #305 | Grok Build 0.1 none | X AI | 2 | 3.6 | $0.547 | 0/3 | 103.7s |
| #308 | Grok 4.1 Fast none | X AI | 2 | 5.9 | $0.008 | 1/3 | 1.06s |
| #311 | Laguna Xs.2 none | Poolside | 2 | 5.3 | $0.004 | 1/3 | 371ms |
| #313 | Nemotron 3 Nano Omni 30b A3b Reasoning medium | NVIDIA | 2 | 2.9 | $0.000 | 0/3 | 56.7s |
| #1 | Gemini 3.6 Flash high | 1 | 8.2 | $0.699 | 2/3 | 33.3s | |
| #4 | GPT-6 Astra high | OpenAI | 1 | 7.6 | $3.474 | 2/3 | 95.1s |
| #5 | GPT-6 Astra xhigh | OpenAI | 1 | 7.6 | $5.156 | 2/3 | 147.0s |
| #9 | GPT-6 Astra low | OpenAI | 1 | 7.7 | $1.289 | 2/3 | 13.9s |
| #10 | Gemini 3 Flash Preview medium | 1 | 7.7 | $0.763 | 2/3 | 20.1s |