Samanya Buddhimatta: गलत उत्तर
Samanya Buddhimatta
गलत उत्तर
देखें कि Samanya Buddhimatta में किन AI मॉडलों में गलत उत्तर आने की सबसे अधिक संभावना है, ताकि आप कमजोरियाँ जल्दी पहचान सकें।
विफलता के कारण
90/90
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | गलत उत्तर संख्या | श्रेणी स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #43 | Grok 4.5 medium | X AI | 1 | 6.5 | $2.042 | 0/1 | 12.8s |
| #45 | Grok 4.6 medium | X AI | 1 | 4.1 | $1.713 | 0/1 | 17.3s |
| #46 | Grok 4.5 low | X AI | 1 | 6.1 | $0.945 | 0/1 | 4.88s |
| #50 | Inkling Small high | Thinkingmachines | 1 | 5.3 | $0.398 | 0/1 | 3.62s |
| #56 | Qwen3.8 2.4T A95B low | Qwen | 1 | 6.1 | $2.672 | 0/1 | 23.0s |
| #58 | Muse Glimmer 30B xhigh | Meta | 1 | 5.5 | $0.510 | 0/1 | 7.41s |
| #61 | DeepSeek V4 Flash 0731 low | DeepSeek | 1 | 6.5 | $0.044 | 0/1 | 7.63s |
| #65 | GPT-5.6 Terra high | OpenAI | 1 | 5.1 | $0.836 | 0/1 | 3.03s |
| #68 | Step 3.7 Flash medium | Stepfun | 1 | 4.0 | $0.495 | 0/1 | 6.85s |
| #74 | GPT-5.6 Terra medium | OpenAI | 1 | 5.5 | $0.523 | 0/1 | 2.37s |
| #79 | Qwen3.7 Flash high | Qwen | 1 | 5.1 | $0.052 | 0/1 | 10.7s |
| #85 | GLM 5 Turbo medium | Z.ai | 1 | 6.1 | $0.323 | 0/1 | 10.1s |
| #86 | GPT-5.6 Luna high | OpenAI | 1 | 5.0 | $0.179 | 0/1 | 3.65s |
| #91 | GPT-5.6 Terra low | OpenAI | 1 | 4.8 | $0.420 | 0/1 | 3.52s |
| #98 | Grok Build 0.1 medium | X AI | 1 | 4.4 | $1.130 | 0/1 | 18.4s |