सामान्य ज्ञान: गलत उत्तर
सामान्य ज्ञान
गलत उत्तर
देखें कि सामान्य ज्ञान में किन AI मॉडलों में गलत उत्तर आने की सबसे अधिक संभावना है, ताकि आप कमजोरियाँ जल्दी पहचान सकें।
विफलता के कारण
259/259
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | गलत उत्तर संख्या | श्रेणी स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #55 | Grok 4.5 medium | X AI | 1 | 3.0 | $2.042 | 0/1 | 74.4s |
| #56 | Muse Spark 1.2 low | Meta | 1 | 3.0 | $0.655 | 0/1 | 10.00s |
| #57 | Grok 4.6 medium | X AI | 1 | 3.0 | $1.713 | 0/1 | 46.9s |
| #58 | Grok 4.5 low | X AI | 1 | 3.0 | $0.945 | 0/1 | 14.0s |
| #59 | GPT-5.2 medium | OpenAI | 1 | 3.0 | $1.182 | 0/1 | 28.2s |
| #60 | Qwen3.8 27B high | Qwen | 1 | 3.0 | ~$0.287 | 0/1 | 264.0s |
| #61 | Seed 2.1 Turbo medium | Bytedance Seed | 1 | 3.0 | $1.951 | 0/1 | 91.0s |
| #62 | Inkling Small high | Thinkingmachines | 1 | 3.0 | $0.398 | 0/1 | 49.3s |
| #63 | DeepSeek V4.1 Flash max | DeepSeek | 1 | 3.0 | $1.073 | 0/1 | 98.5s |
| #64 | Muse Spark 1.1 low | Meta | 1 | 3.0 | $0.673 | 0/1 | 8.17s |
| #66 | Gemini 2.5 Flash medium | 1 | 3.0 | $0.644 | 0/1 | 2.76s | |
| #67 | Muse Spark 1.3 low | Meta | 1 | 3.0 | $0.689 | 0/1 | 23.4s |
| #68 | Claude Sonnet 5 medium | Anthropic | 1 | 3.0 | $0.922 | 0/1 | 7.06s |
| #69 | Qwen3.8 2.4T A95B low | Qwen | 1 | 3.0 | $2.672 | 0/1 | 422.5s |
| #70 | GPT-5 Mini medium | OpenAI | 1 | 3.0 | $0.241 | 0/1 | 9.99s |