AI BENCHY श्रेणी विफलताएँ
पहेली समाधान: गलत उत्तर
पहेली समाधान
गलत उत्तर
देखें कि पहेली समाधान में किन AI मॉडलों में गलत उत्तर आने की सबसे अधिक संभावना है, ताकि आप कमजोरियाँ जल्दी पहचान सकें। क्रमबद्ध करें: विफलता संख्या ↑.
विफलता के कारण
| रैंक | मॉडल | कंपनी | गलत उत्तर संख्या | श्रेणी स्कोर | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|
| #11 | Gemini 3.1 Flash Lite Preview high | 1 | 7.7 | 2/3 | 46.3s | |
| #15 | Gemini 2.5 Flash medium | 1 | 7.7 | 2/3 | 3.94s | |
| #17 | Gemini 3.1 Flash Lite Preview medium | 1 | 7.7 | 2/3 | 3.58s | |
| #21 | Gemini 3 Flash Preview none | 1 | 7.7 | 2/3 | 1.06s | |
| #27 | DeepSeek V3.2 medium | DeepSeek | 1 | 8.2 | 2/3 | 36.9s |
| #28 | GPT-5.2 Chat none | OpenAI | 1 | 7.7 | 2/3 | 4.42s |
| #30 | Step 3.5 Flash medium | Stepfun | 1 | 5.3 | 1/3 | 7.72s |
| #33 | GLM 5.1 medium | Z.ai | 1 | 8.2 | 2/3 | 23.8s |
| #34 | Kimi K2.6 medium | Moonshot AI | 1 | 5.0 | 0/3 | 25.6s |
| #35 | MiMo-V2-Omni medium | Xiaomi | 1 | 6.5 | 1/3 | 3.88s |
| #37 | Claude Opus 4.6 medium | Anthropic | 1 | 7.7 | 2/3 | 4.60s |
| #38 | GPT-5.4 Nano medium | OpenAI | 1 | 4.0 | 0/3 | 3.65s |
| #39 | Seed-2.0-Mini medium | Bytedance Seed | 1 | 8.2 | 2/3 | 25.9s |
| #41 | MiMo-V2-Flash medium | Xiaomi | 1 | 7.7 | 2/3 | 3.77s |
| #43 | Qwen3.5-35B-A3B medium | Qwen | 1 | 6.4 | 1/3 | 31.6s |