AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY श्रेणी अपयशे

अँटी-एआय युक्त्या: चुकीचे उत्तर

अँटी-एआय युक्त्या
चुकीचे उत्तर

अँटी-एआय युक्त्या मध्ये कोणत्या AI मॉडेल्सना चुकीचे उत्तर येण्याची शक्यता जास्त आहे ते पाहा, म्हणजे कमकुवत बाजू लवकर ओळखता येतील.

दाखवलेली मॉडेल्स

15

एकूण अपयशे

245

सर्वाधिक प्रभावित मॉडेल

Gemini 2.5 Flash 4
क्रमांक मॉडेल कंपनी चुकीचे उत्तर संख्या श्रेणी स्कोअर बरोबर चाचण्या प्रतिसाद वेळ (सरासरी)
#158 GLM 4.7 Flash medium Z.ai 2 4.7 1/4 15.0s
#162 Nemotron 3 Nano Omni 30b A3b Reasoning none NVIDIA 2 4.8 1/4 584ms
#163 Granite 4.1 8B none IBM Granite 2 4.9 1/4 844ms
#8 Claude Opus 4.7 none Anthropic 1 8.3 3/4 2.12s
#11 Claude Opus 4.7 medium Anthropic 1 8.3 3/4 1.85s
#13 Grok 4.20 Beta medium X AI 1 8.7 3/4 3.16s
#15 GPT-5.3-Codex medium OpenAI 1 8.7 3/4 4.16s
#19 Seed-2.0-Lite medium Bytedance Seed 1 8.3 3/4 18.0s
#21 GPT-5.4 medium OpenAI 1 8.3 3/4 4.11s
#24 GPT-5.2 Chat none OpenAI 1 8.7 3/4 3.40s
#25 Qwen3.5 Plus 2026-02-15 medium Qwen 1 8.2 3/4 45.8s
#28 Gemini 2.5 Flash medium Google 1 8.4 3/4 6.30s
#31 DeepSeek V4 Flash high DeepSeek 1 8.3 3/4 28.5s
#42 GPT-5.2 medium OpenAI 1 6.5 2/4 7.81s
#45 GPT-5.4 Mini medium OpenAI 1 8.6 3/4 4.05s

चुकीचे उत्तर संख्या नुसार शीर्ष मॉडेल्स

चुकीचे उत्तर संख्या वि स्कोअर

प्रतिसाद वेळ (सरासरी) नुसार शीर्ष मॉडेल्स

अंदाजित वाया गेलेला खर्च नुसार शीर्ष मॉडेल्स