AI BENCHY
Your ad here

Eșecuri AI BENCHY

Eșecuri Răspuns greșit

Vezi ce modele AI se lovesc cel mai des de Răspuns greșit, ca să identifici riscurile de fiabilitate înainte să alegi. Sortează după: Teste corecte ↓.

Modele afișate

15

Eșecuri totale

572

Modelul cel mai afectat

Gemini 3.1 Pro Preview 1
Rang Model Companie Număr de Răspuns greșit Scor Teste corecte Timp de răspuns (mediu)
#17 Gemini 3.1 Flash Lite Preview medium Google 4 8.2 13/18 3.74s
#19 Qwen3.5-122B-A10B medium Qwen 3 8.1 13/18 31.4s
#20 Qwen3.6 Plus medium Qwen 3 8.1 13/18 15.3s
#21 Gemini 3 Flash Preview none Google 5 8.1 13/18 1.65s
#22 Gemini 3.1 Flash Lite Preview low Google 4 8.1 13/18 3.22s
#24 Gemma 4 26B A4B medium Google 2 8.0 13/18 25.0s
#26 Claude Sonnet 4.6 medium Anthropic 2 8.0 13/18 12.7s
#18 GLM 5 Turbo medium Z.ai 3 8.1 12/18 17.7s
#23 MiMo-V2-Pro medium Xiaomi 3 8.1 12/18 12.3s
#25 Grok 4.20 Beta medium X AI 3 8.0 12/18 9.81s
#27 DeepSeek V3.2 medium DeepSeek 3 8.0 12/18 46.4s
#28 GPT-5.2 Chat none OpenAI 5 7.9 12/18 6.84s
#29 Gemini 3.1 Flash Lite Preview none Google 4 7.9 12/18 1.30s
#33 GLM 5.1 medium Z.ai 3 7.8 12/18 24.1s
#37 Claude Opus 4.6 medium Anthropic 2 7.6 12/18 21.1s

Top modele după Număr de Răspuns greșit

Număr de Răspuns greșit vs Scor

Top modele după Timp de răspuns (mediu)