AI BENCHY
Your ad here

Eșecuri AI BENCHY

Eșecuri Răspuns greșit

Vezi ce modele AI se lovesc cel mai des de Răspuns greșit, ca să identifici riscurile de fiabilitate înainte să alegi. Sortează după: Număr de eșecuri ↑.

Modele afișate

15

Eșecuri totale

572

Modelul cel mai afectat

Gemini 3.1 Pro Preview 1
Rang Model Companie Număr de Răspuns greșit Scor Teste corecte Timp de răspuns (mediu)
#98 LFM2-24B-A2B none Liquid 9 4.1 1/16 811ms
#61 Seed-2.0-Lite none Bytedance Seed 10 6.2 8/18 2.53s
#62 Gemini 2.5 Flash none Google 10 6.2 7/18 903ms
#66 GPT-5.4 none OpenAI 10 5.9 7/18 1.51s
#67 Qwen3.5-27B none Qwen 10 5.9 6/18 1.74s
#74 GLM 4.7 Flash none Z.ai 10 5.6 5/18 3.35s
#75 GLM 5.1 none Z.ai 10 5.6 5/18 4.33s
#77 GLM 5 Turbo none Z.ai 10 5.5 6/18 2.94s
#79 Grok 4.20 Beta none X AI 10 5.3 4/18 1.19s
#86 GPT-5.4 Mini none OpenAI 10 5.1 5/18 1.17s
#88 Nemotron 3 Super none NVIDIA 10 5.1 4/18 8.54s
#90 Qwen3.5-9B none Qwen 10 4.8 4/18 1.47s
#70 Qwen3.5-122B-A10B none Qwen 11 5.7 6/18 3.69s
#78 Trinity Large Preview none Arcee AI 11 5.3 5/18 5.07s
#83 Mistral Small 4 none Mistral 11 5.2 5/18 665ms

Top modele după Număr de Răspuns greșit

Număr de Răspuns greșit vs Scor

Top modele după Timp de răspuns (mediu)