AI BENCHY
Your ad here

Eșecuri AI BENCHY

Eșecuri Apel de instrument invalid

Vezi ce modele AI se lovesc cel mai des de Apel de instrument invalid, ca să identifici riscurile de fiabilitate înainte să alegi. Sortează după: Timp de răspuns (mediu) ↑.

Modele afișate

12

Eșecuri totale

13

Modelul cel mai afectat

Grok 4.20 1
Rang Model Companie Număr de Apel de instrument invalid Scor Teste corecte Timp de răspuns (mediu)
#82 Grok 4.20 none X AI 1 5.2 5/18 1.11s
#79 Grok 4.20 Beta none X AI 1 5.3 4/18 1.19s
#85 Elephant none Openrouter 1 5.2 5/18 1.23s
#81 Elephant medium Openrouter 1 5.2 5/18 1.27s
#90 Qwen3.5-9B none Qwen 1 4.8 4/18 1.47s
#74 GLM 4.7 Flash none Z.ai 1 5.6 5/18 3.35s
#75 GLM 5.1 none Z.ai 1 5.6 5/18 4.33s
#64 DeepSeek V3.2 none DeepSeek 1 6.1 7/18 12.1s
#31 GLM 5V Turbo medium Z.ai 2 7.8 11/18 15.0s
#80 MiniMax M2.7 medium Minimax 1 5.3 4/18 31.1s
#93 GLM 4.7 Flash medium Z.ai 1 4.6 4/18 32.3s
#71 MiniMax M2.5 medium Minimax 1 5.7 5/18 39.6s

Top modele după Număr de Apel de instrument invalid

Număr de Apel de instrument invalid vs Scor

Top modele după Timp de răspuns (mediu)