AI BENCHY
Advertise here

Échecs par catégorie AI BENCHY

Culture générale : Mauvaise réponse

Culture générale
Mauvaise réponse

Voyez quels modèles d'IA ont le plus de chances de rencontrer Mauvaise réponse sur Culture générale, pour repérer plus vite les points faibles. Trier par: Temps de réponse (moy.) ↑.

Modèles affichés

15

Échecs totaux

117

Modèle le plus touché

Qwen3.5-122B-A10B 1

Raisons d'échec

Rang Modèle Entreprise Nombre de Mauvaise réponse Score de catégorie Tests corrects Temps de réponse (moy.)
#110 Qwen3.5-122B-A10B none Qwen 1 3.0 0/1 295ms
#142 Granite 4.1 8B none IBM Granite 1 3.0 0/1 306ms
#124 Mistral Small 4 none Mistral 1 3.0 0/1 397ms
#129 Qwen3 Coder Next medium Qwen 1 3.0 0/1 399ms
#126 Qwen3.6 35B A3B none Qwen 1 3.0 0/1 414ms
#91 Qwen3.5-35B-A3B none Qwen 1 3.0 0/1 493ms
#131 Mercury 2 none Inception 1 3.0 0/1 548ms
#89 Qwen3.5-Flash none Qwen 1 3.0 0/1 588ms
#93 Qwen3.5-27B none Qwen 1 3.0 0/1 599ms
#121 Qwen3 Coder Next none Qwen 1 3.0 0/1 601ms
#105 Qwen3.6 Flash none Qwen 1 3.0 0/1 649ms
#97 GLM 4.7 Flash none Z.ai 1 3.0 0/1 692ms
#68 Gemini 3.1 Flash Lite minimal Google 1 3.0 0/1 724ms
#139 Grok 4.1 Fast none X AI 1 3.0 0/1 731ms
#73 Gemini 3.1 Flash Lite none Google 1 3.0 0/1 733ms

Meilleurs modèles par Nombre de Mauvaise réponse

Nombre de Mauvaise réponse vs Score

Meilleurs modèles par Temps de réponse (moy.)

Meilleurs modèles par Coût gaspillé estimé