AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Échecs par catégorie AI BENCHY

Résolution d'énigmes : Mauvaise réponse

Résolution d'énigmes
Mauvaise réponse

Voyez quels modèles d'IA ont le plus de chances de rencontrer Mauvaise réponse sur Résolution d'énigmes, pour repérer plus vite les points faibles. Trier par: Temps de réponse (moy.) ↑.

Modèles affichés

15

Échecs totaux

85

Modèle le plus touché

Grok 4.20 1
Rang Modèle Entreprise Nombre de Mauvaise réponse Score de catégorie Tests corrects Temps de réponse (moy.)
#82 Grok 4.20 none X AI 1 5.3 1/3 487ms
#91 Mercury 2 none Inception 3 3.1 0/3 533ms
#79 Grok 4.20 Beta none X AI 1 5.9 1/3 541ms
#62 Gemini 2.5 Flash none Google 1 5.7 1/3 576ms
#83 Mistral Small 4 none Mistral 1 3.1 0/3 589ms
#90 Qwen3.5-9B none Qwen 1 3.2 0/3 683ms
#60 Gemma 4 26B A4B none Google 1 5.7 1/3 739ms
#85 Elephant none Openrouter 2 3.3 0/3 849ms
#86 GPT-5.4 Mini none OpenAI 1 5.4 1/3 860ms
#81 Elephant medium Openrouter 1 3.7 0/3 867ms
#54 Mercury 2 medium Inception 1 3.9 0/3 934ms
#70 Qwen3.5-122B-A10B none Qwen 2 5.4 1/3 982ms
#74 GLM 4.7 Flash none Z.ai 1 4.4 0/3 1.00s
#21 Gemini 3 Flash Preview none Google 1 7.7 2/3 1.06s
#95 Grok 4.1 Fast none X AI 3 3.2 0/3 1.28s

Meilleurs modèles par Nombre de Mauvaise réponse

Nombre de Mauvaise réponse vs Score

Meilleurs modèles par Temps de réponse (moy.)

Meilleurs modèles par Coût gaspillé estimé