AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Échecs par catégorie AI BENCHY

Résolution d'énigmes : Mauvaise réponse

Résolution d'énigmes
Mauvaise réponse

Voyez quels modèles d'IA ont le plus de chances de rencontrer Mauvaise réponse sur Résolution d'énigmes, pour repérer plus vite les points faibles. Trier par: Temps de réponse (moy.) ↓.

Modèles affichés

15

Échecs totaux

147

Modèle le plus touché

Qwen3.6 27B 1
Rang Modèle Entreprise Nombre de Mauvaise réponse Score de catégorie Tests corrects Temps de réponse (moy.)
#78 Qwen3.6 27B medium Qwen 1 7.7 2/3 61.1s
#67 MiniMax M3 medium Minimax 1 7.9 2/3 49.9s
#76 Kimi K2.5 medium Moonshot AI 1 5.3 1/3 43.2s
#72 DeepSeek V3.2 medium DeepSeek 1 7.0 1/3 37.7s
#103 DeepSeek V4 Pro high DeepSeek 1 5.9 1/3 34.8s
#161 Qwen3.5-9B medium Qwen 1 3.0 0/3 32.3s
#73 Seed-2.0-Mini medium Bytedance Seed 1 8.2 2/3 31.8s
#55 GLM 5.1 medium Z.ai 1 8.2 2/3 31.6s
#60 Kimi K2.6 medium Moonshot AI 1 6.0 1/3 25.1s
#130 MiniMax M2.7 medium Minimax 1 5.9 1/3 24.9s
#140 Qwen3 Coder Next none Qwen 3 3.0 0/3 24.3s
#139 DeepSeek V4 Flash none DeepSeek 1 3.1 0/3 23.7s
#38 Grok 4.3 medium X AI 1 5.9 1/3 22.5s
#99 gpt-oss-120b medium OpenAI 1 5.3 1/3 21.7s
#75 Ring-2.6-1T medium Inclusionai 1 5.9 1/3 20.7s

Meilleurs modèles par Nombre de Mauvaise réponse

Nombre de Mauvaise réponse vs Score

Meilleurs modèles par Temps de réponse (moy.)

Meilleurs modèles par Coût gaspillé estimé