6.1Score moyen sur l’ensemble des tests de benchmark.…
3.9Score moyen sur l’ensemble des tests de benchmark.…
Tests corrects
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.N'a pas suivi les instructions: 3Mauvaise réponse: 3Délai dépassé: 1Temps de réponse (moy.)25.92sTemps de réponse (max)88.15sTemps de réponse (total)388.79sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 8N'a pas suivi les instructions: 2invalid tool call: 1Temps de réponse (moy.)3.16sTemps de réponse (max)7.05sTemps de réponse (total)25.31sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
Cohérence
8.9Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
8.3Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
Coût par résultat
1.401Affiche le coût moyen par réponse correcte du benchmark, en centimes (plus bas est meilleur).…
0.064Affiche le coût moyen par réponse correcte du benchmark, en centimes (plus bas est meilleur).…
Coût total
$0.113Coût total…
$0.003Coût total…
Taux de réussite par tentative
62.2%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
37.8%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
Tests instables
2Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
3Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
common.totalAttempts
45 (15 x 3)common.totalAttempts…
45 (15 x 3)common.totalAttempts…
Jetons de sortie
5,477Jetons de sortie…
1,721Jetons de sortie…
Jetons de raisonnement
46,912Jetons de raisonnement…
0Jetons de raisonnement…
Temps de réponse (moy.)
25.92sTemps de réponse (moy.)…
3.16sTemps de réponse (moy.)…
Temps de réponse (max)
88.15sTemps de réponse (max)…
7.05sTemps de réponse (max)…
Temps de réponse (total)
388.79sTemps de réponse (total)…
25.31sTemps de réponse (total)…
Meilleurs modèles par score
Temps de réponse (moy.)
Score vs coût total
Score moy. vs Temps de réponse (moy.)
Répartition par catégorie
Astuces anti-IA
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
OpenAI: GPT-5 Mini
7.0Score moyen sur l’ensemble des tests de benchmark.…
9.6Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
66.7%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.N'a pas suivi les instructions: 1Temps de réponse (moy.)16.45sTemps de réponse (max)26.00sTemps de réponse (total)49.36sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
16.45sTemps de réponse (moy.)…
1,645Jetons de sortie…
5,824Jetons de raisonnement…
Z.ai: GLM 4.7 Flash
10.0Score moyen sur l’ensemble des tests de benchmark.…
7.2Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
22.2%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 3Temps de réponse (moy.)6.59sTemps de réponse (max)6.59sTemps de réponse (total)6.59sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
6.59sTemps de réponse (moy.)…
430Jetons de sortie…
0Jetons de raisonnement…
Combiné
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
OpenAI: GPT-5 Mini
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)88.15sTemps de réponse (max)88.15sTemps de réponse (total)88.15sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
88.15sTemps de réponse (moy.)…
754Jetons de sortie…
11,520Jetons de raisonnement…
Z.ai: GLM 4.7 Flash
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.invalid tool call: 1Temps de réponse (moy.)3.22sTemps de réponse (max)3.22sTemps de réponse (total)3.22sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
3.22sTemps de réponse (moy.)…
704Jetons de sortie…
0Jetons de raisonnement…
Analyse et extraction des données
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
OpenAI: GPT-5 Mini
9.9Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)12.58sTemps de réponse (max)13.87sTemps de réponse (total)25.16sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
12.58sTemps de réponse (moy.)…
453Jetons de sortie…
3,200Jetons de raisonnement…
Z.ai: GLM 4.7 Flash
5.4Score moyen sur l’ensemble des tests de benchmark.…
5.8Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
83.3%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)4.82sTemps de réponse (max)4.82sTemps de réponse (total)4.82sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
4.82sTemps de réponse (moy.)…
196Jetons de sortie…
0Jetons de raisonnement…
Spécifique au domaine
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
OpenAI: GPT-5 Mini
10.0Score moyen sur l’ensemble des tests de benchmark.…
7.2Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
22.2%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 2Délai dépassé: 1Temps de réponse (moy.)44.63sTemps de réponse (max)82.55sTemps de réponse (total)133.89sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
44.63sTemps de réponse (moy.)…
293Jetons de sortie…
14,016Jetons de raisonnement…
Z.ai: GLM 4.7 Flash
7.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
66.7%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)744msTemps de réponse (max)744msTemps de réponse (total)744msUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
744msTemps de réponse (moy.)…
19Jetons de sortie…
0Jetons de raisonnement…
Suivi des instructions
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
OpenAI: GPT-5 Mini
7.5Score moyen sur l’ensemble des tests de benchmark.…
6.6Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
83.3%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.N'a pas suivi les instructions: 1Temps de réponse (moy.)15.66sTemps de réponse (max)21.80sTemps de réponse (total)31.32sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
15.66sTemps de réponse (moy.)…
318Jetons de sortie…
4,992Jetons de raisonnement…
Z.ai: GLM 4.7 Flash
5.5Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
50.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)888msTemps de réponse (max)888msTemps de réponse (total)888msUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
888msTemps de réponse (moy.)…
62Jetons de sortie…
0Jetons de raisonnement…
Puzzle Solving
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
OpenAI: GPT-5 Mini
4.3Score moyen sur l’ensemble des tests de benchmark.…
9.8Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
33.3%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.N'a pas suivi les instructions: 1Mauvaise réponse: 1Temps de réponse (moy.)14.09sTemps de réponse (max)16.81sTemps de réponse (total)42.28sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
14.09sTemps de réponse (moy.)…
1,527Jetons de sortie…
5,760Jetons de raisonnement…
Z.ai: GLM 4.7 Flash
3.7Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.N'a pas suivi les instructions: 2Mauvaise réponse: 1Temps de réponse (moy.)1.00sTemps de réponse (max)1.12sTemps de réponse (total)2.00sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
1.00sTemps de réponse (moy.)…
98Jetons de sortie…
0Jetons de raisonnement…
Appel d'outils
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
OpenAI: GPT-5 Mini
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)18.64sTemps de réponse (max)18.64sTemps de réponse (total)18.64sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
18.64sTemps de réponse (moy.)…
487Jetons de sortie…
1,600Jetons de raisonnement…
Z.ai: GLM 4.7 Flash
10.0Score moyen sur l’ensemble des tests de benchmark.…
1.6Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
33.3%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)7.05sTemps de réponse (max)7.05sTemps de réponse (total)7.05sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…