8.2Score moyen sur l’ensemble des tests de benchmark.…
8.2Score moyen sur l’ensemble des tests de benchmark.…
Rang
#7
#6
Tests corrects
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 2N'a pas suivi les instructions: 1Temps de réponse (moy.)21.06sTemps de réponse (max)100.41sTemps de réponse (total)315.95sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 3Temps de réponse (moy.)29.45sTemps de réponse (max)119.29sTemps de réponse (total)441.71sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
Cohérence
8.9Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
9.4Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
Coût par résultat
6.533Affiche le coût moyen par réponse correcte du benchmark, en centimes (plus bas est meilleur).…
3.962Affiche le coût moyen par réponse correcte du benchmark, en centimes (plus bas est meilleur).…
Coût total
$0.784Coût total…
$0.476Coût total…
Taux de réussite par tentative
86.7%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
82.2%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
Tests instables
2Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
common.totalRuns
45 (15 x 3)common.totalRuns…
45 (15 x 3)common.totalRuns…
Jetons de sortie
1,611Jetons de sortie…
17,226Jetons de sortie…
Jetons de raisonnement
46,321Jetons de raisonnement…
138,033Jetons de raisonnement…
Temps de réponse (moy.)
21.06sTemps de réponse (moy.)…
29.45sTemps de réponse (moy.)…
Temps de réponse (max)
100.41sTemps de réponse (max)…
119.29sTemps de réponse (max)…
Temps de réponse (total)
315.95sTemps de réponse (total)…
441.71sTemps de réponse (total)…
Meilleurs modèles par score
Score vs coût total
Temps de réponse (moy.)
Score moy. vs Temps de réponse (moy.)
Répartition par catégorie
Astuces anti-IA
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
OpenAI: GPT-5.4
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)5.02sTemps de réponse (max)6.42sTemps de réponse (total)15.06sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
5.02sTemps de réponse (moy.)…
216Jetons de sortie…
1,466Jetons de raisonnement…
Qwen: Qwen3.5-122B-A10B
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)6.99sTemps de réponse (max)11.62sTemps de réponse (total)20.98sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
6.99sTemps de réponse (moy.)…
248Jetons de sortie…
10,486Jetons de raisonnement…
Combiné
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
OpenAI: GPT-5.4
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)20.57sTemps de réponse (max)20.57sTemps de réponse (total)20.57sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
20.57sTemps de réponse (moy.)…
301Jetons de sortie…
3,543Jetons de raisonnement…
Qwen: Qwen3.5-122B-A10B
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)107.79sTemps de réponse (max)107.79sTemps de réponse (total)107.79sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
107.79sTemps de réponse (moy.)…
483Jetons de sortie…
11,337Jetons de raisonnement…
Analyse et extraction des données
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
OpenAI: GPT-5.4
9.9Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)5.32sTemps de réponse (max)5.40sTemps de réponse (total)10.64sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
5.32sTemps de réponse (moy.)…
234Jetons de sortie…
804Jetons de raisonnement…
Qwen: Qwen3.5-122B-A10B
9.9Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)23.41sTemps de réponse (max)29.79sTemps de réponse (total)46.83sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
23.41sTemps de réponse (moy.)…
270Jetons de sortie…
16,558Jetons de raisonnement…
Spécifique au domaine
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
OpenAI: GPT-5.4
4.0Score moyen sur l’ensemble des tests de benchmark.…
7.2Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
44.4%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 2Temps de réponse (moy.)74.27sTemps de réponse (max)100.41sTemps de réponse (total)222.80sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
74.27sTemps de réponse (moy.)…
61Jetons de sortie…
34,748Jetons de raisonnement…
Qwen: Qwen3.5-122B-A10B
10.0Score moyen sur l’ensemble des tests de benchmark.…
7.2Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
11.1%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 3Temps de réponse (moy.)63.40sTemps de réponse (max)119.29sTemps de réponse (total)190.20sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
63.40sTemps de réponse (moy.)…
15,537Jetons de sortie…
64,889Jetons de raisonnement…
Suivi des instructions
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
OpenAI: GPT-5.4
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)3.11sTemps de réponse (max)3.68sTemps de réponse (total)6.22sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
3.11sTemps de réponse (moy.)…
93Jetons de sortie…
897Jetons de raisonnement…
Qwen: Qwen3.5-122B-A10B
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)9.88sTemps de réponse (max)15.44sTemps de réponse (total)19.76sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
9.88sTemps de réponse (moy.)…
77Jetons de sortie…
7,372Jetons de raisonnement…
Puzzle Solving
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
OpenAI: GPT-5.4
7.0Score moyen sur l’ensemble des tests de benchmark.…
7.2Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
88.9%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.N'a pas suivi les instructions: 1Temps de réponse (moy.)9.13sTemps de réponse (max)18.14sTemps de réponse (total)27.39sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
9.13sTemps de réponse (moy.)…
442Jetons de sortie…
3,832Jetons de raisonnement…
Qwen: Qwen3.5-122B-A10B
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)17.18sTemps de réponse (max)31.99sTemps de réponse (total)51.55sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
17.18sTemps de réponse (moy.)…
289Jetons de sortie…
26,165Jetons de raisonnement…
Appel d'outils
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
OpenAI: GPT-5.4
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)13.28sTemps de réponse (max)13.28sTemps de réponse (total)13.28sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
13.28sTemps de réponse (moy.)…
264Jetons de sortie…
1,031Jetons de raisonnement…
Qwen: Qwen3.5-122B-A10B
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)4.60sTemps de réponse (max)4.60sTemps de réponse (total)4.60sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…