7.6Score moyen sur l’ensemble des tests de benchmark.…
6.4Score moyen sur l’ensemble des tests de benchmark.…
Rang
#12
#29
Tests corrects
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 4Temps de réponse (moy.)3.49sTemps de réponse (max)11.91sTemps de réponse (total)52.29sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 3N'a pas suivi les instructions: 1Aucune réponse: 1Délai dépassé: 1Temps de réponse (moy.)69.84sTemps de réponse (max)137.29sTemps de réponse (total)558.72sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
Cohérence
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
7.8Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
Coût par résultat
0.170Affiche le coût moyen par réponse correcte du benchmark, en centimes (plus bas est meilleur).…
2.082Affiche le coût moyen par réponse correcte du benchmark, en centimes (plus bas est meilleur).…
Coût total
$0.019Coût total…
$0.188Coût total…
Taux de réussite par tentative
73.3%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
73.3%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
Tests instables
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
4Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
common.totalRuns
45 (15 x 3)common.totalRuns…
45 (15 x 3)common.totalRuns…
Jetons de sortie
1,542Jetons de sortie…
34,638Jetons de sortie…
Jetons de raisonnement
6,888Jetons de raisonnement…
68,234Jetons de raisonnement…
Temps de réponse (moy.)
3.49sTemps de réponse (moy.)…
69.84sTemps de réponse (moy.)…
Temps de réponse (max)
11.91sTemps de réponse (max)…
137.29sTemps de réponse (max)…
Temps de réponse (total)
52.29sTemps de réponse (total)…
558.72sTemps de réponse (total)…
Meilleurs modèles par score
Score vs coût total
Temps de réponse (moy.)
Score moy. vs Temps de réponse (moy.)
Répartition par catégorie
Astuces anti-IA
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
Google: Gemini 3.1 Flash Lite Preview
7.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
66.7%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)2.18sTemps de réponse (max)3.18sTemps de réponse (total)6.53sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
2.18sTemps de réponse (moy.)…
456Jetons de sortie…
1,224Jetons de raisonnement…
MoonshotAI: Kimi K2.5
7.0Score moyen sur l’ensemble des tests de benchmark.…
7.2Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
88.9%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse: 1Temps de réponse (moy.)85.28sTemps de réponse (max)85.28sTemps de réponse (total)85.28sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
85.28sTemps de réponse (moy.)…
335Jetons de sortie…
6,255Jetons de raisonnement…
Combiné
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
Google: Gemini 3.1 Flash Lite Preview
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)11.91sTemps de réponse (max)11.91sTemps de réponse (total)11.91sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
11.91sTemps de réponse (moy.)…
225Jetons de sortie…
762Jetons de raisonnement…
MoonshotAI: Kimi K2.5
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)71.37sTemps de réponse (max)71.37sTemps de réponse (total)71.37sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
71.37sTemps de réponse (moy.)…
703Jetons de sortie…
3,713Jetons de raisonnement…
Analyse et extraction des données
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
Google: Gemini 3.1 Flash Lite Preview
9.9Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)3.00sTemps de réponse (max)3.74sTemps de réponse (total)5.99sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
3.00sTemps de réponse (moy.)…
291Jetons de sortie…
696Jetons de raisonnement…
MoonshotAI: Kimi K2.5
9.9Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)49.78sTemps de réponse (max)49.78sTemps de réponse (total)49.78sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
49.78sTemps de réponse (moy.)…
563Jetons de sortie…
7,940Jetons de raisonnement…
Spécifique au domaine
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
Google: Gemini 3.1 Flash Lite Preview
4.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
33.3%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 2Temps de réponse (moy.)2.36sTemps de réponse (max)3.51sTemps de réponse (total)7.07sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
2.36sTemps de réponse (moy.)…
18Jetons de sortie…
1,212Jetons de raisonnement…
MoonshotAI: Kimi K2.5
10.0Score moyen sur l’ensemble des tests de benchmark.…
4.4Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
33.3%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
2Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 2Délai dépassé: 1Temps de réponse (moy.)137.29sTemps de réponse (max)137.29sTemps de réponse (total)137.29sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
137.29sTemps de réponse (moy.)…
20,753Jetons de sortie…
30,564Jetons de raisonnement…
Suivi des instructions
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
Google: Gemini 3.1 Flash Lite Preview
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)1.49sTemps de réponse (max)1.66sTemps de réponse (total)2.99sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
1.49sTemps de réponse (moy.)…
72Jetons de sortie…
753Jetons de raisonnement…
MoonshotAI: Kimi K2.5
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)92.47sTemps de réponse (max)92.47sTemps de réponse (total)92.47sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
92.47sTemps de réponse (moy.)…
5,371Jetons de sortie…
6,547Jetons de raisonnement…
Puzzle Solving
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
Google: Gemini 3.1 Flash Lite Preview
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)2.76sTemps de réponse (max)5.08sTemps de réponse (total)8.27sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
2.76sTemps de réponse (moy.)…
243Jetons de sortie…
1,248Jetons de raisonnement…
MoonshotAI: Kimi K2.5
4.0Score moyen sur l’ensemble des tests de benchmark.…
7.3Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
44.4%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.N'a pas suivi les instructions: 1Mauvaise réponse: 1Temps de réponse (moy.)45.40sTemps de réponse (max)82.75sTemps de réponse (total)90.79sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
45.40sTemps de réponse (moy.)…
6,671Jetons de sortie…
12,403Jetons de raisonnement…
Appel d'outils
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
Google: Gemini 3.1 Flash Lite Preview
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)9.54sTemps de réponse (max)9.54sTemps de réponse (total)9.54sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
9.54sTemps de réponse (moy.)…
237Jetons de sortie…
993Jetons de raisonnement…
MoonshotAI: Kimi K2.5
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)31.74sTemps de réponse (max)31.74sTemps de réponse (total)31.74sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…