6.8Score moyen sur l’ensemble des tests de benchmark.…
7.4Score moyen sur l’ensemble des tests de benchmark.…
Cohérence
9.6Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
9.1Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
Coût par résultat
2.504Affiche le coût moyen par réponse correcte du benchmark, en centimes (plus bas est meilleur).…
0.000Affiche le coût moyen par réponse correcte du benchmark, en centimes (plus bas est meilleur).…
Coût total
$0.251Coût total…
$0.000Coût total…
Tests corrects
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mise en forme supplémentaire: 3Mauvaise réponse: 2N'a pas suivi les instructions: 1Temps de réponse (moy.)5.57sTemps de réponse (max)23.84sTemps de réponse (total)50.12sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.N'a pas suivi les instructions: 3Mauvaise réponse: 3Temps de réponse (moy.)29.10sTemps de réponse (max)170.45sTemps de réponse (total)290.96sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
Taux de réussite par tentative
66.7%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
68.8%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
Tests instables
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
2Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Exécutions totales
48 (16 x 3)Exécutions totales…
48 (16 x 3)Exécutions totales…
Jetons de sortie
6,895Jetons de sortie…
71,452Jetons de sortie…
Jetons de raisonnement
0Jetons de raisonnement…
155,147Jetons de raisonnement…
Temps de réponse (moy.)
5.57sTemps de réponse (moy.)…
29.10sTemps de réponse (moy.)…
Temps de réponse (max)
23.84sTemps de réponse (max)…
170.45sTemps de réponse (max)…
Temps de réponse (total)
50.12sTemps de réponse (total)…
290.96sTemps de réponse (total)…
Meilleurs modèles par score
Score vs coût total
Temps de réponse (moy.)
Score moy. vs Temps de réponse (moy.)
Répartition par catégorie
Astuces anti-IA
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
Anthropic: Claude Sonnet 4.6
4.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
33.3%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mise en forme supplémentaire: 2Temps de réponse (moy.)4.83sTemps de réponse (max)4.83sTemps de réponse (total)4.83sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
4.83sTemps de réponse (moy.)…
1,199Jetons de sortie…
0Jetons de raisonnement…
StepFun: Step 3.5 Flash
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)18.54sTemps de réponse (max)32.30sTemps de réponse (total)37.07sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
18.54sTemps de réponse (moy.)…
13,924Jetons de sortie…
17,208Jetons de raisonnement…
Combiné
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
Anthropic: Claude Sonnet 4.6
9.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)23.84sTemps de réponse (max)23.84sTemps de réponse (total)23.84sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
23.84sTemps de réponse (moy.)…
3,766Jetons de sortie…
0Jetons de raisonnement…
StepFun: Step 3.5 Flash
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)29.57sTemps de réponse (max)29.57sTemps de réponse (total)29.57sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
29.57sTemps de réponse (moy.)…
1,176Jetons de sortie…
12,984Jetons de raisonnement…
Analyse et extraction des données
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
Anthropic: Claude Sonnet 4.6
9.9Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)3.43sTemps de réponse (max)3.43sTemps de réponse (total)3.43sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
3.43sTemps de réponse (moy.)…
252Jetons de sortie…
0Jetons de raisonnement…
StepFun: Step 3.5 Flash
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)15.01sTemps de réponse (max)15.01sTemps de réponse (total)15.01sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
15.01sTemps de réponse (moy.)…
600Jetons de sortie…
13,886Jetons de raisonnement…
Spécifique au domaine
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
Anthropic: Claude Sonnet 4.6
7.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
66.7%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)3.54sTemps de réponse (max)3.54sTemps de réponse (total)3.54sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
3.54sTemps de réponse (moy.)…
413Jetons de sortie…
0Jetons de raisonnement…
StepFun: Step 3.5 Flash
4.0Score moyen sur l’ensemble des tests de benchmark.…
7.2Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
44.4%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 2Temps de réponse (moy.)170.45sTemps de réponse (max)170.45sTemps de réponse (total)170.45sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
170.45sTemps de réponse (moy.)…
45,350Jetons de sortie…
90,436Jetons de raisonnement…
Intelligence générale
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
Anthropic: Claude Sonnet 4.6
5.0Score moyen sur l’ensemble des tests de benchmark.…
3.1Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
66.7%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.N'a pas suivi les instructions: 1Temps de réponse (moy.)2.56sTemps de réponse (max)2.56sTemps de réponse (total)2.56sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
2.56sTemps de réponse (moy.)…
192Jetons de sortie…
0Jetons de raisonnement…
StepFun: Step 3.5 Flash
6.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.N'a pas suivi les instructions: 1Temps de réponse (moy.)6.54sTemps de réponse (max)6.54sTemps de réponse (total)6.54sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
6.54sTemps de réponse (moy.)…
2,214Jetons de sortie…
2,584Jetons de raisonnement…
Suivi des instructions
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
Anthropic: Claude Sonnet 4.6
5.5Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
50.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)1.96sTemps de réponse (max)1.96sTemps de réponse (total)1.96sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
1.96sTemps de réponse (moy.)…
90Jetons de sortie…
0Jetons de raisonnement…
StepFun: Step 3.5 Flash
9.0Score moyen sur l’ensemble des tests de benchmark.…
6.8Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
83.3%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.N'a pas suivi les instructions: 1Temps de réponse (moy.)4.98sTemps de réponse (max)4.98sTemps de réponse (total)4.98sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
4.98sTemps de réponse (moy.)…
2,284Jetons de sortie…
3,412Jetons de raisonnement…
Puzzle Solving
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
Anthropic: Claude Sonnet 4.6
7.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
66.7%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mise en forme supplémentaire: 1Temps de réponse (moy.)2.92sTemps de réponse (max)3.33sTemps de réponse (total)5.84sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
2.92sTemps de réponse (moy.)…
536Jetons de sortie…
0Jetons de raisonnement…
StepFun: Step 3.5 Flash
4.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
33.3%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.N'a pas suivi les instructions: 1Mauvaise réponse: 1Temps de réponse (moy.)7.72sTemps de réponse (max)10.60sTemps de réponse (total)15.44sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
7.72sTemps de réponse (moy.)…
5,629Jetons de sortie…
10,835Jetons de raisonnement…
Appel d'outils
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
Anthropic: Claude Sonnet 4.6
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)4.11sTemps de réponse (max)4.11sTemps de réponse (total)4.11sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
4.11sTemps de réponse (moy.)…
447Jetons de sortie…
0Jetons de raisonnement…
StepFun: Step 3.5 Flash
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)11.91sTemps de réponse (max)11.91sTemps de réponse (total)11.91sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…