64Score moyen sur l’ensemble des tests de benchmark.…
34Score moyen sur l’ensemble des tests de benchmark.…
Cohérence
89Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
89Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
Coût par résultat
14.411Affiche le coût moyen par réponse correcte du benchmark, en centimes (plus bas est meilleur).…
0.147Affiche le coût moyen par réponse correcte du benchmark, en centimes (plus bas est meilleur).…
Coût total
$1.297Coût total…
$0.006Coût total…
Temps de réponse (moy.)
25.08sTemps de réponse (moy.)…
594msTemps de réponse (moy.)…
Temps de réponse (max)
83.40sTemps de réponse (max)…
1.27sTemps de réponse (max)…
Temps de réponse (total)
200.67sTemps de réponse (total)…
8.91sTemps de réponse (total)…
Tests corrects
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mise en forme supplémentaire: 4Mauvaise réponse: 2Temps de réponse (moy.)25.08sTemps de réponse (max)83.40sTemps de réponse (total)200.67sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 11Temps de réponse (moy.)594msTemps de réponse (max)1.27sTemps de réponse (total)8.91sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
Taux de réussite par tentative
64.4%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
33.3%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
Tests instables
2Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
2Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Jetons de sortie
26,066Jetons de sortie…
1,144Jetons de sortie…
Jetons de raisonnement
17,071Jetons de raisonnement…
0Jetons de raisonnement…
Meilleurs modèles par score
Temps de réponse (moy.)
Score vs coût total
Score moy. vs Temps de réponse (moy.)
Répartition par catégorie
Astuces anti-IA
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
Anthropic: Claude Opus 4.6
40Score moyen sur l’ensemble des tests de benchmark.…
44Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
55.6%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
2Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mise en forme supplémentaire: 2Temps de réponse (moy.)11.88sTemps de réponse (max)11.88sTemps de réponse (total)11.88sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
11.88sTemps de réponse (moy.)…
897Jetons de sortie…
1,000Jetons de raisonnement…
Inception: Mercury 2
100Score moyen sur l’ensemble des tests de benchmark.…
100Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 3Temps de réponse (moy.)466msTemps de réponse (max)716msTemps de réponse (total)1.40sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
466msTemps de réponse (moy.)…
274Jetons de sortie…
0Jetons de raisonnement…
Combiné
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
Anthropic: Claude Opus 4.6
100Score moyen sur l’ensemble des tests de benchmark.…
100Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)76.66sTemps de réponse (max)76.66sTemps de réponse (total)76.66sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
76.66sTemps de réponse (moy.)…
8,178Jetons de sortie…
5,194Jetons de raisonnement…
Inception: Mercury 2
100Score moyen sur l’ensemble des tests de benchmark.…
100Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)606msTemps de réponse (max)606msTemps de réponse (total)606msUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
606msTemps de réponse (moy.)…
131Jetons de sortie…
0Jetons de raisonnement…
Analyse et extraction des données
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
Anthropic: Claude Opus 4.6
99Score moyen sur l’ensemble des tests de benchmark.…
100Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)7.37sTemps de réponse (max)7.37sTemps de réponse (total)7.37sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
7.37sTemps de réponse (moy.)…
691Jetons de sortie…
757Jetons de raisonnement…
Inception: Mercury 2
55Score moyen sur l’ensemble des tests de benchmark.…
59Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
83.3%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)667msTemps de réponse (max)819msTemps de réponse (total)1.33sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
667msTemps de réponse (moy.)…
180Jetons de sortie…
0Jetons de raisonnement…
Spécifique au domaine
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
Anthropic: Claude Opus 4.6
100Score moyen sur l’ensemble des tests de benchmark.…
100Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mise en forme supplémentaire: 2Mauvaise réponse: 1Temps de réponse (moy.)83.40sTemps de réponse (max)83.40sTemps de réponse (total)83.40sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
83.40sTemps de réponse (moy.)…
14,642Jetons de sortie…
8,687Jetons de raisonnement…
Inception: Mercury 2
40Score moyen sur l’ensemble des tests de benchmark.…
72Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
44.4%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 2Temps de réponse (moy.)534msTemps de réponse (max)733msTemps de réponse (total)1.60sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
534msTemps de réponse (moy.)…
46Jetons de sortie…
0Jetons de raisonnement…
Suivi des instructions
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
Anthropic: Claude Opus 4.6
100Score moyen sur l’ensemble des tests de benchmark.…
100Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)2.43sTemps de réponse (max)2.43sTemps de réponse (total)2.43sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
2.43sTemps de réponse (moy.)…
266Jetons de sortie…
467Jetons de raisonnement…
Inception: Mercury 2
55Score moyen sur l’ensemble des tests de benchmark.…
100Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
50.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)551msTemps de réponse (max)622msTemps de réponse (total)1.10sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
551msTemps de réponse (moy.)…
82Jetons de sortie…
0Jetons de raisonnement…
Puzzle Solving
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
Anthropic: Claude Opus 4.6
70Score moyen sur l’ensemble des tests de benchmark.…
100Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
66.7%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)4.60sTemps de réponse (max)4.66sTemps de réponse (total)9.20sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
4.60sTemps de réponse (moy.)…
531Jetons de sortie…
637Jetons de raisonnement…
Inception: Mercury 2
100Score moyen sur l’ensemble des tests de benchmark.…
100Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 3Temps de réponse (moy.)533msTemps de réponse (max)637msTemps de réponse (total)1.60sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
533msTemps de réponse (moy.)…
234Jetons de sortie…
0Jetons de raisonnement…
Appel d'outils
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
Anthropic: Claude Opus 4.6
100Score moyen sur l’ensemble des tests de benchmark.…
100Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)9.73sTemps de réponse (max)9.73sTemps de réponse (total)9.73sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
9.73sTemps de réponse (moy.)…
861Jetons de sortie…
329Jetons de raisonnement…
Inception: Mercury 2
100Score moyen sur l’ensemble des tests de benchmark.…
100Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)1.27sTemps de réponse (max)1.27sTemps de réponse (total)1.27sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…