5.5Score moyen sur l’ensemble des tests de benchmark.…
6.5Score moyen sur l’ensemble des tests de benchmark.…
Cohérence
8.4Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
7.9Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
Coût par résultat
0.220Affiche le coût moyen par réponse correcte du benchmark, en centimes (plus bas est meilleur).…
3.125Affiche le coût moyen par réponse correcte du benchmark, en centimes (plus bas est meilleur).…
Coût total
$0.016Coût total…
$0.313Coût total…
Tests corrects
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 6Mise en forme supplémentaire: 2invalid tool call: 1Temps de réponse (moy.)12.86sTemps de réponse (max)115.89sTemps de réponse (total)205.78sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.N'a pas suivi les instructions: 3Aucune réponse: 1Délai dépassé: 1Mauvaise réponse: 1Temps de réponse (moy.)15.33sTemps de réponse (max)77.80sTemps de réponse (total)138.01sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
Taux de réussite par tentative
54.2%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
75.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
Tests instables
3Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
4Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Exécutions totales
48Exécutions totales…
48Exécutions totales…
Jetons de sortie
7,823Jetons de sortie…
2,220Jetons de sortie…
Jetons de raisonnement
0Jetons de raisonnement…
16,811Jetons de raisonnement…
Temps de réponse (moy.)
12.86sTemps de réponse (moy.)…
15.33sTemps de réponse (moy.)…
Temps de réponse (max)
115.89sTemps de réponse (max)…
77.80sTemps de réponse (max)…
Temps de réponse (total)
205.78sTemps de réponse (total)…
138.01sTemps de réponse (total)…
Meilleurs modèles par score
Score vs coût total
Temps de réponse (moy.)
Score moy. vs Temps de réponse (moy.)
Répartition par catégorie
Astuces anti-IA
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
DeepSeek: DeepSeek V3.2
10.0Score moyen sur l’ensemble des tests de benchmark.…
9.7Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mise en forme supplémentaire: 2Mauvaise réponse: 1Temps de réponse (moy.)8.79sTemps de réponse (max)12.26sTemps de réponse (total)26.38sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
8.79sTemps de réponse (moy.)…
1,411Jetons de sortie…
0Jetons de raisonnement…
OpenAI: GPT-5.2
7.0Score moyen sur l’ensemble des tests de benchmark.…
7.3Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
77.8%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.N'a pas suivi les instructions: 1Temps de réponse (moy.)14.34sTemps de réponse (max)14.34sTemps de réponse (total)14.34sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
14.34sTemps de réponse (moy.)…
549Jetons de sortie…
2,002Jetons de raisonnement…
Combiné
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
DeepSeek: DeepSeek V3.2
8.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.invalid tool call: 1Temps de réponse (moy.)115.89sTemps de réponse (max)115.89sTemps de réponse (total)115.89sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
115.89sTemps de réponse (moy.)…
2,887Jetons de sortie…
0Jetons de raisonnement…
OpenAI: GPT-5.2
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)14.06sTemps de réponse (max)14.06sTemps de réponse (total)14.06sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
14.06sTemps de réponse (moy.)…
291Jetons de sortie…
1,757Jetons de raisonnement…
Analyse et extraction des données
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
DeepSeek: DeepSeek V3.2
5.4Score moyen sur l’ensemble des tests de benchmark.…
5.8Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
66.7%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)9.42sTemps de réponse (max)16.20sTemps de réponse (total)18.84sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
9.42sTemps de réponse (moy.)…
1,710Jetons de sortie…
0Jetons de raisonnement…
OpenAI: GPT-5.2
9.9Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)3.15sTemps de réponse (max)3.15sTemps de réponse (total)3.15sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
3.15sTemps de réponse (moy.)…
234Jetons de sortie…
420Jetons de raisonnement…
Spécifique au domaine
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
DeepSeek: DeepSeek V3.2
10.0Score moyen sur l’ensemble des tests de benchmark.…
7.2Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
22.2%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 3Temps de réponse (moy.)1.61sTemps de réponse (max)1.77sTemps de réponse (total)4.83sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
1.61sTemps de réponse (moy.)…
24Jetons de sortie…
0Jetons de raisonnement…
OpenAI: GPT-5.2
4.0Score moyen sur l’ensemble des tests de benchmark.…
7.2Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
55.6%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Délai dépassé: 1Mauvaise réponse: 1Temps de réponse (moy.)77.80sTemps de réponse (max)77.80sTemps de réponse (total)77.80sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
77.80sTemps de réponse (moy.)…
42Jetons de sortie…
10,342Jetons de raisonnement…
Intelligence générale
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
DeepSeek: DeepSeek V3.2
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)2.86sTemps de réponse (max)2.86sTemps de réponse (total)2.86sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
2.86sTemps de réponse (moy.)…
67Jetons de sortie…
0Jetons de raisonnement…
OpenAI: GPT-5.2
10.0Score moyen sur l’ensemble des tests de benchmark.…
9.7Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.N'a pas suivi les instructions: 1Temps de réponse (moy.)4.32sTemps de réponse (max)4.32sTemps de réponse (total)4.32sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
4.32sTemps de réponse (moy.)…
162Jetons de sortie…
269Jetons de raisonnement…
Suivi des instructions
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
DeepSeek: DeepSeek V3.2
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)1.52sTemps de réponse (max)1.99sTemps de réponse (total)3.04sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
1.52sTemps de réponse (moy.)…
66Jetons de sortie…
0Jetons de raisonnement…
OpenAI: GPT-5.2
9.5Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)3.12sTemps de réponse (max)3.12sTemps de réponse (total)3.12sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
3.12sTemps de réponse (moy.)…
94Jetons de sortie…
614Jetons de raisonnement…
Puzzle Solving
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
DeepSeek: DeepSeek V3.2
7.7Score moyen sur l’ensemble des tests de benchmark.…
7.5Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
88.9%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)7.37sTemps de réponse (max)10.78sTemps de réponse (total)22.10sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
7.37sTemps de réponse (moy.)…
1,136Jetons de sortie…
0Jetons de raisonnement…
OpenAI: GPT-5.2
7.0Score moyen sur l’ensemble des tests de benchmark.…
7.3Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
77.8%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.N'a pas suivi les instructions: 1Temps de réponse (moy.)5.47sTemps de réponse (max)6.45sTemps de réponse (total)10.94sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
5.47sTemps de réponse (moy.)…
609Jetons de sortie…
938Jetons de raisonnement…
Appel d'outils
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
DeepSeek: DeepSeek V3.2
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)11.85sTemps de réponse (max)11.85sTemps de réponse (total)11.85sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
11.85sTemps de réponse (moy.)…
522Jetons de sortie…
0Jetons de raisonnement…
OpenAI: GPT-5.2
10.0Score moyen sur l’ensemble des tests de benchmark.…
1.6Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
66.7%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse: 1Temps de réponse (moy.)10.30sTemps de réponse (max)10.30sTemps de réponse (total)10.30sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…