6.9Score moyen sur l’ensemble des tests de benchmark.…
8.2Score moyen sur l’ensemble des tests de benchmark.…
Cohérence
9.1Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
9.6Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
Coût par résultat
0.280Affiche le coût moyen par réponse correcte du benchmark, en centimes (plus bas est meilleur).…
19.243Affiche le coût moyen par réponse correcte du benchmark, en centimes (plus bas est meilleur).…
Coût total
$0.028Coût total…
$2.310Coût total…
Tests corrects
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Délai dépassé: 4N'a pas suivi les instructions: 1Mauvaise réponse: 1Temps de réponse (moy.)65.09sTemps de réponse (max)262.83sTemps de réponse (total)846.14sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 3N'a pas suivi les instructions: 1Temps de réponse (moy.)68.83sTemps de réponse (max)280.52sTemps de réponse (total)1101.32sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
Taux de réussite par tentative
68.8%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
77.1%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
Tests instables
2Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
common.totalRuns
48 (16 x 3)common.totalRuns…
48 (16 x 3)common.totalRuns…
Jetons de sortie
1,965Jetons de sortie…
1,283Jetons de sortie…
Jetons de raisonnement
58,456Jetons de raisonnement…
1,533,310Jetons de raisonnement…
Temps de réponse (moy.)
65.09sTemps de réponse (moy.)…
68.83sTemps de réponse (moy.)…
Temps de réponse (max)
262.83sTemps de réponse (max)…
280.52sTemps de réponse (max)…
Temps de réponse (total)
846.14sTemps de réponse (total)…
1101.32sTemps de réponse (total)…
Meilleurs modèles par score
Score vs coût total
Temps de réponse (moy.)
Score moy. vs Temps de réponse (moy.)
Répartition par catégorie
Astuces anti-IA
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
ByteDance Seed: Seed-2.0-Mini
7.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
66.7%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Délai dépassé: 1Temps de réponse (moy.)98.99sTemps de réponse (max)182.10sTemps de réponse (total)296.96sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
98.99sTemps de réponse (moy.)…
354Jetons de sortie…
9,352Jetons de raisonnement…
Google: Gemini 3.1 Flash Lite Preview
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)43.87sTemps de réponse (max)121.88sTemps de réponse (total)131.62sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
43.87sTemps de réponse (moy.)…
144Jetons de sortie…
193,077Jetons de raisonnement…
Combiné
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
ByteDance Seed: Seed-2.0-Mini
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)262.83sTemps de réponse (max)262.83sTemps de réponse (total)262.83sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
262.83sTemps de réponse (moy.)…
404Jetons de sortie…
29,806Jetons de raisonnement…
Google: Gemini 3.1 Flash Lite Preview
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)280.52sTemps de réponse (max)280.52sTemps de réponse (total)280.52sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
280.52sTemps de réponse (moy.)…
335Jetons de sortie…
380,440Jetons de raisonnement…
Analyse et extraction des données
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
ByteDance Seed: Seed-2.0-Mini
9.9Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)24.27sTemps de réponse (max)27.52sTemps de réponse (total)48.54sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
24.27sTemps de réponse (moy.)…
246Jetons de sortie…
2,743Jetons de raisonnement…
Google: Gemini 3.1 Flash Lite Preview
9.9Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)7.16sTemps de réponse (max)8.54sTemps de réponse (total)14.31sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
7.16sTemps de réponse (moy.)…
279Jetons de sortie…
6,186Jetons de raisonnement…
Spécifique au domaine
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
ByteDance Seed: Seed-2.0-Mini
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Délai dépassé: 3Temps de réponse (moy.)0msTemps de réponse (max)0msTemps de réponse (total)0msUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
0msTemps de réponse (moy.)…
0Jetons de sortie…
0Jetons de raisonnement…
Google: Gemini 3.1 Flash Lite Preview
4.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
33.3%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 2Temps de réponse (moy.)127.58sTemps de réponse (max)133.93sTemps de réponse (total)382.74sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
127.58sTemps de réponse (moy.)…
18Jetons de sortie…
566,202Jetons de raisonnement…
Intelligence générale
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
ByteDance Seed: Seed-2.0-Mini
6.0Score moyen sur l’ensemble des tests de benchmark.…
3.4Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
33.3%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.N'a pas suivi les instructions: 1Temps de réponse (moy.)36.65sTemps de réponse (max)36.65sTemps de réponse (total)36.65sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
36.65sTemps de réponse (moy.)…
213Jetons de sortie…
4,210Jetons de raisonnement…
Google: Gemini 3.1 Flash Lite Preview
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)5.25sTemps de réponse (max)5.25sTemps de réponse (total)5.25sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
5.25sTemps de réponse (moy.)…
117Jetons de sortie…
3,915Jetons de raisonnement…
Suivi des instructions
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
ByteDance Seed: Seed-2.0-Mini
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)17.47sTemps de réponse (max)19.46sTemps de réponse (total)34.93sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
17.47sTemps de réponse (moy.)…
69Jetons de sortie…
2,050Jetons de raisonnement…
Google: Gemini 3.1 Flash Lite Preview
9.0Score moyen sur l’ensemble des tests de benchmark.…
6.9Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
66.7%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.N'a pas suivi les instructions: 1Temps de réponse (moy.)70.07sTemps de réponse (max)136.53sTemps de réponse (total)140.14sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
70.07sTemps de réponse (moy.)…
69Jetons de sortie…
190,053Jetons de raisonnement…
Puzzle Solving
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
ByteDance Seed: Seed-2.0-Mini
7.0Score moyen sur l’ensemble des tests de benchmark.…
7.2Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
88.9%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)25.85sTemps de réponse (max)32.95sTemps de réponse (total)77.55sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
25.85sTemps de réponse (moy.)…
457Jetons de sortie…
5,060Jetons de raisonnement…
Google: Gemini 3.1 Flash Lite Preview
7.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
66.7%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)46.33sTemps de réponse (max)134.22sTemps de réponse (total)139.00sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
46.33sTemps de réponse (moy.)…
87Jetons de sortie…
190,953Jetons de raisonnement…
Appel d'outils
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
ByteDance Seed: Seed-2.0-Mini
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)88.68sTemps de réponse (max)88.68sTemps de réponse (total)88.68sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
88.68sTemps de réponse (moy.)…
222Jetons de sortie…
5,235Jetons de raisonnement…
Google: Gemini 3.1 Flash Lite Preview
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)7.73sTemps de réponse (max)7.73sTemps de réponse (total)7.73sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…