4.2Score moyen sur l’ensemble des tests de benchmark.…
3.1Score moyen sur l’ensemble des tests de benchmark.…
Cohérence
9.6Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
6.4Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
Coût par résultat
0.000Affiche le coût moyen par réponse correcte du benchmark, en centimes (plus bas est meilleur).…
1.040Affiche le coût moyen par réponse correcte du benchmark, en centimes (plus bas est meilleur).…
Coût total
$0.000Coût total…
$0.042Coût total…
Tests corrects
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 9N'a pas suivi les instructions: 2Temps de réponse (moy.)3.15sTemps de réponse (max)8.91sTemps de réponse (total)50.46sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 7N'a pas suivi les instructions: 2Aucune réponse: 2invalid tool call: 1Temps de réponse (moy.)36.84sTemps de réponse (max)174.55sTemps de réponse (total)331.58sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
Taux de réussite par tentative
33.3%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
41.7%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
Tests instables
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
7Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Exécutions totales
48Exécutions totales…
48Exécutions totales…
Jetons de sortie
1,837Jetons de sortie…
38,682Jetons de sortie…
Jetons de raisonnement
0Jetons de raisonnement…
64,952Jetons de raisonnement…
Temps de réponse (moy.)
3.15sTemps de réponse (moy.)…
36.84sTemps de réponse (moy.)…
Temps de réponse (max)
8.91sTemps de réponse (max)…
174.55sTemps de réponse (max)…
Temps de réponse (total)
50.46sTemps de réponse (total)…
331.58sTemps de réponse (total)…
Meilleurs modèles par score
Score vs coût total
Temps de réponse (moy.)
Score moy. vs Temps de réponse (moy.)
Répartition par catégorie
Astuces anti-IA
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
Trinity Large Preview
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 3Temps de réponse (moy.)3.59sTemps de réponse (max)8.17sTemps de réponse (total)10.78sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
3.59sTemps de réponse (moy.)…
587Jetons de sortie…
0Jetons de raisonnement…
Z.ai: GLM 4.7 Flash
4.0Score moyen sur l’ensemble des tests de benchmark.…
4.5Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
55.6%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
2Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.N'a pas suivi les instructions: 1Mauvaise réponse: 1Temps de réponse (moy.)27.09sTemps de réponse (max)27.09sTemps de réponse (total)27.09sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
27.09sTemps de réponse (moy.)…
1,085Jetons de sortie…
5,597Jetons de raisonnement…
Combiné
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
Trinity Large Preview
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)8.91sTemps de réponse (max)8.91sTemps de réponse (total)8.91sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
8.91sTemps de réponse (moy.)…
294Jetons de sortie…
0Jetons de raisonnement…
Z.ai: GLM 4.7 Flash
10.0Score moyen sur l’ensemble des tests de benchmark.…
2.1Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
33.3%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.invalid tool call: 1Temps de réponse (moy.)65.57sTemps de réponse (max)65.57sTemps de réponse (total)65.57sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
65.57sTemps de réponse (moy.)…
2,585Jetons de sortie…
20,648Jetons de raisonnement…
Analyse et extraction des données
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
Trinity Large Preview
9.9Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)3.26sTemps de réponse (max)4.66sTemps de réponse (total)6.52sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
3.26sTemps de réponse (moy.)…
186Jetons de sortie…
0Jetons de raisonnement…
Z.ai: GLM 4.7 Flash
5.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
50.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse: 1Temps de réponse (moy.)1.51sTemps de réponse (max)1.51sTemps de réponse (total)1.51sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
1.51sTemps de réponse (moy.)…
584Jetons de sortie…
2,755Jetons de raisonnement…
Spécifique au domaine
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
Trinity Large Preview
4.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
33.3%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 2Temps de réponse (moy.)877msTemps de réponse (max)894msTemps de réponse (total)2.63sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
877msTemps de réponse (moy.)…
25Jetons de sortie…
0Jetons de raisonnement…
Z.ai: GLM 4.7 Flash
10.0Score moyen sur l’ensemble des tests de benchmark.…
4.4Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
33.3%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
2Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 2Aucune réponse: 1Temps de réponse (moy.)174.55sTemps de réponse (max)174.55sTemps de réponse (total)174.55sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
174.55sTemps de réponse (moy.)…
33,000Jetons de sortie…
25,394Jetons de raisonnement…
Intelligence générale
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
Trinity Large Preview
3.0Score moyen sur l’ensemble des tests de benchmark.…
9.9Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.N'a pas suivi les instructions: 1Temps de réponse (moy.)2.86sTemps de réponse (max)2.86sTemps de réponse (total)2.86sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
2.86sTemps de réponse (moy.)…
124Jetons de sortie…
0Jetons de raisonnement…
Z.ai: GLM 4.7 Flash
10.0Score moyen sur l’ensemble des tests de benchmark.…
9.7Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)18.14sTemps de réponse (max)18.14sTemps de réponse (total)18.14sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
18.14sTemps de réponse (moy.)…
18Jetons de sortie…
2,138Jetons de raisonnement…
Suivi des instructions
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
Trinity Large Preview
3.5Score moyen sur l’ensemble des tests de benchmark.…
6.7Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
16.7%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.N'a pas suivi les instructions: 1Mauvaise réponse: 1Temps de réponse (moy.)1.09sTemps de réponse (max)1.23sTemps de réponse (total)2.19sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
1.09sTemps de réponse (moy.)…
63Jetons de sortie…
0Jetons de raisonnement…
Z.ai: GLM 4.7 Flash
5.0Score moyen sur l’ensemble des tests de benchmark.…
5.8Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
66.7%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)2.97sTemps de réponse (max)2.97sTemps de réponse (total)2.97sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
2.97sTemps de réponse (moy.)…
388Jetons de sortie…
2,181Jetons de raisonnement…
Puzzle Solving
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
Trinity Large Preview
4.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
33.3%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 2Temps de réponse (moy.)3.30sTemps de réponse (max)4.81sTemps de réponse (total)9.91sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
3.30sTemps de réponse (moy.)…
291Jetons de sortie…
0Jetons de raisonnement…
Z.ai: GLM 4.7 Flash
10.0Score moyen sur l’ensemble des tests de benchmark.…
7.2Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
11.1%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 2N'a pas suivi les instructions: 1Temps de réponse (moy.)12.90sTemps de réponse (max)22.33sTemps de réponse (total)25.80sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
12.90sTemps de réponse (moy.)…
798Jetons de sortie…
5,225Jetons de raisonnement…
Appel d'outils
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons de sortie
Jetons de raisonnement
Trinity Large Preview
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)6.67sTemps de réponse (max)6.67sTemps de réponse (total)6.67sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
6.67sTemps de réponse (moy.)…
267Jetons de sortie…
0Jetons de raisonnement…
Z.ai: GLM 4.7 Flash
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)15.95sTemps de réponse (max)15.95sTemps de réponse (total)15.95sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…