Google: Gemini 3.5 Flash vs Grok 4.20 Multi Agent Beta
Résumé
Comparaison benchmark Gemini 3.5 Flash vs Grok 4.20 Multi Agent Beta : Gemini 3.5 Flash mène au score moyen avec 9.4 vs 6.6. Gemini 3.5 Flash a le coût de benchmark le plus bas avec $0.349 vs $5.599. Gemini 3.5 Flash est plus rapide avec 3.27s vs 9.69s, avec des taux de réussite de 90.5% vs 59.3%.
Modèle recommandé: Gemini 3.5 Flash - Il obtient le meilleur score ici (9.4) tout en coûtant environ 16.1x moins que Grok 4.20 Multi Agent Beta.
Benchmarks générés à partir des suites de tests AI BENCHY le: 2026-06-10
9.4Score moyen sur l’ensemble des tests de benchmark.…
6.6Score moyen sur l’ensemble des tests de benchmark.…
Rang
#3
#85
Fiabilité
10.0Score de réussite au premier essai : 10.0 signifie aucun échec réessayable de l'API cible ou de limite de débit avant les appels réussis ; les échecs suivis réduisent le score.…
N/DScore de réussite au premier essai : 10.0 signifie aucun échec réessayable de l'API cible ou de limite de débit avant les appels réussis ; les échecs suivis réduisent le score.…
Cohérence
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
7.9Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
Tests corrects
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 2Temps de réponse (moy.)3.27sTemps de réponse (max)9.05sTemps de réponse (total)68.65sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)2.52sTemps de réponse (max)5.40sTemps de réponse (total)10.08sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
2.52sTemps de réponse (moy.)…
494Total des jetons d'entrée…
209Jetons de sortie…
2,536Jetons de raisonnement…
Grok 4.20 Multi Agent BetaModèle archivé : ce modèle n'est plus mis à jour ni testé sur de nouveaux tests.
6.9Score moyen sur l’ensemble des tests de benchmark.…
5.8Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
75.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
2Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mise en forme supplémentaire: 1Mauvaise réponse: 1Temps de réponse (moy.)3.46sTemps de réponse (max)4.38sTemps de réponse (total)13.86sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
7.8Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
66.7%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)6.71sTemps de réponse (max)9.05sTemps de réponse (total)20.13sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
6.71sTemps de réponse (moy.)…
8,118Total des jetons d'entrée…
458Jetons de sortie…
13,420Jetons de raisonnement…
Grok 4.20 Multi Agent BetaModèle archivé : ce modèle n'est plus mis à jour ni testé sur de nouveaux tests.
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)27.11sTemps de réponse (max)27.11sTemps de réponse (total)27.11sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)6.44sTemps de réponse (max)6.44sTemps de réponse (total)6.44sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
6.44sTemps de réponse (moy.)…
12,873Total des jetons d'entrée…
351Jetons de sortie…
3,050Jetons de raisonnement…
Grok 4.20 Multi Agent BetaModèle archivé : ce modèle n'est plus mis à jour ni testé sur de nouveaux tests.
3.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Erreur API: 1Temps de réponse (moy.)0msTemps de réponse (max)0msTemps de réponse (total)0msUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)1.81sTemps de réponse (max)2.32sTemps de réponse (total)3.63sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
1.81sTemps de réponse (moy.)…
7,548Total des jetons d'entrée…
279Jetons de sortie…
1,164Jetons de raisonnement…
Grok 4.20 Multi Agent BetaModèle archivé : ce modèle n'est plus mis à jour ni testé sur de nouveaux tests.
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)5.54sTemps de réponse (max)7.51sTemps de réponse (total)11.08sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
7.7Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
66.7%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)3.39sTemps de réponse (max)4.44sTemps de réponse (total)10.16sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
3.39sTemps de réponse (moy.)…
633Total des jetons d'entrée…
12Jetons de sortie…
4,538Jetons de raisonnement…
Grok 4.20 Multi Agent BetaModèle archivé : ce modèle n'est plus mis à jour ni testé sur de nouveaux tests.
2.9Score moyen sur l’ensemble des tests de benchmark.…
7.2Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
11.1%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 2Mise en forme supplémentaire: 1Temps de réponse (moy.)24.67sTemps de réponse (max)35.28sTemps de réponse (total)74.02sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)2.27sTemps de réponse (max)2.27sTemps de réponse (total)2.27sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
2.27sTemps de réponse (moy.)…
486Total des jetons d'entrée…
119Jetons de sortie…
916Jetons de raisonnement…
Grok 4.20 Multi Agent BetaModèle archivé : ce modèle n'est plus mis à jour ni testé sur de nouveaux tests.
5.8Score moyen sur l’ensemble des tests de benchmark.…
2.8Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
66.7%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.N'a pas suivi les instructions: 1Temps de réponse (moy.)6.40sTemps de réponse (max)6.40sTemps de réponse (total)6.40sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
9.9Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)1.86sTemps de réponse (max)2.10sTemps de réponse (total)3.73sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
1.86sTemps de réponse (moy.)…
615Total des jetons d'entrée…
71Jetons de sortie…
1,652Jetons de raisonnement…
Grok 4.20 Multi Agent BetaModèle archivé : ce modèle n'est plus mis à jour ni testé sur de nouveaux tests.
9.8Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)3.52sTemps de réponse (max)3.80sTemps de réponse (total)7.04sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)2.35sTemps de réponse (max)3.25sTemps de réponse (total)7.06sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
2.35sTemps de réponse (moy.)…
558Total des jetons d'entrée…
288Jetons de sortie…
2,150Jetons de raisonnement…
Grok 4.20 Multi Agent BetaModèle archivé : ce modèle n'est plus mis à jour ni testé sur de nouveaux tests.
6.7Score moyen sur l’ensemble des tests de benchmark.…
7.9Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
55.6%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.N'a pas suivi les instructions: 1Mauvaise réponse: 1Temps de réponse (moy.)5.19sTemps de réponse (max)5.49sTemps de réponse (total)15.57sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)3.27sTemps de réponse (max)3.27sTemps de réponse (total)3.27sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
3.27sTemps de réponse (moy.)…
5,457Total des jetons d'entrée…
234Jetons de sortie…
403Jetons de raisonnement…
Grok 4.20 Multi Agent BetaModèle archivé : ce modèle n'est plus mis à jour ni testé sur de nouveaux tests.
3.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Erreur API: 1Temps de réponse (moy.)0msTemps de réponse (max)0msTemps de réponse (total)0msUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)1.88sTemps de réponse (max)1.88sTemps de réponse (total)1.88sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
1.88sTemps de réponse (moy.)…
156Total des jetons d'entrée…
12Jetons de sortie…
690Jetons de raisonnement…
Grok 4.20 Multi Agent BetaModèle archivé : ce modèle n'est plus mis à jour ni testé sur de nouveaux tests.