AI BENCHY Compare

Anthropic: Claude Opus 4.6 vs Google: Gemini 3.1 Flash Lite

Benchmarks générés à partir des suites de tests AI BENCHY le: 2026-05-10

Métrique	Claude Opus 4.6 Claude Opus 4.6 medium Sortie: 2026-02-05	Gemini 3.1 Flash Lite Gemini 3.1 Flash Lite low Sortie: 2026-05-08

Métrique	Claude Opus 4.6 Claude Opus 4.6 medium Sortie: 2026-02-05	Gemini 3.1 Flash Lite Gemini 3.1 Flash Lite low Sortie: 2026-05-08
Score	7.4	7.6
Rang	#52	#44
Fiabilité	10.0	10.0
Cohérence	9.1	9.2
Tests corrects
Taux de réussite par tentative	66.7%	68.4%
Tests instables	2	2
Exécutions totales	57	57
Coût par résultat	14.243	0.203
Coût total	$1.710	$0.025
Prix d'entrée	$5.000 / 1M	$0.250 / 1M
Prix de sortie	$25.000 / 1M	$1.500 / 1M
Jetons de sortie	37,874	2,702
Jetons de raisonnement	21,390	8,596
Temps de réponse (moy.)	24.59s	1.92s
Temps de réponse (max)	83.40s	5.66s
Temps de réponse (total)	295.08s	36.49s

Meilleurs modèles par score

Score vs coût total

Temps de réponse (moy.)

Score vs Temps de réponse (moy.)

Total des jetons de sortie

Score vs Total des jetons de sortie

Répartition par catégorie

Astuces anti-IA	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons de sortie	Jetons de raisonnement
Claude Opus 4.6	6.4	5.8	66.7%	2		7.45s	986	1,071
Gemini 3.1 Flash Lite	7.3	6.2	75.0%	2		1.84s	1,013	1,548

Programmation	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons de sortie	Jetons de raisonnement
Claude Opus 4.6	10.0	10.0	100.0%	0		23.11s	3,486	1,504
Gemini 3.1 Flash Lite	10.0	10.0	100.0%	0		1.46s	441	408

Combiné	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons de sortie	Jetons de raisonnement
Claude Opus 4.6	10.0	10.0	100.0%	0		76.66s	8,178	5,194
Gemini 3.1 Flash Lite	3.0	10.0	0.0%	0		4.48s	348	975

Analyse et extraction des données	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons de sortie	Jetons de raisonnement
Claude Opus 4.6	10.0	10.0	100.0%	0		7.37s	691	757
Gemini 3.1 Flash Lite	10.0	10.0	100.0%	0		1.44s	291	697

Spécifique au domaine	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons de sortie	Jetons de raisonnement
Claude Opus 4.6	3.0	10.0	0.0%	0		83.40s	14,642	8,687
Gemini 3.1 Flash Lite	5.3	10.0	33.3%	0		1.52s	15	1,214

Intelligence générale	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons de sortie	Jetons de raisonnement
Claude Opus 4.6	10.0	10.0	100.0%	0		5.04s	188	292
Gemini 3.1 Flash Lite	4.0	10.0	0.0%	0		1.37s	69	438

Suivi des instructions	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons de sortie	Jetons de raisonnement
Claude Opus 4.6	10.0	10.0	100.0%	0		2.43s	266	467
Gemini 3.1 Flash Lite	10.0	10.0	100.0%	0		1.52s	72	760

Résolution d'énigmes	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons de sortie	Jetons de raisonnement
Claude Opus 4.6	7.7	10.0	66.7%	0		4.60s	531	637
Gemini 3.1 Flash Lite	10.0	10.0	100.0%	0		1.40s	210	1,191

Appel d'outils	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons de sortie	Jetons de raisonnement
Claude Opus 4.6	10.0	10.0	100.0%	0		9.73s	861	329
Gemini 3.1 Flash Lite	10.0	10.0	100.0%	0		5.66s	234	945

Culture générale	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons de sortie	Jetons de raisonnement
Claude Opus 4.6	3.0	10.0	0.0%	0		63.24s	8,045	2,452
Gemini 3.1 Flash Lite	3.0	10.0	0.0%	0		1.46s	9	420

Comparaison rapide

Changer la paire de comparaison

Gemini 3.1 Flash LitelowvsStep 3.5 Flashmedium Gemini 3.1 Flash LitelowvsQwen3.5-Flashmedium Gemini 3.1 Flash LitelowvsKimi K2.6medium Gemini 3.1 Flash LitelowvsGPT-5.3 Chatnone Gemini 3.1 Flash LitelowvsGPT-5.2 Chatnone Gemini 3.1 Flash LitelowvsGLM 5.1medium DeepSeek V4 FlashhighvsGemini 3.1 Flash Litelow Gemini 3.1 Flash LitelowvsGLM 5V Turbomedium Gemini 3.1 Flash LitelowvsQwen3.6 Flashmedium Gemini 3.1 Flash LitelowvsMiMo-V2-Promedium Claude Opus 4.6mediumvsQwen3.6 Max Previewnone Claude Opus 4.6mediumvsRing 2.6 1tnoneDisponible gratuitement