AI BENCHY Compare

Anthropic: Claude Opus 4.8 vs Qwen: Qwen3.6 Plus

Benchmarks générés à partir des suites de tests AI BENCHY le: 2026-05-29

Métrique	Claude Opus 4.8 Claude Opus 4.8 none Sortie: 2026-05-28	Qwen3.6 Plus Qwen3.6 Plus medium Sortie: 2026-04-20

Métrique	Claude Opus 4.8 Claude Opus 4.8 none Sortie: 2026-05-28	Qwen3.6 Plus Qwen3.6 Plus medium Sortie: 2026-04-20
Score	7.3	7.8
Rang	#65	#38
Fiabilité	10.0	10.0
Cohérence	9.2	9.2
Tests corrects
Taux de réussite par tentative	65.0%	68.3%
Tests instables	2	2
Exécutions totales	60	60
Coût par résultat	4.324	0.630
Coût total	$0.519	$0.082
Prix d'entrée	$5.000 / 1M	$0.325 / 1M
Prix de sortie	$25.000 / 1M	$1.950 / 1M
Jetons de sortie	8,098	1,833
Jetons de raisonnement	0	124,782
Temps de réponse (moy.)	3.51s	26.81s
Temps de réponse (max)	17.73s	201.68s
Temps de réponse (total)	70.19s	509.43s

Meilleurs modèles par score

Score vs coût total

Temps de réponse (moy.)

Score vs Temps de réponse (moy.)

Total des jetons de sortie

Score vs Total des jetons de sortie

Répartition par catégorie

Astuces anti-IA	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons de sortie	Jetons de raisonnement
Claude Opus 4.8	6.5	10.0	50.0%	0		3.40s	1,472	0
Qwen3.6 Plus	10.0	10.0	100.0%	0		9.90s	207	7,557

Programmation	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons de sortie	Jetons de raisonnement
Claude Opus 4.8	6.8	10.0	50.0%	0		3.59s	1,323	0
Qwen3.6 Plus	4.1	6.7	16.7%	1		201.68s	38	33,395

Combiné	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons de sortie	Jetons de raisonnement
Claude Opus 4.8	9.5	10.0	100.0%	0		17.73s	3,259	0
Qwen3.6 Plus	10.0	10.0	100.0%	0		34.95s	452	13,073

Analyse et extraction des données	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons de sortie	Jetons de raisonnement
Claude Opus 4.8	7.3	5.8	83.3%	1		1.77s	308	0
Qwen3.6 Plus	10.0	10.0	100.0%	0		14.95s	270	10,706

Spécifique au domaine	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons de sortie	Jetons de raisonnement
Claude Opus 4.8	5.3	7.2	44.4%	1		1.66s	61	0
Qwen3.6 Plus	2.9	7.2	11.1%	1		29.59s	56	33,464

Intelligence générale	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons de sortie	Jetons de raisonnement
Claude Opus 4.8	10.0	10.0	100.0%	0		3.48s	230	0
Qwen3.6 Plus	5.1	10.0	0.0%	0		27.05s	111	5,232

Suivi des instructions	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons de sortie	Jetons de raisonnement
Claude Opus 4.8	9.9	10.0	100.0%	0		1.37s	95	0
Qwen3.6 Plus	10.0	10.0	100.0%	0		7.54s	102	5,552

Résolution d'énigmes	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons de sortie	Jetons de raisonnement
Claude Opus 4.8	7.7	10.0	66.7%	0		2.74s	783	0
Qwen3.6 Plus	10.0	10.0	100.0%	0		6.34s	309	6,712

Appel d'outils	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons de sortie	Jetons de raisonnement
Claude Opus 4.8	10.0	10.0	100.0%	0		5.35s	355	0
Qwen3.6 Plus	10.0	10.0	100.0%	0		5.87s	267	1,330

Culture générale	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons de sortie	Jetons de raisonnement
Claude Opus 4.8	3.0	10.0	0.0%	0		3.41s	212	0
Qwen3.6 Plus	3.0	10.0	0.0%	0		47.51s	21	7,761

Comparaison rapide

Changer la paire de comparaison

Claude Opus 4.8nonevsDeepSeek V3.2medium Claude Opus 4.8nonevsQwen3.5-35B-A3Bmedium Claude Opus 4.8nonevsRing-2.6-1Tmedium Claude Opus 4.8nonevsGPT-5.4 Minimedium Claude Opus 4.8nonevsGPT-5.2medium Claude Opus 4.8nonevsGLM 5V Turbomedium Claude Opus 4.8nonevsGPT-5.4 Nanomedium GPT-5.2 ChatnonevsQwen3.6 Plusmedium Claude Opus 4.8nonevsStep 3.5 Flashmedium Claude Opus 4.8nonevsStep 3.7 Flashlow Gemini 3 Flash PreviewnonevsQwen3.6 Plusmedium Claude Opus 4.8nonevsGPT-5 Minimedium