Anthropic: Claude Opus 4.8 vs Qwen: Qwen3.5-122B-A10B

Claude Opus 4.8 mène au score moyen avec 7.3 vs 7.1. Qwen3.5-122B-A10B (medium) a le coût de benchmark le plus bas avec $1.046 vs $1.166. Claude Opus 4.8 est plus rapide avec 4.91s vs 64.16s, avec des taux de réussite de 63.6% vs 71.2%.

Modèle recommandéClaude Opus 4.8Il obtient le meilleur score ici (7.3) et répond environ 13.1x plus vite que Qwen3.5-122B-A10B (medium).

Benchmarks générés à partir des suites de tests AI BENCHY le: 2026-07-17

Métrique	Claude Opus 4.8 Claude Opus 4.8 none Sortie: 2026-05-28	Qwen3.5-122B-A10B Qwen3.5-122B-A10B medium Sortie: 2026-02-24

Métrique	Claude Opus 4.8 Claude Opus 4.8 none Sortie: 2026-05-28	Qwen3.5-122B-A10B Qwen3.5-122B-A10B medium Sortie: 2026-02-24
Score	7.3	7.1
Rang	#63	#69
Fiabilité	10.0	10.0
Cohérence	9.2	8.5
Tests corrects
Taux de réussite par tentative	63.6%	71.2%
Tests instables	2	4
Exécutions totales	66	66
Coût par résultat	8.969	8.509
Coût total	$1.166	$1.046
Prix d'entrée	$5.000 / 1M	$0.260 / 1M
Prix de sortie	$25.000 / 1M	$2.080 / 1M
Total des jetons d'entrée	149,206	124,771
Jetons de sortie	16,797	44,077
Jetons de raisonnement	0	443,141
Temps de réponse (moy.)	4.91s	64.16s
Temps de réponse (max)	35.03s	519.30s
Temps de réponse (total)	108.03s	1411.60s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#63 Claude Opus 4.8

none

Coût: $0.053
Temps: 22.0s
Tokens: 2,253 tok

#69 Qwen3.5-122B-A10B

medium

Coût: $0.019
Temps: 48.7s
Tokens: 6,034 tok

Meilleurs modèles par score

Score vs coût total

Temps de réponse (moy.)

Score vs Temps de réponse (moy.)

Total des jetons de sortie

Score vs Total des jetons de sortie

Répartition par catégorie

Catégorie:

Astuces anti-IA	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
Claude Opus 4.8	6.5	10.0	50.0%	0		3.40s	834	1,472	0
Qwen3.5-122B-A10B	10.0	10.0	100.0%	0		9.75s	672	269	16,835

Programmation	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
Claude Opus 4.8	5.5	10.0	33.3%	0		3.29s	10,590	1,332	0
Qwen3.5-122B-A10B	6.0	7.2	55.6%	1		114.48s	7,630	8,057	82,578

Combiné	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
Claude Opus 4.8	9.8	10.0	100.0%	0		26.38s	111,760	11,949	0
Qwen3.5-122B-A10B	6.4	5.8	66.7%	1		313.55s	97,886	18,373	203,450

Analyse et extraction des données	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
Claude Opus 4.8	7.3	5.8	83.3%	1		1.77s	10,503	308	0
Qwen3.5-122B-A10B	10.0	10.0	100.0%	0		23.41s	7,782	270	16,558

Spécifique au domaine	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
Claude Opus 4.8	5.3	7.2	44.4%	1		1.70s	975	61	0
Qwen3.5-122B-A10B	2.9	7.2	11.1%	1		63.40s	771	15,537	64,889

Intelligence générale	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
Claude Opus 4.8	10.0	10.0	100.0%	0		3.48s	708	230	0
Qwen3.5-122B-A10B	3.4	2.2	33.3%	1		34.11s	344	66	7,592

Suivi des instructions	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
Claude Opus 4.8	9.9	10.0	100.0%	0		1.37s	909	95	0
Qwen3.5-122B-A10B	10.0	10.0	100.0%	0		9.88s	593	77	7,372

Résolution d'énigmes	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
Claude Opus 4.8	7.7	10.0	66.7%	0		2.74s	894	783	0
Qwen3.5-122B-A10B	10.0	10.0	100.0%	0		17.89s	696	284	27,575

Appel d'outils	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
Claude Opus 4.8	10.0	10.0	100.0%	0		5.35s	11,775	355	0
Qwen3.5-122B-A10B	10.0	10.0	100.0%	0		4.60s	8,193	322	1,226

Culture générale	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
Claude Opus 4.8	3.0	10.0	0.0%	0		3.41s	258	212	0
Qwen3.5-122B-A10B	3.0	10.0	0.0%	0		52.87s	204	822	15,066

Comparaison rapide

Changer la paire de comparaison