Anthropic: Claude Opus 4.8 vs Qwen: Qwen3.5-27B

Qwen3.5-27B (medium) mène au score moyen avec 7.4 vs 7.3. Claude Opus 4.8 a le coût de benchmark le plus bas avec $1.166 vs $1.627. Claude Opus 4.8 est plus rapide avec 4.91s vs 111.94s, avec des taux de réussite de 63.6% vs 72.7%.

Modèle recommandéClaude Opus 4.8Son score reste proche du meilleur score ici (7.3 vs 7.4) et il répond environ 22.8x plus vite que Qwen3.5-27B (medium).

Benchmarks générés à partir des suites de tests AI BENCHY le: 2026-07-18

Métrique	Claude Opus 4.8 Claude Opus 4.8 none Sortie: 2026-05-28	Qwen3.5-27B Qwen3.5-27B medium Sortie: 2026-02-24

Métrique	Claude Opus 4.8 Claude Opus 4.8 none Sortie: 2026-05-28	Qwen3.5-27B Qwen3.5-27B medium Sortie: 2026-02-24
Score	7.3	7.4
Rang	#65	#58
Fiabilité	10.0	10.0
Cohérence	9.2	8.2
Tests corrects
Taux de réussite par tentative	63.6%	72.7%
Tests instables	2	5
Exécutions totales	66	66
Coût par résultat	8.969	8.324
Coût total	$1.166	$1.627
Prix d'entrée	$5.000 / 1M	$0.260 / 1M
Prix de sortie	$25.000 / 1M	$2.600 / 1M
Total des jetons d'entrée	149,206	111,635
Jetons de sortie	16,797	15,999
Jetons de raisonnement	0	598,430
Temps de réponse (moy.)	4.91s	111.94s
Temps de réponse (max)	35.03s	1026.43s
Temps de réponse (total)	108.03s	2462.67s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#65 Claude Opus 4.8

none

Coût: $0.053
Temps: 22.0s
Tokens: 2,253 tok

#58 Qwen3.5-27B

medium

Coût: $0.008
Temps: 62.0s
Tokens: 3,099 tok

Meilleurs modèles par score

Score vs coût total

Temps de réponse (moy.)

Score vs Temps de réponse (moy.)

Total des jetons de sortie

Score vs Total des jetons de sortie

Répartition par catégorie

Catégorie:

Astuces anti-IA	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
Claude Opus 4.8	6.5	10.0	50.0%	0		3.40s	834	1,472	0
Qwen3.5-27B	8.7	7.9	91.7%	1		19.75s	672	569	31,505

Programmation	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
Claude Opus 4.8	5.5	10.0	33.3%	0		3.29s	10,590	1,332	0
Qwen3.5-27B	6.2	7.1	55.6%	1		160.69s	7,895	6,381	89,388

Combiné	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
Claude Opus 4.8	9.8	10.0	100.0%	0		26.38s	111,760	11,949	0
Qwen3.5-27B	7.3	5.8	83.3%	1		595.19s	84,417	7,948	279,132

Analyse et extraction des données	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
Claude Opus 4.8	7.3	5.8	83.3%	1		1.77s	10,503	308	0
Qwen3.5-27B	10.0	10.0	100.0%	0		30.26s	7,782	270	16,150

Spécifique au domaine	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
Claude Opus 4.8	5.3	7.2	44.4%	1		1.70s	975	61	0
Qwen3.5-27B	5.3	10.0	33.3%	0		79.53s	553	43	52,368

Intelligence générale	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
Claude Opus 4.8	10.0	10.0	100.0%	0		3.48s	708	230	0
Qwen3.5-27B	6.1	3.1	66.7%	1		101.41s	524	70	23,147

Suivi des instructions	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
Claude Opus 4.8	9.9	10.0	100.0%	0		1.37s	909	95	0
Qwen3.5-27B	10.0	10.0	100.0%	0		19.66s	699	97	11,638

Résolution d'énigmes	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
Claude Opus 4.8	7.7	10.0	66.7%	0		2.74s	894	783	0
Qwen3.5-27B	8.2	7.7	77.8%	1		59.60s	696	242	70,096

Appel d'outils	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
Claude Opus 4.8	10.0	10.0	100.0%	0		5.35s	11,775	355	0
Qwen3.5-27B	10.0	10.0	100.0%	0		7.45s	8,193	348	1,323

Culture générale	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
Claude Opus 4.8	3.0	10.0	0.0%	0		3.41s	258	212	0
Qwen3.5-27B	3.0	10.0	0.0%	0		85.11s	204	31	23,683

Comparaison rapide

Changer la paire de comparaison

Claude Opus 4.8nonevsStep 3.7 Flashlow Claude Opus 4.8nonevsKimi K2.6medium Claude Opus 4.8nonevsGemini 3.1 Flash Litemedium Claude Opus 4.8nonevsKAT-Coder-Pro V2.5high GPT-5.6 TerralowvsQwen3.5-27Bmedium Claude Opus 4.8nonevsGemini 3.1 Flash Lite Previewmedium GPT-5.3 ChatnonevsQwen3.5-27Bmedium Gemini 3 Flash PreviewlowvsQwen3.5-27Bmedium KAT-Coder-Pro V2.5lowvsQwen3.5-27Bmedium Claude Opus 4.8nonevsQwen3.5 Plus 2026-04-20medium Claude Sonnet 4.6nonevsQwen3.5-27Bmedium Claude Opus 4.8nonevsKAT-Coder-Pro V2.5low