AI BENCHY Compare

Anthropic: Claude Opus 4.8 vs OpenAI: GPT-5.4

Benchmarks générés à partir des suites de tests AI BENCHY le: 2026-06-03

Métrique	Claude Opus 4.8 Claude Opus 4.8 none Sortie: 2026-05-28	GPT-5.4 GPT-5.4 medium Sortie: 2026-03-05

Métrique	Claude Opus 4.8 Claude Opus 4.8 none Sortie: 2026-05-28	GPT-5.4 GPT-5.4 medium Sortie: 2026-03-05
Score	7.3	7.9
Rang	#62	#27
Fiabilité	10.0	10.0
Cohérence	9.2	8.5
Tests corrects
Taux de réussite par tentative	65.0%	75.0%
Tests instables	2	4
Exécutions totales	60	60
Coût par résultat	4.324	8.765
Coût total	$0.519	$1.140
Prix d'entrée	$5.000 / 1M	$2.500 / 1M
Prix de sortie	$25.000 / 1M	$15.000 / 1M
Total des jetons d'entrée	63,282	31,489
Jetons de sortie	8,098	2,221
Jetons de raisonnement	0	68,486
Temps de réponse (moy.)	3.51s	22.31s
Temps de réponse (max)	17.73s	100.41s
Temps de réponse (total)	70.19s	446.17s

Meilleurs modèles par score

Score vs coût total

Temps de réponse (moy.)

Score vs Temps de réponse (moy.)

Total des jetons de sortie

Score vs Total des jetons de sortie

Répartition par catégorie

Astuces anti-IA	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
Claude Opus 4.8	6.5	10.0	50.0%	0		3.40s	834	1,472	0
GPT-5.4	8.3	10.0	75.0%	0		4.11s	606	240	1,511

Programmation	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
Claude Opus 4.8	6.8	10.0	50.0%	0		3.59s	6,768	1,323	0
GPT-5.4	8.2	6.7	83.3%	1		54.98s	4,686	412	19,995

Combiné	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
Claude Opus 4.8	9.5	10.0	100.0%	0		17.73s	29,658	3,259	0
GPT-5.4	10.0	10.0	100.0%	0		20.57s	11,019	301	3,543

Analyse et extraction des données	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
Claude Opus 4.8	7.3	5.8	83.3%	1		1.77s	10,503	308	0
GPT-5.4	10.0	10.0	100.0%	0		5.32s	7,140	234	804

Spécifique au domaine	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
Claude Opus 4.8	5.3	7.2	44.4%	1		1.66s	975	61	0
GPT-5.4	5.3	7.2	44.4%	1		74.27s	619	61	34,748

Intelligence générale	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
Claude Opus 4.8	10.0	10.0	100.0%	0		3.48s	708	230	0
GPT-5.4	4.7	3.1	33.3%	1		4.92s	477	145	321

Suivi des instructions	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
Claude Opus 4.8	9.9	10.0	100.0%	0		1.37s	909	95	0
GPT-5.4	10.0	10.0	100.0%	0		3.11s	660	93	897

Résolution d'énigmes	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
Claude Opus 4.8	7.7	10.0	66.7%	0		2.74s	894	783	0
GPT-5.4	8.2	7.2	88.9%	1		9.14s	642	441	3,815

Appel d'outils	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
Claude Opus 4.8	10.0	10.0	100.0%	0		5.35s	11,775	355	0
GPT-5.4	10.0	10.0	100.0%	0		13.28s	5,445	264	1,031

Culture générale	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
Claude Opus 4.8	3.0	10.0	0.0%	0		3.41s	258	212	0
GPT-5.4	3.0	10.0	0.0%	0		13.95s	195	30	1,821

Comparaison rapide

Changer la paire de comparaison

GPT-5.4mediumvsQwen3.7 Maxnone Claude Opus 4.8nonevsQwen3.5-35B-A3Bmedium Claude Opus 4.8nonevsGPT-5.4 Minimedium Gemini 3.5 FlashminimalvsGPT-5.4medium Claude Opus 4.8nonevsGPT-5.2medium Claude Opus 4.8nonevsQwen3.6 35B A3Bmedium Claude Opus 4.8nonevsGLM 5V Turbomedium Claude Opus 4.8nonevsGPT-5.4 Nanomedium Claude Opus 4.8nonevsStep 3.7 Flashhigh Claude Opus 4.8nonevsMiniMax M3medium Claude Opus 4.8nonevsStep 3.7 Flashlow Claude Opus 4.8nonevsGPT-5 Minimedium