Comparer Graphiques Méthodologie

Langue:

❤️ Made by XCS

AI BENCHY Compare

OpenAI: GPT-5.3 Chat vs Qwen: Qwen3.5-27B

Comparer:

Benchmarks générés à partir des suites de tests AI BENCHY le: 2026-03-06

Métrique	OpenAI: GPT-5.3 Chat none Sortie: 2026-03-03	Qwen: Qwen3.5-27B medium Sortie: 2026-02-24
Rang	#19	#7
Score moy.	7.3	8.2
Cohérence	8.5	9.1
Coût par résultat	3.163	3.585
Coût total	$0.317	$0.431
Tests corrects
Taux de réussite par tentative	70.8%	81.3%
Tests instables	3	2
Exécutions totales	48 (16 x 3)	48 (16 x 3)
Jetons de sortie	19,272	1,658
Jetons de raisonnement	0	200,786
Temps de réponse (moy.)	5.96s	52.13s
Temps de réponse (max)	18.33s	163.96s
Temps de réponse (total)	95.30s	834.16s

Meilleurs modèles par score

Score vs coût total

Temps de réponse (moy.)

Score moy. vs Temps de réponse (moy.)

Répartition par catégorie

Astuces anti-IA	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons de sortie	Jetons de raisonnement
OpenAI: GPT-5.3 Chat	7.3	7.5	77.8%	1		4.72s	3,091	0
Qwen: Qwen3.5-27B	10.0	10.0	100.0%	0		9.69s	102	8,956

Combiné	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons de sortie	Jetons de raisonnement
OpenAI: GPT-5.3 Chat	10.0	10.0	100.0%	0		11.96s	2,614	0
Qwen: Qwen3.5-27B	10.0	10.0	100.0%	0		163.96s	483	9,991

Analyse et extraction des données	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons de sortie	Jetons de raisonnement
OpenAI: GPT-5.3 Chat	9.9	10.0	100.0%	0		2.21s	942	0
Qwen: Qwen3.5-27B	9.9	10.0	100.0%	0		30.26s	270	16,150

Spécifique au domaine	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons de sortie	Jetons de raisonnement
OpenAI: GPT-5.3 Chat	10.0	4.4	33.3%	2		13.01s	8,264	0
Qwen: Qwen3.5-27B	4.0	10.0	33.3%	0		79.53s	43	52,368

Intelligence générale	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons de sortie	Jetons de raisonnement
OpenAI: GPT-5.3 Chat	4.0	10.0	0.0%	0		1.99s	319	0
Qwen: Qwen3.5-27B	5.0	3.1	66.7%	1		101.41s	70	23,147

Suivi des instructions	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons de sortie	Jetons de raisonnement
OpenAI: GPT-5.3 Chat	9.0	10.0	50.0%	0		3.29s	1,455	0
Qwen: Qwen3.5-27B	10.0	10.0	100.0%	0		19.66s	97	11,638

Puzzle Solving	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons de sortie	Jetons de raisonnement
OpenAI: GPT-5.3 Chat	10.0	10.0	100.0%	0		2.93s	1,726	0
Qwen: Qwen3.5-27B	8.3	7.7	77.8%	1		64.61s	245	77,213

Appel d'outils	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons de sortie	Jetons de raisonnement
OpenAI: GPT-5.3 Chat	10.0	10.0	100.0%	0		8.36s	861	0
Qwen: Qwen3.5-27B	10.0	10.0	100.0%	0		7.45s	348	1,323

Comparaison rapide

Changer la paire de comparaison

Gemini 3.1 Flash Lite PreviewhighvsQwen3.5-27Bmedium DeepSeek V3.2mediumvsGPT-5.3 Chatnone Gemini 3 Flash PreviewlowvsQwen3.5-27Bmedium Gemini 3.1 Flash Lite PreviewlowvsGPT-5.3 Chatnone GPT-5.3 ChatnonevsMiMo-V2-Flashmedium Gemini 2.5 FlashmediumvsGPT-5.3 Chatnone GPT-5.3 ChatnonevsGLM 5medium GPT-5.3 ChatnonevsStep 3.5 FlashmediumDisponible gratuitement Gemini 3.1 Flash Lite PreviewmediumvsGPT-5.3 Chatnone Seed-2.0-MinimediumvsGPT-5.3 Chatnone GPT-5.3 ChatnonevsQwen3.5-Flashmedium Claude Sonnet 4.6mediumvsGPT-5.3 Chatnone