AI BENCHY Compare

OpenAI: GPT-5.2 vs Qwen: Qwen3.6 Max Preview

Benchmarks aus AI BENCHY-Test-Suites generiert am: 2026-04-27

Metrik	GPT-5.2 GPT-5.2 medium Veröffentlichung: 2025-12-11	Qwen3.6 Max Preview Qwen3.6 Max Preview none Veröffentlichung: 2026-04-20

Metrik	GPT-5.2 GPT-5.2 medium Veröffentlichung: 2025-12-11	Qwen3.6 Max Preview Qwen3.6 Max Preview none Veröffentlichung: 2026-04-20
Punktzahl	7.5	7.3
Rang	#52	#56
Zuverlässigkeit	k. A.	10.0
Konsistenz	8.1	8.7
Korrekte Tests
Erfolgsquote pro Versuch	72.2%	66.7%
Instabile Tests	4	3
Gesamtläufe	54	54
Kosten pro Ergebnis	3.193	0.827
Gesamtkosten	$0.352	$0.083
Eingabepreis	$1.750 / 1M	$1.300 / 1M
Ausgabepreis	$14.000 / 1M	$7.800 / 1M
Ausgabe-Token	2,705	4,732
Denk-Token	18,977	0
Antwortzeit (Durchschnitt)	14.04s	3.38s
Antwortzeit (Maximum)	77.80s	20.51s
Antwortzeit (Gesamt)	154.41s	60.83s

Top-Modelle nach Score

Score vs. Gesamtkosten

Antwortzeit (Durchschnitt)

Punktzahl vs Antwortzeit (Durchschnitt)

Gesamte Ausgabe-Token

Punktzahl vs Gesamte Ausgabe-Token

Kategorieaufschlüsselung

Anti-KI-Tricks	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Ausgabe-Token	Denk-Token
GPT-5.2	6.5	8.0	58.3%	1		7.81s	567	2,002
Qwen3.6 Max Preview	5.2	7.9	41.7%	1		2.63s	513	0

Programmierung	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Ausgabe-Token	Denk-Token
GPT-5.2	10.0	10.0	100.0%	0		15.12s	467	2,166
Qwen3.6 Max Preview	5.0	2.0	66.7%	1		3.45s	426	0

Kombiniert	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Ausgabe-Token	Denk-Token
GPT-5.2	10.0	10.0	100.0%	0		14.06s	291	1,757
Qwen3.6 Max Preview	3.0	10.0	0.0%	0		20.51s	2,842	0

Datenanalyse und -extraktion	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Ausgabe-Token	Denk-Token
GPT-5.2	10.0	10.0	100.0%	0		3.15s	234	420
Qwen3.6 Max Preview	10.0	10.0	100.0%	0		2.87s	243	0

Domänenspezifisch	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Ausgabe-Token	Denk-Token
GPT-5.2	5.9	7.2	55.6%	1		77.80s	42	10,342
Qwen3.6 Max Preview	7.7	10.0	66.7%	0		1.22s	18	0

Allgemeine Intelligenz	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Ausgabe-Token	Denk-Token
GPT-5.2	3.7	9.7	0.0%	0		4.32s	162	269
Qwen3.6 Max Preview	4.3	10.0	0.0%	0		1.62s	76	0

Befolgung von Anweisungen	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Ausgabe-Token	Denk-Token
GPT-5.2	9.9	10.0	100.0%	0		3.12s	94	614
Qwen3.6 Max Preview	8.4	6.9	83.3%	1		1.45s	69	0

Rätsellösen	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Ausgabe-Token	Denk-Token
GPT-5.2	7.7	7.3	77.8%	1		5.47s	609	938
Qwen3.6 Max Preview	10.0	10.0	100.0%	0		2.38s	323	0

Werkzeugaufrufe	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Ausgabe-Token	Denk-Token
GPT-5.2	4.7	1.6	66.7%	1		10.30s	239	469
Qwen3.6 Max Preview	10.0	10.0	100.0%	0		5.27s	222	0

Schnellvergleich

Vergleichspaar wechseln

Claude Sonnet 4.6nonevsGPT-5.2medium GPT-5.4 MinimediumvsQwen3.6 Max Previewnone Qwen3.6 Max PreviewnonevsMiMo-V2-Flashmedium Seed-2.0-MinimediumvsQwen3.6 Max Previewnone GPT-5.4 NanomediumvsQwen3.6 Max Previewnone Claude Opus 4.6mediumvsQwen3.6 Max Previewnone GPT-5 MinimediumvsQwen3.6 Max Previewnone Kimi K2.5mediumvsQwen3.6 Max Previewnone Qwen3.6 Max PreviewnonevsMiMo-V2-Omnimedium DeepSeek V4 FlashhighvsGPT-5.2medium Qwen3.6 Max PreviewnonevsGrok 4.20medium Kimi K2.6mediumvsQwen3.6 Max Previewnone