AI BENCHY Compare

Qwen: Qwen3.5-27B vs Qwen: Qwen3.6 35B A3B

Benchmarks aus AI BENCHY-Test-Suites generiert am: 2026-04-27

Metrik	Qwen3.5-27B Qwen3.5-27B medium Veröffentlichung: 2026-02-24	Qwen3.6 35B A3B Qwen3.6 35B A3B medium Veröffentlichung: 2026-04-20

Metrik	Qwen3.5-27B Qwen3.5-27B medium Veröffentlichung: 2026-02-24	Qwen3.6 35B A3B Qwen3.6 35B A3B medium Veröffentlichung: 2026-04-20
Punktzahl	8.4	8.8
Rang	#15	#9
Zuverlässigkeit	k. A.	10.0
Konsistenz	8.8	9.5
Korrekte Tests
Erfolgsquote pro Versuch	81.5%	83.3%
Instabile Tests	3	1
Gesamtläufe	54	54
Kosten pro Ergebnis	3.822	0.800
Gesamtkosten	$0.497	$0.104
Eingabepreis	$0.195 / 1M	$0.162 / 1M
Ausgabepreis	$1.560 / 1M	$0.966 / 1M
Ausgabe-Token	2,500	14,256
Denk-Token	242,500	98,005
Antwortzeit (Durchschnitt)	53.03s	11.98s
Antwortzeit (Maximum)	163.96s	45.02s
Antwortzeit (Gesamt)	954.46s	191.76s

Top-Modelle nach Score

Score vs. Gesamtkosten

Antwortzeit (Durchschnitt)

Punktzahl vs Antwortzeit (Durchschnitt)

Gesamte Ausgabe-Token

Punktzahl vs Gesamte Ausgabe-Token

Kategorieaufschlüsselung

Anti-KI-Tricks	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Ausgabe-Token	Denk-Token
Qwen3.5-27B	8.7	7.9	91.7%	1		19.75s	569	31,505
Qwen3.6 35B A3B	10.0	10.0	100.0%	0		6.02s	1,154	12,385

Programmierung	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Ausgabe-Token	Denk-Token
Qwen3.5-27B	10.0	10.0	100.0%	0		70.35s	375	19,165
Qwen3.6 35B A3B	10.0	10.0	100.0%	0		32.58s	3,294	15,116

Kombiniert	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Ausgabe-Token	Denk-Token
Qwen3.5-27B	10.0	10.0	100.0%	0		163.96s	483	9,991
Qwen3.6 35B A3B	0.0	0.0	0.0%	0		0ms	0	0

Datenanalyse und -extraktion	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Ausgabe-Token	Denk-Token
Qwen3.5-27B	10.0	10.0	100.0%	0		30.26s	270	16,150
Qwen3.6 35B A3B	10.0	10.0	100.0%	0		12.99s	2,591	9,968

Domänenspezifisch	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Ausgabe-Token	Denk-Token
Qwen3.5-27B	5.3	10.0	33.3%	0		79.53s	43	52,368
Qwen3.6 35B A3B	5.3	7.2	44.4%	1		22.50s	6,193	39,116

Allgemeine Intelligenz	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Ausgabe-Token	Denk-Token
Qwen3.5-27B	6.1	3.1	66.7%	1		101.41s	70	23,147
Qwen3.6 35B A3B	4.4	9.9	0.0%	0		8.66s	129	4,569

Befolgung von Anweisungen	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Ausgabe-Token	Denk-Token
Qwen3.5-27B	10.0	10.0	100.0%	0		19.66s	97	11,638
Qwen3.6 35B A3B	10.0	10.0	100.0%	0		7.50s	219	7,404

Rätsellösen	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Ausgabe-Token	Denk-Token
Qwen3.5-27B	8.2	7.7	77.8%	1		64.61s	245	77,213
Qwen3.6 35B A3B	10.0	10.0	100.0%	0		5.98s	676	9,447

Werkzeugaufrufe	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Ausgabe-Token	Denk-Token
Qwen3.5-27B	10.0	10.0	100.0%	0		7.45s	348	1,323
Qwen3.6 35B A3B	0.0	0.0	0.0%	0		0ms	0	0

Schnellvergleich

Vergleichspaar wechseln

Gemini 3 Flash PreviewlowvsQwen3.6 35B A3Bmedium Qwen3.5-27BmediumvsHY3 PreviewhighKostenlos verfügbar GPT-5.5lowvsQwen3.6 35B A3Bmedium Qwen3.6 35B A3BmediumvsHY3 PreviewhighKostenlos verfügbar Qwen3.5-27BmediumvsHY3 PreviewlowKostenlos verfügbar Gemini 3 Flash PreviewnonevsQwen3.5-27Bmedium Gemini 3.1 Flash Lite PreviewlowvsQwen3.5-27Bmedium Gemini 3 Flash PreviewlowvsQwen3.5-27Bmedium Claude Opus 4.7nonevsQwen3.6 35B A3Bmedium GPT-5.2 ChatnonevsQwen3.5-27Bmedium Gemini 3.1 Flash Lite PreviewnonevsQwen3.5-27Bmedium GPT-5.5lowvsQwen3.5-27Bmedium