AI BENCHY Compare

Anthropic: Claude Opus 4.7 vs Qwen: Qwen3.6 35B A3B

Benchmarks aus AI BENCHY-Test-Suites generiert am: 2026-04-27

Metrik	Claude Opus 4.7 Claude Opus 4.7 none Veröffentlichung: 2026-04-16	Qwen3.6 35B A3B Qwen3.6 35B A3B none Veröffentlichung: 2026-04-20

Metrik	Claude Opus 4.7 Claude Opus 4.7 none Veröffentlichung: 2026-04-16	Qwen3.6 35B A3B Qwen3.6 35B A3B none Veröffentlichung: 2026-04-20
Punktzahl	9.2	5.1
Rang	#4	#112
Zuverlässigkeit	k. A.	10.0
Konsistenz	10.0	7.4
Korrekte Tests
Erfolgsquote pro Versuch	88.9%	39.6%
Instabile Tests	0	5
Gesamtläufe	54	54
Kosten pro Ergebnis	3.155	0.471
Gesamtkosten	$0.505	$0.019
Eingabepreis	$5.000 / 1M	$0.162 / 1M
Ausgabepreis	$25.000 / 1M	$0.966 / 1M
Ausgabe-Token	6,326	17,503
Denk-Token	0	0
Antwortzeit (Durchschnitt)	3.13s	2.87s
Antwortzeit (Maximum)	18.27s	12.46s
Antwortzeit (Gesamt)	56.33s	46.00s

Top-Modelle nach Score

Score vs. Gesamtkosten

Antwortzeit (Durchschnitt)

Punktzahl vs Antwortzeit (Durchschnitt)

Gesamte Ausgabe-Token

Punktzahl vs Gesamte Ausgabe-Token

Kategorieaufschlüsselung

Anti-KI-Tricks	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Ausgabe-Token	Denk-Token
Claude Opus 4.7	8.3	10.0	75.0%	0		2.12s	522	0
Qwen3.6 35B A3B	3.6	7.6	16.7%	1		2.10s	1,571	0

Programmierung	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Ausgabe-Token	Denk-Token
Claude Opus 4.7	10.0	10.0	100.0%	0		2.84s	494	0
Qwen3.6 35B A3B	10.0	10.0	100.0%	0		2.05s	921	0

Kombiniert	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Ausgabe-Token	Denk-Token
Claude Opus 4.7	9.5	10.0	100.0%	0		18.27s	3,504	0
Qwen3.6 35B A3B	0.0	0.0	0.0%	0		0ms	0	0

Datenanalyse und -extraktion	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Ausgabe-Token	Denk-Token
Claude Opus 4.7	10.0	10.0	100.0%	0		2.15s	324	0
Qwen3.6 35B A3B	10.0	10.0	100.0%	0		1.46s	248	0

Domänenspezifisch	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Ausgabe-Token	Denk-Token
Claude Opus 4.7	7.7	10.0	66.7%	0		1.19s	78	0
Qwen3.6 35B A3B	3.5	4.4	33.3%	2		7.45s	11,381	0

Allgemeine Intelligenz	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Ausgabe-Token	Denk-Token
Claude Opus 4.7	10.0	10.0	100.0%	0		3.47s	257	0
Qwen3.6 35B A3B	4.4	3.0	33.3%	1		3.51s	1,545	0

Befolgung von Anweisungen	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Ausgabe-Token	Denk-Token
Claude Opus 4.7	10.0	10.0	100.0%	0		1.46s	114	0
Qwen3.6 35B A3B	6.2	5.8	66.7%	1		1.86s	1,264	0

Rätsellösen	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Ausgabe-Token	Denk-Token
Claude Opus 4.7	10.0	10.0	100.0%	0		2.58s	661	0
Qwen3.6 35B A3B	3.2	9.9	0.0%	0		1.00s	573	0

Werkzeugaufrufe	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Ausgabe-Token	Denk-Token
Claude Opus 4.7	10.0	10.0	100.0%	0		4.74s	372	0
Qwen3.6 35B A3B	0.0	0.0	0.0%	0		0ms	0	0

Schnellvergleich

Vergleichspaar wechseln

Claude Opus 4.7nonevsGPT-5.5low Elephant AlphamediumvsQwen3.6 35B A3Bnone MiniMax M2.7mediumvsQwen3.6 35B A3Bnone Claude Opus 4.7nonevsGPT-5.5medium Claude Opus 4.7nonevsGemini 3 Flash Previewlow Claude Opus 4.7nonevsQwen3.6 Max Previewmedium Claude Opus 4.7nonevsGemini 3.1 Pro Previewmedium Claude Opus 4.7nonevsQwen3.6 35B A3Bmedium Qwen3.6 35B A3BnonevsGLM 4.7 Flashmedium Mistral Small 4mediumvsQwen3.6 35B A3Bnone Claude Opus 4.7nonevsSeed-2.0-Litemedium MiniMax M2.5mediumKostenlos verfügbarvsQwen3.6 35B A3Bnone