AI BENCHY Compare

DeepSeek: DeepSeek V3.2 vs IBM: Granite 4.1 8B

Zusammenfassung

DeepSeek V3.2 vs Granite 4.1 8B Benchmark-Vergleich: DeepSeek V3.2 führt beim Durchschnittsscore mit 5.3 vs 4.0. Granite 4.1 8B hat die niedrigeren Benchmark-Kosten mit $0.003 vs $0.017. Granite 4.1 8B ist schneller mit 728ms vs 13.83s, mit Erfolgsraten von 39.7% vs 9.5%.

Empfohlenes Modell: Granite 4.1 8B - Es bietet den besten Gesamtkompromiss: wettbewerbsfähige Punktzahl (4.0), niedrigere Kosten als DeepSeek V3.2 und ausgewogene Antwortzeit.

Benchmarks aus AI BENCHY-Test-Suites generiert am: 2026-06-12

Metrik	DeepSeek V3.2 DeepSeek V3.2 none Veröffentlichung: 2025-12-01	Granite 4.1 8B Granite 4.1 8B none Veröffentlichung: 2026-05-01

Metrik	DeepSeek V3.2 DeepSeek V3.2 none Veröffentlichung: 2025-12-01	Granite 4.1 8B Granite 4.1 8B none Veröffentlichung: 2026-05-01
Punktzahl	5.3	4.0
Rang	#133	#163
Zuverlässigkeit	10.0	10.0
Konsistenz	7.6	10.0
Korrekte Tests
Erfolgsquote pro Versuch	39.7%	9.5%
Instabile Tests	6	0
Gesamtläufe	63	63
Kosten pro Ergebnis	0.306	0.131
Gesamtkosten	$0.017	$0.003
Eingabepreis	$0.229 / 1M	$0.050 / 1M
Ausgabepreis	$0.344 / 1M	$0.100 / 1M
Gesamte Eingabe-Token	55,997	46,285
Ausgabe-Token	11,165	2,911
Denk-Token	0	0
Antwortzeit (Durchschnitt)	13.83s	728ms
Antwortzeit (Maximum)	115.89s	2.17s
Antwortzeit (Gesamt)	290.43s	15.29s

Generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#133 DeepSeek V3.2

none

Cost: $0.002
Time: 7.0s
Tokens: 1,046 tok

#163 IBM: Granite 4.1 8B

none

Cost: $0.001
Time: 3.2s
Tokens: 491 tok

Top-Modelle nach Score

Score vs. Gesamtkosten

Antwortzeit (Durchschnitt)

Punktzahl vs Antwortzeit (Durchschnitt)

Gesamte Ausgabe-Token

Punktzahl vs Gesamte Ausgabe-Token

Kategorieaufschlüsselung

Anti-KI-Tricks	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Eingabe-Token	Ausgabe-Token	Denk-Token
DeepSeek V3.2	3.2	8.0	8.3%	1		9.35s	494	1,073	0
Granite 4.1 8B	4.9	10.0	25.0%	0		844ms	645	903	0

Programmierung	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Eingabe-Token	Ausgabe-Token	Denk-Token
DeepSeek V3.2	3.1	6.9	11.1%	1		14.54s	7,279	4,528	0
Granite 4.1 8B	4.5	10.0	0.0%	0		775ms	8,344	525	0

Kombiniert	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Eingabe-Token	Ausgabe-Token	Denk-Token
DeepSeek V3.2	6.5	10.0	0.0%	0		115.89s	29,843	2,887	0
Granite 4.1 8B	3.0	10.0	0.0%	0		1.88s	19,089	396	0

Datenanalyse und -extraktion	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Eingabe-Token	Ausgabe-Token	Denk-Token
DeepSeek V3.2	6.3	5.8	66.7%	1		9.42s	7,890	1,710	0
Granite 4.1 8B	3.0	10.0	0.0%	0		575ms	7,617	195	0

Domänenspezifisch	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Eingabe-Token	Ausgabe-Token	Denk-Token
DeepSeek V3.2	2.9	7.2	11.1%	1		4.17s	624	21	0
Granite 4.1 8B	3.0	10.0	0.0%	0		357ms	768	24	0

Allgemeine Intelligenz	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Eingabe-Token	Ausgabe-Token	Denk-Token
DeepSeek V3.2	4.7	1.6	66.7%	1		9.32s	314	43	0
Granite 4.1 8B	4.0	10.0	0.0%	0		499ms	528	115	0

Befolgung von Anweisungen	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Eingabe-Token	Ausgabe-Token	Denk-Token
DeepSeek V3.2	10.0	10.0	100.0%	0		1.52s	627	66	0
Granite 4.1 8B	3.6	9.9	0.0%	0		344ms	687	66	0

Rätsellösen	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Eingabe-Token	Ausgabe-Token	Denk-Token
DeepSeek V3.2	7.6	7.2	77.8%	1		6.91s	424	298	0
Granite 4.1 8B	3.2	10.0	0.0%	0		608ms	672	432	0

Werkzeugaufrufe	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Eingabe-Token	Ausgabe-Token	Denk-Token
DeepSeek V3.2	10.0	10.0	100.0%	0		11.85s	8,319	522	0
Granite 4.1 8B	10.0	10.0	100.0%	0		2.17s	7,719	243	0

Allgemeinwissen	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Eingabe-Token	Ausgabe-Token	Denk-Token
DeepSeek V3.2	3.0	10.0	0.0%	0		17.23s	183	17	0
Granite 4.1 8B	3.0	10.0	0.0%	0		306ms	216	12	0

Schnellvergleich

Vergleichspaar wechseln

DeepSeek V3.2nonevsMiniMax M2.7medium DeepSeek V3.2nonevsMistral Small 4medium Granite 4.1 8BnonevsQwen3.5-9Bmedium Granite 4.1 8BnonevsGLM 4.7 Flashmedium CobuddymediumvsDeepSeek V3.2none DeepSeek V3.2nonevsMiniMax M2.5medium DeepSeek V3.2nonevsQwen3 Coder Nextmedium Granite 4.1 8BnonevsQwen3 Coder Nextmedium Granite 4.1 8BnonevsMiniMax M2.5medium DeepSeek V3.2nonevsGemini 3.1 Flash Liteminimal CobuddymediumvsGranite 4.1 8Bnone DeepSeek V3.2nonevsGLM 4.7 Flashmedium