AI BENCHY Compare

IBM: Granite 4.1 8B vs OpenAI: GPT-5.5

Ringkasan

Perbandingan benchmark Granite 4.1 8B vs GPT-5.5: GPT-5.5 unggul dalam skor rata-rata dengan 9.3 vs 4.0. Granite 4.1 8B memiliki biaya benchmark lebih rendah di $0.003 vs $0.907. Granite 4.1 8B lebih cepat di 728ms vs 9.76s, dengan tingkat keberhasilan 9.5% vs 85.7%.

Model yang direkomendasikan: Granite 4.1 8B - It offers the best overall trade-off: a competitive score (4.0), lower cost than GPT-5.5, and balanced response time.

Benchmark dihasilkan dari suite pengujian AI BENCHY pada: 2026-06-12

Metrik	Granite 4.1 8B Granite 4.1 8B none Rilis: 2026-05-01	GPT-5.5 GPT-5.5 low Rilis: 2026-04-24

Metrik	Granite 4.1 8B Granite 4.1 8B none Rilis: 2026-05-01	GPT-5.5 GPT-5.5 low Rilis: 2026-04-24
Skor	4.0	9.3
Peringkat	#163	#5
Keandalan	10.0	10.0
Konsistensi	10.0	10.0
Tes benar
Tingkat lulus per percobaan	9.5%	85.7%
Tes tidak stabil	0	0
Total Run	63	63
Biaya per hasil	0.131	5.035
Total Biaya	$0.003	$0.907
Harga input	$0.050 / 1M	$5.000 / 1M
Harga output	$0.100 / 1M	$30.000 / 1M
Total token input	46,285	34,209
Token output	2,911	2,046
Token penalaran	0	22,460
Waktu respons (rata-rata)	728ms	9.76s
Waktu respons (maks)	2.17s	56.19s
Waktu respons (total)	15.29s	204.92s

Generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#163 IBM: Granite 4.1 8B

none

Cost: $0.001
Time: 3.2s
Tokens: 491 tok

#5 GPT-5.5

low

Cost: $0.068
Time: 37.0s
Tokens: 2,339 tok

Model teratas berdasarkan skor

Skor vs Total Biaya

Waktu respons (rata-rata)

Skor vs Waktu respons (rata-rata)

Total token output

Skor vs Total token output

Rincian Kategori

Trik anti-AI	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Granite 4.1 8B	4.9	10.0	25.0%	0		844ms	645	903	0
GPT-5.5	10.0	10.0	100.0%	0		4.41s	606	238	1,020

Pemrograman	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Granite 4.1 8B	4.5	10.0	0.0%	0		775ms	8,344	525	0
GPT-5.5	10.0	10.0	100.0%	0		15.04s	7,302	423	6,402

Gabungan	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Granite 4.1 8B	3.0	10.0	0.0%	0		1.88s	19,089	396	0
GPT-5.5	10.0	10.0	100.0%	0		9.56s	11,019	303	717

Parsing dan ekstraksi data	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Granite 4.1 8B	3.0	10.0	0.0%	0		575ms	7,617	195	0
GPT-5.5	10.0	10.0	100.0%	0		3.28s	7,140	228	157

Spesifik domain	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Granite 4.1 8B	3.0	10.0	0.0%	0		357ms	768	24	0
GPT-5.5	5.3	10.0	33.3%	0		28.05s	723	69	11,609

Kecerdasan umum	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Granite 4.1 8B	4.0	10.0	0.0%	0		499ms	528	115	0
GPT-5.5	10.0	10.0	100.0%	0		5.17s	477	133	245

Kepatuhan instruksi	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Granite 4.1 8B	3.6	9.9	0.0%	0		344ms	687	66	0
GPT-5.5	9.9	10.0	100.0%	0		3.74s	660	93	415

Pemecahan teka-teki	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Granite 4.1 8B	3.2	10.0	0.0%	0		608ms	672	432	0
GPT-5.5	10.0	10.0	100.0%	0		4.74s	642	279	954

Pemanggilan alat	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Granite 4.1 8B	10.0	10.0	100.0%	0		2.17s	7,719	243	0
GPT-5.5	10.0	10.0	100.0%	0		4.96s	5,445	250	101

Pengetahuan umum	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Granite 4.1 8B	3.0	10.0	0.0%	0		306ms	216	12	0
GPT-5.5	3.0	10.0	0.0%	0		10.06s	195	30	840

Perbandingan Cepat

Ganti Pasangan Perbandingan

GPT-5.5lowvsQwen3.7 Maxmedium Claude Fable 5mediumvsGPT-5.5low Gemini 3.1 Pro PreviewmediumvsGPT-5.5low Gemini 3.5 FlashmediumvsGPT-5.5low Granite 4.1 8BnonevsQwen3.5-9Bmedium Gemini 3 Flash PreviewmediumvsGPT-5.5low Granite 4.1 8BnonevsGLM 4.7 Flashmedium GPT-5.5lowvsQwen3.6 Max Previewmedium Claude Opus 4.8mediumvsGPT-5.5low Gemini 3.5 FlashhighvsGPT-5.5low Claude Opus 4.7mediumvsGPT-5.5low Granite 4.1 8BnonevsQwen3 Coder Nextmedium