AI BENCHY Compare

MoonshotAI: Kimi K2.7 Code vs OpenAI: GPT-5.5

Ringkasan

Perbandingan benchmark Kimi K2.7 Code vs GPT-5.5: GPT-5.5 unggul dalam skor rata-rata dengan 9.3 vs 7.0. Kimi K2.7 Code memiliki biaya benchmark lebih rendah di $0.669 vs $0.907. GPT-5.5 lebih cepat di 9.76s vs 83.60s, dengan tingkat keberhasilan 66.7% vs 85.7%.

Model yang direkomendasikan: GPT-5.5 - It has the best score here (9.3), while responding about 8.6x faster than Kimi K2.7 Code.

Benchmark dihasilkan dari suite pengujian AI BENCHY pada: 2026-06-12

Metrik	Kimi K2.7 Code Kimi K2.7 Code medium Rilis: 2026-06-12	GPT-5.5 GPT-5.5 low Rilis: 2026-04-24

Metrik	Kimi K2.7 Code Kimi K2.7 Code medium Rilis: 2026-06-12	GPT-5.5 GPT-5.5 low Rilis: 2026-04-24
Skor	7.0	9.3
Peringkat	#65	#5
Keandalan	9.2	10.0
Konsistensi	7.7	10.0
Tes benar
Tingkat lulus per percobaan	66.7%	85.7%
Tes tidak stabil	6	0
Total Run	63	63
Biaya per hasil	6.074	5.035
Total Biaya	$0.669	$0.907
Harga input	$0.950 / 1M	$5.000 / 1M
Harga output	$4.000 / 1M	$30.000 / 1M
Total token input	25,991	34,209
Token output	80,516	2,046
Token penalaran	161,391	22,460
Waktu respons (rata-rata)	83.60s	9.76s
Waktu respons (maks)	365.80s	56.19s
Waktu respons (total)	1671.99s	204.92s

Generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#65 MoonshotAI: Kimi K2.7 Code

medium

Cost: $0.025
Time: 138.0s
Tokens: 6,093 tok

#5 GPT-5.5

low

Cost: $0.068
Time: 37.0s
Tokens: 2,339 tok

Model teratas berdasarkan skor

Skor vs Total Biaya

Waktu respons (rata-rata)

Skor vs Waktu respons (rata-rata)

Total token output

Skor vs Total token output

Rincian Kategori

Trik anti-AI	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Kimi K2.7 Code	7.3	5.8	83.3%	2		11.56s	618	3,048	5,041
GPT-5.5	10.0	10.0	100.0%	0		4.41s	606	238	1,020

Pemrograman	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Kimi K2.7 Code	7.6	7.2	77.8%	1		146.73s	4,650	1,864	25,635
GPT-5.5	10.0	10.0	100.0%	0		15.04s	7,302	423	6,402

Gabungan	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Kimi K2.7 Code	4.7	1.6	66.7%	1		34.83s	11,271	444	3,906
GPT-5.5	10.0	10.0	100.0%	0		9.56s	11,019	303	717

Parsing dan ekstraksi data	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Kimi K2.7 Code	10.0	10.0	100.0%	0		12.27s	7,014	248	2,569
GPT-5.5	10.0	10.0	100.0%	0		3.28s	7,140	228	157

Spesifik domain	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Kimi K2.7 Code	5.3	7.2	44.4%	1		213.29s	431	55,572	63,639
GPT-5.5	5.3	10.0	33.3%	0		28.05s	723	69	11,609

Kecerdasan umum	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Kimi K2.7 Code	10.0	10.0	100.0%	0		10.78s	477	1,024	1,071
GPT-5.5	10.0	10.0	100.0%	0		5.17s	477	133	245

Kepatuhan instruksi	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Kimi K2.7 Code	9.9	10.0	100.0%	0		5.39s	669	725	1,232
GPT-5.5	9.9	10.0	100.0%	0		3.74s	660	93	415

Pemecahan teka-teki	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Kimi K2.7 Code	5.9	7.7	44.4%	1		41.00s	651	15,438	17,368
GPT-5.5	10.0	10.0	100.0%	0		4.74s	642	279	954

Pemanggilan alat	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Kimi K2.7 Code	3.0	10.0	0.0%	0		0ms	0	0	0
GPT-5.5	10.0	10.0	100.0%	0		4.96s	5,445	250	101

Pengetahuan umum	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Kimi K2.7 Code	3.0	10.0	0.0%	0		341.76s	210	2,153	40,930
GPT-5.5	3.0	10.0	0.0%	0		10.06s	195	30	840

Perbandingan Cepat

Ganti Pasangan Perbandingan

Gemini 3.5 FlashnonevsKimi K2.7 Codemedium GPT-5.5lowvsQwen3.7 Maxmedium Kimi K2.7 CodemediumvsStep 3.7 Flashhigh Gemini 3 Flash PreviewnonevsKimi K2.7 Codemedium Claude Fable 5mediumvsGPT-5.5low Gemini 3.1 Pro PreviewmediumvsGPT-5.5low Kimi K2.7 CodemediumvsQwen3.7 Maxnone Kimi K2.7 CodemediumvsQwen3.7 Plusnone Gemini 3.5 FlashminimalvsKimi K2.7 Codemedium Gemini 3.5 FlashmediumvsGPT-5.5low Claude Opus 4.8nonevsKimi K2.7 Codemedium Gemini 3 Flash PreviewmediumvsGPT-5.5low