Navigate
AI BENCHY
Advertise here

MoonshotAI: Kimi K2.7 Code vs OpenAI: GPT-5.6 Luna

The average score is effectively tied at 7.5 vs 7.6. GPT-5.6 Luna (medium) has the lower benchmark cost at $0.352 vs $0.692. GPT-5.6 Luna (medium) is faster at 7.28s vs 84.25s, with pass rates of 65.2% vs 65.2%.

Recommended modelGPT-5.6 Luna (medium)It has the best score here (7.6), while costing about 2.0x less than Kimi K2.7 Code (medium).

Last updated at: 2026-07-25

Comparison summary

Rank
#60
Total Output Tokens
262,507
Response Time (avg)
84.25s
Total Cost
$0.692
Rank
#57
Total Output Tokens
43,679
Response Time (avg)
7.28s
Total Cost
$0.352

Detailed comparison

Metric Kimi K2.7 Code Kimi K2.7 Code medium Release: 2026-06-12 GPT-5.6 Luna GPT-5.6 Luna medium Release: 2026-07-09
Score 7.5 7.6
Rank #60 #57
Reliability 10.0 10.0
Consistency 8.3 9.6
Tests Correct
Attempt pass rate 65.2% 65.2%
Flaky tests 4 1
Total Runs 66 66
Cost per result 6.457 2.513
Total Cost $0.692 $0.352
Input Price $0.780 / 1M $1.000 / 1M
Output Price $3.500 / 1M $6.000 / 1M
Total Input Tokens 72,073 89,676
Output Tokens 83,714 5,699
Reasoning Tokens 178,793 37,980
Response Time (avg) 84.25s 7.28s
Response Time (max) 365.80s 29.85s
Response Time (total) 1769.22s 160.27s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#60 MoonshotAI: Kimi K2.7 Code

medium
Cost
$0.025
Time
138.0s
Tokens
6,093 tok

#57 GPT-5.6 Luna

medium
Cost
$0.014
Time
14.6s
Tokens
2,362 tok

Top Models by Score

Score vs Total Cost

Response Time (avg)

Score vs Response Time (avg)

Total Output Tokens

Score vs Total Output Tokens

Category Breakdown

Coding Score Consistency Attempt pass rate Flaky tests Tests Correct Response Time (avg) Input Tokens Output Tokens Reasoning Tokens
Kimi K2.7 Code 7.8 9.3 66.7% 0 146.73s 4,650 1,864 25,635
GPT-5.6 Luna 5.4 7.2 44.4% 1 10.38s 7,302 564 9,928

Quick Compare

Switch Comparison Pair