Navigate
AI BENCHY
Advertise here

GPT-5.6 Luna vs Qwen3.8 27B

Qwen3.8 27B leads on average score with 5.5 vs 5.4. Local hardware cost was not measured, so cost comparisons are unavailable. GPT-5.6 Luna is faster at 1.50s vs 3.12s, with pass rates of 36.4% vs 40.9%.

Last updated at: 2026-08-15

Rank
#216
Total Output Tokens
6,709
Response Time (avg)
1.50s
Total Cost
$0.015
Rank
#211
Total Output Tokens
11,445
Response Time (avg)
3.12s
Total Cost
N/A
Recommended model GPT-5.6 Luna

Its score stays close to the best score here (5.4 vs 5.5), while responding about 2.1x faster than Qwen3.8 27B.

Detailed comparison

Metric GPT-5.6 Luna GPT-5.6 Luna none Release: 2026-07-09 Qwen3.8 27B Qwen3.8 27B none Release: 2026-08-14
Score 5.4 5.5
Rank #216 #211
Reliability 10.0 10.0
Consistency 8.8 10.0
Attempts 66/66 66/66
Tests Correct
Attempt pass rate 36.4% 40.9%
Flaky tests 3 0
Total Runs 66 66
Cost per result 2.357 N/A
Total Cost $0.015 N/A
Input Price $0.100 / 1M N/A
Output Price $0.600 / 1M N/A
Total Input Tokens 101,332 122,463
Output Tokens 6,709 11,445
Reasoning Tokens 0 0
Response Time (avg) 1.50s 3.12s
Response Time (max) 10.57s 44.76s
Response Time (total) 33.05s 68.69s
Parameters ~400B total (~17B active) 27.3B
Availability Closed Weights available

Model generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#216 GPT-5.6 Luna

none
Cost
$0.016
Time
15.8s
Tokens
2,685 tok

#211 Qwen3.8 27B

none
Cost
N/A
Time
23.9s
Tokens
1,922 tok

Top Models by Score

Score vs Total Cost

Response Time (avg)

Score vs Response Time (avg)

Total Output Tokens

Score vs Total Output Tokens

Category Breakdown

Coding Score Consistency Attempt pass rate Flaky tests Tests Correct Response Time (avg) Input Tokens Output Tokens Reasoning Tokens
GPT-5.6 Luna 3.8 7.2 22.2% 1 980ms 7,302 459 0
Qwen3.8 27B 5.5 10.0 33.3% 0 1.19s 7,911 408 0

Quick Compare

Switch Comparison Pair