Navigate
Advertise here

Muse Glimmer 30B (medium) vs GPT-6 Luna (high)

The average score is effectively tied at 7.7 vs 7.7. GPT-6 Luna (high) has the lower benchmark cost at $0.074 vs $0.353. GPT-6 Luna (high) is faster at 20.37s vs 33.97s, with pass rates of 65.2% vs 73.9%.

Last updated at: 2026-10-01

Compared models

Rank
#115
Total Output Tokens
180,687
Response Time (avg)
33.97s
Total Cost
$0.353
Rank
#111
Total Output Tokens
101,587
Response Time (avg)
20.37s
Total Cost
$0.074
Recommended model GPT-6 Luna (high)

It has the best score here (7.7), while costing about 4.8x less than Muse Glimmer 30B (medium).

Detailed comparison

Metric Muse Glimmer 30B Muse Glimmer 30B medium Release: 2026-08-11 GPT-6 Luna GPT-6 Luna high Release: 2026-09-23
Score 7.7 7.7
Rank #115 #111
Reliability 10.0 10.0
Consistency 8.0 8.7
Attempts 69/69 69/69
Tests Correct
Attempt pass rate 65.2% 73.9%
Flaky tests 6 4
Total Runs 69 69
Cost per result 2.935 0.492
Total Cost $0.353 $0.074
Input Price $0.350 / 1M $0.100 / 1M
Output Price $1.500 / 1M $0.500 / 1M
Total Input Tokens 269,497 229,986
Output Tokens 34,935 6,037
Reasoning Tokens 145,752 95,550
Response Time (avg) 33.97s 20.37s
Response Time (max) 181.08s 106.93s
Response Time (total) 781.36s 468.52s
Parameters 30B ~400B total (~17B active)
Availability Open source Closed

Model generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#115 Muse Glimmer 30B

medium
Cost
$0.003
Time
31.9s
Tokens
1,845 tok

#111 GPT-6 Luna

high
Cost
$0.003
Time
49.2s
Tokens
5,231 tok

Top Models by Score

Score vs Total Cost

Response Time (avg)

Score vs Response Time (avg)

Total Output Tokens

Score vs Total Output Tokens

Category Breakdown

Coding Score Consistency Attempt pass rate Flaky tests Tests Correct Response Time (avg) Input Tokens Output Tokens Reasoning Tokens
Muse Glimmer 30B 8.4 7.8 77.8% 1 33.67s 7,419 4,662 20,605
GPT-6 Luna 7.8 7.4 77.8% 1 24.69s 7,302 483 15,691

Quick Compare

Switch Comparison Pair