नेविगेशन
Advertise here

KAT-Coder-Air V2.5 (medium) vs GPT-6 Luna

average score लगभग बराबर है: 5.6 vs 5.6. GPT-6 Luna की benchmark लागत कम है: $0.012 vs $0.048. KAT-Coder-Air V2.5 (medium) तेज है: 8.65s vs 19.08s, pass rates 45.5% vs 42.4%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-23

तुलना किए गए मॉडल

रैंक
#264
कुल आउटपुट टोकन
66,576
प्रतिक्रिया समय (औसत)
8.65s
कुल लागत
$0.048
रैंक
#260
कुल आउटपुट टोकन
5,508
प्रतिक्रिया समय (औसत)
19.08s
कुल लागत
$0.012
अनुशंसित मॉडल KAT-Coder-Air V2.5 (medium)

It has the best score here (5.6), while responding about 2.2x faster than GPT-6 Luna.

विस्तृत तुलना

मेट्रिक KAT-Coder-Air V2.5 KAT-Coder-Air V2.5 medium रिलीज़: 2026-07-14 GPT-6 Luna GPT-6 Luna none रिलीज़: 2026-09-23
स्कोर 5.6 5.6
रैंक #264 #260
विश्वसनीयता 9.6 9.9
संगति 8.9 8.1
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 45.5% 42.4%
अस्थिर टेस्ट 3 5
कुल रन 66 66
प्रति परिणाम लागत 0.596 0.164
कुल लागत $0.048 $0.012
इनपुट कीमत $0.150 / 1M $0.100 / 1M
आउटपुट कीमत $0.600 / 1M $0.500 / 1M
कुल इनपुट टोकन 51,369 87,216
आउटपुट टोकन 8,008 5,508
रीजनिंग टोकन 58,568 0
प्रतिक्रिया समय (औसत) 8.65s 19.08s
प्रतिक्रिया समय (अधिकतम) 48.19s 98.62s
प्रतिक्रिया समय (कुल) 190.35s 419.83s
पैरामीटर ~35B कुल (~3B सक्रिय) ~400B कुल (~17B सक्रिय)
उपलब्धता बंद स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#264 KAT-Coder-Air V2.5

medium
लागत
$0.003
समय
23.7s
टोकन
4,924 tok

#260 GPT-6 Luna

none
लागत
$0.002
समय
26.0s
टोकन
3,235 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
KAT-Coder-Air V2.5 3.6 7.0 22.2% 1 23.37s 7,893 5,199 29,973
GPT-6 Luna 5.5 10.0 33.3% 0 8.04s 7,302 376 0

त्वरित तुलना

तुलना जोड़ी बदलें