नेव्हिगेशन
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

KAT Coder AIR V2.5 (high) vs GPT-5.6 Luna

GPT-5.6 Luna average score मध्ये पुढे आहे: 5.3 vs 5.2. GPT-5.6 Luna चा benchmark खर्च कमी आहे: $0.042 vs $0.077. GPT-5.6 Luna वेगवान आहे: 3.78s vs 15.23s, pass rates 40.6% vs 34.8%.

AI BENCHY टेस्ट सूटमधून बेंचमार्क या वेळी तयार झाले: 2026-10-07

तुलना केलेली मॉडेल्स

क्रमांक
#306
एकूण आउटपुट टोकन्स
114,654
प्रतिसाद वेळ (सरासरी)
15.23s
एकूण खर्च
$0.077
क्रमांक
#297
एकूण आउटपुट टोकन्स
8,000
प्रतिसाद वेळ (सरासरी)
3.78s
एकूण खर्च
$0.042
शिफारस केलेले मॉडेल GPT-5.6 Luna

It has the best score here (5.3), while costing about 1.8x less than KAT Coder AIR V2.5 (high).

तपशीलवार तुलना

मेट्रिक KAT Coder AIR V2.5 KAT Coder AIR V2.5 high प्रकाशन: 2026-07-14 GPT-5.6 Luna GPT-5.6 Luna none प्रकाशन: 2026-07-09
स्कोअर 5.2 5.3
क्रमांक #306 #297
विश्वसनीयता 9.8 10.0
सुसंगतता 8.2 8.8
प्रयत्न 69/69 69/69
बरोबर चाचण्या
प्रति प्रयत्न पास दर 40.6% 34.8%
अस्थिर चाचण्या 5 3
एकूण रन 69 69
प्रति निकाल खर्च 1.091 2.814
एकूण खर्च $0.077 $0.042
इनपुट किंमत $0.150 / 1M $0.200 / 1M
आउटपुट किंमत $0.600 / 1M $1.200 / 1M
कॅश वाचण्याची किंमत लागू नाही $0.020 / 1M
कॅश लिहिण्याची किंमत लागू नाही $0.250 / 1M
एकूण इनपुट टोकन्स 50,423 230,744
आउटपुट टोकन्स 4,144 8,000
रिझनिंग टोकन्स 110,510 0
प्रतिसाद वेळ (सरासरी) 15.23s 3.78s
प्रतिसाद वेळ (कमाल) 118.35s 53.77s
प्रतिसाद वेळ (एकूण) 350.26s 86.83s
पॅरामीटर्स ~35B एकूण (~3B सक्रिय) ~400B एकूण (~17B सक्रिय)
उपलब्धता बंद स्रोत बंद स्रोत

कॅशच्या किमती इनपुट टोकनला लागू होतात. वाचताना साठवलेले प्रॉम्प्ट पुन्हा वापरले जातात; लिहिताना ते साठवले जातात आणि अधिक खर्च होऊ शकतो. आउटपुट टोकनला आउटपुट किंमत लागू होते.

मॉडेल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#306 KAT Coder AIR V2.5

high
Reached the allocated time limit (300 seconds) without receiving showcase output.
खर्च
$0.000
वेळ
300.0s
टोकन्स
0 tok

#297 GPT-5.6 Luna

none
खर्च
$0.016
वेळ
15.8s
टोकन्स
2,685 tok

स्कोअरनुसार शीर्ष मॉडेल्स

स्कोअर विरुद्ध एकूण खर्च

प्रतिसाद वेळ (सरासरी)

स्कोअर vs प्रतिसाद वेळ (सरासरी)

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

श्रेणीवार तपशील

कोडिंग स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
KAT Coder AIR V2.5 4.3 7.3 11.1% 1 39.07s 6,948 1,166 55,883
GPT-5.6 Luna 3.8 7.2 22.2% 1 980ms 7,302 459 0

तुलना जोडी बदला