नेव्हिगेशन
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Kwaipilot: KAT-Coder-Air V2.5 vs OpenAI: GPT-5.6 Luna

KAT-Coder-Air V2.5 (high) average score मध्ये पुढे आहे: 5.6 vs 5.4. KAT-Coder-Air V2.5 (high) चा benchmark खर्च कमी आहे: $0.077 vs $0.142. GPT-5.6 Luna वेगवान आहे: 1.50s vs 15.90s, pass rates 43.9% vs 34.9%.

शिफारस केलेले मॉडेलGPT-5.6 LunaIts score stays close to the best score here (5.4 vs 5.6), while responding about 10.6x faster than KAT-Coder-Air V2.5 (high).

AI BENCHY टेस्ट सूटमधून बेंचमार्क या वेळी तयार झाले: 2026-07-18

मेट्रिक KAT-Coder-Air V2.5 KAT-Coder-Air V2.5 high प्रकाशन: 2026-07-14 GPT-5.6 Luna GPT-5.6 Luna none प्रकाशन: 2026-07-09
स्कोअर 5.6 5.4
क्रमांक #140 #155
विश्वसनीयता 9.9 10.0
सुसंगतता 7.7 8.8
बरोबर चाचण्या
प्रति प्रयत्न पास दर 43.9% 34.9%
अस्थिर चाचण्या 6 3
एकूण रन 66 66
प्रति निकाल खर्च 1.097 2.360
एकूण खर्च $0.077 $0.142
इनपुट किंमत $0.150 / 1M $1.000 / 1M
आउटपुट किंमत $0.600 / 1M $6.000 / 1M
एकूण इनपुट टोकन्स 50,470 101,323
आउटपुट टोकन्स 3,957 6,709
रिझनिंग टोकन्स 111,374 0
प्रतिसाद वेळ (सरासरी) 15.90s 1.50s
प्रतिसाद वेळ (कमाल) 118.35s 10.57s
प्रतिसाद वेळ (एकूण) 349.71s 32.91s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#140 KAT-Coder-Air V2.5

high
अवैध SVG
खर्च
$0.000
वेळ
300.0s
टोकन्स
0 tok

#155 GPT-5.6 Luna

none
खर्च
$0.016
वेळ
15.8s
टोकन्स
2,685 tok

स्कोअरनुसार शीर्ष मॉडेल्स

स्कोअर विरुद्ध एकूण खर्च

प्रतिसाद वेळ (सरासरी)

स्कोअर vs प्रतिसाद वेळ (सरासरी)

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

श्रेणीवार तपशील

कोडिंग स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
KAT-Coder-Air V2.5 4.3 7.3 11.1% 1 39.07s 6,948 1,166 55,883
GPT-5.6 Luna 3.8 7.2 22.2% 1 980ms 7,302 459 0

झटपट तुलना

तुलना जोडी बदला