नेविगेशन
AI BENCHY
Advertise here

Kwaipilot: KAT-Coder-Air V2.5 vs OpenAI: GPT-5.6 Luna

KAT-Coder-Air V2.5 (high) average score में आगे है: 5.6 vs 5.4. KAT-Coder-Air V2.5 (high) की benchmark लागत कम है: $0.077 vs $0.142. GPT-5.6 Luna तेज है: 1.50s vs 15.90s, pass rates 43.9% vs 34.9%.

अनुशंसित मॉडलGPT-5.6 LunaIts score stays close to the best score here (5.4 vs 5.6), while responding about 10.6x faster than KAT-Coder-Air V2.5 (high).

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-18

मेट्रिक KAT-Coder-Air V2.5 KAT-Coder-Air V2.5 high रिलीज़: 2026-07-14 GPT-5.6 Luna GPT-5.6 Luna none रिलीज़: 2026-07-09
स्कोर 5.6 5.4
रैंक #140 #155
विश्वसनीयता 9.9 10.0
संगति 7.7 8.8
सही परीक्षण
प्रति प्रयास पास दर 43.9% 34.9%
अस्थिर टेस्ट 6 3
कुल रन 66 66
प्रति परिणाम लागत 1.097 2.360
कुल लागत $0.077 $0.142
इनपुट कीमत $0.150 / 1M $1.000 / 1M
आउटपुट कीमत $0.600 / 1M $6.000 / 1M
कुल इनपुट टोकन 50,470 101,323
आउटपुट टोकन 3,957 6,709
रीजनिंग टोकन 111,374 0
प्रतिक्रिया समय (औसत) 15.90s 1.50s
प्रतिक्रिया समय (अधिकतम) 118.35s 10.57s
प्रतिक्रिया समय (कुल) 349.71s 32.91s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#140 KAT-Coder-Air V2.5

high
अमान्य SVG
लागत
$0.000
समय
300.0s
टोकन
0 tok

#155 GPT-5.6 Luna

none
लागत
$0.016
समय
15.8s
टोकन
2,685 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
KAT-Coder-Air V2.5 4.3 7.3 11.1% 1 39.07s 6,948 1,166 55,883
GPT-5.6 Luna 3.8 7.2 22.2% 1 980ms 7,302 459 0

त्वरित तुलना

तुलना जोड़ी बदलें