নেভিগেশন
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Kwaipilot: KAT-Coder-Air V2.5 vs OpenAI: GPT-5.6 Luna

KAT-Coder-Air V2.5 (high) average score-এ এগিয়ে: 5.6 vs 5.4. KAT-Coder-Air V2.5 (high)-এর benchmark খরচ কম: $0.077 vs $0.142. GPT-5.6 Luna দ্রুত: 1.50s vs 15.90s, pass rates 43.9% vs 34.9%.

প্রস্তাবিত মডেলGPT-5.6 LunaIts score stays close to the best score here (5.4 vs 5.6), while responding about 10.6x faster than KAT-Coder-Air V2.5 (high).

AI BENCHY টেস্ট স্যুট থেকে বেঞ্চমার্ক তৈরি হয়েছে: 2026-07-20

মেট্রিক KAT-Coder-Air V2.5 KAT-Coder-Air V2.5 high প্রকাশ: 2026-07-14 GPT-5.6 Luna GPT-5.6 Luna none প্রকাশ: 2026-07-09
স্কোর 5.6 5.4
র‍্যাঙ্ক #144 #159
নির্ভরযোগ্যতা 9.9 10.0
ধারাবাহিকতা 7.7 8.8
সঠিক টেস্ট
প্রতি চেষ্টায় পাস রেট 43.9% 34.9%
অস্থির টেস্ট 6 3
মোট রান 66 66
প্রতি ফলাফলে খরচ 1.097 2.360
মোট খরচ $0.077 $0.142
ইনপুট মূল্য $0.150 / 1M $1.000 / 1M
আউটপুট মূল্য $0.600 / 1M $6.000 / 1M
মোট ইনপুট টোকেন 50,470 101,323
আউটপুট টোকেন 3,957 6,709
রিজনিং টোকেন 111,374 0
প্রতিক্রিয়া সময় (গড়) 15.90s 1.50s
প্রতিক্রিয়া সময় (সর্বোচ্চ) 118.35s 10.57s
প্রতিক্রিয়া সময় (মোট) 349.71s 32.91s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#144 KAT-Coder-Air V2.5

high
অবৈধ SVG
খরচ
$0.000
সময়
300.0s
টোকেন
0 tok

#159 GPT-5.6 Luna

none
খরচ
$0.016
সময়
15.8s
টোকেন
2,685 tok

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর বনাম মোট খরচ

প্রতিক্রিয়া সময় (গড়)

স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

কোডিং স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) ইনপুট টোকেন আউটপুট টোকেন রিজনিং টোকেন
KAT-Coder-Air V2.5 4.3 7.3 11.1% 1 39.07s 6,948 1,166 55,883
GPT-5.6 Luna 3.8 7.2 22.2% 1 980ms 7,302 459 0

দ্রুত তুলনা

তুলনার জুটি বদলান