নেভিগেশন
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

KAT Coder AIR V2.5 (high) vs GPT-5.6 Luna

GPT-5.6 Luna average score-এ এগিয়ে: 5.3 vs 5.2. GPT-5.6 Luna-এর benchmark খরচ কম: $0.042 vs $0.077. GPT-5.6 Luna দ্রুত: 3.78s vs 15.23s, pass rates 40.6% vs 34.8%.

AI BENCHY টেস্ট স্যুট থেকে বেঞ্চমার্ক তৈরি হয়েছে: 2026-10-07

তুলনা করা মডেল

র‍্যাঙ্ক
#306
মোট আউটপুট টোকেন
114,654
প্রতিক্রিয়া সময় (গড়)
15.23s
মোট খরচ
$0.077
র‍্যাঙ্ক
#297
মোট আউটপুট টোকেন
8,000
প্রতিক্রিয়া সময় (গড়)
3.78s
মোট খরচ
$0.042
প্রস্তাবিত মডেল GPT-5.6 Luna

It has the best score here (5.3), while costing about 1.8x less than KAT Coder AIR V2.5 (high).

বিস্তারিত তুলনা

মেট্রিক KAT Coder AIR V2.5 KAT Coder AIR V2.5 high প্রকাশ: 2026-07-14 GPT-5.6 Luna GPT-5.6 Luna none প্রকাশ: 2026-07-09
স্কোর 5.2 5.3
র‍্যাঙ্ক #306 #297
নির্ভরযোগ্যতা 9.8 10.0
ধারাবাহিকতা 8.2 8.8
প্রচেষ্টা 69/69 69/69
সঠিক টেস্ট
প্রতি চেষ্টায় পাস রেট 40.6% 34.8%
অস্থির টেস্ট 5 3
মোট রান 69 69
প্রতি ফলাফলে খরচ 1.091 2.814
মোট খরচ $0.077 $0.042
ইনপুট মূল্য $0.150 / 1M $0.200 / 1M
আউটপুট মূল্য $0.600 / 1M $1.200 / 1M
ক্যাশ পড়ার মূল্য প্রযোজ্য নয় $0.020 / 1M
ক্যাশ লেখার মূল্য প্রযোজ্য নয় $0.250 / 1M
মোট ইনপুট টোকেন 50,423 230,744
আউটপুট টোকেন 4,144 8,000
রিজনিং টোকেন 110,510 0
প্রতিক্রিয়া সময় (গড়) 15.23s 3.78s
প্রতিক্রিয়া সময় (সর্বোচ্চ) 118.35s 53.77s
প্রতিক্রিয়া সময় (মোট) 350.26s 86.83s
প্যারামিটার ~35B মোট (~3B সক্রিয়) ~400B মোট (~17B সক্রিয়)
উপলভ্যতা বন্ধ উৎস বন্ধ উৎস

ক্যাশের মূল্য ইনপুট টোকেনের জন্য প্রযোজ্য। পড়ার সময় ক্যাশ করা প্রম্পট আবার ব্যবহার হয়; লেখার সময় সেগুলি সংরক্ষিত হয় এবং বাড়তি খরচ হতে পারে। আউটপুট টোকেনের জন্য আউটপুট মূল্য প্রযোজ্য।

মডেল জেনারেশন শোকেস

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#306 KAT Coder AIR V2.5

high
Reached the allocated time limit (300 seconds) without receiving showcase output.
খরচ
$0.000
সময়
300.0s
টোকেন
0 tok

#297 GPT-5.6 Luna

none
খরচ
$0.016
সময়
15.8s
টোকেন
2,685 tok

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর বনাম মোট খরচ

প্রতিক্রিয়া সময় (গড়)

স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

কোডিং স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) ইনপুট টোকেন আউটপুট টোকেন রিজনিং টোকেন
KAT Coder AIR V2.5 4.3 7.3 11.1% 1 39.07s 6,948 1,166 55,883
GPT-5.6 Luna 3.8 7.2 22.2% 1 980ms 7,302 459 0

তুলনার জুটি বদলান