নেভিগেশন
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

MoonshotAI: Kimi K2.6 vs OpenAI: gpt-oss-120b

gpt-oss-120b (medium) average score-এ এগিয়ে: 6.1 vs 5.8. gpt-oss-120b (medium)-এর benchmark খরচ কম: $0.019 vs $0.184. Kimi K2.6 দ্রুত: 19.58s vs 21.91s, pass rates 34.9% vs 50.0%.

প্রস্তাবিত মডেলgpt-oss-120b (medium)It has the best score here (6.1), while costing about 9.8x less than Kimi K2.6.

AI BENCHY টেস্ট স্যুট থেকে বেঞ্চমার্ক তৈরি হয়েছে: 2026-07-20

মেট্রিক Kimi K2.6 Kimi K2.6 none প্রকাশ: 2026-04-20 gpt-oss-120b gpt-oss-120b medium প্রকাশ: 2025-08-05
স্কোর 5.8 6.1
র‍্যাঙ্ক #138 #121
নির্ভরযোগ্যতা 10.0 10.0
ধারাবাহিকতা 9.3 8.0
সঠিক টেস্ট
প্রতি চেষ্টায় পাস রেট 34.9% 50.0%
অস্থির টেস্ট 2 5
মোট রান 66 66
প্রতি ফলাফলে খরচ 3.199 0.221
মোট খরচ $0.184 $0.019
ইনপুট মূল্য $0.684 / 1M $0.037 / 1M
আউটপুট মূল্য $3.420 / 1M $0.170 / 1M
মোট ইনপুট টোকেন 116,970 108,747
আউটপুট টোকেন 30,253 29,772
রিজনিং টোকেন 0 68,044
প্রতিক্রিয়া সময় (গড়) 19.58s 21.91s
প্রতিক্রিয়া সময় (সর্বোচ্চ) 238.89s 68.16s
প্রতিক্রিয়া সময় (মোট) 430.85s 328.70s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#138 MoonshotAI: Kimi K2.6

none
খরচ
$0.020
সময়
127.4s
টোকেন
4,429 tok

#121 gpt-oss-120b

medium
খরচ
$0.001
সময়
26.7s
টোকেন
555 tok

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর বনাম মোট খরচ

প্রতিক্রিয়া সময় (গড়)

স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

কোডিং স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) ইনপুট টোকেন আউটপুট টোকেন রিজনিং টোকেন
Kimi K2.6 5.5 9.8 33.3% 0 82.57s 5,986 14,754 0
gpt-oss-120b 5.9 7.0 55.6% 1 38.37s 7,782 3,365 11,973

দ্রুত তুলনা

তুলনার জুটি বদলান