নেভিগেশন
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

তুলনা করা মডেল

Claude Sonnet 4.6 (medium) vs Claude Sonnet 5 (medium) vs Claude Opus 4.8 (medium) vs GLM 5.2 (medium) benchmark তুলনা: Claude Opus 4.8 (medium) স্কোর-এ 8.8 নিয়ে এগিয়ে। Claude Sonnet 4.6 (medium) নির্ভরযোগ্যতা-এ 10.0 নিয়ে এগিয়ে। GLM 5.2 (medium)-এর মোট খরচ সবচেয়ে কম, $0.281. Claude Sonnet 5 (medium) 12.54s-এ সবচেয়ে দ্রুত।

AI BENCHY টেস্ট স্যুট থেকে বেঞ্চমার্ক তৈরি হয়েছে: 2026-09-29

তুলনা করা মডেল

র‍্যাঙ্ক
#108
মোট আউটপুট টোকেন
120,427
প্রতিক্রিয়া সময় (গড়)
28.08s
মোট খরচ
$2.126
র‍্যাঙ্ক
#85
মোট আউটপুট টোকেন
63,204
প্রতিক্রিয়া সময় (গড়)
12.54s
মোট খরচ
$0.922
র‍্যাঙ্ক
#51
মোট আউটপুট টোকেন
51,927
প্রতিক্রিয়া সময় (গড়)
12.97s
মোট খরচ
$1.983
র‍্যাঙ্ক
#106
মোট আউটপুট টোকেন
61,761
প্রতিক্রিয়া সময় (গড়)
23.28s
মোট খরচ
$0.281
প্রস্তাবিত মডেল Claude Opus 4.8 (medium)

It has the best score here (8.8), while responding about 1.6x faster than এই তুলনার অন্য মডেলগুলো.

বিস্তারিত তুলনা

মেট্রিক Claude Sonnet 4.6 Claude Sonnet 4.6 medium প্রকাশ: 2026-02-17 Claude Sonnet 5 Claude Sonnet 5 medium প্রকাশ: 2026-06-30 Claude Opus 4.8 Claude Opus 4.8 medium প্রকাশ: 2026-05-28 GLM 5.2 GLM 5.2 medium প্রকাশ: 2026-06-17
স্কোর 7.8 8.2 8.8 7.8
র‍্যাঙ্ক #108 #85 #51 #106
নির্ভরযোগ্যতা 10.0 10.0 10.0 9.5
ধারাবাহিকতা 9.5 9.0 9.2 8.0
প্রচেষ্টা 66/66 66/66 66/66 63/66
সঠিক টেস্ট
প্রতি চেষ্টায় পাস রেট 65.2% 75.8% 83.3% 80.3%
অস্থির টেস্ট 1 3 2 4
মোট রান 66 66 66 63
প্রতি ফলাফলে খরচ 15.182 6.144 11.662 2.159
মোট খরচ $2.126 $0.922 $1.983 $0.281
ইনপুট মূল্য $3.000 / 1M $2.000 / 1M $5.000 / 1M $0.234 / 1M
আউটপুট মূল্য $15.000 / 1M $10.000 / 1M $25.000 / 1M $4.400 / 1M
মোট ইনপুট টোকেন 106,316 145,953 138,448 37,199
আউটপুট টোকেন 79,338 52,330 40,765 12,261
রিজনিং টোকেন 41,089 10,874 11,162 49,500
প্রতিক্রিয়া সময় (গড়) 28.08s 12.54s 12.97s 23.28s
প্রতিক্রিয়া সময় (সর্বোচ্চ) 140.96s 66.71s 70.54s 101.36s
প্রতিক্রিয়া সময় (মোট) 421.15s 275.90s 285.29s 488.94s
প্যারামিটার ~1T মোট (~100B সক্রিয়) ~1T মোট (~100B সক্রিয়) ~5T মোট (~500B সক্রিয়) 744B মোট (40B সক্রিয়)
উপলভ্যতা বন্ধ উৎস বন্ধ উৎস বন্ধ উৎস উন্মুক্ত উৎস

মডেল জেনারেশন শোকেস

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#108 Claude Sonnet 4.6

medium
Reached the allocated time limit (300 seconds) without receiving showcase output.
খরচ
$0.000
সময়
300.0s
টোকেন
0 tok

#85 Claude Sonnet 5

medium
খরচ
$0.007
সময়
6.4s
টোকেন
832 tok

#51 Claude Opus 4.8

medium
খরচ
$0.057
সময়
23.1s
টোকেন
2,412 tok

#106 GLM 5.2

medium
খরচ
$0.041
সময়
195.8s
টোকেন
9,287 tok

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর বনাম মোট খরচ

প্রতিক্রিয়া সময় (গড়)

স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

কোডিং স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) ইনপুট টোকেন আউটপুট টোকেন রিজনিং টোকেন
Claude Sonnet 4.6 5.7 6.6 44.4% 1 33.29s 6,995 16,089 3,686
Claude Sonnet 5 9.0 7.9 88.9% 1 17.28s 10,590 13,153 2,379
Claude Opus 4.8 10.0 10.0 100.0% 0 15.33s 10,590 9,945 1,381
GLM 5.2 8.2 7.2 88.9% 1 40.96s 7,317 1,475 17,123

দ্রুত তুলনা

তুলনার জুটি বদলান

Claude Sonnet 5mediumvsMuse Spark 1.3lowClaude Opus 4.8mediumvsGemini 3.5 Flash LitehighClaude Opus 4.8mediumvsGemini 3.6 FlashlowClaude Opus 4.8mediumvsGLM 5.3 FlashmaxQwen3.8 27BlowvsGLM 5.2mediumClaude Opus 4.8mediumvsGemini 3.5 FlashlowClaude Sonnet 4.6mediumvsQwen3.8 27BlowGPT-5.2 ChatnonevsGLM 5.2mediumClaude Sonnet 4.6mediumvsQwen3.7 FlashhighKimi K3maxvsGLM 5.2mediumClaude Opus 4.8mediumvsMuse Spark 1.2highClaude Opus 4.8lowvsGLM 5.2medium