AI BENCHY Compare

OpenAI: GPT-5.2 vs Qwen: Qwen3.7 Plus

সারাংশ

GPT-5.2 vs Qwen3.7 Plus benchmark তুলনা: GPT-5.2 average score-এ এগিয়ে: 8.4 vs 8.2. Qwen3.7 Plus-এর benchmark খরচ কম: $0.177 vs $0.548. GPT-5.2 দ্রুত: 16.88s vs 38.95s, pass rates 71.4% vs 77.8%.

প্রস্তাবিত মডেল: Qwen3.7 Plus - Its score stays close to the best score here (8.2 vs 8.4), while costing about 3.1x less than GPT-5.2.

AI BENCHY টেস্ট স্যুট থেকে বেঞ্চমার্ক তৈরি হয়েছে: 2026-06-18

মেট্রিক	GPT-5.2 GPT-5.2 medium প্রকাশ: 2025-12-11	Qwen3.7 Plus Qwen3.7 Plus medium প্রকাশ: 2026-06-03

মেট্রিক	GPT-5.2 GPT-5.2 medium প্রকাশ: 2025-12-11	Qwen3.7 Plus Qwen3.7 Plus medium প্রকাশ: 2026-06-03
স্কোর	8.4	8.2
র‍্যাঙ্ক	#22	#25
নির্ভরযোগ্যতা	10.0	10.0
ধারাবাহিকতা	8.4	9.1
সঠিক টেস্ট
প্রতি চেষ্টায় পাস রেট	71.4%	77.8%
অস্থির টেস্ট	4	2
মোট রান	63	63
প্রতি ফলাফলে খরচ	4.209	1.474
মোট খরচ	$0.548	$0.177
ইনপুট মূল্য	$1.750 / 1M	$0.320 / 1M
আউটপুট মূল্য	$14.000 / 1M	$1.280 / 1M
মোট ইনপুট টোকেন	33,967	40,939
আউটপুট টোকেন	2,901	2,125
রিজনিং টোকেন	31,932	125,754
প্রতিক্রিয়া সময় (গড়)	16.88s	38.95s
প্রতিক্রিয়া সময় (সর্বোচ্চ)	77.80s	178.04s
প্রতিক্রিয়া সময় (মোট)	236.34s	817.85s

জেনারেশন শোকেস

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#22 GPT-5.2

medium

খরচ: $0.047
সময়: 49.2s
টোকেন: 3,396 tok

#25 Qwen3.7 Plus

medium

খরচ: $0.018
সময়: 193.2s
টোকেন: 10,821 tok

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর বনাম মোট খরচ

প্রতিক্রিয়া সময় (গড়)

স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

অ্যান্টি-এআই কৌশল	স্কোর	ধারাবাহিকতা	প্রতি চেষ্টায় পাস রেট	অস্থির টেস্ট	সঠিক টেস্ট	প্রতিক্রিয়া সময় (গড়)	ইনপুট টোকেন	আউটপুট টোকেন	রিজনিং টোকেন
GPT-5.2	6.5	8.0	58.3%	1		7.81s	606	567	2,002
Qwen3.7 Plus	10.0	10.0	100.0%	0		8.58s	672	195	5,065

কোডিং	স্কোর	ধারাবাহিকতা	প্রতি চেষ্টায় পাস রেট	অস্থির টেস্ট	সঠিক টেস্ট	প্রতিক্রিয়া সময় (গড়)	ইনপুট টোকেন	আউটপুট টোকেন	রিজনিং টোকেন
GPT-5.2	10.0	10.0	100.0%	0		22.73s	7,302	511	11,912
Qwen3.7 Plus	6.1	6.6	55.6%	1		108.60s	6,472	414	43,576

সমন্বিত	স্কোর	ধারাবাহিকতা	প্রতি চেষ্টায় পাস রেট	অস্থির টেস্ট	সঠিক টেস্ট	প্রতিক্রিয়া সময় (গড়)	ইনপুট টোকেন	আউটপুট টোকেন	রিজনিং টোকেন
GPT-5.2	10.0	10.0	100.0%	0		14.06s	11,019	291	1,757
Qwen3.7 Plus	10.0	10.0	100.0%	0		65.24s	14,934	366	10,132

ডেটা পার্সিং ও নিষ্কাশন	স্কোর	ধারাবাহিকতা	প্রতি চেষ্টায় পাস রেট	অস্থির টেস্ট	সঠিক টেস্ট	প্রতিক্রিয়া সময় (গড়)	ইনপুট টোকেন	আউটপুট টোকেন	রিজনিং টোকেন
GPT-5.2	10.0	10.0	100.0%	0		3.15s	7,140	234	420
Qwen3.7 Plus	10.0	10.0	100.0%	0		21.75s	7,782	270	6,713

ডোমেইন-নির্দিষ্ট	স্কোর	ধারাবাহিকতা	প্রতি চেষ্টায় পাস রেট	অস্থির টেস্ট	সঠিক টেস্ট	প্রতিক্রিয়া সময় (গড়)	ইনপুট টোকেন	আউটপুট টোকেন	রিজনিং টোকেন
GPT-5.2	5.9	7.2	55.6%	1		77.80s	473	42	10,342
Qwen3.7 Plus	3.6	7.2	22.2%	1		45.35s	771	57	27,073

Sadharon Buddhimotta	স্কোর	ধারাবাহিকতা	প্রতি চেষ্টায় পাস রেট	অস্থির টেস্ট	সঠিক টেস্ট	প্রতিক্রিয়া সময় (গড়)	ইনপুট টোকেন	আউটপুট টোকেন	রিজনিং টোকেন
GPT-5.2	3.7	9.7	0.0%	0		4.32s	477	162	269
Qwen3.7 Plus	10.0	10.0	100.0%	0		25.48s	516	123	3,998

নির্দেশনা অনুসরণ	স্কোর	ধারাবাহিকতা	প্রতি চেষ্টায় পাস রেট	অস্থির টেস্ট	সঠিক টেস্ট	প্রতিক্রিয়া সময় (গড়)	ইনপুট টোকেন	আউটপুট টোকেন	রিজনিং টোকেন
GPT-5.2	9.9	10.0	100.0%	0		3.12s	660	94	614
Qwen3.7 Plus	10.0	10.0	100.0%	0		16.13s	699	102	5,013

ধাঁধা সমাধান	স্কোর	ধারাবাহিকতা	প্রতি চেষ্টায় পাস রেট	অস্থির টেস্ট	সঠিক টেস্ট	প্রতিক্রিয়া সময় (গড়)	ইনপুট টোকেন	আউটপুট টোকেন	রিজনিং টোকেন
GPT-5.2	7.5	7.3	77.8%	1		5.80s	642	735	924
Qwen3.7 Plus	10.0	10.0	100.0%	0		16.38s	696	280	7,312

টুল কলিং	স্কোর	ধারাবাহিকতা	প্রতি চেষ্টায় পাস রেট	অস্থির টেস্ট	সঠিক টেস্ট	প্রতিক্রিয়া সময় (গড়)	ইনপুট টোকেন	আউটপুট টোকেন	রিজনিং টোকেন
GPT-5.2	4.7	1.6	66.7%	1		10.30s	5,453	239	469
Qwen3.7 Plus	10.0	10.0	100.0%	0		15.02s	8,193	292	1,831

সাধারণ জ্ঞান	স্কোর	ধারাবাহিকতা	প্রতি চেষ্টায় পাস রেট	অস্থির টেস্ট	সঠিক টেস্ট	প্রতিক্রিয়া সময় (গড়)	ইনপুট টোকেন	আউটপুট টোকেন	রিজনিং টোকেন
GPT-5.2	3.0	10.0	0.0%	0		28.18s	195	26	3,223
Qwen3.7 Plus	3.0	10.0	0.0%	0		91.07s	204	26	15,041

দ্রুত তুলনা

তুলনার জুটি বদলান

DeepSeek V4 FlashhighvsQwen3.7 Plusmedium DeepSeek V4 FlashhighvsGPT-5.2medium GPT-5.2 ChatnonevsQwen3.7 Plusmedium Qwen3.7 PlusmediumvsStep 3.7 Flashlow DeepSeek V4 ProhighvsQwen3.7 Plusmedium GPT-5.3 ChatnonevsQwen3.7 Plusmedium GPT-5.2mediumvsStep 3.7 Flashlow DeepSeek V4 ProhighvsGPT-5.2medium Gemini 3 Flash PreviewlowvsQwen3.7 Plusmedium Gemini 3.5 FlashlowvsGPT-5.2medium Claude Sonnet 4.6nonevsQwen3.7 Plusmedium Claude Opus 4.8nonevsQwen3.7 Plusmedium