AI BENCHY तुलना

OpenAI: GPT-4o-mini vs Qwen: Qwen3.5-9B

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-03-12

मेट्रिक	GPT-4o-mini GPT-4o-mini none रिलीज़: 2024-07-18	Qwen3.5-9B Qwen3.5-9B medium रिलीज़: 2026-03-02

मेट्रिक	GPT-4o-mini GPT-4o-mini none रिलीज़: 2024-07-18	Qwen3.5-9B Qwen3.5-9B medium रिलीज़: 2026-03-02
रैंक	#55	#66
औसत स्कोर	4.0	2.6
संगति	10.0	7.4
प्रति परिणाम लागत	0.114	0.779
कुल लागत	$0.005	$0.024
सही परीक्षण
प्रति प्रयास पास दर	25.0%	35.4%
अस्थिर टेस्ट	0	5
कुल रन	48	48
आउटपुट टोकन	1,594	17,930
रीजनिंग टोकन	0	139,706
प्रतिक्रिया समय (औसत)	2.07s	71.44s
प्रतिक्रिया समय (अधिकतम)	7.58s	226.38s
प्रतिक्रिया समय (कुल)	18.60s	928.77s

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

औसत स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

औसत स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

एंटी-एआई ट्रिक्स	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	आउटपुट टोकन	रीजनिंग टोकन
GPT-4o-mini	4.0	10.0	33.3%	0		1.83s	180	0
Qwen3.5-9B	4.0	7.2	55.6%	1		31.54s	2,410	10,913

संयुक्त	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	आउटपुट टोकन	रीजनिंग टोकन
GPT-4o-mini	10.0	10.0	0.0%	0		7.58s	568	0
Qwen3.5-9B	10.0	10.0	0.0%	0		0ms	0	0

डेटा पार्सिंग और निष्कर्षण	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	आउटपुट टोकन	रीजनिंग टोकन
GPT-4o-mini	9.9	10.0	100.0%	0		1.27s	183	0
Qwen3.5-9B	5.0	5.6	33.3%	1		87.31s	1,383	32,113

डोमेन-विशिष्ट	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	आउटपुट टोकन	रीजनिंग टोकन
GPT-4o-mini	10.0	10.0	0.0%	0		637ms	15	0
Qwen3.5-9B	10.0	7.2	22.2%	1		137.75s	11,549	48,475

Samanya Buddhimatta	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	आउटपुट टोकन	रीजनिंग टोकन
GPT-4o-mini	3.0	10.0	0.0%	0		909ms	66	0
Qwen3.5-9B	10.0	1.6	33.3%	1		226.38s	0	30,695

निर्देश पालन	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	आउटपुट टोकन	रीजनिंग टोकन
GPT-4o-mini	4.5	10.0	0.0%	0		1.27s	69	0
Qwen3.5-9B	5.5	5.8	66.7%	1		17.15s	599	4,517

Puzzle Solving	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	आउटपुट टोकन	रीजनिंग टोकन
GPT-4o-mini	2.3	10.0	0.0%	0		1.30s	308	0
Qwen3.5-9B	10.0	10.0	0.0%	0		33.38s	1,545	11,844

टूल कॉलिंग	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	आउटपुट टोकन	रीजनिंग टोकन
GPT-4o-mini	10.0	10.0	100.0%	0		2.51s	205	0
Qwen3.5-9B	10.0	10.0	100.0%	0		4.31s	444	1,149

त्वरित तुलना

तुलना जोड़ी बदलें

Qwen3.5-9BmediumvsMiMo-V2-Flashnone Qwen3.5-9BmediumvsGrok 4.1 Fastnone GPT-4o-mininonevsQwen3 Coder Nextmedium MiniMax M2.5mediumvsGPT-4o-mininone Mercury 2nonevsQwen3.5-9Bmedium Nemotron 3 Super 120b A12bnoneनिःशुल्क उपलब्धvsQwen3.5-9Bmedium GPT-4o-mininonevsGLM 4.7 Flashmedium GPT-4o-mininonevsGrok 4.20 Multi-Agent Betamedium Qwen3.5-9BmediumvsGLM 4.7 Flashnone Mercury 2mediumvsGPT-4o-mininone Kimi K2.5nonevsQwen3.5-9Bmedium GPT-4o-mininonevsQwen3.5-35B-A3Bmedium