Advertise here
#159

Qwen3.5-9B

Qwen रिलीज़: 2026-03-02 परीक्षण किया गया: 2026-06-04 13:41 qwen/qwen3.5-9b::medium
9Bसघनमुक्त स्रोत
(medium) (none)

सारांश

Qwen3.5-9B AI BENCHY पर 4.2 स्कोर करता है और #159 पर है। इसकी reliability 5.6, pass rate 27.0%, कुल लागत $0.035, और औसत response time 82.24s है।

Qwen3.5-9B को अलग क्या बनाता है: इस score range के लिए इसकी कुल benchmark लागत असामान्य रूप से कम है।

मॉडल विवरण

शोध की तारीख: 2026-08-12

घोषित
पैरामीटर
9B
आर्किटेक्चर
सघन
उपलब्धता
मुक्त स्रोत
लाइसेंस
Apache-2.0

संगति

8.0

कुल लागत (वर्तमान कीमत)

$0.035 ↓ -2.5%

परीक्षण के समय: $0.036

कुल आउटपुट टोकन

238,561

कुल इनपुट टोकन

17,070

इनपुट कीमत

$0.040 / 1M

आउटपुट कीमत

$0.150 / 1M

सही परीक्षण

गलत टेस्ट: 18

प्रति प्रयास पास दर: 27.0%

अस्थिर टेस्ट

5

अस्थिर टेस्ट में रनों के बीच मिले-जुले परिणाम रहे (कम से कम एक पास और एक फेल)।

प्रतिक्रिया समय (औसत)

82.24s

प्रतिक्रिया समय (अधिकतम): 226.38s

प्रतिक्रिया समय (कुल): 1315.88s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#159 Qwen3.5-9B

medium
लागत
$0.001
समय
35.9s
टोकन
3,030 tok

रन इतिहास

परीक्षण किया गया स्कोर विश्वसनीयता सही परीक्षण कुल लागत तुलना करें
2026-08-14 02:23 दोबारा परीक्षण 3.8 6.0 $0.062 तुलना करें
2026-07-16 23:12 नया टेस्ट जोड़ा गया 3.8 5.0 $0.036 तुलना करें
2026-06-04 13:41 नया टेस्ट जोड़ा गया 4.2 5.6 $0.035 वर्तमान रन
2026-05-22 00:18 सूट बदला गया 4.2 1.7 $0.035 तुलना करें
2026-05-08 14:44 सूट बदला गया 4.3 3.3 $0.035 तुलना करें
2026-05-08 14:44 सूट बदला गया 4.3 3.3 $0.035 तुलना करें
2026-04-20 17:48 पहला दर्ज रन 4.4 लागू नहीं $0.030 तुलना करें

इस रन में अलग बेंचमार्क सूट इस्तेमाल हुआ था। ऐतिहासिक बदलाव पढ़ते समय सूट बदलाव को ध्यान में रखें।

रन तुलना

रनबेंचमार्क कवरेजस्कोरसंगतिविश्वसनीयतासही परीक्षणअस्थिर टेस्टकुल आउटपुट टोकनकुल इनपुट टोकनकुल लागतप्रतिक्रिया समय (औसत)
2026-06-04 13:41 · नया टेस्ट जोड़ा गया63/63 प्रयास4.28.05.63/215238,56117,070$0.03582.24s
2026-07-16 23:12 · नया टेस्ट जोड़ा गया66/66 प्रयास3.88.15.03/225238,56117,070$0.03682.24s
अंतर+0.4-0.1+0.60000-$0.0020ms

बेंचमार्क कवरेज अलग है: 63/63 प्रयास (लक्ष्य: प्रति टेस्ट 3 दोहराव) बनाम 66/66 प्रयास (लक्ष्य: प्रति टेस्ट 3 दोहराव)। कुल और दोहराव-संवेदनशील मेट्रिक सीधे तुलना योग्य नहीं हैं।

इन दो रन में अलग-अलग बेंचमार्क सूट इस्तेमाल हुए थे, इसलिए अंतर मॉडल बदलाव और सूट बदलाव दोनों को दर्शाते हैं।

कीमत का इतिहास

OpenRouter से इस मॉडल का ऐतिहासिक मूल्य डेटा।

तारीख इनपुट कीमत आउटपुट कीमत
2026-06-04 14:42 $0.040 / 1M $0.150 / 1M

चार्ट

पहले मॉडल चुनें, फिर दूसरा मॉडल क्लिक करके साइड-बाय-साइड पेज खोलें।

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

त्वरित तुलना

श्रेणी विवरण

श्रेणी स्कोर संगति सही परीक्षण
एंटी-एआई ट्रिक्स 5.1 5.8
कोडिंग 2.9 10.0
संयुक्त 3.0 10.0
डेटा पार्सिंग और निष्कर्षण 3.6 5.6
डोमेन-विशिष्ट 3.6 7.2
Samanya Buddhimatta 2.8 1.6
निर्देश पालन 6.5 10.0
पहेली समाधान 3.0 10.0
टूल कॉलिंग 10.0 10.0
सामान्य ज्ञान 3.0 10.0

तुलना किए गए मॉडल