Advertise here
#149

Qwen3.5-27B

Qwen रिलीज़: 2026-02-24 परीक्षण किया गया: 2026-10-01 01:05 qwen/qwen3.5-27b::none
27Bसघनमुक्त स्रोत
(medium) (none)

सारांश

Qwen3.5-27B AI BENCHY पर 7.2 स्कोर करता है और #149 पर है। इसकी reliability 10.0, pass rate 47.8%, कुल लागत $0.116, और औसत response time 9.98s है।

Qwen3.5-27B को अलग क्या बनाता है: यह स्वायत्त एजेंट कार्य में सबसे अलग दिखता है, जहाँ इसकी रैंक #1 है; जबकि एंटी-एआई ट्रिक्स इसकी सबसे कमजोर जगह है, जहाँ यह #17 पर है।

मॉडल विवरण

शोध की तारीख: 2026-08-12

घोषित
पैरामीटर
27B
आर्किटेक्चर
सघन
उपलब्धता
मुक्त स्रोत
लाइसेंस
Apache-2.0

संगति

9.4

कुल आउटपुट टोकन

36,422

कुल इनपुट टोकन

283,977

इनपुट कीमत

$0.195 / 1M

आउटपुट कीमत

$1.560 / 1M

कैश पढ़ने की कीमत

लागू नहीं

कैश लिखने की कीमत

लागू नहीं

कैश की कीमतें इनपुट टोकन पर लागू होती हैं। पढ़ने पर कैश किए गए प्रॉम्प्ट का दोबारा उपयोग होता है; लिखने पर वे सहेजे जाते हैं और अतिरिक्त लागत हो सकती है। आउटपुट टोकन पर आउटपुट की कीमत लागू होती है।

सही परीक्षण

गलत टेस्ट: 13

प्रति प्रयास पास दर: 47.8%

अस्थिर टेस्ट

2

अस्थिर टेस्ट में रनों के बीच मिले-जुले परिणाम रहे (कम से कम एक पास और एक फेल)।

प्रतिक्रिया समय (औसत)

9.98s

प्रतिक्रिया समय (अधिकतम): 124.53s

प्रतिक्रिया समय (कुल): 229.52s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#149 Qwen3.5-27B

none
लागत
$0.007
समय
42.9s
टोकन
4,273 tok

रन इतिहास

परीक्षण किया गया स्कोर विश्वसनीयता सही परीक्षण कुल लागत तुलना करें
2026-10-01 01:05 दोबारा परीक्षण 7.2 10.0 $0.116 वर्तमान रन
2026-07-16 22:01 नया टेस्ट जोड़ा गया 6.5 10.0 $0.058 ↓ तुलना करें
2026-06-04 13:28 नया टेस्ट जोड़ा गया 5.7 10.0 $0.015 ↓ तुलना करें
2026-05-21 23:59 सूट बदला गया 5.8 10.0 $0.017 तुलना करें
2026-04-11 01:19 पहला दर्ज रन 5.9 लागू नहीं $0.016 तुलना करें

इस रन में अलग बेंचमार्क सूट इस्तेमाल हुआ था। ऐतिहासिक बदलाव पढ़ते समय सूट बदलाव को ध्यान में रखें।

रन तुलना

रनबेंचमार्क कवरेजस्कोरसंगतिविश्वसनीयतासही परीक्षणअस्थिर टेस्टकुल आउटपुट टोकनकुल इनपुट टोकनकुल लागतप्रतिक्रिया समय (औसत)
2026-10-01 01:05 · वर्तमान रन69/69 प्रयास7.29.410.010/23236,422283,977$0.1169.98s
2026-07-16 22:01 · नया टेस्ट जोड़ा गया66/66 प्रयास6.59.310.08/22224,321102,316$0.0584.76s
अंतर—+0.7+0.10.0+20+12101+181661+$0.058+5220ms

बेंचमार्क कवरेज अलग है: 69/69 प्रयास (लक्ष्य: प्रति टेस्ट 3 दोहराव) बनाम 66/66 प्रयास (लक्ष्य: प्रति टेस्ट 3 दोहराव)। कुल और दोहराव-संवेदनशील मेट्रिक सीधे तुलना योग्य नहीं हैं।

इन दो रन में अलग-अलग बेंचमार्क सूट इस्तेमाल हुए थे, इसलिए अंतर मॉडल बदलाव और सूट बदलाव दोनों को दर्शाते हैं।

चार्ट

पहले मॉडल चुनें, फिर दूसरा मॉडल क्लिक करके साइड-बाय-साइड पेज खोलें।

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

त्वरित तुलना

श्रेणी विवरण

श्रेणी स्कोर संगति सही परीक्षण
स्वायत्त एजेंट कार्य 10.0 10.0
एंटी-एआई ट्रिक्स 4.8 10.0
कोडिंग 5.8 10.0
संयुक्त 6.4 5.8
डेटा पार्सिंग और निष्कर्षण 10.0 10.0
डोमेन-विशिष्ट 5.3 10.0
Samanya Buddhimatta 5.0 10.0
निर्देश पालन 6.3 10.0
पहेली समाधान 6.7 7.9
टूल कॉलिंग 10.0 10.0
सामान्य ज्ञान 3.0 10.0

तुलना किए गए मॉडल