नेविगेशन
Advertise here

Trinity Large Thinking (low) vs Qwen3.6 Flash

Qwen3.6 Flash average score में आगे है: 6.1 vs 6.0. Qwen3.6 Flash की benchmark लागत कम है: $0.062 vs $0.625. Qwen3.6 Flash तेज है: 3.73s vs 96.61s, pass rates 47.0% vs 34.9%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-10

तुलना किए गए मॉडल

रैंक
#208
कुल आउटपुट टोकन
818,359
प्रतिक्रिया समय (औसत)
96.61s
कुल लागत
$0.625
रैंक
#204
कुल आउटपुट टोकन
30,947
प्रतिक्रिया समय (औसत)
3.73s
कुल लागत
$0.062
अनुशंसित मॉडल Qwen3.6 Flash

It has the best score here (6.1), while costing about 10.2x less than Trinity Large Thinking (low).

विस्तृत तुलना

मेट्रिक Trinity Large Thinking Trinity Large Thinking low रिलीज़: 2026-07-28 Qwen3.6 Flash Qwen3.6 Flash none रिलीज़: 2026-04-20
स्कोर 6.0 6.1
रैंक #208 #204
विश्वसनीयता 10.0 10.0
संगति 8.3 9.6
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 47.0% 34.9%
अस्थिर टेस्ट 5 1
कुल रन 66 66
प्रति परिणाम लागत 8.221 0.935
कुल लागत $0.625 $0.062
इनपुट कीमत $0.250 / 1M $0.188 / 1M
आउटपुट कीमत $0.800 / 1M $1.125 / 1M
कुल इनपुट टोकन 122,854 139,797
आउटपुट टोकन 119,810 30,947
रीजनिंग टोकन 698,549 0
प्रतिक्रिया समय (औसत) 96.61s 3.73s
प्रतिक्रिया समय (अधिकतम) 540.96s 48.79s
प्रतिक्रिया समय (कुल) 2125.51s 81.95s
पैरामीटर 398B कुल (13B सक्रिय) ~35B कुल (~3B सक्रिय)
उपलब्धता वेट उपलब्ध बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#208 Trinity Large Thinking

low
लागत
$0.021
समय
173.2s
टोकन
24,586 tok

#204 Qwen3.6 Flash

none
लागत
$0.005
समय
20.1s
टोकन
4,211 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Trinity Large Thinking 5.3 10.0 33.3% 0 344.45s 5,441 27,039 217,241
Qwen3.6 Flash 5.4 10.0 33.3% 0 1.79s 6,488 889 0

त्वरित तुलना

तुलना जोड़ी बदलें