नेविगेशन
AI BENCHY
Advertise here

Trinity Large Thinking (medium) vs Qwen3.5-Flash

Qwen3.5-Flash average score में आगे है: 6.1 vs 6.0. Qwen3.5-Flash की benchmark लागत कम है: $0.073 vs $0.792. Qwen3.5-Flash तेज है: 25.28s vs 84.96s, pass rates 45.5% vs 39.4%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-28

रैंक
#150
कुल आउटपुट टोकन
1,002,646
प्रतिक्रिया समय (औसत)
84.96s
कुल लागत
$0.792
रैंक
#140
कुल आउटपुट टोकन
209,201
प्रतिक्रिया समय (औसत)
25.28s
कुल लागत
$0.073
अनुशंसित मॉडल Qwen3.5-Flash

It has the best score here (6.1), while costing about 10.9x less than Trinity Large Thinking (medium).

विस्तृत तुलना

मेट्रिक Trinity Large Thinking Trinity Large Thinking medium रिलीज़: 2026-07-28 Qwen3.5-Flash Qwen3.5-Flash none रिलीज़: 2026-02-24
स्कोर 6.0 6.1
रैंक #150 #140
विश्वसनीयता 10.0 10.0
संगति 7.6 9.3
सही परीक्षण
प्रति प्रयास पास दर 45.5% 39.4%
अस्थिर टेस्ट 7 2
कुल रन 66 66
प्रति परिणाम लागत 11.308 0.933
कुल लागत $0.792 $0.073
इनपुट कीमत $0.220 / 1M $0.065 / 1M
आउटपुट कीमत $0.850 / 1M $0.260 / 1M
कुल इनपुट टोकन 118,477 282,347
आउटपुट टोकन 148,823 209,201
रीजनिंग टोकन 853,823 0
प्रतिक्रिया समय (औसत) 84.96s 25.28s
प्रतिक्रिया समय (अधिकतम) 525.14s 480.96s
प्रतिक्रिया समय (कुल) 1869.16s 556.24s

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#150 Trinity Large Thinking

medium
लागत
$0.016
समय
75.9s
टोकन
19,401 tok

#140 Qwen3.5-Flash

none
लागत
$0.003
समय
47.4s
टोकन
7,799 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Trinity Large Thinking 7.5 10.0 66.7% 0 179.02s 7,248 7,413 351,155
Qwen3.5-Flash 5.5 10.0 33.3% 0 850ms 7,913 519 0

त्वरित तुलना

तुलना जोड़ी बदलें