नेविगेशन
Advertise here

Trinity Large Thinking (medium) vs Qwen3.7 Flash

average score लगभग बराबर है: 6.1 vs 6.1. Qwen3.7 Flash की benchmark लागत कम है: $0.019 vs $0.756. Qwen3.7 Flash तेज है: 10.05s vs 85.44s, pass rates 48.5% vs 36.4%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-10

तुलना किए गए मॉडल

रैंक
#203
कुल आउटपुट टोकन
1,016,785
प्रतिक्रिया समय (औसत)
85.44s
कुल लागत
$0.756
रैंक
#199
कुल आउटपुट टोकन
90,507
प्रतिक्रिया समय (औसत)
10.05s
कुल लागत
$0.019
अनुशंसित मॉडल Qwen3.7 Flash

It has the best score here (6.1), while costing about 41.2x less than Trinity Large Thinking (medium).

विस्तृत तुलना

मेट्रिक Trinity Large Thinking Trinity Large Thinking medium रिलीज़: 2026-07-28 Qwen3.7 Flash Qwen3.7 Flash none रिलीज़: 2026-07-28
स्कोर 6.1 6.1
रैंक #203 #199
विश्वसनीयता 10.0 10.0
संगति 7.9 9.2
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 48.5% 36.4%
अस्थिर टेस्ट 6 2
कुल रन 66 66
प्रति परिणाम लागत 9.972 0.262
कुल लागत $0.756 $0.019
इनपुट कीमत $0.250 / 1M $0.030 / 1M
आउटपुट कीमत $0.800 / 1M $0.130 / 1M
कुल इनपुट टोकन 118,486 218,740
आउटपुट टोकन 156,166 90,507
रीजनिंग टोकन 860,619 0
प्रतिक्रिया समय (औसत) 85.44s 10.05s
प्रतिक्रिया समय (अधिकतम) 525.14s 186.24s
प्रतिक्रिया समय (कुल) 1879.75s 221.13s
पैरामीटर 398B कुल (13B सक्रिय) ~35B कुल (~3B सक्रिय)
उपलब्धता वेट उपलब्ध बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#203 Trinity Large Thinking

medium
लागत
$0.016
समय
75.9s
टोकन
19,401 tok

#199 Qwen3.7 Flash

none
लागत
$0.001
समय
34.0s
टोकन
4,814 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Trinity Large Thinking 7.5 10.0 66.7% 0 179.02s 7,248 7,413 351,155
Qwen3.7 Flash 5.5 10.0 33.3% 0 1.55s 7,911 855 0

त्वरित तुलना

तुलना जोड़ी बदलें