Advertise here
#100

Owl Alpha

Openrouter रिलीज़: 2026-04-30 परीक्षण किया गया: 2026-05-22 00:43 openrouter/owl-alpha::medium
1.6T कुल (48B सक्रिय)MoEमुक्त स्रोत
(medium) (none)

सारांश

Owl Alpha AI BENCHY पर 5.8 स्कोर करता है और #100 पर है। इसकी reliability 9.9, pass rate 41.7%, कुल लागत $0.000, और औसत response time 11.59s है।

Owl Alpha को अलग क्या बनाता है: यह डोमेन-विशिष्ट में सबसे अलग दिखता है, जहाँ इसकी रैंक #3 है; जबकि एंटी-एआई ट्रिक्स इसकी सबसे कमजोर जगह है, जहाँ यह #17 पर है। इस score range के लिए इसकी कुल benchmark लागत असामान्य रूप से कम है।

संग्रहीत मॉडल: इस मॉडल को अब अपडेट नहीं किया जाएगा और नए परीक्षणों में टेस्ट नहीं किया जाएगा।

पहचान नोट

Owl Alpha, Meituan: LongCat 2.0 का स्टेल्थ संस्करण था।

मॉडल विवरण

शोध की तारीख: 2026-08-12

घोषित
पैरामीटर
1.6T कुल (48B सक्रिय)
आर्किटेक्चर
MoE
उपलब्धता
मुक्त स्रोत
लाइसेंस
MIT

संगति

9.6

कुल आउटपुट टोकन

2,965

कुल इनपुट टोकन

0

इनपुट कीमत

$0.000 / 1M

आउटपुट कीमत

$0.000 / 1M

सही परीक्षण

गलत टेस्ट: 12

प्रति प्रयास पास दर: 41.7%

अस्थिर टेस्ट

1

अस्थिर टेस्ट में रनों के बीच मिले-जुले परिणाम रहे (कम से कम एक पास और एक फेल)।

प्रतिक्रिया समय (औसत)

11.59s

प्रतिक्रिया समय (अधिकतम): 58.63s

प्रतिक्रिया समय (कुल): 231.84s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#100 Owl Alpha

medium
Provider returned error
लागत
$0.000
समय
0.2s
टोकन
0 tok

रन इतिहास

परीक्षण किया गया स्कोर विश्वसनीयता सही परीक्षण कुल लागत तुलना करें
2026-06-04 14:30 नया टेस्ट जोड़ा गया 5.6 10.0 $0.000 तुलना करें
2026-05-22 00:43 सूट बदला गया 5.8 9.9 $0.000 वर्तमान रन
2026-04-30 17:29 पहला रन 5.6 10.0 $0.000 तुलना करें

इस रन में अलग बेंचमार्क सूट इस्तेमाल हुआ था। ऐतिहासिक बदलाव पढ़ते समय सूट बदलाव को ध्यान में रखें।

रन तुलना

रनबेंचमार्क कवरेजस्कोरसंगतिविश्वसनीयतासही परीक्षणअस्थिर टेस्टकुल आउटपुट टोकनकुल इनपुट टोकनकुल लागतप्रतिक्रिया समय (औसत)
2026-05-22 00:43 · सूट बदला गया60/60 प्रयास5.89.69.98/2012,9650$0.00011.59s
2026-04-30 17:29 · पहला रन54/54 प्रयास5.69.210.06/1821,5960$0.00011.04s
अंतर+0.2+0.4-0.1+2-1+13690$0.000+556ms

बेंचमार्क कवरेज अलग है: 60/60 प्रयास (लक्ष्य: प्रति टेस्ट 3 दोहराव) बनाम 54/54 प्रयास (लक्ष्य: प्रति टेस्ट 3 दोहराव)। कुल और दोहराव-संवेदनशील मेट्रिक सीधे तुलना योग्य नहीं हैं।

इन दो रन में अलग-अलग बेंचमार्क सूट इस्तेमाल हुए थे, इसलिए अंतर मॉडल बदलाव और सूट बदलाव दोनों को दर्शाते हैं।

चार्ट

पहले मॉडल चुनें, फिर दूसरा मॉडल क्लिक करके साइड-बाय-साइड पेज खोलें।

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

श्रेणी स्कोर संगति सही परीक्षण
एंटी-एआई ट्रिक्स 4.8 10.0
कोडिंग 6.6 10.0
संयुक्त 3.0 10.0
डेटा पार्सिंग और निष्कर्षण 10.0 10.0
डोमेन-विशिष्ट 5.3 10.0
Samanya Buddhimatta 4.3 10.0
निर्देश पालन 6.3 10.0
पहेली समाधान 5.3 7.2
टूल कॉलिंग 10.0 10.0
सामान्य ज्ञान 3.0 10.0

तुलना किए गए मॉडल