নেভিগেশন
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY Compare

Anthropic: Claude Opus 4.7 vs Qwen: Qwen3.7 Max

সারাংশ

Claude Opus 4.7 (medium) average score-এ এগিয়ে: 8.7 vs 6.9. Qwen3.7 Max-এর benchmark খরচ কম: $0.054 vs $0.679. Qwen3.7 Max দ্রুত: 1.30s vs 4.73s, pass rates 82.5% vs 66.7%.

প্রস্তাবিত মডেলQwen3.7 MaxIt offers the best overall trade-off: a competitive score (6.9), lower cost than Claude Opus 4.7 (medium), and balanced response time.

AI BENCHY টেস্ট স্যুট থেকে বেঞ্চমার্ক তৈরি হয়েছে: 2026-07-14

মেট্রিক Claude Opus 4.7 Claude Opus 4.7 medium প্রকাশ: 2026-04-16 Qwen3.7 Max Qwen3.7 Max none প্রকাশ: 2026-05-22
স্কোর 8.7 6.9
র‍্যাঙ্ক #16 #85
নির্ভরযোগ্যতা 10.0 10.0
ধারাবাহিকতা 9.6 10.0
সঠিক টেস্ট
প্রতি চেষ্টায় পাস রেট 82.5% 66.7%
অস্থির টেস্ট 1 0
মোট রান 63 63
প্রতি ফলাফলে খরচ 3.991 0.744
মোট খরচ $0.679 $0.054
ইনপুট মূল্য $5.000 / 1M $1.250 / 1M
আউটপুট মূল্য $25.000 / 1M $3.750 / 1M
মোট ইনপুট টোকেন 65,406 37,107
আউটপুট টোকেন 11,858 1,994
রিজনিং টোকেন 2,198 0
প্রতিক্রিয়া সময় (গড়) 4.73s 1.30s
প্রতিক্রিয়া সময় (সর্বোচ্চ) 23.18s 3.92s
প্রতিক্রিয়া সময় (মোট) 94.51s 27.21s

জেনারেশন শোকেস

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#16 Claude Opus 4.7

medium
খরচ
$0.059
সময়
26.8s
টোকেন
2,475 tok

#85 Qwen3.7 Max

none
খরচ
$0.046
সময়
195.0s
টোকেন
12,171 tok

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর বনাম মোট খরচ

প্রতিক্রিয়া সময় (গড়)

স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

কোডিং স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) ইনপুট টোকেন আউটপুট টোকেন রিজনিং টোকেন
Claude Opus 4.7 7.6 7.2 77.8% 1 12.96s 10,635 7,629 1,114
Qwen3.7 Max 5.5 10.0 33.3% 0 1.35s 7,911 582 0

দ্রুত তুলনা

তুলনার জুটি বদলান