AI BENCHY Compare
Anthropic: Claude Sonnet 4.6 vs Google: Gemini 3.1 Flash Lite Preview
तुलना करा:
AI BENCHY टेस्ट सूटमधून बेंचमार्क या वेळी तयार झाले: 2026-03-03
| मेट्रिक | Anthropic: Claude Sonnet 4.6 medium प्रकाशन: 2026-02-17 | Google: Gemini 3.1 Flash Lite Preview none प्रकाशन: 2026-03-03 |
|---|---|---|
| क्रमांक | #11 | #10 |
| सरासरी स्कोअर | 7.43 | 7.70 |
| सुसंगतता | 9.40 | 9.54 |
| प्रति निकाल खर्च | 8.105 | 0.116 |
| एकूण खर्च | $0.811 | $0.011 |
| बरोबर चाचण्या | ||
| प्रति प्रयत्न पास दर | 73.8% | 69.1% |
| अस्थिर चाचण्या | 1 | 1 |
| आउटपुट टोकन्स | 29,098 | 4,307 |
| रिझनिंग टोकन्स | 20,435 | 0 |
स्कोअर विरुद्ध एकूण खर्च
श्रेणीवार तपशील
| अँटी-एआय युक्त्या | स्कोअर | सुसंगतता | प्रति प्रयत्न पास दर | अस्थिर चाचण्या | बरोबर चाचण्या | आउटपुट टोकन्स | रिझनिंग टोकन्स |
|---|---|---|---|---|---|---|---|
| Anthropic: Claude Sonnet 4.6 | 7.00 | 10.00 | 66.7% | 0 | 1,031 | 1,093 | |
| Google: Gemini 3.1 Flash Lite Preview | 6.00 | 7.85 | 55.6% | 1 | 1,086 | 0 |
| डेटा पार्सिंग आणि निष्कर्षण | स्कोअर | सुसंगतता | प्रति प्रयत्न पास दर | अस्थिर चाचण्या | बरोबर चाचण्या | आउटपुट टोकन्स | रिझनिंग टोकन्स |
|---|---|---|---|---|---|---|---|
| Anthropic: Claude Sonnet 4.6 | 10.00 | 10.00 | 100.0% | 0 | 727 | 907 | |
| Google: Gemini 3.1 Flash Lite Preview | 9.88 | 10.00 | 100.0% | 0 | 399 | 0 |
| डोमेन-विशिष्ट | स्कोअर | सुसंगतता | प्रति प्रयत्न पास दर | अस्थिर चाचण्या | बरोबर चाचण्या | आउटपुट टोकन्स | रिझनिंग टोकन्स |
|---|---|---|---|---|---|---|---|
| Anthropic: Claude Sonnet 4.6 | 1.00 | 7.21 | 11.1% | 1 | 25,790 | 16,919 | |
| Google: Gemini 3.1 Flash Lite Preview | 4.00 | 10.00 | 33.3% | 0 | 568 | 0 |
| सूचनांचे पालन | स्कोअर | सुसंगतता | प्रति प्रयत्न पास दर | अस्थिर चाचण्या | बरोबर चाचण्या | आउटपुट टोकन्स | रिझनिंग टोकन्स |
|---|---|---|---|---|---|---|---|
| Anthropic: Claude Sonnet 4.6 | 10.00 | 10.00 | 100.0% | 0 | 316 | 523 | |
| Google: Gemini 3.1 Flash Lite Preview | 9.00 | 10.00 | 50.0% | 0 | 574 | 0 |
| Puzzle Solving | स्कोअर | सुसंगतता | प्रति प्रयत्न पास दर | अस्थिर चाचण्या | बरोबर चाचण्या | आउटपुट टोकन्स | रिझनिंग टोकन्स |
|---|---|---|---|---|---|---|---|
| Anthropic: Claude Sonnet 4.6 | 10.00 | 10.00 | 100.0% | 0 | 579 | 642 | |
| Google: Gemini 3.1 Flash Lite Preview | 10.00 | 10.00 | 100.0% | 0 | 898 | 0 |
| टूल कॉलिंग | स्कोअर | सुसंगतता | प्रति प्रयत्न पास दर | अस्थिर चाचण्या | बरोबर चाचण्या | आउटपुट टोकन्स | रिझनिंग टोकन्स |
|---|---|---|---|---|---|---|---|
| Anthropic: Claude Sonnet 4.6 | 10.00 | 10.00 | 100.0% | 0 | 655 | 351 | |
| Google: Gemini 3.1 Flash Lite Preview | 10.00 | 10.00 | 100.0% | 0 | 782 | 0 |
झटपट तुलना
तुलना जोडी बदला
Claude Sonnet 4.6mediumvsGPT-5.2 ChatnoneClaude Sonnet 4.6mediumvsGPT-5.3 ChatnoneClaude Sonnet 4.6mediumvsGemini 3 Flash PreviewnoneGemini 3.1 Flash Lite PreviewnonevsGPT-5.3-CodexmediumClaude Sonnet 4.6mediumvsGemini 3.1 Flash Lite PreviewhighClaude Sonnet 4.6mediumvsGemini 3.1 Flash Lite PreviewlowGemini 3.1 Flash Lite PreviewnonevsGLM 5mediumGemini 3.1 Flash Lite PreviewnonevsStep 3.5 Flashmediumमोफत उपलब्धDeepSeek V3.2mediumvsGemini 3.1 Flash Lite PreviewnoneGemini 3.1 Flash Lite PreviewnonevsGPT-5.2mediumGemini 3.1 Flash Lite PreviewnonevsQwen3.5-27BmediumGemini 3.1 Flash Lite PreviewnonevsQwen3.5-122B-A10Bmedium