#21 Seed-2.0-Lite
medium- Cost
- $0.005
- Time
- 86.7s
- Tokens
- 2,354 tok
AI BENCHY 对比
摘要
Seed-2.0-Lite vs Qwen3.7 Plus benchmark 对比:Seed-2.0-Lite 平均分领先,为 8.5 vs 8.2。 Seed-2.0-Lite benchmark 成本更低,为 $0.175 vs $0.177。 Qwen3.7 Plus 更快,为 38.95s vs 47.07s,通过率为 76.2% vs 77.8%。
推荐模型: Qwen3.7 Plus - 它提供了最佳整体取舍:得分有竞争力(8.2),响应快于Seed-2.0-Lite,成本也较均衡。
基准结果生成自 AI BENCHY 测试套件,时间:: 2026-06-12
| 指标 | Seed-2.0-Lite Seed-2.0-Lite medium | Qwen3.7 Plus Qwen3.7 Plus medium |
|---|---|---|
| 分数 | 8.5 | 8.2 |
| 排名 | #21 | #28 |
| 可靠性 | 10.0 | 10.0 |
| 一致性 | 9.0 | 9.1 |
| 测试正确 | ||
| 尝试通过率 | 76.2% | 77.8% |
| 不稳定测试 | 3 | 2 |
| 总运行次数 | 63 | 63 |
| 每个结果成本 | 1.250 | 1.474 |
| 总成本 | $0.175 | $0.177 |
| 输入价格 | $0.250 / 1M | $0.320 / 1M |
| 输出价格 | $2.000 / 1M | $1.280 / 1M |
| 总输入令牌 | 46,740 | 40,939 |
| 输出令牌 | 3,230 | 2,125 |
| 推理令牌 | 78,406 | 125,754 |
| 响应时间(平均) | 47.07s | 38.95s |
| 响应时间(最大) | 254.92s | 178.04s |
| 响应时间(总计) | 988.37s | 817.85s |
Generation showcase
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
| 反AI技巧 | 分数 | 一致性 | 尝试通过率 | 不稳定测试 | 测试正确 | 响应时间(平均) | 输入令牌 | 输出令牌 | 推理令牌 |
|---|---|---|---|---|---|---|---|---|---|
| Seed-2.0-Lite | 8.3 | 10.0 | 75.0% | 0 | 17.99s | 942 | 996 | 7,142 | |
| Qwen3.7 Plus | 10.0 | 10.0 | 100.0% | 0 | 8.58s | 672 | 195 | 5,065 |
| 编程 | 分数 | 一致性 | 尝试通过率 | 不稳定测试 | 测试正确 | 响应时间(平均) | 输入令牌 | 输出令牌 | 推理令牌 |
|---|---|---|---|---|---|---|---|---|---|
| Seed-2.0-Lite | 8.0 | 9.8 | 66.7% | 0 | 156.74s | 8,247 | 458 | 31,890 | |
| Qwen3.7 Plus | 6.1 | 6.6 | 55.6% | 1 | 108.60s | 6,472 | 414 | 43,576 |
| 综合 | 分数 | 一致性 | 尝试通过率 | 不稳定测试 | 测试正确 | 响应时间(平均) | 输入令牌 | 输出令牌 | 推理令牌 |
|---|---|---|---|---|---|---|---|---|---|
| Seed-2.0-Lite | 10.0 | 10.0 | 100.0% | 0 | 37.67s | 16,254 | 506 | 4,299 | |
| Qwen3.7 Plus | 10.0 | 10.0 | 100.0% | 0 | 65.24s | 14,934 | 366 | 10,132 |
| 数据解析与提取 | 分数 | 一致性 | 尝试通过率 | 不稳定测试 | 测试正确 | 响应时间(平均) | 输入令牌 | 输出令牌 | 推理令牌 |
|---|---|---|---|---|---|---|---|---|---|
| Seed-2.0-Lite | 10.0 | 10.0 | 100.0% | 0 | 9.07s | 8,562 | 246 | 1,742 | |
| Qwen3.7 Plus | 10.0 | 10.0 | 100.0% | 0 | 21.75s | 7,782 | 270 | 6,713 |
| 领域专项 | 分数 | 一致性 | 尝试通过率 | 不稳定测试 | 测试正确 | 响应时间(平均) | 输入令牌 | 输出令牌 | 推理令牌 |
|---|---|---|---|---|---|---|---|---|---|
| Seed-2.0-Lite | 5.9 | 7.2 | 55.6% | 1 | 88.74s | 843 | 15 | 23,897 | |
| Qwen3.7 Plus | 3.6 | 7.2 | 22.2% | 1 | 45.35s | 771 | 57 | 27,073 |
| 通用智能 | 分数 | 一致性 | 尝试通过率 | 不稳定测试 | 测试正确 | 响应时间(平均) | 输入令牌 | 输出令牌 | 推理令牌 |
|---|---|---|---|---|---|---|---|---|---|
| Seed-2.0-Lite | 6.7 | 3.6 | 66.7% | 1 | 18.25s | 582 | 304 | 1,620 | |
| Qwen3.7 Plus | 10.0 | 10.0 | 100.0% | 0 | 25.48s | 516 | 123 | 3,998 |
| 指令遵循 | 分数 | 一致性 | 尝试通过率 | 不稳定测试 | 测试正确 | 响应时间(平均) | 输入令牌 | 输出令牌 | 推理令牌 |
|---|---|---|---|---|---|---|---|---|---|
| Seed-2.0-Lite | 10.0 | 10.0 | 100.0% | 0 | 7.26s | 834 | 71 | 1,480 | |
| Qwen3.7 Plus | 10.0 | 10.0 | 100.0% | 0 | 16.13s | 699 | 102 | 5,013 |
| 谜题求解 | 分数 | 一致性 | 尝试通过率 | 不稳定测试 | 测试正确 | 响应时间(平均) | 输入令牌 | 输出令牌 | 推理令牌 |
|---|---|---|---|---|---|---|---|---|---|
| Seed-2.0-Lite | 9.0 | 7.9 | 88.9% | 1 | 10.23s | 894 | 403 | 3,285 | |
| Qwen3.7 Plus | 10.0 | 10.0 | 100.0% | 0 | 16.38s | 696 | 280 | 7,312 |
| 工具调用 | 分数 | 一致性 | 尝试通过率 | 不稳定测试 | 测试正确 | 响应时间(平均) | 输入令牌 | 输出令牌 | 推理令牌 |
|---|---|---|---|---|---|---|---|---|---|
| Seed-2.0-Lite | 10.0 | 10.0 | 100.0% | 0 | 12.38s | 9,306 | 222 | 1,011 | |
| Qwen3.7 Plus | 10.0 | 10.0 | 100.0% | 0 | 15.02s | 8,193 | 292 | 1,831 |
| 常识问答 | 分数 | 一致性 | 尝试通过率 | 不稳定测试 | 测试正确 | 响应时间(平均) | 输入令牌 | 输出令牌 | 推理令牌 |
|---|---|---|---|---|---|---|---|---|---|
| Seed-2.0-Lite | 3.0 | 10.0 | 0.0% | 0 | 48.32s | 276 | 9 | 2,040 | |
| Qwen3.7 Plus | 3.0 | 10.0 | 0.0% | 0 | 91.07s | 204 | 26 | 15,041 |
切换对比组合