导航
AI BENCHY
比较 图表 方法论
❤️ Made by XCS
Your ad here

AI BENCHY 对比

Google: Gemini 3.1 Flash Lite Preview vs Qwen: Qwen3.5-35B-A3B

比较:

基准结果生成自 AI BENCHY 测试套件,时间:: 2026-03-06

指标 Google: Gemini 3.1 Flash Lite Preview none 发布日期: 2026-03-03 Qwen: Qwen3.5-35B-A3B medium 发布日期: 2026-02-24
平均分 7.4 5.8
排名 #21 #34
测试正确
一致性 9.6 6.7
每个结果成本 0.142 4.189
总成本 $0.015 $0.336
尝试通过率 71.1% 80.0%
不稳定测试 1 6
common.totalRuns 45 (15 x 3) 45 (15 x 3)
输出令牌 4,646 5,475
推理令牌 0 165,513
响应时间(平均) 1.37s 44.84s
响应时间(最大) 3.39s 106.00s
响应时间(总计) 20.53s 672.55s

按分数排名的模型

分数 vs 总成本

响应时间(平均)

平均分 vs 响应时间(平均)

类别细分

反AI技巧 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输出令牌 推理令牌
Google: Gemini 3.1 Flash Lite Preview 6.0 7.8 55.6% 1 1.16s 1,086 0
Qwen: Qwen3.5-35B-A3B 10.0 10.0 100.0% 0 21.75s 429 36,235
综合 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输出令牌 推理令牌
Google: Gemini 3.1 Flash Lite Preview 10.0 10.0 0.0% 0 3.20s 339 0
Qwen: Qwen3.5-35B-A3B 10.0 1.6 66.7% 1 75.34s 775 12,485
数据解析与提取 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输出令牌 推理令牌
Google: Gemini 3.1 Flash Lite Preview 9.9 10.0 100.0% 0 1.22s 399 0
Qwen: Qwen3.5-35B-A3B 5.5 5.9 83.3% 1 59.33s 235 19,493
领域专项 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输出令牌 推理令牌
Google: Gemini 3.1 Flash Lite Preview 4.0 10.0 33.3% 0 942ms 568 0
Qwen: Qwen3.5-35B-A3B 10.0 4.4 44.5% 2 88.34s 41 46,368
指令遵循 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输出令牌 推理令牌
Google: Gemini 3.1 Flash Lite Preview 10.0 10.0 100.0% 0 1.13s 574 0
Qwen: Qwen3.5-35B-A3B 10.0 10.0 100.0% 0 24.45s 97 17,361
Puzzle Solving 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输出令牌 推理令牌
Google: Gemini 3.1 Flash Lite Preview 10.0 10.0 100.0% 0 972ms 898 0
Qwen: Qwen3.5-35B-A3B 4.0 4.4 77.8% 2 31.58s 3,589 32,206
工具调用 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输出令牌 推理令牌
Google: Gemini 3.1 Flash Lite Preview 10.0 10.0 100.0% 0 3.39s 782 0
Qwen: Qwen3.5-35B-A3B 10.0 10.0 100.0% 0 4.65s 309 1,365

快速对比

切换对比组合