导航
AI BENCHY
Advertise here

AI BENCHY 对比

Qwen: Qwen3.6 35B A3B vs xAI: Grok 4.20

摘要

Qwen3.6 35B A3B vs Grok 4.20 benchmark 对比:Grok 4.20 平均分领先,为 5.4 vs 4.6Qwen3.6 35B A3B benchmark 成本更低,为 $0.031 vs $0.057Grok 4.20 更快,为 1.11s vs 3.73s,通过率为 30.2% vs 33.3%

推荐模型: Grok 4.20 - 它在这里得分最高(5.4),同时响应速度比Qwen3.6 35B A3B快约 3.4 倍。

基准结果生成自 AI BENCHY 测试套件,时间:: 2026-06-10

指标 Qwen3.6 35B A3B Qwen3.6 35B A3B none 发布日期: 2026-04-20 Grok 4.20 Grok 4.20 none 发布日期: 2026-03-31
分数 4.6 5.4
排名 #154 #128
可靠性 10.0 不适用
一致性 8.0 10.0
测试正确
尝试通过率 30.2% 33.3%
不稳定测试 5 0
总运行次数 63 54
每个结果成本 0.754 1.570
总成本 $0.031 $0.057
输入价格 $0.140 / 1M $1.250 / 1M
输出价格 $1.000 / 1M $2.500 / 1M
总输入令牌 19,329 41,313
输出令牌 27,755 1,923
推理令牌 0 0
响应时间(平均) 3.73s 1.11s
响应时间(最大) 22.52s 6.04s
响应时间(总计) 70.86s 19.96s

Generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#154 Qwen3.6 35B A3B

none
Cost
$0.008
Time
30.1s
Tokens
6,317 tok

#128 xAI: Grok 4.20

none
Cost
$0.004
Time
6.5s
Tokens
1,367 tok

按分数排名的模型

分数 vs 总成本

响应时间(平均)

分数 vs 响应时间(平均)

总输出令牌

分数 vs 总输出令牌

类别细分

反AI技巧 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Qwen3.6 35B A3B 3.6 7.6 16.7% 1 2.10s 696 1,571 0
Grok 4.20 4.8 10.0 25.0% 0 501ms 1,986 267 0
编程 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Qwen3.6 35B A3B 5.5 10.0 33.3% 0 8.77s 7,911 11,161 0
Grok 4.20 3.4 9.3 0.0% 0 1.22s 1,074 312 0
综合 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Qwen3.6 35B A3B 3.0 10.0 0.0% 0 0ms 0 0 0
Grok 4.20 3.0 10.0 0.0% 0 6.04s 17,673 282 0
数据解析与提取 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Qwen3.6 35B A3B 10.0 10.0 100.0% 0 1.46s 7,788 248 0
Grok 4.20 10.0 10.0 100.0% 0 522ms 7,749 207 0
领域专项 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Qwen3.6 35B A3B 3.5 4.4 33.3% 2 7.45s 781 11,381 0
Grok 4.20 3.0 10.0 0.0% 0 687ms 1,746 325 0
通用智能 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Qwen3.6 35B A3B 4.4 3.0 33.3% 1 3.51s 520 1,545 0
Grok 4.20 4.8 10.0 0.0% 0 659ms 819 83 0
指令遵循 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Qwen3.6 35B A3B 6.2 5.8 66.7% 1 1.86s 709 1,264 0
Grok 4.20 6.3 10.0 50.0% 0 445ms 1,350 60 0
谜题求解 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Qwen3.6 35B A3B 3.2 9.9 0.0% 0 1.07s 714 573 0
Grok 4.20 5.3 10.0 33.3% 0 473ms 1,671 198 0
工具调用 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Qwen3.6 35B A3B 3.0 10.0 0.0% 0 0ms 0 0 0
Grok 4.20 10.0 10.0 100.0% 0 4.63s 7,245 189 0
常识问答 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Qwen3.6 35B A3B 3.0 10.0 0.0% 0 414ms 210 12 0
Grok 4.20 - - - - - - - - -

快速对比

切换对比组合