AI BENCHY

AI 基准排行榜

Name: AI BENCHY 模型基准结果
Creator: AI BENCHY
License: https://aibenchy.com/methodology/

基准结果生成自 AI BENCHY 测试套件，时间：: 2026-06-18 已评估模型: 169

169/169

排名	模型	分数	公司	总成本	响应时间（平均）
#105#105	GLM 5V Turbonone	5.9	Z.ai	$0.052	2.99s
查看模型卡片总测试数 21 错误测试数 13 可靠性 10.0 尝试通过率 38.1% 不稳定测试 0 输入令牌 37,100 输出令牌 1,766 推理令牌 0 响应时间（平均） 2.99s 响应时间（总计） 62.74s 响应时间（最大） 6.51s 答案错误: 11 未遵循指令: 2 反AI技巧 : 4.8 编程 : 5.5 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 4.6 指令遵循 : 6.5 谜题求解 : 5.3 工具调用 : 10.0 常识问答 : 3.0
#106#106	Qwen3.5 Plus 2026-02-15none	5.8	Qwen	$0.016 ↓	2.31s
查看模型卡片总测试数 21 错误测试数 12 可靠性 10.0 尝试通过率 46.0% 不稳定测试 2 输入令牌 45,864 输出令牌 2,480 推理令牌 0 响应时间（平均） 2.31s 响应时间（总计） 34.63s 响应时间（最大） 6.65s 答案错误: 12 反AI技巧 : 4.8 编程 : 4.3 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 4.4 指令遵循 : 10.0 谜题求解 : 7.7 工具调用 : 10.0 常识问答 : 3.0
#108#108	Owl Alphamedium	5.8	Openrouter	$0.000	11.95s
查看模型卡片总测试数 21 错误测试数 13 可靠性 10.0 尝试通过率 39.7% 不稳定测试 1 输入令牌 43,478 输出令牌 2,974 推理令牌 0 响应时间（平均） 11.95s 响应时间（总计） 250.88s 响应时间（最大） 58.63s 答案错误: 10 未遵循指令: 2 API 错误: 1 反AI技巧 : 4.8 编程 : 5.4 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 4.3 指令遵循 : 6.5 谜题求解 : 5.3 工具调用 : 10.0 常识问答 : 3.0
#109#109	Mimo V2 PROnone	5.8	Xiaomi	$0.045 ↓	2.27s
查看模型卡片总测试数 21 错误测试数 14 可靠性 10.0 尝试通过率 41.3% 不稳定测试 3 输入令牌 39,344 输出令牌 2,352 推理令牌 0 响应时间（平均） 2.27s 响应时间（总计） 45.50s 响应时间（最大） 6.58s 答案错误: 11 未遵循指令: 2 API 错误: 1 反AI技巧 : 3.5 编程 : 5.5 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 4.3 指令遵循 : 6.5 谜题求解 : 6.0 工具调用 : 10.0 常识问答 : 3.0
#110#110	Owl Alphanone	5.8	Openrouter	$0.000	9.88s
查看模型卡片总测试数 21 错误测试数 14 可靠性 10.0 尝试通过率 36.5% 不稳定测试 1 输入令牌 42,283 输出令牌 5,913 推理令牌 0 响应时间（平均） 9.88s 响应时间（总计） 207.38s 响应时间（最大） 47.10s 答案错误: 10 未遵循指令: 3 额外格式: 1 反AI技巧 : 3.4 编程 : 5.6 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 4.3 指令遵循 : 6.4 谜题求解 : 5.4 工具调用 : 10.0 常识问答 : 3.0
#111#111	Kimi K2.6none	5.8	Moonshot AI	$0.079 ↓	13.27s
查看模型卡片总测试数 21 错误测试数 14 可靠性 10.0 尝试通过率 36.5% 不稳定测试 2 输入令牌 32,916 输出令牌 16,410 推理令牌 0 响应时间（平均） 13.27s 响应时间（总计） 278.57s 响应时间（最大） 238.89s 答案错误: 11 未遵循指令: 3 反AI技巧 : 4.6 编程 : 5.5 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 5.4 指令遵循 : 6.5 谜题求解 : 3.1 工具调用 : 10.0 常识问答 : 3.0
#112#112	GPT-5.4none	5.8	OpenAI	$0.122	1.42s
查看模型卡片总测试数 21 错误测试数 14 可靠性 10.0 尝试通过率 36.5% 不稳定测试 2 输入令牌 34,212 输出令牌 2,417 推理令牌 0 响应时间（平均） 1.42s 响应时间（总计） 29.87s 响应时间（最大） 2.95s 答案错误: 13 未遵循指令: 1 反AI技巧 : 3.2 编程 : 5.5 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 4.4 指令遵循 : 6.5 谜题求解 : 5.6 工具调用 : 10.0 常识问答 : 3.0
#114#114	Mimo V2 Omninone	5.7	Xiaomi	$0.021 ↓	2.44s
查看模型卡片总测试数 21 错误测试数 13 可靠性 10.0 尝试通过率 39.7% 不稳定测试 1 输入令牌 40,852 输出令牌 3,314 推理令牌 0 响应时间（平均） 2.44s 响应时间（总计） 48.81s 响应时间（最大） 6.81s 答案错误: 10 API 错误: 1 额外格式: 1 未遵循指令: 1 反AI技巧 : 3.6 编程 : 4.4 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 4.1 指令遵循 : 6.5 谜题求解 : 10.0 工具调用 : 10.0 常识问答 : 3.0
#115#115	Grok 4.1 Fastmedium	5.6	X AI	$0.069 ↑	23.85s
查看模型卡片总测试数 19 错误测试数 10 可靠性 10.0 尝试通过率 55.6% 不稳定测试 6 输入令牌 42,845 输出令牌 2,006 推理令牌 96,334 响应时间（平均） 23.85s 响应时间（总计） 286.16s 响应时间（最大） 121.79s 未遵循指令: 4 答案错误: 4 无答案: 1 超时: 1 反AI技巧 : 8.7 编程 : 7.8 综合 : 10.0 数据解析与提取 : 10.0 领域专项 : 5.8 通用智能 : 4.2 指令遵循 : 6.5 谜题求解 : 5.3 工具调用 : 2.8 常识问答 : 3.0
#116#116	GLM 5.1none	5.6	Z.ai	$0.058 ↓	4.10s
查看模型卡片总测试数 21 错误测试数 14 可靠性 10.0 尝试通过率 41.3% 不稳定测试 4 输入令牌 47,133 输出令牌 3,754 推理令牌 0 响应时间（平均） 4.10s 响应时间（总计） 86.18s 响应时间（最大） 32.57s 答案错误: 13 无效工具调用: 1 反AI技巧 : 4.0 编程 : 3.9 综合 : 2.8 数据解析与提取 : 10.0 领域专项 : 2.9 通用智能 : 5.0 指令遵循 : 9.8 谜题求解 : 7.7 工具调用 : 10.0 常识问答 : 3.0
#117#117	DeepSeek V4 Flashnone	5.5	DeepSeek	$0.007 ↓	26.75s
查看模型卡片总测试数 21 错误测试数 16 可靠性 10.0 尝试通过率 30.2% 不稳定测试 3 输入令牌 50,127 输出令牌 13,710 推理令牌 0 响应时间（平均） 26.75s 响应时间（总计） 561.82s 响应时间（最大） 111.96s 答案错误: 12 额外格式: 2 未遵循指令: 1 无效工具调用: 1 反AI技巧 : 3.0 编程 : 4.2 综合 : 4.5 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 4.2 指令遵循 : 6.5 谜题求解 : 3.1 工具调用 : 10.0 常识问答 : 3.0
#118#118	Kimi K2.5none	5.5	Moonshot AI	$0.027 ↑	13.18s
查看模型卡片总测试数 21 错误测试数 15 可靠性 10.0 尝试通过率 34.9% 不稳定测试 3 输入令牌 36,034 输出令牌 6,657 推理令牌 0 响应时间（平均） 13.18s 响应时间（总计） 184.47s 响应时间（最大） 42.13s 答案错误: 15 反AI技巧 : 3.6 编程 : 5.5 综合 : 2.8 数据解析与提取 : 7.3 领域专项 : 5.3 通用智能 : 10.0 指令遵循 : 6.5 谜题求解 : 3.0 工具调用 : 10.0 常识问答 : 3.0
#119#119	MiMo-V2.5-Pronone	5.5	Xiaomi	$0.017 ↓	1.78s
查看模型卡片总测试数 21 错误测试数 15 可靠性 10.0 尝试通过率 39.7% 不稳定测试 4 输入令牌 30,724 输出令牌 3,043 推理令牌 0 响应时间（平均） 1.78s 响应时间（总计） 37.42s 响应时间（最大） 8.32s 答案错误: 11 未遵循指令: 4 反AI技巧 : 3.3 编程 : 4.3 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 4.0 指令遵循 : 6.4 谜题求解 : 6.7 工具调用 : 10.0 常识问答 : 3.0
#120#120	Qwen3.6 27Bnone	5.5	Qwen	$0.028 ↓	3.72s
查看模型卡片总测试数 21 错误测试数 14 可靠性 10.0 尝试通过率 47.6% 不稳定测试 6 输入令牌 52,721 输出令牌 3,812 推理令牌 0 响应时间（平均） 3.72s 响应时间（总计） 78.08s 响应时间（最大） 11.82s 答案错误: 11 未遵循指令: 2 无效工具调用: 1 反AI技巧 : 3.8 编程 : 5.5 综合 : 3.0 数据解析与提取 : 7.3 领域专项 : 7.7 通用智能 : 5.2 指令遵循 : 6.2 谜题求解 : 5.3 工具调用 : 9.5 常识问答 : 3.0
#121#121	Gemma 4 26B A4Bnone	5.5	Google	$0.004 ↓	5.91s
查看模型卡片总测试数 21 错误测试数 13 可靠性 10.0 尝试通过率 44.4% 不稳定测试 2 输入令牌 40,038 输出令牌 1,824 推理令牌 0 响应时间（平均） 5.91s 响应时间（总计） 124.05s 响应时间（最大） 57.10s 答案错误: 10 未遵循指令: 2 超时: 1 反AI技巧 : 8.3 编程 : 3.7 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 3.6 通用智能 : 4.0 指令遵循 : 6.3 谜题求解 : 6.2 工具调用 : 10.0 常识问答 : 3.0
#122#122	Qwen3.5 Plus 2026-04-20none	5.5	Qwen	$0.032 ↓	4.39s
查看模型卡片总测试数 21 错误测试数 14 可靠性 10.0 尝试通过率 41.3% 不稳定测试 4 输入令牌 38,910 输出令牌 11,145 推理令牌 0 响应时间（平均） 4.39s 响应时间（总计） 92.26s 响应时间（最大） 33.34s 答案错误: 12 未遵循指令: 2 反AI技巧 : 4.8 编程 : 3.9 综合 : 2.8 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 4.8 指令遵循 : 6.2 谜题求解 : 6.7 工具调用 : 10.0 常识问答 : 3.0
#123#123	GLM 5 Turbonone	5.3	Z.ai	$0.047 ↑	2.82s
查看模型卡片总测试数 21 错误测试数 15 可靠性 10.0 尝试通过率 31.8% 不稳定测试 2 输入令牌 32,525 输出令牌 1,815 推理令牌 0 响应时间（平均） 2.82s 响应时间（总计） 59.29s 响应时间（最大） 8.21s 答案错误: 13 未遵循指令: 2 反AI技巧 : 3.0 编程 : 3.9 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 4.2 指令遵循 : 6.5 谜题求解 : 5.5 工具调用 : 10.0 常识问答 : 3.0
#124#124	GPT-5.4 Mininone	5.3	OpenAI	$0.038	1.13s
查看模型卡片总测试数 21 错误测试数 16 可靠性 10.0 尝试通过率 30.2% 不稳定测试 3 输入令牌 34,244 输出令牌 2,541 推理令牌 0 响应时间（平均） 1.13s 响应时间（总计） 23.82s 响应时间（最大） 2.52s 答案错误: 13 未遵循指令: 3 反AI技巧 : 3.1 编程 : 5.5 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 3.5 通用智能 : 4.8 指令遵循 : 6.3 谜题求解 : 5.4 工具调用 : 3.0 常识问答 : 3.0
#125#125	Qwen3.5-122B-A10Bnone	5.3	Qwen	$0.020 ↓	3.41s
查看模型卡片总测试数 21 错误测试数 15 可靠性 10.0 尝试通过率 31.8% 不稳定测试 1 输入令牌 47,735 输出令牌 3,383 推理令牌 0 响应时间（平均） 3.41s 响应时间（总计） 71.59s 响应时间（最大） 46.00s 答案错误: 13 未遵循指令: 2 反AI技巧 : 4.8 编程 : 3.7 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 5.0 指令遵循 : 6.3 谜题求解 : 3.8 工具调用 : 10.0 常识问答 : 3.0
#126#126	DeepSeek V3.2none	5.3	DeepSeek	$0.017 ↓	13.83s
查看模型卡片总测试数 21 错误测试数 15 可靠性 10.0 尝试通过率 39.7% 不稳定测试 6 输入令牌 55,997 输出令牌 11,165 推理令牌 0 响应时间（平均） 13.83s 响应时间（总计） 290.43s 响应时间（最大） 115.89s 答案错误: 7 API 错误: 4 额外格式: 2 未遵循指令: 1 无效工具调用: 1 反AI技巧 : 3.2 编程 : 3.1 综合 : 6.5 数据解析与提取 : 6.3 领域专项 : 2.9 通用智能 : 4.7 指令遵循 : 10.0 谜题求解 : 7.6 工具调用 : 10.0 常识问答 : 3.0
#127#127	MiniMax M2.7medium	5.2	Minimax	$0.104 ↓	38.18s
查看模型卡片总测试数 21 错误测试数 16 可靠性 10.0 尝试通过率 46.0% 不稳定测试 8 输入令牌 34,371 输出令牌 8,981 推理令牌 89,812 响应时间（平均） 38.18s 响应时间（总计） 763.60s 响应时间（最大） 196.21s 答案错误: 6 未遵循指令: 5 超时: 2 API 错误: 1 无效工具调用: 1 无答案: 1 反AI技巧 : 7.9 编程 : 5.7 综合 : 4.7 数据解析与提取 : 6.3 领域专项 : 3.0 通用智能 : 3.9 指令遵循 : 3.8 谜题求解 : 5.9 工具调用 : 4.7 常识问答 : 3.0
#128#128	Qwen3.6 35B A3Bnone	5.2	Qwen	$0.031 ↑	3.73s
查看模型卡片总测试数 21 错误测试数 17 可靠性 10.0 尝试通过率 30.2% 不稳定测试 5 输入令牌 19,329 输出令牌 27,755 推理令牌 0 响应时间（平均） 3.73s 响应时间（总计） 70.86s 响应时间（最大） 22.52s 答案错误: 13 API 错误: 2 未遵循指令: 2 反AI技巧 : 3.6 编程 : 5.5 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 3.5 通用智能 : 4.4 指令遵循 : 6.2 谜题求解 : 3.2 工具调用 : 3.0 常识问答 : 3.0
#129#129	Mistral Small 4none	5.1	Mistral	$0.007	630ms
查看模型卡片总测试数 21 错误测试数 16 可靠性 10.0 尝试通过率 27.0% 不稳定测试 1 输入令牌 37,309 输出令牌 2,201 推理令牌 0 响应时间（平均） 630ms 响应时间（总计） 13.22s 响应时间（最大） 1.72s 答案错误: 15 未遵循指令: 1 反AI技巧 : 3.4 编程 : 3.7 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 4.0 指令遵循 : 6.5 谜题求解 : 3.1 工具调用 : 10.0 常识问答 : 3.0
#130#130	Qwen3 Coder Nextnone	5.1	Qwen	$0.009 ↓	8.62s
查看模型卡片总测试数 21 错误测试数 16 可靠性 10.0 尝试通过率 27.0% 不稳定测试 1 输入令牌 47,507 输出令牌 3,584 推理令牌 0 响应时间（平均） 8.62s 响应时间（总计） 129.37s 响应时间（最大） 45.14s 答案错误: 14 额外格式: 1 未遵循指令: 1 反AI技巧 : 3.6 编程 : 4.6 综合 : 3.0 数据解析与提取 : 6.5 领域专项 : 5.3 通用智能 : 10.0 指令遵循 : 6.3 谜题求解 : 3.0 工具调用 : 10.0 常识问答 : 3.0
#133#133	Mistral Small 4medium	5.1	Mistral	$0.068	9.40s
查看模型卡片总测试数 21 错误测试数 16 可靠性 10.0 尝试通过率 44.4% 不稳定测试 8 输入令牌 42,576 输出令牌 24,184 推理令牌 84,678 响应时间（平均） 9.40s 响应时间（总计） 197.39s 响应时间（最大） 59.15s 答案错误: 12 API 错误: 2 未遵循指令: 2 反AI技巧 : 5.6 编程 : 4.4 综合 : 3.0 数据解析与提取 : 7.3 领域专项 : 5.3 通用智能 : 4.8 指令遵循 : 7.3 谜题求解 : 3.4 工具调用 : 10.0 常识问答 : 3.0
#134#134	MiMo-V2.5none	5.1	Xiaomi	$0.007 ↓	2.20s
查看模型卡片总测试数 21 错误测试数 16 可靠性 10.0 尝试通过率 27.0% 不稳定测试 1 输入令牌 41,985 输出令牌 2,267 推理令牌 0 响应时间（平均） 2.20s 响应时间（总计） 46.21s 响应时间（最大） 6.86s 答案错误: 14 额外格式: 1 未遵循指令: 1 反AI技巧 : 3.5 编程 : 5.5 综合 : 3.0 数据解析与提取 : 6.5 领域专项 : 3.0 通用智能 : 4.4 指令遵循 : 6.5 谜题求解 : 5.4 工具调用 : 10.0 常识问答 : 3.0
#135#135	Qwen3.5-9Bnone	5.1	Qwen	$0.006 ↑	1.89s
查看模型卡片总测试数 21 错误测试数 17 可靠性 10.0 尝试通过率 20.6% 不稳定测试 1 输入令牌 48,041 输出令牌 3,952 推理令牌 0 响应时间（平均） 1.89s 响应时间（总计） 39.68s 响应时间（最大） 6.03s 答案错误: 14 未遵循指令: 2 无效工具调用: 1 反AI技巧 : 3.1 编程 : 3.9 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 3.0 通用智能 : 4.4 指令遵循 : 6.5 谜题求解 : 3.2 工具调用 : 10.0 常识问答 : 3.0
#137#137	Trinity Large Previewnone	5.0	Arcee AI	$0.008 ↑	2.98s
查看模型卡片总测试数 21 错误测试数 17 可靠性 10.0 尝试通过率 22.2% 不稳定测试 2 输入令牌 29,828 输出令牌 2,169 推理令牌 0 响应时间（平均） 2.98s 响应时间（总计） 56.57s 响应时间（最大） 14.34s 答案错误: 12 未遵循指令: 3 API 错误: 2 反AI技巧 : 3.1 编程 : 3.7 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 4.5 指令遵循 : 3.5 谜题求解 : 3.6 工具调用 : 10.0 常识问答 : 3.0
#138#138	Laguna M.1medium	5.0	Poolside	$0.000	14.73s
查看模型卡片总测试数 19 错误测试数 10 可靠性 10.0 尝试通过率 47.6% 不稳定测试 2 输入令牌 44,969 输出令牌 58,087 推理令牌 0 响应时间（平均） 14.73s 响应时间（总计） 220.93s 响应时间（最大） 53.14s API 错误: 4 答案错误: 4 未遵循指令: 1 无答案: 1 反AI技巧 : 6.5 编程 : 1.5 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 3.0 指令遵循 : 10.0 谜题求解 : 5.3 工具调用 : 10.0 常识问答 : 3.0
#139#139	GPT-4o-mininone	5.0	OpenAI	$0.006	1.77s
查看模型卡片总测试数 21 错误测试数 16 可靠性 10.0 尝试通过率 23.8% 不稳定测试 0 输入令牌 31,518 输出令牌 1,982 推理令牌 0 响应时间（平均） 1.77s 响应时间（总计） 24.80s 响应时间（最大） 7.58s 答案错误: 15 未遵循指令: 1 反AI技巧 : 4.8 编程 : 3.2 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 3.0 通用智能 : 4.0 指令遵循 : 6.3 谜题求解 : 3.5 工具调用 : 10.0 常识问答 : 3.0

←

1 2 3 4 5 6

→

快速对比

Gemini 3.5 FlashhighvsGemini 3 Flash Previewmedium Gemini 3.5 FlashhighvsQwen3.7 Maxmedium Gemini 3.5 FlashhighvsGPT-5.5low Gemini 3.5 FlashhighvsGemini 3.5 Flashlow Gemini 3.5 FlashhighvsClaude Fable 5medium Gemini 3.5 FlashhighvsGemini 3.1 Pro Previewmedium Gemini 3.5 FlashhighvsNemotron 3 Ultra 550b A55bmedium免费可用 Gemini 3.5 FlashhighvsNorth Mini Codemedium免费可用 Gemini 3 Flash PreviewmediumvsQwen3.7 Maxmedium Qwen3.7 MaxmediumvsGPT-5.5low GPT-5.5lowvsGemini 3.5 Flashlow Gemini 3.5 FlashlowvsClaude Fable 5medium

AI 基准排行榜

筛选模型

快速对比