标准能力雷达
知识、推理、数学、阅读、指令与真实性
等待提交IDLE
查看 lm-eval 原始指标0–100 展示归一化
评测在服务器后台运行,当前任务不阻止再开新任务。点「新测试」或再次提交三要素即可另开;历史显示模型、时间、状态,可分页看完全部记录。
提交后任务在后台执行,页面可继续新建另一测试;不必等当前任务结束。
思维链兼容说明 · 若被测端点不支持思维链参数,系统会自动去掉该参数、以不带思维链的普通请求继续跑完整场测试,不会因为这个可选参数把评测判成失败;实际是否降级会在下方结果区标注为「端点不支持,已自动降级」,并附上端点拒绝时返回的原文。
知识、推理、数学、阅读、指令与真实性
固定分段刻度,原始数值不封顶;聚合decode 不等于 4K / 100K 单流 decode;含 C1/C4/C8/C16 聚合与 C4k→C100k 衰减
题库批次 2024-11-25、六类题库按档位抽样、纯客观判分不用 LLM 裁判
每流 100K 输入 · 并发从 1 起逐步加 1 · 相邻吞吐绝对变化率严格小于 5% 停止 · 横轴流数 · 纵轴聚合输出吞吐 tok/s