大模型评测集基准测试
该能力基于 OmniRoute 命令行工具,帮助开发者与算法工程师系统化评测大语言模型的表现。用户可以通过 JSONL 文件定义输入与期望输出,选择精准匹配(exact-match)、包含匹配(contains)、正则匹配(regex)或大模型裁判(llm-judge)等评分准则;支持实时终端监控、异步任务查询、多模型横向评分对比,以及将评测流程集成进 CI/CD 自动化流水线中以实现回归质检。
它会先理解你的原始内容和目标,再按清晰的步骤完成处理。你不需要学习复杂命令,也不用理解背后的技术细节。
常见场景
它能帮你做什么?
三步完成
怎么使用
把右侧安装请求发给你的 AI。
告诉 AI 你想完成什么,或直接贴入内容。
按需要继续调整语气、范围或格式。
复制就能用
你可以直接这样说
“使用 samples.jsonl 文件创建一个名为 code-quality 的评测集,采用 exact-match 评分规则”
“对评测集 suite-123 运行 claude-sonnet-4-6 模型,并启用 --watch 实时查看测试进度”
“导出评测运行任务 run-456 的 scorecard 成绩单,筛选出所有未通过的样本及实际输出”
适用人群
适合谁?
上手门槛
使用难度
需要了解任务流程,页面已整理好使用步骤。
兼容范围
支持哪些 AI?
中文用户增强