Skill 广场
大模型评测集基准测试 Skill

大模型评测集基准测试.Skill

@diegosouzapw/cli-eval

4.6优秀AI 评分基础检查通过源自 GitHub

该能力基于 OmniRoute 命令行工具,帮助开发者与算法工程师系统化评测大语言模型的表现。用户可以通过 JSONL 文件定义输入与期望输出,选择精准匹配(exact-match)、包含匹配(contains)、正则匹配(regex)或大模型裁判(llm-judge)等评分准则;支持实时终端监控、异步任务查询、多模型横向评分对比,以及将评测流程集成进 CI/CD 自动化流水线中以实现回归质检。

AI工作流AI应用开发者LLM提示词工程师算法工程师2026-09-23 更新main

大模型评测集基准测试

该能力基于 OmniRoute 命令行工具,帮助开发者与算法工程师系统化评测大语言模型的表现。用户可以通过 JSONL 文件定义输入与期望输出,选择精准匹配(exact-match)、包含匹配(contains)、正则匹配(regex)或大模型裁判(llm-judge)等评分准则;支持实时终端监控、异步任务查询、多模型横向评分对比,以及将评测流程集成进 CI/CD 自动化流水线中以实现回归质检。

它会先理解你的原始内容和目标,再按清晰的步骤完成处理。你不需要学习复杂命令,也不用理解背后的技术细节。

常见场景

它能帮你做什么?

01

02

03

三步完成

怎么使用

1安装 Skill

把右侧安装请求发给你的 AI。

2说清楚目标

告诉 AI 你想完成什么,或直接贴入内容。

3检查结果

按需要继续调整语气、范围或格式。

复制就能用

你可以直接这样说

使用 samples.jsonl 文件创建一个名为 code-quality 的评测集,采用 exact-match 评分规则

对评测集 suite-123 运行 claude-sonnet-4-6 模型,并启用 --watch 实时查看测试进度

导出评测运行任务 run-456 的 scorecard 成绩单,筛选出所有未通过的样本及实际输出

适用人群

适合谁?

AI应用开发者LLM提示词工程师算法工程师DevOps测试工程师

上手门槛

使用难度

进阶

需要了解任务流程,页面已整理好使用步骤。

兼容范围

支持哪些 AI?

Codex可直接使用
Claude Code可直接使用
OpenClaw可直接使用
Hermes可直接使用
国内 Agent可直接使用

中文用户增强

Skill Px 做了什么?

中文说明简化使用方式补充中文案例整理安装流程降低理解难度