Skill 广场
编程Agent基准评测 Skill

编程Agent基准评测.Skill

@affaan-m/agent-eval

4.6优秀AI 评分基础检查通过源自 GitHub

该能力提供了一套系统化的AI代码智能体基准评测方案,用于替代主观凭感觉评估编程工具的做法。用户可以通过YAML文件定义具体的编码任务、限定修改文件以及判定条件(如pytest单元测试、正则匹配或LLM评审)。系统会自动利用Git Worktree为每次运行创建隔离的代码副本,无需Docker即可并发或多次独立执行Claude Code、Aider等不同智能体,最后汇总统计通过率、单次花费、响应时间和多次运行的一致性表现,帮助开发者与团队做出客观的数据驱动选型决策。

编程技术团队架构师AI工程化研发人员追求开发效率的资深程序员2026-09-23 更新main

编程Agent基准评测

该能力提供了一套系统化的AI代码智能体基准评测方案,用于替代主观凭感觉评估编程工具的做法。用户可以通过YAML文件定义具体的编码任务、限定修改文件以及判定条件(如pytest单元测试、正则匹配或LLM评审)。系统会自动利用Git Worktree为每次运行创建隔离的代码副本,无需Docker即可并发或多次独立执行Claude Code、Aider等不同智能体,最后汇总统计通过率、单次花费、响应时间和多次运行的一致性表现,帮助开发者与团队做出客观的数据驱动选型决策。

它会先理解你的原始内容和目标,再按清晰的步骤完成处理。你不需要学习复杂命令,也不用理解背后的技术细节。

常见场景

它能帮你做什么?

01

02

03

三步完成

怎么使用

1安装 Skill

把右侧安装请求发给你的 AI。

2说清楚目标

告诉 AI 你想完成什么,或直接贴入内容。

3检查结果

按需要继续调整语气、范围或格式。

复制就能用

你可以直接这样说

编写一个针对 src/http_client.py 添加指数退避重试逻辑的 agent-eval YAML 任务,并用 pytest 作为通过判断标准。

对比 claude-code 与 aider 在 tasks/add-retry-logic.yaml 任务上的表现,各运行 3 次并生成控制台对比表格。

为项目现有的前端重构任务编写评测配置,同时结合 npm run build 命令和正则检查两个判定规则。

适用人群

适合谁?

技术团队架构师AI工程化研发人员追求开发效率的资深程序员开发者工具评测博主

上手门槛

使用难度

进阶

需要了解任务流程,页面已整理好使用步骤。

兼容范围

支持哪些 AI?

Codex可直接使用
Claude Code可直接使用
OpenClaw可直接使用
Hermes可直接使用
国内 Agent可直接使用

中文用户增强

Skill Px 做了什么?

中文说明简化使用方式补充中文案例整理安装流程降低理解难度