编程Agent基准评测
该能力提供了一套系统化的AI代码智能体基准评测方案,用于替代主观凭感觉评估编程工具的做法。用户可以通过YAML文件定义具体的编码任务、限定修改文件以及判定条件(如pytest单元测试、正则匹配或LLM评审)。系统会自动利用Git Worktree为每次运行创建隔离的代码副本,无需Docker即可并发或多次独立执行Claude Code、Aider等不同智能体,最后汇总统计通过率、单次花费、响应时间和多次运行的一致性表现,帮助开发者与团队做出客观的数据驱动选型决策。
它会先理解你的原始内容和目标,再按清晰的步骤完成处理。你不需要学习复杂命令,也不用理解背后的技术细节。
常见场景
它能帮你做什么?
三步完成
怎么使用
把右侧安装请求发给你的 AI。
告诉 AI 你想完成什么,或直接贴入内容。
按需要继续调整语气、范围或格式。
复制就能用
你可以直接这样说
“编写一个针对 src/http_client.py 添加指数退避重试逻辑的 agent-eval YAML 任务,并用 pytest 作为通过判断标准。”
“对比 claude-code 与 aider 在 tasks/add-retry-logic.yaml 任务上的表现,各运行 3 次并生成控制台对比表格。”
“为项目现有的前端重构任务编写评测配置,同时结合 npm run build 命令和正则检查两个判定规则。”
适用人群
适合谁?
上手门槛
使用难度
需要了解任务流程,页面已整理好使用步骤。
兼容范围
支持哪些 AI?
中文用户增强