Skill 广场
智能体输出反思与评测调优 Skill

智能体输出反思与评测调优.Skill

@github/agentic-eval

4.6优秀AI 评分基础检查通过源自 GitHub

该能力提炼了 AI Agent 系统中常见的自动化评估与迭代自愈设计模式。涵盖基础自我反思(Reflection)、评估者-优化者(Evaluator-Optimizer)架构、测试驱动的代码自动纠错闭环,以及量规(Rubric)打分和 LLM-as-Judge 评审策略。通过结构化 JSON 输出和收敛终止条件控制,让智能体在生成高要求代码、专业报告或结构化数据时能够自动检查缺陷并反复调优,脱离单次生成的质量不稳定性。

AI工作流AI应用开发者大模型算法工程师Agent流程架构师2026-09-23 更新main

智能体输出反思与评测调优

该能力提炼了 AI Agent 系统中常见的自动化评估与迭代自愈设计模式。涵盖基础自我反思(Reflection)、评估者-优化者(Evaluator-Optimizer)架构、测试驱动的代码自动纠错闭环,以及量规(Rubric)打分和 LLM-as-Judge 评审策略。通过结构化 JSON 输出和收敛终止条件控制,让智能体在生成高要求代码、专业报告或结构化数据时能够自动检查缺陷并反复调优,脱离单次生成的质量不稳定性。

它会先理解你的原始内容和目标,再按清晰的步骤完成处理。你不需要学习复杂命令,也不用理解背后的技术细节。

常见场景

它能帮你做什么?

01

02

03

三步完成

怎么使用

1安装 Skill

把右侧安装请求发给你的 AI。

2说清楚目标

告诉 AI 你想完成什么,或直接贴入内容。

3检查结果

按需要继续调整语气、范围或格式。

复制就能用

你可以直接这样说

参考 Evaluator-Optimizer 模式,用 Python 写一个根据多维度量规给分析报告打分并自动迭代润色的类

如何设计一个带有 pytest 单元测试验证和最大重试收敛控制的代码反思修复循环?

为合同审查 Agent 设计一套采用 JSON 结构输出 PASS/FAIL 与改进建议的 self-critique 提示词模板

适用人群

适合谁?

AI应用开发者大模型算法工程师Agent流程架构师自动化测试研发人员

上手门槛

使用难度

进阶

需要了解任务流程,页面已整理好使用步骤。

兼容范围

支持哪些 AI?

Codex可直接使用
Claude Code可直接使用
OpenClaw可直接使用
Hermes可直接使用
国内 Agent可直接使用

中文用户增强

Skill Px 做了什么?

中文说明简化使用方式补充中文案例整理安装流程降低理解难度