Skill 广场
大模型可观测与评测管理 Skill

大模型可观测与评测管理.Skill

@langfuse/langfuse

4.8优秀AI 评分基础检查通过源自 GitHub

该功能专为大模型应用工程师设计,整合了 Langfuse 官方最新的文档索引与 CLI 操作能力。无论是为基于 LangGraph、LlamaIndex 的 Agent 应用补充执行追踪(Tracing),还是将散落在工程源码中的 Prompt 集中收敛至托管中心,亦或是构建基于 LLM-as-a-Judge 的自动化评测数据集与 CI/CD 质检门禁,它都能直接生成规范代码并执行 API 同步,彻底解决大模型在生产环境中黑盒不可控、调优缺乏数据量化支撑的痛点。

AI工作流大模型应用开发者AI 架构师LLMOps 运维工程师2026-09-23 更新main

大模型可观测与评测管理

该功能专为大模型应用工程师设计,整合了 Langfuse 官方最新的文档索引与 CLI 操作能力。无论是为基于 LangGraph、LlamaIndex 的 Agent 应用补充执行追踪(Tracing),还是将散落在工程源码中的 Prompt 集中收敛至托管中心,亦或是构建基于 LLM-as-a-Judge 的自动化评测数据集与 CI/CD 质检门禁,它都能直接生成规范代码并执行 API 同步,彻底解决大模型在生产环境中黑盒不可控、调优缺乏数据量化支撑的痛点。

它会先理解你的原始内容和目标,再按清晰的步骤完成处理。你不需要学习复杂命令,也不用理解背后的技术细节。

常见场景

它能帮你做什么?

01

Agent 链路调用埋点与报错回溯:为复杂的 Multi-Agent 或 LangGraph 工作流集成 Langfuse SDK,实时捕获每一步的输入输出 Token、延迟与异常报错调用链。

02

硬编码 Prompt 集中版本化迁移:扫描代码库中分散的系统提示词模板,自动打包并调用 Langfuse CLI 推送到平台进行集中式版本管理与动态热更新。

03

大模型裁判与自动化评测集搭建:基于生产抓取的真实对话 Trace 提取不良样本,构建基准评估数据集,并配置 LLM-as-a-Judge 规则与混淆矩阵校准。

三步完成

怎么使用

1安装 Skill

把右侧安装请求发给你的 AI。

2说清楚目标

告诉 AI 你想完成什么,或直接贴入内容。

3检查结果

按需要继续调整语气、范围或格式。

复制就能用

你可以直接这样说

请帮我用 Python SDK 为这个 LangGraph 多智能体客服系统接入 Langfuse 链路追踪埋点,需要记录每轮对话的 session_id 和 user_id。

检查我当前代码库中的所有 prompt.py 文件,提取变量并给出用 langfuse-cli 批量创建托管 Prompt 的脚本指令。

如何根据生产环境导出的低评分 Trace 构建一个评测数据集?请使用最新的 Langfuse API 给出具体的创建与标注实现。

适用人群

适合谁?

大模型应用开发者AI 架构师LLMOps 运维工程师Agent 算法工程师

上手门槛

使用难度

进阶

需要了解任务流程,页面已整理好使用步骤。

兼容范围

支持哪些 AI?

Codex可直接使用
Claude Code可直接使用
OpenClaw可直接使用
Hermes可直接使用
国内 Agent可直接使用

中文用户增强

Skill Px 做了什么?

中文说明简化使用方式补充中文案例整理安装流程降低理解难度