大模型可观测与评测管理
该功能专为大模型应用工程师设计,整合了 Langfuse 官方最新的文档索引与 CLI 操作能力。无论是为基于 LangGraph、LlamaIndex 的 Agent 应用补充执行追踪(Tracing),还是将散落在工程源码中的 Prompt 集中收敛至托管中心,亦或是构建基于 LLM-as-a-Judge 的自动化评测数据集与 CI/CD 质检门禁,它都能直接生成规范代码并执行 API 同步,彻底解决大模型在生产环境中黑盒不可控、调优缺乏数据量化支撑的痛点。
它会先理解你的原始内容和目标,再按清晰的步骤完成处理。你不需要学习复杂命令,也不用理解背后的技术细节。
常见场景
它能帮你做什么?
Agent 链路调用埋点与报错回溯:为复杂的 Multi-Agent 或 LangGraph 工作流集成 Langfuse SDK,实时捕获每一步的输入输出 Token、延迟与异常报错调用链。
硬编码 Prompt 集中版本化迁移:扫描代码库中分散的系统提示词模板,自动打包并调用 Langfuse CLI 推送到平台进行集中式版本管理与动态热更新。
大模型裁判与自动化评测集搭建:基于生产抓取的真实对话 Trace 提取不良样本,构建基准评估数据集,并配置 LLM-as-a-Judge 规则与混淆矩阵校准。
三步完成
怎么使用
把右侧安装请求发给你的 AI。
告诉 AI 你想完成什么,或直接贴入内容。
按需要继续调整语气、范围或格式。
复制就能用
你可以直接这样说
“请帮我用 Python SDK 为这个 LangGraph 多智能体客服系统接入 Langfuse 链路追踪埋点,需要记录每轮对话的 session_id 和 user_id。”
“检查我当前代码库中的所有 prompt.py 文件,提取变量并给出用 langfuse-cli 批量创建托管 Prompt 的脚本指令。”
“如何根据生产环境导出的低评分 Trace 构建一个评测数据集?请使用最新的 Langfuse API 给出具体的创建与标注实现。”
适用人群
适合谁?
上手门槛
使用难度
需要了解任务流程,页面已整理好使用步骤。
兼容范围
支持哪些 AI?
中文用户增强