Agent Skills
返回列表
🤖

Langfuse LLM 可观测性平台

AI Agent 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @org-02qudk26/langfuse-zh。

技能介绍

LLM 应用的问题

LLM 应用不能只用传统服务的 5xx 视角监控。一次请求可能同时消耗 token 成本、受提示词版本影响,并产生可感知的 延迟 和 质量回归。如果只看平均响应时间,很难判断是模型问题、提示词问题、工具调用问题,还是会话上下文问题。

技能如何工作

这个技能把 Langfuse 当作 LLM 可观测性架构来使用,而不是简单接入 SDK。它会围绕 trace、span、metric 来组织观测数据,并覆盖:

  • 链路追踪:把 LLM 调用、关键逻辑、用户操作分组为可读的调用链。
  • Prompt 管理:对提示词做版本控制和 A/B 测试,减少“改了一句就上线”的回归风险。
  • 评估与数据集:把线上样本沉淀为数据集,配合评分发现质量退化。
  • 成本与性能:把 token、延迟、错误等指标纳入同一分析视角。

关键步骤是先确定集成方式,例如 OpenAI、LangChain 或自定义 Python/TypeScript 调用;然后在 LLM 调用周围添加有语义的 span,并传入稳定的 user_id、session_id 和必要 metadata;最后把评估、成本和延迟指标挂到同一条 trace 上。对于 Serverless,需要显式调用 langfuse.flush(),避免进程提前退出导致批量数据丢失。

适用边界

该技能适合已经使用 LLM API、Agent 框架或 RAG 流程的团队,要求具备 Python/TypeScript/JavaScript 环境、Langfuse 账户和相应 API 密钥。需要注意:追踪所有请求会产生噪音,高流量场景需要采样、字段裁剪或后端优化;自托管还需要额外基础设施;实时仪表盘可能延迟,评估配置也需要单独维护。

使用场景

  • 在 OpenAI 应用上线前,为每次 LLM 调用添加自动链路追踪,定位延迟、失败请求和成本异常。
  • 维护 LangChain Agent 时,把提示词、工具调用与模型输出组成 trace,排查工具选择错误。
  • 提示词改版后,用数据集和评分对比新旧版本,确认回答质量没有回归。
  • Serverless 部署 LLM 接口时,配置 `langfuse.flush()` 和 `session_id`,避免追踪数据丢失。

适合人员

  • 负责 LLM 线上质量排查的后端工程师:需要从 trace 里找到慢请求、错误调用和成本异常。
  • 维护 Agent 工作流的 AI 工程师:需要把模型、工具和提示词串成链路并评估回归。
  • 做提示词迭代的平台工程师:需要版本化 prompt、A/B 对比并沉淀评估数据集。
  • 部署 LLM 服务的平台工程师:需要监控成本、延迟和错误,并避免 Serverless 丢数。