LLMOps 与可观测性:把大模型应用送进生产

什么是 LLMOps

LLMOps(Large Language Model Operations,大模型运维)是源于 MLOps 的运营实践,专门应对大模型应用上线后的独特挑战,包括提示词管理、评估管线、可观测性与部署控制。与经典 MLOps 以模型权重、训练流水线为重心不同,LLMOps 把「提示词」与「输出」放在运营核心:同一个系统提示词的小改动,往往比更换模型版本更能改变最终结果。MLflow 官方将 LLMOps 定义为「构建、部署、监控并维护生产环境大模型应用的学科」,涵盖链路追踪、评估、提示词管理、AI 网关与生产监控。

提示词版本与评估闭环

原型阶段的提示词常藏在代码里、谁都能改、没人知道线上跑的是哪一版。LLMOps 把提示词当作「一等公民」的运营资产,与代码同等对待:

  • 提示词版本管理:将提示词模板、推理参数(temperature、top_p)纳入版本库或专用注册表,记录每次变更与对应输出差异,支持回滚。
  • 评估(Eval)闭环:构建覆盖已知边界情况的测试集,在每次提示词或模型变更后自动跑评估,阻断质量回归再上线。评估方式包括规则校验、LLM-as-a-Judge、人工标注与用户反馈。
  • 回归测试:提示词或模型变更时,验证「原本可用的场景」没有变差。MLflow 与 LangSmith 都支持在 CI(pytest/GitHub Actions)中集成离线评测。

可观测性四大维度

生产环境的大模型应用需要持续观测四个维度,任何一个缺失都会让系统变成黑盒:

  1. 请求链路追踪(Trace):将一次请求拆成结构化步骤——系统提示、检索、工具调用、各次 LLM 调用,记录每一步的输入、输出与耗时,便于定位失败根因。
  2. Token 与成本:按 span、用户、会话统计 token 消耗与花费,及时发现异常增长。
  3. 延迟:端到端响应时间与各步骤耗时,直接影响用户体验。
  4. 输出质量评分:用 LLM-as-a-Judge、启发式规则或人工评论对输出打分,在生产流量上持续监控质量漂移。

一个 OpenTelemetry/GenAI 语义约定下的 trace 字段示意:

{
  "trace_id": "a1b2c3d4",
  "spans": [
    {
      "name": "openai.chat",
      "gen_ai.system": "openai",
      "gen_ai.request.model": "gpt-4o-mini",
      "gen_ai.usage.input_tokens": 320,
      "gen_ai.usage.output_tokens": 96,
      "gen_ai.response.latency_ms": 840,
      "quality_score": 0.92
    }
  ]
}

代表工具

  • LangSmith(LangChain 官方):框架无关的 Agent 工程平台,提供端到端追踪、实时成本与延迟监控、在线/离线评估、提示词工程与部署。支持 OpenTelemetry,可自托管或 BYOC;文档见 docs.smith.langchain.com。
  • Langfuse(开源,GitHub):MIT 许可的开源 LLM 工程平台,将追踪、提示词管理、评估、实验与人审标注集成于一个工作流,基于 OpenTelemetry,可自托管(Docker/K8s),仓库为 github.com/langfuse/langfuse。
  • OpenLLMetry(开源插桩):由 Traceloop 维护、基于 OpenTelemetry 的插桩集合(Apache 2.0),对 OpenAI、Anthropic、LangChain、向量库等自动生成标准 OTel Span,可接入 Datadog、Grafana、SigNoz 等任意兼容后端,避免厂商锁定;仓库为 github.com/traceloop/openllmetry。

与 DevOps / MLOps 的区别

DevOps 假设函数是确定性的、测试结果非对即错;MLOps 以模型产物与标注测试集的准确率漂移为核心。LLMOps 面对的是非确定性输出、提示词频繁变更、需要语义级质量评分,且必须完整保存「输入/输出对」而非仅预测标签。它复用 DevOps 的部署门禁与 MLOps 的监控治理思想,但把运营重心从模型权重转移到提示词与输出质量。

生产化落地清单

  • 提示词即代码:把提示词纳入版本控制或注册表,变更走评审。
  • 先建评估集:覆盖已知边界场景,作为一切迭代的基线。
  • 接入链路追踪:记录每次请求的完整 span 与 token、延迟。
  • 质量评分上线:对生产流量采样打分并设置告警阈值。
  • 灰度与回滚:通过 dev staging production 的受控发布与标签切换,质量劣化时一键回滚提示词版本。

小结

LLMOps 把原型级的大模型应用变成可运营、可度量、可回滚的生产系统。核心是把提示词当作代码管理、用评估闭环拦截回归、以链路追踪与质量评分构成可观测性。LangSmith、Langfuse、OpenLLMetry 分别从平台、开源与 OTel 插桩三个角度落地,团队可按技术栈与合规要求组合选用。

参考与延伸阅读

本文累计阅读