跳转到内容

监控与观测

Prometheus 运行在 http://<host>:9090,负责采集平台各服务的指标数据。

采集目标包括:

  • Blade Agent 服务指标
  • LLM Gateway 请求指标
  • 沙箱容器资源使用

Grafana 运行在 http://<host>:3000,提供监控仪表盘的可视化展示。

默认提供以下仪表盘:

  • 服务健康概览
  • LLM 请求量与延迟
  • 资源使用趋势

在 Blade OS 的高级设置中可以查看 LLM 调用统计,包括:

  • 各模型的调用次数和 Token 用量
  • 请求成功率和错误分布
  • 响应延迟统计

如需更详细的 LLM 调用追踪,可配置 Langfuse 或 Helicone 作为 tracing 后端,参见环境变量参考中的可观测性章节。生产环境开启完整 payload 前,先阅读安全与数据边界

指标或现象建议阈值先查什么
/api/health 连续失败2 个采集周期容器状态、数据库连接、启动日志
模型错误率升高5 分钟窗口超过日常基线模型源状态、配额、网关日志
P95 响应延迟突增超过日常基线 2 倍排队、模型延迟、Socket.IO 连接数
沙箱启动失败任何连续失败Docker daemon、镜像、磁盘、挂载权限
工作区磁盘使用率80% 预警,90% 告警大文件会话、过期工作区、备份任务
文件描述符使用率70% 预警WebSocket 数、浏览器会话、泄漏连接

阈值应按实际并发和机器规格调整。重点不是照抄数字,而是保证每条告警都有人接、能定位到日志和处理步骤。

  1. 请求 GET /api/healthGET /api/health/runtime,确认进程、线程和文件描述符状态。
  2. 查看 Blade Agent、LLM Gateway 与 Docker 日志,先找同一时间段的首个错误。
  3. 只有模型请求异常时,再进入 LLM 观测页检查 payload 和上游响应。
  4. 只有特定会话失败时,记录 session_id、角色、Skill 和沙箱容器,避免把局部问题误判成平台故障。