监控与观测
Prometheus
Section titled “Prometheus”Prometheus 运行在 http://<host>:9090,负责采集平台各服务的指标数据。
采集目标包括:
- Blade Agent 服务指标
- LLM Gateway 请求指标
- 沙箱容器资源使用
Grafana
Section titled “Grafana”Grafana 运行在 http://<host>:3000,提供监控仪表盘的可视化展示。
默认提供以下仪表盘:
- 服务健康概览
- LLM 请求量与延迟
- 资源使用趋势
LLM 请求观测
Section titled “LLM 请求观测”在 Blade OS 的高级设置中可以查看 LLM 调用统计,包括:
- 各模型的调用次数和 Token 用量
- 请求成功率和错误分布
- 响应延迟统计
如需更详细的 LLM 调用追踪,可配置 Langfuse 或 Helicone 作为 tracing 后端,参见环境变量参考中的可观测性章节。生产环境开启完整 payload 前,先阅读安全与数据边界。
| 指标或现象 | 建议阈值 | 先查什么 |
|---|---|---|
/api/health 连续失败 | 2 个采集周期 | 容器状态、数据库连接、启动日志 |
| 模型错误率升高 | 5 分钟窗口超过日常基线 | 模型源状态、配额、网关日志 |
| P95 响应延迟突增 | 超过日常基线 2 倍 | 排队、模型延迟、Socket.IO 连接数 |
| 沙箱启动失败 | 任何连续失败 | Docker daemon、镜像、磁盘、挂载权限 |
| 工作区磁盘使用率 | 80% 预警,90% 告警 | 大文件会话、过期工作区、备份任务 |
| 文件描述符使用率 | 70% 预警 | WebSocket 数、浏览器会话、泄漏连接 |
阈值应按实际并发和机器规格调整。重点不是照抄数字,而是保证每条告警都有人接、能定位到日志和处理步骤。
- 请求
GET /api/health和GET /api/health/runtime,确认进程、线程和文件描述符状态。 - 查看 Blade Agent、LLM Gateway 与 Docker 日志,先找同一时间段的首个错误。
- 只有模型请求异常时,再进入 LLM 观测页检查 payload 和上游响应。
- 只有特定会话失败时,记录
session_id、角色、Skill 和沙箱容器,避免把局部问题误判成平台故障。