ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Observal生产运维清单:升级回滚、备份恢复、数据保留与故障排查实战手册

Observal生产运维清单:升级回滚、备份恢复、数据保留与故障排查实战手册 Observal生产运维清单升级回滚、备份恢复、数据保留与故障排查实战手册【免费下载链接】ObservalObserval is self-hosted registry for your coding agent extensions with a built in insight engine. Setup Observal, define the scope and share your Skills, MCPs and Agents with your peers.项目地址: https://gitcode.com/gh_mirrors/ob/ObservalObserval 是一个自托管的 AI 编码智能体扩展注册中心Registry用于集中管理和共享团队的 Skills、MCP 与 Agents并内置洞察引擎分析 Agent 使用情况。本文面向新手运维整理 Observal 生产运维的核心清单升级与回滚、备份恢复、数据保留策略与常见故障排查帮助你安全地把 Observal 跑在生产环境。先搞清楚Observal 生产环境有哪些关键组件Observal 生产部署由 Docker Compose 编排多个服务其中最关键的是 5 个持久化数据卷数据卷存放内容丢失后果apidataJWT 签名密钥所有会话失效无法恢复pgdata用户、RBAC、注册中心元数据全部账户与注册中心丢失chdata会话事件、聚合统计、审计与安全事件全部遥测丢失grafanadata自定义 Grafana 仪表盘仅丢失自定义仪表盘redisdata任务队列状态在途任务丢失重启后重新入队核心原则apidata和pgdata必须一起备份。只备份其中一个恢复后会处于半残状态。升级与回滚最快、最安全的操作路径一键升级推荐如果通过observal server start安装嵌入式部署CLI 会自动完成升级observal server upgrade --dry-run --output json observal server upgrade --version 0.9.0 --force --output json该命令会自动拉取新镜像、备份 PostgreSQL、重建容器并执行健康检查若健康检查失败会自动请求回退到旧版本镜像。手动升级标准流程先备份pgdata和apidata阅读 CHANGELOG确认跨版本是否有破坏性变更固定到具体版本 tag 升级不要盲目拉取 main 分支重新构建并启动镜像观察 init 容器日志中的迁移输出Postgres 的 Alembic 迁移与 ClickHouse SQL 迁移在 API 启动前自动执行用curl http://localhost/health验证健康状态。回滚操作与迁移陷阱新版本出问题时的回滚三步停栈 → 切回旧版本 tag → 重建启动。关键陷阱如果失败版本已经执行过数据库迁移旧版 API 可能不识别新 schema增量迁移大多数情况旧版本可以正常兼容运行无需额外操作破坏性迁移少见必须从升级前的pgdata备份恢复——这就是备份永远是第一步的原因。详细流程见 docs/self-hosting/upgrades.md 与 docs/cli/server.md。备份恢复什么节奏、什么顺序备份节奏清单节奏备份对象保留时长每天pgdata、apidata30 天每周chdata12 周每次升级前以上全部确认升级稳定后再清理操作方式很简单Postgres 在容器内执行pg_dump导出并 gzip 压缩JWT 密钥用tar打包apidata卷中的keys目录ClickHouse 可选卷快照短暂停机或原生BACKUP命令零停机。把备份目录定期同步到异地存储S3、B2 或 rsync 到另一台主机。恢复顺序灾难恢复时停掉整个栈先恢复apidataJWT 密钥——跳过这步会导致所有用户被迫重新登录恢复pgdata恢复chdata启动栈用observal auth login/observal auth status做冒烟测试。每季度至少做一次恢复演练——没测试过的备份只是猜测。完整命令见 docs/self-hosting/backup-and-restore.md。数据保留设置合理的保留策略Observal 提供两层保留控制建议在管理后台按需配置应用级保留策略管理员设置项设置项作用retention.enabled启用定时清理retention.trace_days删除超过 N 天的会话事件retention.score_days删除超过 N 天的洞察报告retention.max_trace_count限制保留的会话数量ClickHouse TTLdata.retention_days默认 90 天控制原始会话内容的自动过期。隐私敏感环境可降到 30 天需要年度趋势分析可升到 365 天不建议设为 0无限保留。另外管理后台的Purge Traces Insights是危险区操作它会永久删除遥测与洞察数据但不会删除注册中心的 Agents、Skills、用户与审计日志。仅在需要干净的遥测起点如交付演示实例前时使用操作前务必先备份数据库。更多参数缓存 TTL、日志级别、指标开关见 docs/self-hosting/data-retention.md 和 docs/self-hosting/observability-settings.md。故障排查5 个最常见生产故障速查故障现象快速定位解决办法CLI 报 Connection faileddocker compose pscurl http://localhost/health检查server_url配置后重新observal auth login端口已分配查看占用进程用POSTGRES_HOST_PORT5433 REDIS_HOST_PORT6380等环境变量改映射端口服务卡在starting逐个看observal-db/observal-clickhouse/observal-redis日志常见为CLICKHOUSE_PASSWORD与服务配置不一致重启后全员掉线检查apidata卷是否被重建从备份恢复apidata卷JWT 密钥丢失会导致所有会话失效仪表盘没有数据observal ops telemetry status→observal doctor --output json缺少 Hook 时执行observal doctor patch --harness harness排查三板斧docker compose logs -f日志、curl http://localhost/health健康、observal auth status状态。定期巡检清单每月照做一遍✅ 确认最近一次pgdataapidata备份成功且已同步异地✅ 检查 ClickHouse 存储增长趋势必要时调整保留天数✅ 确认/health端点与 Prometheus 指标如已启用正常✅ 查看审计与安全日志审计日志模块是否有异常访问✅ 大版本升级前读 CHANGELOG、备份三卷、锁定 tag✅ 每季度做一次备份恢复演练掌握这份清单后Observal 的升级、备份、数据保留与故障处理都有了明确的操作路径可以放心把自托管的 AI 组件注册中心交给团队长期使用。【免费下载链接】ObservalObserval is self-hosted registry for your coding agent extensions with a built in insight engine. Setup Observal, define the scope and share your Skills, MCPs and Agents with your peers.项目地址: https://gitcode.com/gh_mirrors/ob/Observal创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表