🏛 架构平台 Arch.Platform

服务器#2灾备机建设:六服务温备常跑+每4小时数据班车+监控告警+人工DNS切换

5b6c2552
✏️ 编辑
优先级 P1
类型 新功能
状态 草稿
负责人

📝 描述

> 项目代号: **双城** | 目标:#2(81.71.132.24)建成#1(124.71.219.208)真灾备。in-scope:①#2温备部署6个存活服务(3容器arch-platform/llm-knowledge-graph/medieval-baseline-api+2systemd babybus/career-ops+静态主页,nginx 6站点+证书从#1同步);②数据班车:#1每4h按正确姿势导出各服务数据(SQLite在线备份/pg_dump/容器暂停快照/文件rsync)走现有arch-platform-backup SSH通道推#2,#2自动装载+健康自检;③QQ SMTP邮件通知(成功摘要+失败告警,凭据secrets.json qq_smtp);④#3 prometheus/grafana加探测:#1六站点存活+班车按时到站+#2备机健康,异常邮件告警;⑤切换手册+半自动切换脚本(阿里云DNS改A记录,TTL预降10分钟)+回切数据回迁流程;⑥交付前真实演练验证#2六服务可用。out-of-scope:全自动DNS切换、实时数据复制、babybus/career-ops容器化改造。RTO分钟级/RPO 4小时。复用评估:复用L0 docker、L1 nginx/certbot/prometheus/grafana既有组件;现有backup.sh的rsync over SSH模式为参考实现但未登记为组件,本需求将其泛化为可复用数据班车组件——全新组件(type=new_feature),不关联既有component版本升级。

👤 用户故事

作为站长,#1故障时我希望收到告警并在几分钟内把域名切到#2恢复全部6个服务,最多丢4小时数据;平时每次班车成功/失败我都收到邮件,随时知道灾备链路是活的。

🔄 推进状态

新状态
负责人
描述(rejected/cancelled 必填)

创建于 2026-07-14 19:37