优先级
P1
类型
新功能
状态
草稿
负责人
—
> 项目代号: **双城** | 目标:#2(81.71.132.24)建成#1(124.71.219.208)真灾备。in-scope:①#2温备部署6个存活服务(3容器arch-platform/llm-knowledge-graph/medieval-baseline-api+2systemd babybus/career-ops+静态主页,nginx 6站点+证书从#1同步);②数据班车:#1每4h按正确姿势导出各服务数据(SQLite在线备份/pg_dump/容器暂停快照/文件rsync)走现有arch-platform-backup SSH通道推#2,#2自动装载+健康自检;③QQ SMTP邮件通知(成功摘要+失败告警,凭据secrets.json qq_smtp);④#3 prometheus/grafana加探测:#1六站点存活+班车按时到站+#2备机健康,异常邮件告警;⑤切换手册+半自动切换脚本(阿里云DNS改A记录,TTL预降10分钟)+回切数据回迁流程;⑥交付前真实演练验证#2六服务可用。out-of-scope:全自动DNS切换、实时数据复制、babybus/career-ops容器化改造。RTO分钟级/RPO 4小时。复用评估:复用L0 docker、L1 nginx/certbot/prometheus/grafana既有组件;现有backup.sh的rsync over SSH模式为参考实现但未登记为组件,本需求将其泛化为可复用数据班车组件——全新组件(type=new_feature),不关联既有component版本升级。
作为站长,#1故障时我希望收到告警并在几分钟内把域名切到#2恢复全部6个服务,最多丢4小时数据;平时每次班车成功/失败我都收到邮件,随时知道灾备链路是活的。
创建于 2026-07-14 19:37