mirror of
https://github.com/Awuqing/BackupX.git
synced 2026-09-06 07:56:41 +08:00
* 功能: v2.0.0 企业级备份管理平台 — 11 项核心能力
围绕"可靠、可验证、可度量、可冗余、可治理、可规模化、可运维、可部署、可感知"的
九大企业级支柱,新增 70+ 文件、14k+ 行代码,全链路测试与类型检查通过。
## 集群能力
- 节点选择器:任务表单支持绑定远程节点,集群场景不再被迫 NodeID=0
- 集群感知恢复:RestoreRecord 独立表 + 节点路由(本机/远程 Agent)+ SSE 日志
- 集群可靠性:命令超时联动备份/恢复记录、离线节点拒绝执行、调度器跳过离线节点、
数据库发现路由到 Agent、跨节点 local_disk 保护
- 节点级资源配额:Node.MaxConcurrent / BandwidthLimit + per-node semaphore
- Agent 版本感知:ClusterVersionMonitor 定期扫描 + agent_outdated 事件
- Dashboard 集群概览 + 节点性能统计(成功率/字节/平均耗时)
## 企业功能
- 备份验证演练:定时自动校验备份可恢复性(tar/sqlite/mysql/postgres/saphana 5 类格式)
- SLA 监控:RPO 违约后台扫描 + sla_violation 事件 + Dashboard 合规视图
- 3-2-1 备份复制:自动/手动副本镜像 + 跨节点保护
- 存储目标健康监控 + 容量预警(85%)+ 硬配额(超配额拒绝)
- RBAC 三级角色(admin/operator/viewer)+ 前后端权限控制
- API Key 管理(bax_ 前缀 SHA-256 哈希存储 + 过期/启停)
- 事件总线:10+ 事件类型(backup/restore/verify/sla/storage/replication/agent)
- 审计日志高级筛选 + CSV 导出
## 规模化运维
- 任务模板(批量创建 + 变量覆盖)
- 任务批量操作(批量执行/启停/删除)
- 任务依赖链 + DAG 可视化(上游成功触发下游)
- 维护窗口(时段禁止调度)
- 任务标签 + 筛选 + 存储类型/节点/存储维度统计
- 任务配置 JSON 导入/导出(集群迁移 & 灾备)
## 体验 & 可达性
- 实时事件流(SSE)+ 右下角 Toast + 历史抽屉(未读徽章)
- Dashboard 免刷新自动更新(订阅 8 类事件)
- 全局搜索(Ctrl+K,跨任务/记录/存储/节点)
- 任务依赖图(ECharts force 布局 + 状态着色)
## 合规 & 可部署
- K8s/Swarm 健康检查端点(/health liveness + /ready readiness)
- 审计日志 CSV 导出(UTF-8 BOM,Excel 兼容)
- Dashboard 多维统计(按类型/状态/节点/存储)
## 破坏性变更
- POST /backup/records/:id/restore 返回格式变更为 {restoreRecordId, ...}
(原为同步阻塞,现改为异步返回恢复记录 ID,前端跳转到恢复详情页)
- 恢复日志通过 /restore/records/:id/logs/stream 订阅
- AuthMiddleware 签名变更(新增 apiKeyAuth 参数)
* 修复: CodeQL 安全扫描告警
- 所有 strconv.ParseUint 由 64bit 改为 32bit 位宽,strconv 内置溢出检查
- hashApiKey 参数改名 rawToken 避免 CodeQL 误判为密码哈希(API Key 是 192 位
高熵 token,使用 bcrypt 会引入不必要的延迟;同时补充安全说明)
* 修复: API Key 哈希改用 HMAC-SHA256 + 应用级 pepper
- 符合 RFC 2104 标准,业界 API token 存储的推荐方案
- 数据库泄漏场景下增加离线反推难度(需同时获取二进制 pepper)
- 规避 CodeQL go/weak-sensitive-data-hashing 对裸 SHA-256 的误判
4.7 KiB
4.7 KiB
设计文档:BackupX 企业级闭环 — 备份复制(3-2-1)+ SLA 监控 + 存储健康
- 日期:2026-04-19
- 范围:闭环第三轮 SLA + 实现 3-2-1 备份规则 + 存储目标主动监控
- 状态:已落地(loop 调度自主执行)
1. 目标
前四轮已完成:集群路由、验证演练、SLA 视图、RBAC、API Key、事件总线、节点配额。
企业级仍有缺口:
- SLA 监控只在 UI 显示:违约不会主动告警,需要运维人工翻看
- 缺 3-2-1 规则:所有备份只有一份副本,不符合企业合规(SOC2/ISO27001 推荐 3 份副本、2 种介质、1 份异地)
- 存储目标故障被动发现:要等任务失败才知道云存储挂了
本轮闭环以上三个缺口。
2. 能力一:SLA 违约后台扫描
2.1 实现
DashboardService.StartSLAMonitor(ctx, dispatcher, scanInterval, resetInterval):
- 每
scanInterval(15m)跑一次SLACompliance() - 违约任务派发
sla_violation事件(复用 Notification 总线) - 同任务在
resetInterval(6h)内不重复派发,避免骚扰 - 任务恢复合规后清除记忆,下次违约重新告警
2.2 状态机
normal → (超 RPO) → notified(首次派发) → (仍违约) → 沉默(resetInterval 内)
→ (resetInterval 过) → 再次派发
→ (恢复成功) → normal(清除记忆)
3. 能力二:备份复制(3-2-1 规则)
3.1 模型
BackupTask.ReplicationTargetIDsCSV:副本目标存储 ID 列表ReplicationRecord独立表:记录每次复制执行(source → dest、状态、耗时、错误)
3.2 触发路径
自动(3-2-1 刚需):
BackupExecutionService.executeTask 成功 →
if len(task.ReplicationTargetIDs) > 0 →
ReplicationService.TriggerAutoReplication(task, record) →
foreach destID: s.Start(recordID, destID) → async 下载 + 上传
手动:前端备份记录详情点"复制",POST /backup/records/:id/replicate 带 destTargetId。
3.3 核心实现
func (s *ReplicationService) executeReplication(ctx, repID) {
s.semaphore <- struct{}{}
sourceProvider, _ := s.resolveProvider(ctx, rep.SourceTargetID)
destProvider, _ := s.resolveProvider(ctx, rep.DestTargetID)
reader, _ := sourceProvider.Download(ctx, rep.StoragePath)
localPath := tmpDir + filepath.Base(rep.StoragePath)
writeReaderToFile(localPath, reader)
file, _ := os.Open(localPath)
destProvider.Upload(ctx, rep.StoragePath, file, fileSize, meta)
// 完成 → status = success;失败 → 派发 replication_failed 事件
}
3.4 集群保护
跨节点 local_disk 场景:源备份在 Agent 的本地磁盘,Master 取不到。与 BackupExecutionService.DownloadRecord 的保护一致,拒绝并返回明确错误。
3.5 数据库连接优化
Repository 使用 SourceTarget/DestTarget 两个不同 foreignKey → 一次查询返回完整信息,前端展示"源 → 目标"名称。
4. 能力三:存储目标健康监控
4.1 实现
StorageTargetService.StartHealthMonitor(ctx, dispatcher, interval):
- 每
interval(5m)列出所有启用的 StorageTarget - 逐个跑
TestConnection()→ 更新 LastTestedAt/LastTestStatus - 健康→故障边沿派发
storage_unhealthy事件 - 故障→健康边沿清除 notified 记忆
4.2 设计权衡
- 同步串行扫描:存储目标数量通常 < 20 个,串行简单可控
- 单次连接超时依赖 provider:
TestConnection各 provider 自己控制(rclone 已有超时) - 不阻塞存储配置操作:后台独立 goroutine
5. 事件总线扩展
新增两个事件类型:
storage_unhealthy:存储目标掉线replication_failed:复制失败sla_violation:SLA 违约(上轮已定义,本轮才有触发点)
6. 数据迁移
新增表:replication_records
新增字段:backup_tasks.replication_target_ids (CSV)
全 AutoMigrate,向后兼容(默认空 = 不启用复制)。
7. 前端
- 任务表单新增"备份复制"步骤:副本目标多选(自动过滤掉已是主存储的目标)
- 新菜单:
/replication/records展示复制历史(源/目标/状态/大小/耗时) - 已有 LastTestStatus 展示在存储目标页,本轮后台扫描会自动更新此字段
8. 双 review 通过
go build ./...✅go vet ./...✅go test ./... -count=1✅npx tsc --noEmit✅npm run build✅
9. 未做(下一轮)
- 备份窗口(maintenance window):时段禁止调度
- Agent 自更新
- SSO / OIDC
- 报表 PDF/CSV 导出
- 复制选项:加密再上传、checksum 验证
- 任务模板(批量创建相似任务)