日常运维(站跑起来之后)
这篇给「站已经上线了,接下来要长期照顾它」的站长看。讲的是每天/每周/每月各要做什么、出事了先查哪。 部署阶段还没走完的,先看 建站手把手教程。不懂的词查 术语小词典。
TL;DR(赶时间看这版)
每天:看一眼站活着没(docker ps 六容器是否都 Up)。 每周:跑一次备份演练(restore.sh --drill)。 每月:看一次 性能基线 有没有退化;检查磁盘还剩多少。 出事先做:别慌,先备份,再查日志。日志命令见下。
🔑 一句话记住:备份 → 演练 → 才敢升级。顺序反了出事就回不去。
先记住这 4 条命令(80% 的问题靠它们)
| 场景 | 命令 | 看什么 |
|---|---|---|
| 站还活着吗 | docker ps | 六个容器都 Up;若有 Restarting 说明有问题 |
| 看日志(哪个坏了看哪个) | docker logs <容器名> --tail 50 | 报错信息;容器名如 flux-api |
| 手动备份 | bash scripts/backup.sh | 打印备份文件路径 |
| 验证备份能用 | bash scripts/restore.sh <备份> --drill | 校验通过 = 备份有效 |
容器名记不住就先
docker ps看一眼,下次直接复制。
巡检节奏表
| 频率 | 做什么 | 怎么查 | 不做的后果 |
|---|---|---|---|
| 每天 | 容器状态 | docker ps 六容器全 Up | 用户直接访问不了 |
| 每天 | 磁盘剩余 | df -h(关注 / 和 docker 目录) | 磁盘满 → 数据库写不进去,站会挂 |
| 每周 | 备份演练 | bash scripts/restore.sh <最新备份> --drill | 备份文件损坏都不知道,真出事才发现 |
| 每月 | 性能不退化 | 见 性能基线 | 悄悄变慢,站长察觉不到 |
| 每季度 | 升级演练 | 见 升级演练 | 真要升级那天才发现问题 |
| 随时 | 安全自查 | 见 安全姿态 | 收录申报/等保自查缺材料 |
磁盘满了怎么办(最常见的隐形杀手)
PT 站的数据会持续变大(附件、种子、日志)。磁盘满的典型征兆:站变慢、docker ps 某容器反复重启、页面报错。
df -h确认哪个盘满了;- 找大文件:
du -sh /var/lib/docker/* | sort -h | tail; - 安全清理(不会丢数据):
docker system prune -f(清无用的停止容器/旧镜像/构建缓存); - ⚠️ 千万别跑
docker system prune -a --volumes—— 加了--volumes会连数据库数据卷一起删,站直接没了。
带宽要买多少?(PT 站的隐形大头)
带宽是 PT 站除服务器外的最大一笔开销,而且主要不是网站流量,是用户互传(做种/下载)——所以买小了会直接卡住用户。
怎么估:先按「种子数 × 每对用户同时传输」粗估。经验参考:
| 你的规模 | 建议月带宽起步 |
|---|---|
| 小站(< 500 种子、几十人在线) | 1–2 TB/月 |
| 中站(千级种子、几百人在线) | 5–10 TB/月 |
| 大站(万级种子) | 20 TB+/月,或找机房谈专线 |
省带宽的做法:
- 开 tracker 的限流(默认已开),防止有人用多连接刷带宽;
- 用支持大带宽的机房(很多按 TB 计费,超出很贵)。
服务器本身:2 核 4G 起步通常够千级用户(实测 tracker 吞吐余量 >100 倍),CPU/内存很少是瓶颈,带宽和硬盘才是。想看实测数字见 性能基线。
国内机房走域名要备案,且带宽单价通常更高;境外机房免备案但延迟略高。选机房是带宽/成本/延迟的权衡。
什么时候要升级 & 怎么升级
建议:小版本随时升,大版本(如改了数据库结构的)先演练再升。
升级的完整步骤、命令和回滚方法,站长版看 升级与回滚;想看实测数据和大版本政策,看 升级演练。
一句话原则:升级前一定先备份,因为回滚 = 旧代码 + 旧数据库备份的组合。
监控(可选但推荐)
想「出事先知道」而不是「出事才发现」,可以起监控栈:
docker compose -f docker/docker-compose.yml --profile monitoring up -dPrometheus + Grafana,五条告警规则已预置。不熟悉监控面板可以先跳过——小站靠上面那张巡检表就够了。详见 监控与告警。
出事了怎么排查(按现象)
| 现象 | 先做 | 详见 |
|---|---|---|
| 全站打不开 | docker ps 看哪个容器挂了 → docker logs <它> | 故障排查 |
| 站能开但传不了种 | 客户端连不上 tracker → 检查 announce 反代 | 域名部署 |
| 容器反复重启 | docker logs 找报错,多半是配置/内存/磁盘 | 故障排查 |
| 页面很慢 | 查磁盘是否满 + 性能基线是否退化 | 性能基线 |
| 用户说密码收不到 | 检查邮件配置 | 开站 checklist |
| 想整体换机器 | 按迁站流程走 | 换服务器/迁移数据 |
备份与安全(最该交给别人做的事)
📌 异地存放:备份文件只在同一台机器上,等于没备份——机器坏了文件一起没。把备份传到对象存储或另一台机器。
想把站删掉 / 重装(谨慎)
⚠️ 本节是高危操作。跑之前确认真的要删——删了就没了,除非你有备份。
只想重装(清数据重来,保留机器和代码):
docker compose -f docker/docker-compose.yml down -v # -v 会删数据卷!彻底卸载(连代码带数据全删,机器还给你):
cd .. # 先退出项目目录
docker compose -f FluxTorrent/docker/docker-compose.yml down -v # 停服务并删数据卷
rm -rf FluxTorrent # 删代码和备份(确认过再执行!)怎么算成功:docker ps -a 里看不到 flux 相关容器,docker volume ls 里没有 flux 的数据卷。
💡 更推荐的做法:如果不是要「彻底放弃这个站」,只是想清数据重装,别删目录——保留
backup/里的归档,用 换服务器 / 迁移数据 的恢复流程反而更安全(能先验证备份可用)。删目录 = 把退路也一起删了。
进阶(多站/大站才需要)
更多:站长视角的升级见 升级与回滚;想继续学运营策略看 运营 playbook。
词看不懂?→ 术语小词典