VPS 的 SLA 与在线率承诺是什么?厂商敢写 99.9% 吗

解释 SLA、在线率、赔偿条款的真实含义,拆解便宜 VPS 为何大多无 SLA,帮你评估业务可用性的底线。

延伸阅读

更多相关攻略推荐:数据中心"吞电"真相:为什么能源危机和 AI 算力在悄悄拉高你的网费VPS 的终点是「杜甫」?Hetzner 独服拍卖场、IPMI 远程从免费赠送到一枚 50 美元:IPv4 地址的价格变迁与二手交易风云从阿帕网到万物互联:TCP/IP 协议族的诞生与进化史告别"白菜价"时代:全球 VPS 与云计算厂商涨价背后的深层经济学

先搞清楚:SLA 到底是什么

很多新手看 VPS 厂商页面,都会看到"99.9% 在线率""SLA 保障"这类字眼,但很少有人真的点开 SLA 文档看一眼。SLA(Service Level Agreement,服务等级协议)本质就是厂商和客户之间的一份"可用性承诺书":它写明了你的服务器每月要保证多久能正常访问、达不到时怎么赔、哪些情况不算违约。

对便宜 VPS 用户来说,SLA 的意义不是"赔你多少钱",而是"厂商愿不愿意为可用性负责"。敢写 SLA 的厂商,通常背后有冗余硬件、监控和主动维护;不敢写或根本没 SLA 的,往往把责任推得一干二净。

99.9% 在线率到底等于什么

"99.9%"这个数字看着很美,但换算成停机时间,你可能就没那么安心了。在线率是按时间比例算的,下面是常见档位对应的允许停机时长:

在线率承诺每年允许停机每月允许停机
99.0%约 87.6 小时约 7.3 小时
99.9%(三九)约 8.76 小时约 43.8 分钟
99.99%(四九)约 52.6 分钟约 4.4 分钟
99.999%(五九)约 5.26 分钟约 26 秒

重点来了:行业里最普遍的 99.9% SLA,一年允许你宕机将近 9 个小时——这已经超过了正常工作日的一整天。也就是说,只要厂商全年停机控制在 8.76 小时内,它就算"履约"了,你一分钱赔偿都拿不到。99.99% 才把年停机压到 53 分钟以内,而这种通常要企业级多节点冗余架构才做得到,不是普通单台 VPS 的玩法。

赔偿条款:你真能拿到钱吗

当停机真的超过了 SLA 阈值,厂商给的补偿几乎都是服务抵扣额度(Service Credit),而不是退现金。具体有这几个特点:

  • 触发门槛高:很多 SLA 规定,只有当月停机超过阈值(比如 99.9% 对应 43.8 分钟)才开始算赔偿,刚好卡在线上不算。
  • 只给抵扣,不给现金OVHcloudHetzner 这类有 SLA 的厂商,赔的额度都是充到你账户、抵未来账单,过期作废,不能提现。
  • 额度上限低:通常封顶是当月该服务费用的 100%。举个例子,一台 20 美元/月的 VPS 宕机 2 小时(超过 99.9% 阈值),按常见比例你大概只能拿到 4–8 美元抵扣;可如果这 2 小时正好在你的业务高峰,损失的订单可能值几百美元——赔偿相对实际损失几乎可忽略。

所以 SLA 的真实价值不在赔偿金额,而在它背后的问责机制:白纸黑字写了承诺,厂商就有动力去投资冗余、上监控、主动换硬件;真出问题你也有据可依去工单维权。

哪些情况不算"停机":SLA 的免责黑洞

这是新手最容易忽略的地方。SLA 里一大堆"不算违约"的排除项,往往比承诺本身更关键:

  • 计划内维护:厂商提前通知的升级、打补丁,停机不算违约。这点合理,但要留意通知时长。
  • 不可抗力:自然灾害、战争、政府行为,不赔。
  • 用户自身原因:你配置出错、超资源限额、装了有漏洞的程序、欠费被停,不赔。
  • 上游网络与 DDoS:机房边界以外的网络问题、超出防御能力的 DDoS 攻击,通常不赔。
  • 第三方服务:DNS、外部 API 等不由厂商运营的部分,不赔。

换句话说,真正能让你拿到赔偿的,基本只剩"厂商自己的硬件或网络故障且没提前说"这一小撮情况。下单前一定要把排除项读一遍。

为什么便宜 VPS 大多没有 SLA

你翻一圈 RackNerdCloudcone、Bandwagon 这类几美元月付的便宜 VPS,会发现它们根本不写 SLA,或者只含糊说"尽力保障"。原因很直接——成本结构决定了它们扛不起承诺:

  • 超卖(Over-selling):最便宜的办法就是把更多 VPS 塞进同一台物理机。你买的"4G 内存"可能要和几十个邻居抢真实资源,晚高峰一起忙就集体变慢甚至雪崩。
  • 消费级硬件:企业级 SSD、ECC 内存、冗余电源都贵。便宜厂商常用最便宜的零件,结果是故障多、偶发丢数据。
  • 几乎没有主动监控:认真监控宿主机、提前换坏盘、留资源余量都要花钱。便宜厂商常是"坏了再修",而不是"坏之前就换"。
  • 支持响应慢:工程级 24/7 支持贵,便宜厂商多是工单邮件、社区互助,出问题基本靠自己。

行业实测数据也印证了这点:超低价 VPS 的平均在线率大约只有 98.7%,远低于 99.9%。换算下来一年能宕 90 多个小时。对学习和非关键项目无所谓,但对生产业务就是灾难。

怎么独立验证厂商说的在线率

别全信厂商自报的监控数据——那往往只统计"他们自己看到的部分"。真正要判断自己的服务器稳不稳,得自己上监控:

  • 第三方监控:用 UptimeRobot、HetrixTools 这类免费监控,从外部定时 ping 你的服务,宕机就报警,数据你说了算。
  • 自己记日志:在服务器上用脚本定期写心跳,或部署 Prometheus + Blackbox 这类开源监控,长期画出可用性曲线。
  • 看社区口碑:LowEndTalk、vpsbenchmarks、少数派上搜具体机型,真实用户的宕机汇报比官网漂亮话可信得多。

另外提醒一句:SLA 里"可用性"的定义也很狡猾。有的只算"服务器通电",不算"你的应用能不能用"、也不保证"从你用户那里能不能连上"。所以即便厂商说自己 99.9%,你的网站对部分访客仍可能连不上——这往往卡在数据中心之外的网络上。

给你的下单建议

  • 学习、实验、个人博客、中转:便宜 VPS 完全够用,别为用不上的 SLA 多花钱。
  • 电商、生产业务、对外 API:优先选有明确 SLA 的中高端厂商,比如 OVHcloudHetzner 这类公开写 99.9% 并给服务抵扣的;同时要自己加监控、勤备份,别把身家性命押在厂商承诺上。
  • 关键业务:考虑 99.99% 档或多节点负载均衡,单台 VPS 再好的 SLA 也扛不住"单机即单点故障"。

除了 SLA,可用性还要看这几件事

SLA 只是一张纸,真正决定你服务器稳不稳的还有硬指标:

  • 硬件冗余:机房有没有 N+1 或 2N 的电源、发电机、多上行链路。单链路、单电源的机房,一次断电就全员离线。
  • 存储与备份:有没有 RAID、自动快照。消费级硬盘坏了就是数据没了,有快照还能回滚。
  • DDoS 防御能力:被打了能不能扛住,还是直接把你的 IP 封了事。
  • 超卖比例:同一台母机塞多少邻居,直接决定晚高峰是不是一起卡。

这些往往不会写进 SLA,但比那一行百分比更影响你的真实体验。下单前多问一句"你们母机超卖比多少""快照怎么收费",比盯着 99.9% 更有用。

最后说个扎心的事实:哪怕厂商真写了 99.99%,单台 VPS 永远有"单机即单点故障"的风险——母机一挂,再好的承诺也要等迁移。真正怕宕机的业务,靠的是多节点、多机房、自动故障转移,而不是把希望压在一份 SLA 上。SLA 是底线,不是保险箱。