01
冻结范围和先决条件
从官方管理指南中选择当前受支持的Proxmox VE版本,并在安装前阅读其特定版本的要求。准备唯一的主机名、稳定的管理地址、时间同步、管理访问、经过验证的备份和独立的恢复路径。记录节点和客户资源预算,以便管理服务、存储和恢复工作不会被分配走。
优先选择能够通过稳定的 LAN 级路径通信的节点。Proxmox 文档描述了一个基于法定人数的集群,并要求可靠的 Corosync 传递,延迟低于 5 毫秒才能稳定运行。这使得跨越遥远公共区域的集群成为一种不同且通常不合适的设计,除非您能证明其网络满足官方要求。公共服务器列表并不暗示任何私有跨区域网络。
02
在加入节点之前设计仲裁
写下投票和您打算保留的每个分区。三节点集群是直接的起点,因为在失去一个投票节点后仍能保持多数。两节点设计不会因为一厢情愿的故障转移而变得安全;Proxmox 文档将 QDevice 描述为提供额外投票的一种方式,而该外部投票者引入了自己的可达性和放置要求。
仲裁保护一致的集群状态,而不是应用程序可用性本身。决定如何重新启动客户机、其磁盘需要哪些存储以及当节点被隔离但仍运行时会发生什么。避免将更改预期票数作为常规响应来强制分区可写。
03
诚实地规划 Corosync 和工作负载流量
分别列出管理、Corosync、迁移、存储、备份和公共访客流量,然后将它们映射到已交付的接口和路由地址。专用物理路径或 VLAN 隔离可以减少干扰,但 Tungsto 订单不保证私有 VLAN 或额外的集群链路。订购前确认任何所需的网络功能;否则在提供的接口和公共路由范围内进行设计。
Corosync 重视稳定的延迟和可靠的顺序传递,而不是头条带宽。迁移、复制和备份可能产生更大的流量,因此请安排和测量它们,避免饿死集群通信。根据官方端口要求应用主机防火墙并限制管理暴露;不要从不相关的版本复制规则集。
04
根据承诺的恢复结果选择存储
本地存储使故障域简单,但不会使客户机磁盘在另一个节点上可用。本地 ZFS 复制可以降低恢复点,但它是异步的,可能会在复制之间丢失更改。共享存储可以使相同的客户机卷对多个节点可见,而分布式存储增加了容量、网络和操作要求。这些都不能消除对单独备份的需求。
定义 ISO 镜像、客户机磁盘和备份的存放位置,如何监控可用空间,以及存储填满时会发生什么。Proxmox 警告,使用已满的精简配置存储的客户机可能会收到 I/O 错误。将恢复介质和凭据保存在可能需要重建的集群之外。
05
使用分阶段验收和故障计划
在创建第一个集群之前,对每个独立节点进行补丁和验证,然后使用所选版本的指南逐个加入节点。每次更改后,记录成员资格、法定人数、时间状态、存储可见性和备份状态。仅在控制平面健康后添加非生产客户机。
规划受控演练:一个节点不可用、一条 Corosync 路径不可用、存储不可用以及从备份恢复。在每次演练前定义预期结果和中止条件;不要对工作负载的唯一副本运行破坏性测试。Tungsto 硬件电源和重新安装请求可能会排队等待运营商处理,因此它们不是受管理的 HA 控制器或保证的恢复计时器。最终交付物是一份包含您部署中观察到的结果的自主运行手册,而不是无条件的可用性承诺。
直接回答
关于本指南的问题
三节点Proxmox集群能保证高可用性吗?
不。三个投票有助于法定人数,但客户HA还需要合适的存储、隔离和重启策略、备用容量、可靠的网络和经过测试的恢复。Tungsto不会将集群作为托管HA服务来运营。
我可以假设 Tungsto 服务器之间存在私有 VLAN 吗?
不。目录不保证 VLAN 或专用集群网络。在选择依赖该网络的拓扑之前,请确认确切的网络产品。