ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Nutanix超融合实操手册:Prism登录、AOS升级与容灾切换全解析

Nutanix超融合实操手册:Prism登录、AOS升级与容灾切换全解析 简介面向IT管理员、系统管理员及技术支持人员的Nutanix超融合平台中文操作手册系统讲解超融合基础架构日常运维与操作管理的核心方法。资源包为单个PDF文档大小约7.42MB便于离线查阅已有1866人学习浏览。手册按官方操作流程组织开篇说明系统结构图与浏览器兼容性要求便于环境准备内容涵盖登录认证、主页仪表盘、软件升级AOS/NCC/AHV、固件升级、存储管理、网络管理等环节尤其对创建存储池/存储容器、集群配置、版本查看等高频运维场景给出了明确操作说明。读者既可在新平台上线时作为快速上手指南也可借助其中的流程描述进行日常故障判断与维护规范落地对于需要从传统架构转向超融合环境的技术团队这份中文手册能有效降低学习成本帮助快速建立Nutanix平台的管理能力。1. Nutanix 超融合操作手册这本中文手册到底解决什么问题接手一套 Nutanix 超融合平台之后排在你面前的问题往往不是“集群怎么搭”而是“日常运维按什么顺序做、出问题时去哪找入口”。这份 120 页的 Nutanix 超融合平台操作使用手册把 Prism 登录、AOS/NCC/AHV 升级、固件刷新、存储池与容器、虚拟机管理、异步复制和容灾切换按章节拆好每一步都给了操作路径和注意事项。它的目标读者很明确IT 管理员、系统运维和技术支持而不是架构师。拆完全部内容我的结论是Nutanix 的坑不在功能多难而在操作顺序、输入格式和变更前检查手册把这些点几乎都压在了小字里。2. 登录 Prism 与界面巡检从 9440 端口开始2.1 访问入口和首次登录默认密码 Nutanix/4u 不是让你留着用的在浏览器地址栏输入集群虚拟 IP 或任意 Controller VMCVM的 IP比如 HTTP://10.10.10.10回车后 Prism 会自动把请求重定向到加密端口 9440并弹出一个 SSL 证书警告。这个警告在内网环境中是正常现象点击“继续前往”即可进入。手册特意标注如果访问的是 Prism Central则输入 Prism Central VM 的 IP而不是单个集群的地址。首次登录使用内置管理员账号默认密码是 Nutanix/4u。第一次登录会被强制要求修改密码且密码复杂度要求相当严格我见过把运维逼到写密码本的情况。规范包括至少 8 个字符大小写、数字、特殊字符各至少 1 个与旧密码至少 4 个字符的差异不得是最近 5 次使用过的密码任意字符不能连续出现超过 2 次总长度不超过 199 个字符。改密后新密码会在所有 CVM、Prism Web 控制台、nCLI 和 SSH 之间自动同步这是 Nutanix 一个比较方便的设计不用逐个节点去改。首次登录还会依次出现 EULA 确认、Pulse 设置、增强集群运行状况监控三个屏幕。EULA 需要填写姓名、公司、职位后接受Pulse 我建议保持启用它负责在集群出现问题时向 Nutanix 客户支持发送警示通知关闭之后远程诊断的通道就断了增强监控是否开启取决于安全策略如果实体名称等对外可见信息不敏感建议打开。浏览器兼容性也有明确要求支持当前版本或前两个大版本的 Firefox、Chrome、Safari以及 IE 10/11 和 Edge。实际运维中我默认只用 Chrome 或 Firefox 的当前稳定版避开兼容性上的变数。提示如果启用了用户身份验证且客户端浏览器没有正确的证书页面会直接显示拒绝访问这不是账号被锁去核对证书信任和系统时间。2.2 仪表盘与数据弹性别只看那个绿色图标登录后的主页面是主页仪表盘左上角显示集群名称点击可以打开集群详情窗口里面是集群 ID、名称和虚拟 IP这三项都允许后期修改。仪表盘上最重要的不是 CPU 使用率的数字而是两个状态区运行状况和数据弹性。运行状况图标有绿、黄、红三个颜色它只是入口真正要点击进入“运行状况”视图查看具体检查项。数据弹性区域反映集群的副本健康情况。举个例子如果某个节点的磁盘报故障数据弹性图上会立刻出现黄色警告说明集群中还有节点处于降级状态。这类问题如果拖到第二天才处理期间再坏一块盘或掉一个节点VM 的可用性就会受到实质影响。所以我每天巡检的第一眼不是 CPU而是数据弹性。统计数据区的容量数字只用于规划不用于排障。运行状况视图里可以配置检查项和检查频率也支持用 Web 控制台手动运行检查。升级操作之后我会在这里手动跑一遍完整检查确认所有项从绿色基线开始这个习惯后面升级章节还会再强调。2.3 视图菜单和设置面板把入口位置记熟主菜单左侧的视图下拉列表里有主页、运行状况、存储、虚拟机、硬件、网络仅 AHV、文件服务器、分析、数据保护、警示、任务、自助服务仅 AHV等选项。“分析”视图用于创建对象图表和度量图表做性能监控“数据保护”是容灾的总入口。排障的路径基本固定为三步先看警示再翻任务最后进运行状况看明细。警示图标会在主菜单显示未解决警示的数量任务面板能看到正在进行或失败的异步任务这两块是运维早上打开控制台最先扫的地方。右上角的齿轮图标打开设置面板这里集中了集群详情、CVM 内存配置、集群转换、扩展集群、镜像配置、许可、生命周期管理LCM、升级软件、名称服务器、网络配置、网络交换机、NTP、SNMP、集群锁定、静态数据加密、SSL 证书、警示邮件配置、SMTP、冗余状态、语言与 UI 设置等几十个入口。Nutanix 把几乎所有配置都收敛到了这个面板这点和国内不少超融合平台包括一些人熟悉的深信服超融合平台的菜单逻辑很不一样后者更倾向于把配置分散在对应资源模块里。刚接手集群时建议把设置面板从上到下点一遍记住关键入口的位置能省去很多翻菜单的时间。主菜单右侧还有一个搜索框支持按操作名称或对象名称搜索比如输入“添加”会列出相关的添加操作输入“VM”会返回相关对象。界面不熟时这个搜索比翻手册更快。用户菜单里还有 REST API Explorer、下载 NCLI、下载 Cmdlet 安装程序等入口这些命令行和 API 工具后面专门讲。3. 软件与固件升级AOS、NCC、AHV、LCM 的顺序不是玄学3.1 三个升级组件分别是什么升级软件入口在“设置→升级软件”它管理 AOS、NCC、AHV 三组可独立升级的组件。AOS 是 Nutanix 操作系统本身负责 Prism 界面、数据路径、CVM 的运行NCCNutanix Cluster Check是集群健康检查工具升级前后都要依赖它摸清集群状态AHV 是节点上的虚拟化层相当于 ESXi 的角色承载所有 VM。三者是不同升级包装的时间点也不一样。组件角色升级位置影响范围AOSNutanix 操作系统设置→升级软件Prism、CVM、数据路径NCC集群健康检查设置→升级软件检查项与运行状况报告AHV虚拟化层设置→升级软件节点内核、VM 承载在动手之前先明确本轮要升哪一层。只做健康检查工具的更新没必要动 AOS反过来AOS 大版本跳跃时AHV 通常也要配套升级手册给出的做法是把它们排在一个维护窗口内按顺序做。3.2 升级顺序先 AOS再 NCC最后 AHV我按手册章节顺序和实际运维经验整理出的原则是先 AOS再 NCC最后 AHV。AOS 是 Prism 和 CVM 的承载者AOS 不先就位后续所有组件拿到的兼容性基线都是旧的NCC 紧跟 AOS 升级是为了在 AOS 变化后用新版本的健康检查工具确认集群有没有被升级引入新问题AHV 最后动是因为它直接影响 VM 运行把对业务的冲击收拢在窗口尾部。升级 AOS 阶段有一个很常见的注意点升级完成后以 admin 身份首次登录会被强制要求改密码。这是安全策略不是故障。如果你升级后走 SSH 而不是 Prism 登录 CVM则必须先以原始默认密码 Nutanix/4u 登录再按提示修改没有别的入口。升级期间 Prism 可能短暂变慢或不可访问只要不是持续报错属于正常现象不用紧张。提示AOS 升级期间不要同时在集群上跑 VM 迁移、备份任务或容器操作等升级任务结束、Prism 恢复正常后再动数据面。NCC 升级相对轻量但升级后必须做一件事手动触发一次完整的运行状况检查确认所有检查项从绿色基线开始。版本号只能证明升级包安装成功不能证明系统健康这个习惯我保持了很久。3.3 LCM 固件升级BMC、BIOS、SATADOM 的自动链路固件升级走“设置→生命周期管理”LCM。LCM 负责追踪集群内所有实体的软件和固件版本并执行 BMC、BIOS、SATADOM 的自动升级。第一步是修改 LCM 配置把纳入管理的实体和升级源信息填好之后再按 LCM 给的依赖顺序执行。这里说三个我踩出经验的地方第一固件升级会重启节点。升级窗口要按节点数预留时间别指望十分钟结束一个 4 节点集群刷完一轮固件通常要预留一个完整的维护窗口。第二依赖关系一般是先刷 BMC再刷 BIOS最后 SATADOMLCM 会自动处理但人工排窗口时要知道这条链别在刷 BIOS 的阶段强行重启节点。第三不要一次性全选所有节点批量跑先放行离业务峰值最远的节点观察它刷写完成后能否正常重新加入集群再逐步放行其余节点。曾有同事把全部节点一起刷其中一个节点固件包刷写失败整个队列卡了半个维护窗口。4. 存储、虚拟机与容灾从存储池到保护域的完整链路4.1 存储池与存储容器先把账算明白存储管理在“存储”视图里操作。第一步创建存储池把集群所有节点的 SSD 和 HDD 聚合成一个统一资源池这是超融合和传统 SAN 的关键区别容量不是一个 LUN 一个 LUN 地划而是从物理聚合池里切。第二步基于存储池创建存储容器容器才是 VM 数据存放的逻辑边界可以把它理解成虚拟化平台里的数据存储。创建容器时最重要的参数是冗余因子。RF2 表示每个数据块在集群中有 2 份副本至少需要 2 个节点RF3 表示 3 份副本至少需要 3 个节点。副本越多容错越强但空间开销也越大。容量规划时有个经常算错的账RF2 环境下 10TB 物理容量理论上可用容量只有 5TB 左右因为每份数据都要占两份空间。新建容器前先按业务重要程度定冗余因子测试环境用 RF2核心数据库用 RF3别在容器建好后才发现空间不够。另一个注意点是压缩和去重。这两个功能可以在容器级别开启去重在写入时计算数据指纹对 CPU 有额外开销。镜像库、虚拟桌面这类重复数据多的场景收益明显随机读写为主的数据库场景我一般只开压缩不去重避免 CPU 争抢影响延迟。4.2 虚拟机管理仪表盘、表格视图和镜像虚拟机视图提供仪表盘和表格两种模式。仪表盘适合看整体运行情况表格视图适合批量操作比如多选 VM 执行开机、关机、迁移。创建 VM 时要选定存放的容器配置 CPU、内存、磁盘并在镜像配置窗口AHV 环境导入 ISO 或磁盘镜像之后就能基于镜像批量创建 VM。AHV 的虚拟机高可用在“管理虚拟机高可用性”窗口配置启用了 HA 的 VM 在节点故障时会在集群内其他节点自动重启。需要强调一个很多人理解的偏差HA 不等于零丢失。节点突然掉电时内存里还没来得及落盘的写入还是会丢HA 保证的是故障后有一个可用的 VM 实例重新跑起来而不是恢复到掉电前的那一刻。所以重要业务的备份策略不能因为开了 HA 就放松。注意如果节点故障时 VM 在别的节点上重启这些 VM 的读取请求会通过网络访问远程数据副本性能会暂时下降直到副本迁移到本地。这是手册里数据路径冗余的正常行为不是故障。4.3 关联性策略HA 规则之外的调度控制关联性策略解决的是“VM 应该放在哪”的问题。AHV 里可以配置规则把特定 VM 固定在某个节点上或者强制两个 VM 分布在不同节点。典型场景是两台域控制器必须分居两个物理节点避免单节点故障导致整个域不可用反过来数据库应用和它的内部工具如果放同一节点可以减少跨节点网络开销。配置关联性策略前先数节点数。假如集群只有 3 个节点而你建了 4 条互斥规则规则之间就可能互相冲突导致 VM 无法迁移到满足所有条件的位置。我见过因此无法进行节点维护的案例最后只能一条条删规则排查相当折腾。规则建完以后每次扩容或缩容节点时也要重新评估一遍节点数量变化后原本合理的分布规则可能变成不合理。4.4 异步复制与保护域容灾的切换路径数据保护视图是容灾的总入口包含异步复制、保护域、故障切换和故障恢复。异步复制把本地容器的数据按周期复制到远程站点它不是实时同步RPO 取决于复制周期设置所以容灾级别的选择要提前跟业务方对齐能接受丢失多少分钟的数据决定了复制的频率。保护域是容灾的基本单元把一组 VM 组织在一起统一保护。操作路径是先配置远程站点再创建保护域并加入 VM接着配置异步复制。配置远程站点时要填站点名称、可达 IP 和复制网络复制网络我一般单独规划不和业务网络混用避免复制流量挤占业务带宽。计划内故障切换用于灾备演练灾难非计划故障切换用于站点真正不可用的场景站点恢复后再执行故障恢复把业务切回原站点。手册中这些操作在界面里都是几步点击但前置条件没确认就点切换才是最常翻车的地方。我的习惯是切换前先看保护域状态、复制链路健康度再检查远端站点资源是否充足最后才执行切换。恢复受保护对象时可以选择从保护域或复制副本中克隆、恢复到指定容器误删 VM 后的应急恢复也走这条路。5. 常见问题与排查五个容易翻车的现场写一些实际运维中容易被手册小字坑到的场景每条按现象、原因、解决三段来都是我自己或身边同事真实踩过的。5.1 访问 Prism 被 SSL 证书卡住现象输入 HTTP://集群IP 后浏览器弹证书错误有的环境直接显示拒绝访问找不到继续进入的按钮换了一台电脑也一样。原因Prism 会自动从 80 端口跳到 9440 加密端口默认使用自签名证书如果登录客户端系统时间和集群时间偏差过大证书有效期校验也会失败。另外启用了用户身份验证且客户端没有正确证书时页面会直接给拒绝访问。解决内网环境确认是集群地址后在浏览器高级选项里选择“继续前往”把客户端时间用 NTP 校准偏差超过几分钟就可能导致证书校验失败长期方案是在 SSL 证书设置里导入企业 CA 签发的证书消除每次确认的麻烦。如果是生产环境长期使用别放任自签名证书证书到期前会有一波访问恐慌。5.2 LDAP 用户登录失败现象用户反馈密码没错但登录 Prism 一直认证失败换了几个人都这样本地 admin 账号却能正常登录。原因Nutanix 的 LDAP 认证要求用户名按 samAccountNamedomain 格式输入不支持 UPNuser域全名也不支持反斜杠格式。很多人按 Windows 登录习惯填 UPN直接失败。这个格式说明藏在登录章节的小注里不踩一次很难记住。解决把输入格式改成 samAccountName域名后缀例如账号 zhangsan 在域 corp.local 下就填 zhangsancorp.local。如果不确定 samAccountName 是什么到 AD 用户属性里看“登录名预 Windows 2000”字段拿那个值来拼。别用邮箱前缀去猜两者可能不一样。5.3 升级 AOS 后脚本认证全部失效现象AOS 升级后的第二天定时执行的 nCLI 脚本和 API 任务开始持续报认证失败但人工登录 Prism 正常。原因AOS 升级后首次登录强制改密内置 admin 密码变了而脚本里写死的是旧密码。手册明确说明升级后以 admin 首次登录会提示改密码SSH 登录 CVM 也要先以默认密码登录再改但没人会专门去读升级注意事项里的这句话。改密后密码在所有 CVM 和接口间同步脚本里不更新就全部失效。解决不要在内置 admin 账号上绑脚本。创建一个分配了管理员角色的独立用户专门给脚本和 API 用升级后手动登录完成一次改密再只更新这一个账号的凭据。从那以后我新建环境的第一件事就是建运维专用账号内置 admin 只用于控制台登录和紧急场景。5.4 容器冗余因子选错导致容量紧张现象新建容器时选了 RF3容量规划时发现可用空间比预期少一半测试环境的存储紧张到报警想改成 RF2 又改不动。原因冗余因子决定副本数RF3 意味着每份数据占 3 份物理空间。容器创建后冗余因子受集群规模和已有数据分布限制不是随时能改尤其是已经有 VM 数据落进去以后。解决建容器前按业务等级先定冗余测试用 RF2核心库用 RF3。估算可用容量时按物理容量除以副本数计算RF2 约五折RF3 约三折把这个数字写进规划表里。如果已经建错只能新建一个正确冗余因子的容器把 VM 迁移过去再删掉旧容器迁移期间注意业务窗口。5.5 警示邮件收不到现象节点已经处于降级状态邮箱里一封告警都没有问题最后靠巡检发现追溯时已经过去大半天。原因SMTP 服务器信息没在设置里配置或虽配置了但认证、加密方式不匹配另外 Pulse 没启用时向 Nutanix 客户支持上报问题的通道也是关闭的出问题时官方侧拿不到诊断数据。解决在设置→SMTP 服务器里填写正确的服务器地址、端口和账号先发送测试邮件验证再启用警示邮件并添加收件人。SMTP 端口上25 端口经常被运营商封465/587 需要 SSL/TLS 配置邮件网关的认证方式要和 Nutanix 侧保持一致。配置完以后找一个已知的警示事件验证一遍确保邮件真的能收到别配完就以为完事了。这五条坑的共同点都不是功能不可用而是前置条件或输入格式没对齐。手册里这些内容都以小字或注释存在正式操作前先翻对应章节的注意事项能省掉大量返工。6. 把手册变成日常习惯用 REST API Explorer 和 NCLI 做变更快照6.1 两个被低估的入口REST API Explorer 与 NCLI用户菜单里有两个实用入口经常被忽略REST API Explorer 和下载 NCLI。REST API Explorer 直接在网页里展示集群的 v1/v2 API点开就能看到 cluster、vm、container 等资源的返回 JSON接口路径和参数记不清时它比翻文档快。NCLI 是命令行接口下载 zip 包后配置主机和凭据就能执行查询。做法很简单每次变更前用 NCLI 把集群状态、活动警示、容器列表导出成 JSON 存档变更完成后重新导出一次两份文件做 diff。正常变更的差异应该只有任务相关项如果出现新的警示或容器状态异常说明变更引入了副作用第一时间就能看到不用等告警邮件。# 变更前快照三个命令覆盖状态、警示、存储三个维度 ncli cluster status --outputjson before_cluster.json ncli alert list --outputjson before_alert.json ncli container list --outputjson before_container.json这里用了--outputjson参数目的是让输出格式便于脚本解析和 diff 对比如果不加该参数NCLI 默认是人类可读的文本表格diff 时会因为对齐差异产生大量无效噪声。文件名里带 before 前缀和变更后的 after 文件放同一目录一眼能看出对比对象。REST API Explorer 同理找到接口后用 curl 或 PowerShell 的 Invoke-RestMethod 调度起来就能把每日巡检报告自动化。6.2 把升级和切换的验证步骤固化下来手册里每个操作后面都附了“确认无异常”的要求但落到日常人最容易漏的就是验证。我的做法是把验证步骤做成固定清单AOS 升级完成后看版本号、跑一次运行状况检查、对比 NCLI 快照 diff容灾演练时先看保护域状态和复制链路切换完成后检查远端 VM 是否按预期接管再执行故障恢复。从那以后我每次做 AOS 升级或容器变更前都会强制走一遍快照流程先导三份 JSON 存档完成后重新 diff确认没有引入新的警示才收工。这套方法帮我少踩了很多次“升级完才发现有问题”的坑希望也能帮到你。本文还有配套的精品资源点击获取
返回列表