Linux 内核调优与网络协议栈性能优化开发短记:参数要跟流量模型一起验 Linux 内核调优与网络协议栈性能优化开发短记参数要跟流量模型一起验网络参数不能从别人的清单里直接复制。监听队列、临时端口范围和连接跟踪表是否合适取决于入口是短连接、长连接还是突发回调也取决于负载均衡器是否复用连接。先把这几个前提写在变更单里后面的 sysctl 才有解释空间。准备环境时我会保存发行版、内核版本、网卡驱动、NUMA 拓扑及当前 sysctl 快照。流量发生器应说明包大小、连接建立速率、持续时间和目标端口。观察项不只包括应用错误率还要有ss -s、监听队列溢出计数、nf_conntrack_count、软中断占比和网卡丢包。这样才能区分是应用慢、队列满还是网卡侧已经丢包。例如怀疑 backlog 不足不应直接把数值拉到很大。先在隔离节点增加连接建立速率比较ListenOverflows与应用接受连接的速率随后核对负载均衡器的健康检查是否也占用了队列。若计数不再增长而 P99 仍恶化问题可能在下游连接池而不是内核参数。上线时按节点池灰度并保留原始快照和撤回命令。变更后的窗口内同时观察连接建立失败、重传、CPU 软中断和业务请求分位数任一指标出现异常趋势就停止扩大范围。内核调优的产物应该是一组有适用条件的配置而不是“万能网络参数”。配置说明中还应写明哪些值由镜像初始化写入、哪些由节点池覆盖避免一次手工修正被下次扩容覆盖。出现差异时先比对快照再决定是否修改运行节点。流量回放结束后检查计数器是否自然回落若连接跟踪项持续堆积再查回收超时和异常连接来源。网卡中断亲和性也应留在变更记录中避免节点替换后出现难以解释的差异。