2026/8/31 16:32:54

Linux更新时服务未中断?先排查锁与进程状态,避免更新失效

Linux更新时服务未中断?先排查锁与进程状态,避免更新失效 刚才在一台测试服务器上处理“Linux 更新时系统还能继续使用”这个现象时我发现了一个很有意思的问题表面上看系统在更新过程中没有被锁死用户还能继续跑命令、访问服务这听起来像是一件好事。但顺着日志往下查问题并不是“更新设计得很优雅”而是包管理器的锁根本没有锁住进程还踩着旧二进制继续对外服务dpkg 的状态也出现了不一致。换句话说这次“还能继续使用”不是功能而是另一颗雷。这篇文章我按实际排查顺序整理先说明这个现象到底算不是 bug再拆解如何从锁、进程、服务状态三层定位问题然后给出修复步骤、零中断更新的正确做法以及更新后的验证清单。适合正在维护 Linux 服务器、遇到“更新后服务没断但版本对不上”这类情况的人看。建议先确认环境是 Debian/Ubuntu 系列的 apt/dpkg 体系下面所有排查思路都以这套体系为基础。1. 先搞清楚“更新时还能继续使用”到底算不算 bug1.1 我遇到的现象事情是这样的。当时我在一个终端窗口执行sudo apt-get upgrade按照正常流程这个过程会锁定 dpkg 数据库阻止其他包管理操作并发执行。但我在另一个 SSH 会话里居然再次执行apt-get install成功了而且没有报 “Could not get lock” 错误。更奇怪的是线上那个 Nginx 服务在整个升级过程中一直能访问日志里也没有重启记录。第一反应是“运气真好更新过程零中断”。但冷静下来一想这不正常。一个能正常工作的服务在升级完后应该切换到新版本如果它还在用旧版本说明升级流程没有真正跑完或者进程根本没有被正确重启。这时候“还能继续使用”反而意味着旧进程可能还持有被替换的二进制文件。新装的库或配置没有真正被新进程加载。dpkg 的记录可能处于中间状态下一次安装包时可能连锁报错。1.2 为什么 Windows 式“更新必须重启”和 Linux 不一样很多人第一次接触 Linux 更新时会拿 Windows 的体验来对比。Windows 更新经常要求重启重启前系统进入不可用状态。Linux 不一样它允许你长时间运行同一个系统内核和用户态程序可以分别升级。进程正在运行的旧二进制文件被替换后只要进程没有关闭旧文件在磁盘上删除也不影响已打开的文件句柄这就是 Linux 下常见的 “text file busy” 不一定会出现的机制。这个机制本身不是 bug。真正的问题在于很多人误以为“更新过程中服务不断就代表更新是安全的”。实际恰恰相反服务不断但你不知道它用的是哪个版本如果新旧模块混在一起跑比主动重启一次更危险。1.3 真正需要怀疑的三种情况我这次排查时把“更新时还能继续使用”拆成了三种情况包管理器锁失效同时有多个 apt/dpkg 进程在操作同一个数据库可能导致安装记录错乱。服务没有按预期重启软件包已经替换了二进制但 postinst 脚本或 systemd unit 没有触发服务重启。内核或核心库更新后系统标记需要重启但没有处理最常见的是 glibc、libssl、kernel 这类底层组件升级虽然系统还能用但安全性上处于新旧混用状态。如果你在更新后没有看到任何服务重启也没有 reboot 提示别高兴太早先往下查。2. 从现象到根因这次不是“更新成功”而是“锁没锁住”2.1 先看锁apt/dpkg 的锁机制Debian/Ubuntu 系列用 apt 和 dpkg 管理包。他们通过几个锁文件保证同一时间只有一个安装操作在写数据库/var/lib/dpkg/lock/var/lib/dpkg/lock-frontend/var/lib/apt/lists/lock/var/cache/apt/archives/lock平时执行apt-get upgradeapt 会先拿/var/lib/dpkg/lock-frontenddpkg 本身再拿/var/lib/dpkg/lock。如果另一个进程想拿同一把锁系统会等它释放或者在非交互模式下直接报错。正常情况下不可能出现两个更新任务同时跑还都不报错。我这次先用下面命令确认了持锁进程sudo lslocks | grep -E dpkg|apt sudo fuser -v /var/lib/dpkg/lock-frontend如果锁文件存在但没有任何进程持有说明是锁文件残留如果存在且被某个 PID 持有那才说明当时确实有更新任务在跑。我遇到的情况很典型执行升级的终端显示任务已经结束但 dpkg 进程还残留在后台锁又被另一个进程抢走导致后续的apt-get install能继续跑。这时候不要做一件事不要直接rm /var/lib/dpkg/lock。锁文件本身不是问题问题是锁背后的进程状态。直接删锁可能让 dpkg 觉得自己应该继续写数据库导致事务错乱。正确做法是先看进程是否还活着。2.2 再看进程旧二进制还在跑锁只是第一层。真正让我确认“更新没有完全生效”的是进程检查。在 Linux 里一个进程运行后它对应的可执行文件即使被替换进程也不会自动切到新版本。你可以通过/proc/PID/exe看到进程当前实际使用的二进制ls -l /proc/$(pgrep -f nginx: worker | head -1)/exe如果输出路径后面跟着(deleted)说明这个进程还在使用已经替换掉的旧二进制。换句话说包管理器把文件换成了新版本但正在运行的进程仍然占用旧 inode。服务“没断”只是因为它根本没有切换到新版本。同样的思路也适用于动态库。使用旧 libc 的进程在 glibc 升级后不会自动获得新版本的地址空间。服务继续运行不代表服务已经使用了新的库。2.3 最后看数据库dpkg 状态一致性排查完进程还要看 dpkg 自身的状态是否一致。在刚处理完锁冲突的情况下apt 和 dpkg 的记录可能处于半完成状态。sudo dpkg --audit sudo apt-get checkdpkg --audit会列出信息不完整的包apt-get check会检查依赖关系是否完整。如果这两个命令有输出说明这个系统不能继续正常安装包了必须先恢复。修复命令通常是这样sudo dpkg --configure -a sudo apt-get -f install但要注意不要带着反正系统还能用的心态跳过这一步。如果你不恢复下一次更新会继续踩在同一块烂地上最终可能连apt-get install都进不去。3. 修复步骤让“更新时可用”从巧合变成受控行为3.1 修复前的快速止血如果线上服务还在用旧版本跑先不要急着把它干掉。第一步应该是让系统回到“可再更新”的状态确认是否还有 apt/dpkg 进程残留在后台ps aux | grep -E apt|dpkg | grep -v grep确认锁是否被残留进程占用sudo lslocks | grep -E dpkg|apt确认 dpkg 状态sudo dpkg --audit sudo apt-get check如果没有残留进程又确实需要恢复 dpkg 状态才考虑清理锁文件。这里我强调一下顺序先看进程再看锁最后才考虑删文件。在确认没有 dpkg 进程之后删掉残留锁文件的风险会小很多。但如果你是第一次处理拿不准建议先只跑dpkg --configure -a它会告诉你到底卡在哪一步。3.2 规范更新流程修复之后我把这台服务器的更新流程固定了下来。核心原则是更新前先确认环境干净更新中不要让其他包管理操作并发执行更新后必须做服务重启验证。实际执行的命令大致是这样sudo apt-get update sudo apt-get upgrade --no-install-recommends这里有一个容易被忽略的点--no-install-recommends可以让依赖树更小减少安装无关推荐包的概率降低升级过程中的资源占用和排查范围。如果是在生产环境我更倾向于分成两步sudo apt-get upgrade --dry-run sudo apt-get upgrade先看--dry-run列出这次会更新哪些包、会不会附带拉入新的内核、会不会有配置保留问题。确认之后再真正执行。3.3 让服务在更新后真正切换到新版本单纯执行完 apt 升级还不够。正如前面说的包管理替换的是磁盘上的文件不保证运行中的进程自动切换。所以修复流程里必须包含“服务版本核对”这一步。我这次的做法是先用ss -lntp找出当前监听端口的服务 PID。再用/proc/PID/exe判断进程是否还在旧文件上。如果还在旧文件先做配置检查再重启服务。以 Nginx 为例sudo nginx -t sudo systemctl restart nginx重启后重新看/proc/PID/exe确认新路径后面没有(deleted)。如果你用的是 systemd 管理的服务可以在 update 之后调用needrestart来检查哪些服务还停留在旧库。needrestart不是系统默认自带的需要根据发行版安装执行时它会对比运行中的进程和已经更新的库版本给出需要重启的服务列表。注意不要看到列表就直接needrestart -r a一把梭。生产服务最好先看日志再按依赖顺序重启尤其是数据库、消息队列这类有状态服务。4. 零中断更新到底怎么做4.1 包管理层面的最小化更新真正安全的“更新时还能继续使用”不是靠意外而是靠计划。包管理层面可以做的最小化更新是只更新修复安全漏洞的包不做大版本跨级升级。使用unattended-upgrades只开 security 源避免非安全更新在没人盯的时候引入行为变化。在升级前用apt-get changelog或 release notes 确认更新内容。如果你需要保证服务完全不中断可以先准备第二台实例新实例载入新版本然后通过负载均衡切换流量最后再处理旧实例。这是一种更可控的“继续使用”方案。4.2 服务层面的优雅重启有些服务支持优雅重启比如 Nginx、PHP-FPM、Gunicorn。这类服务在重启时会让新进程先接管监听 socket再让旧进程处理完手头请求后退出。这样外部的客户端几乎感觉不到中断。systemd 下可以使用systemctl reload做配置重载但 reload 不等于 restart。如果升级涉及二进制文件或主要依赖库reload 通常不够因为进程本身没换。判断标准是看/proc/PID/exe和ss -lntp里的 PID 是否变化。如果你维护的是自研服务可以考虑 systemd socket activation让 systemd 持有监听 socket服务进程重启后再接管。这样能减少连接断开窗口但对应用写法有要求不是所有程序都能直接套用。4.3 内核层面的热补丁方案如果更新内容包含内核很多人的第一反应是“更新完必须重启”。这是对的但也有一些生产环境会配合内核热补丁工具在不重启的情况下修补部分内核漏洞。这类工具通常由发行版或第三方服务商提供具体支持范围要以你的内核版本和厂商文档为准。这里要有一个边界认识热补丁能覆盖的安全问题有限不是一次万能重启替代。即使已经打了热补丁也建议在下一个计划维护窗口里安排一次实际重启把完整内核版本切换过去。不要因为系统“还能继续用”就无限期推迟重启。5. 更新后的状态验证清单5.1 命令级验证更新完成不等于更新成功。我先按这个顺序做命令级验证apt list --upgradable sudo apt-get check sudo dpkg --auditapt list --upgradable应该只显示你指定不更新的包或者直接没有输出。如果还有包显示可升级说明刚才的升级没跑完或者中间被锁冲突打断了。5.2 服务级验证对每个监听端口的服务做一次版本和进程核对检查项命令正常表现端口监听ss -lntp服务对应的 PID 存在且监听地址正确进程路径ls -l /proc/PID/exe末尾无(deleted)启动时间ps -o pid,lstart,cmd -p PID启动时间晚于升级时间日志journalctl -u service -n 50没有连续报错或启动失败记录如果服务的启动时间早于这次升级时间而且/proc/PID/exe后面带着(deleted)那就要人工重启服务。5.3 数据层面的验证处理完命令和进程再看数据面。Web 服务可以请求一次健康检查接口curl -I http://127.0.0.1/healthz数据库服务可以先执行一条只读查询确认能正常返回结果。如果升级涉及某个业务服务最好拿一条真实业务场景的最小用例跑一遍而不是只看端口通不通。端口通、健康检查过不等于业务逻辑全部正常这一点在升级核心依赖后尤其重要。6. 这次修复留下的几个重要边界和踩坑提醒6.1 什么时候不要“强制锁”排查过程中最容易犯的错是看到锁文件存在就顺手删掉。锁冲突不等于锁文件损坏很多时候是后台进程还在做事。如果你强行删除 dpkg 的锁可能出现两种后果一是另一个 apt 进程正在写数据库你删了锁会让第二个操作也进来数据库状态直接乱掉二是 dpkg 的事务中断在中间状态后续安装任何包都会卡在同一个位置。我给自己定的规矩是先确认没有 apt/dpkg 进程。再看锁是谁持有的。确认进程真的没了再考虑清理残留锁。清完之后立刻跑dpkg --audit和apt-get check验证。6.2 低配置机器不能照搬全部流程如果你在只有两核 CPU、2GB 内存的云服务器上操作不要把所有升级步骤都放在一个时间段全跑。低配置环境下apt-get upgrade本身会占不少 CPU 和磁盘 I/O如果这时候再叠加编译、备份、重启多个服务很可能因为内存不足触发 OOM反而把之前还正常的服务拖垮。低配环境的建议是先apt-get update再单独执行apt-get upgrade --download-only把包先下好。找一个低峰窗口执行实际安装。一次只重启一个关键服务确认恢复后再继续下一个。升级前看一眼磁盘剩余空间dpkg 在写大数据包时比平时更吃磁盘。6.3 生产环境还需要补充什么如果你维护的是线上业务尤其是带数据库或长连接的服务我只能说更新时“还能继续使用”不是一个可以靠运气维持的状态。生产环境还需要做三件额外的事更新前做备份或快照。数据库至少要做一次一致性备份或者确认从库能接管不然后续想回滚都没有立足点。把服务依赖关系理清楚。先升底层库再升应用包有状态服务和无状态服务要分开处理。建立回滚方案。不是说每次都能回滚但至少要记录当前版本、配置文件位置、数据库迁移到哪一步判断“出了事之后能不能回退”比直接动手升级更重要。这次经历给我最大的一个教训是当系统表现出“更新时还能继续使用”时不要急着发帖庆祝先确认这个“继续使用”是因为设计好还是因为锁没生效、进程没切换。前者是能力后者是故障前的信号。排查顺序无非就是先锁、再进程、再服务、再数据一步一步来很快就能把一次表面上的“灵异事件”变成可复现、可修复、可预防的日常运维问题。