SSD使用一段时间后突然出现读写速度下降,表现可能是文件复制速度从几百MB/s突然掉到几十MB/s,也可能是系统启动、软件加载和文件操作明显变慢。遇到这种情况,不应该立即认定SSD已经损坏。
SSD性能下降可能来自温度保护、缓存耗尽、剩余空间不足、后台大量I/O、固件问题、NAND磨损、连接链路降速,甚至可能是测试方法本身造成的结果。特别是一些消费级SSD使用动态SLC缓存,连续写入超过缓存容量以后,写入速度出现明显下降并不一定代表硬件故障。
因此,排查SSD异常的第一步,是先确定“慢”到底发生在哪里。
一、先确认SSD是真的变慢了
Windows中可以先打开任务管理器,进入“性能”查看磁盘活动情况,再通过资源监视器观察具体进程产生的磁盘I/O。
如果系统正在进行Windows更新、杀毒软件扫描、云同步、文件索引、游戏更新或者大型文件解压,即使SSD本身没有任何问题,磁盘活动也可能达到很高水平。
还需要区分顺序读写和随机读写。
大型文件连续复制测试出来的是顺序吞吐,而操作系统启动程序、数据库、小文件读取等场景更依赖随机I/O和访问延迟。因此,一次简单的文件复制速度不能代表SSD整体性能。
如果需要进行基准测试,应该使用固定测试条件,并比较同一软件、同一测试项目下的结果。不要拿厂商标称的最大顺序读取速度与日常文件操作速度直接比较。
二、温度过高可能导致SSD主动降速
SSD控制器和NAND闪存工作时都会产生热量,NVMe SSD尤其明显。高速PCIe SSD在持续读写时,控制器可能达到较高温度。
当控制器达到特定温度阈值后,SSD固件可以主动降低性能,以控制温度。这种机制通常被称为 thermal throttling,也就是热降速。
但不存在适用于所有SSD的“100℃才降速”或者“120℃才降速”的统一标准。
不同品牌、控制器、固件以及SSD设计的温度传感器和保护策略可能不同。部分SSD在更低温度下就可能开始调整性能,因此判断温度问题应该优先参考SSD制造商提供的规格。
可以使用CrystalDiskInfo、厂商管理软件或者硬件监控工具观察SSD温度。更重要的是观察性能下降是否与持续高负载同时发生。
例如,电脑刚开机时复制速度正常,连续写入几十GB以后速度逐渐下降,同时SSD温度明显升高,那么温度和动态缓存耗尽都值得检查。
如果停止高负载,让SSD冷却后性能恢复,则热因素的可能性进一步增加。
三、不要把所有速度下降都归咎于SSD磨损
SSD使用时间增加后,NAND闪存会发生磨损,但“用了几年所以速度一定明显下降”并不是可靠判断。
SSD的寿命与写入量、NAND类型、控制器、预留空间、工作温度以及使用方式有关。很多SSD在达到厂商标称写入耐久度之前,性能仍然可以保持在正常范围。
可以通过CrystalDiskInfo或者SSD厂商自己的管理软件读取SMART/NVMe健康信息。
NVMe SSD通常可能提供 Percentage Used、Available Spare、Critical Warning 等健康相关字段,但这些字段必须结合具体标准和厂商定义理解。
Percentage Used 表示的是设备对预期寿命消耗程度的估计,并不是“百分之百就是当天坏掉”。Available Spare 也不是一个所有SSD都采用相同解释方式的简单剩余寿命百分比。
因此,“Available Spare低于5%就是寿命终点”或者“Percentage Used超过80%就必须更换”的说法过于绝对。
如果SMART已经出现 Critical Warning、介质错误、不可恢复错误或者厂商工具明确报告健康异常,则应该提高警惕,并优先备份数据。
四、SSD剩余空间不足确实可能影响性能
SSD不能简单按照“剩余空间超过10%就安全”来判断性能。
很多现代SSD会利用动态SLC缓存、垃圾回收、磨损均衡和内部预留空间管理数据。当可用空间越来越少时,控制器处理空闲块的余地可能下降,持续写入性能也可能受到影响。
但影响程度取决于SSD型号和工作负载。
对于经常进行大型文件写入、视频编辑、虚拟机或者数据库操作的SSD,保持一定的空闲空间通常是比较好的使用习惯。空闲空间越充足,控制器通常越容易进行后台垃圾回收和数据整理。
不过,“低于10%一定明显掉速”并不是所有SSD都成立的工程标准。
如果SSD已经接近满盘,可以先删除或移动不必要的数据,然后重新测试性能。如果速度明显恢复,剩余空间就是值得关注的因素。
五、动态SLC缓存耗尽是很多人容易误判的原因
消费级SSD经常使用一部分NAND空间模拟SLC缓存,以提高短时间写入性能。
例如SSD刚开始写入大型文件时可能达到数GB/s,但连续写入超过缓存容量后,速度可能明显下降。
这并不意味着SSD突然坏了。
缓存大小还可能随着剩余容量和SSD工作状态动态变化。因此,同一块SSD在空盘、半满和接近满盘状态下进行长时间连续写入,结果可能并不一样。
如果问题只出现在持续写入几十GB甚至数百GB之后,而普通日常使用速度正常,就应该优先考虑缓存行为、温度以及垃圾回收,而不是马上认定NAND已经损坏。
六、接口和PCIe链路确实值得检查
SSD突然变慢,还需要检查实际连接的接口速度。
SATA SSD的理论接口上限受到SATA链路规格限制。如果SSD连接到较老的SATA接口,最高传输速度可能受到限制。
NVMe SSD则需要检查PCIe代际和实际链路宽度。
例如一块PCIe 4.0 NVMe SSD插入只能提供PCIe 3.0的M.2插槽,通常仍然可以工作,但链路会按照较低规格运行,性能上限因此下降。PCIe通常具有向下兼容特性,所以不能简单说“PCIe 3.0主板不支持PCIe 4.0 SSD”。
更值得检查的是实际链路状态。
如果原本能够以PCIe 4.0 x4运行,后来因为BIOS设置、插槽共享、硬件接触或者平台限制变成PCIe 3.0 x4,甚至PCIe x2,那么高速SSD的性能可能明显下降。
很多主板还存在M.2插槽与CPU PCIe通道、芯片组通道或者其他扩展插槽共享的问题。使用说明书可以确认具体插槽支持的PCIe代际和通道数量。
七、SATA连接问题不一定表现为单纯降速
对于SATA SSD,可以检查SATA数据线、电源连接以及主板端口。
如果数据线、接口或者控制器存在通信问题,系统日志中可能出现I/O错误、设备重置或者链接相关错误。
这类问题与单纯的SSD性能下降不同。
如果更换SATA数据线或者主板SATA端口后问题消失,就需要继续调查原来的线缆或者端口,而不是直接更换SSD。
至于AHCI和RAID,也不能简单说“RAID模式一定影响性能”。现代主板可能通过不同存储控制模式管理SATA设备,实际行为取决于主板、驱动以及系统配置。除非确认系统需要改变控制模式,否则不要为了测试速度随意修改BIOS中的存储控制器模式,否则可能导致Windows无法正常启动。
八、固件和驱动同样可能造成异常
SSD控制器依靠固件管理NAND、缓存、垃圾回收、磨损均衡和错误处理。如果某个SSD型号存在已知固件问题,更新固件可能解决性能或者稳定性异常。
但固件更新存在风险。
更新之前应该完成重要数据备份,并使用SSD厂商提供的官方工具和固件。
Windows存储驱动、主板芯片组驱动和BIOS也可能影响PCIe NVMe设备的识别和运行状态。因此,如果SSD是在系统更新、BIOS升级或者更换硬件之后突然出现问题,也应该把软件和平台变化纳入排查范围。
九、TRIM和文件系统也值得检查
SSD不需要像传统机械硬盘那样进行常规碎片整理。
Windows会针对SSD采用适合固态存储的优化方式,其中包括TRIM。TRIM可以让操作系统告诉SSD哪些数据块已经不再使用,使SSD控制器能够在后续垃圾回收过程中更有效地管理空间。
因此,不应该把传统意义上的“磁盘碎片整理”当作解决SSD性能问题的主要办法。
如果系统的存储优化机制出现异常,可以检查Windows的“优化驱动器”功能以及文件系统状态。
至于文件碎片化,也不能简单断言“exFAT碎片化一定导致SSD读取效率明显下降”。实际影响与文件大小、访问方式、文件系统以及工作负载有关。
十、什么时候应该怀疑SSD正在坏掉
如果SSD突然出现速度异常,同时伴随系统冻结、文件损坏、应用程序频繁报错、SMART错误、NVMe Critical Warning、I/O错误或者设备间歇性消失,那么问题就不应该继续停留在“性能优化”层面。
这时最重要的事情是先备份数据。
如果SSD已经出现明显错误,反复进行大量基准测试并不能修复硬件,反而会增加写入量。
如果数据非常重要,也不应该首先尝试格式化、Secure Erase或者各种所谓“SSD修复工具”。
对于仍然能够读取的数据,应优先完成备份;如果设备已经出现严重读取错误,则应该考虑专业的数据恢复方案。
十一、一个更可靠的排查顺序
SSD突然变慢,可以按照这样的顺序检查。
先确认是不是后台程序正在产生大量I/O;然后测试实际读写性能,区分顺序和随机性能;接着观察SSD温度,判断是否存在热降速;检查剩余容量和动态SLC缓存行为;随后读取SMART或NVMe健康数据;再检查SATA连接或者NVMe的PCIe实际链路速度;最后检查SSD固件、主板BIOS、芯片组驱动和Windows存储状态。
如果SSD出现错误日志或者健康状态异常,则优先备份,而不是继续折腾性能。
SSD性能异常的判断不能依靠一个温度数字、一项SMART指标或者一次测速结果。
同样是“复制文件速度从2GB/s降到500MB/s”,原因可能是缓存耗尽;从2GB/s突然长期只能跑几百MB/s,可能是PCIe链路降级;持续负载后速度下降并伴随高温,可能与热降速有关;如果同时出现I/O错误和设备消失,则应该优先怀疑硬件或者连接稳定性。
对普通用户来说,最有价值的信息不是某个软件显示的“健康度百分比”,而是温度、实际链路、剩余空间、SMART错误、后台I/O以及性能变化之间是否能够形成一条完整的因果关系。
只有把这些因素结合起来,才能判断SSD到底是在正常工作范围内降速,还是已经出现了需要更换硬件的故障。
SSD突然变得非常慢,从温度、健康状态到接口逐项检查硬件原因
喜欢这篇报道?
使用下面的功能,方便以后继续阅读和分享 MNewsTV
关于文章收藏
收藏不需要注册帐号,收藏信息仅保存在当前浏览器中。
删除收藏请进入「我的收藏」进行管理。
分享 Facebook | X | WhatsApp | LinkedIn
捐助(Paypal): https://www.paypal.me/observeccp 订阅中国观察电报 Telegram : https://t.me/s/ObserveCCP