电科技9月30日消息,海外用户Future_Fuel_8425分享了一段自己本地跑大模型的经历,其在一台搭载128GB DDR4 ECC内存的工作站上运行35B参数大模型Ornith-1.5-35B-A3B,仅90分钟后就烧坏了一根DDR4内存条,8至9天后第二根也开始报错。
该用户使用的是2019年款ThinkStation P920,配备双路至强处理器和128GB DDR4 ECC内存(16根8GB内存条),显卡为RTX 5070 Ti 16GB。
此前半年该用户一直运行20B及以下的小模型,全部装在显存中,即使长时间高负载运行也没出过问题。
这次因数据库任务需要更大模型,切换到35B的Ornith-1.5后,模型部分溢出到系统内存,90分钟后系统崩溃,日志显示第8插槽的内存条ECC错误堆积,拔掉该内存条后恢复正常。
没想到继续重度使用8至9天后,日志显示另一根内存条也即将失效。
用户强调温度不是问题,CPU从未超过80°C,GPU很少超过65°C,还配备了辅助散热,所有内存条均为同一批次匹配条,推测只是老化严重,经不住长时间高强度的连续读取。
不过用户只提到了CPU和GPU温度,并未展示内存温度数据,消费级内存本就不是为长时间连续顺序读取设计的,DDR4的老化和持续高负载叠加,加上内存条本身散热条件有限,很可能是内存损坏的真实原因。

