128GB DDR4跑35B大模型!90分钟就烧坏一根、9天后第二根又告急

电科技9月30日消息,海外用户Future_Fuel_8425分享了一段自己本地跑大模型的经历,其在一台搭载128GB DDR4 ECC内存的工作站上运行35B参数大模型Ornith-1.5-35B-A3B,仅90分钟后就烧坏了一根DDR4内存条,8至9天后第二根也开始报错。

该用户使用的是2019年款ThinkStation P920,配备双路至强处理器和128GB DDR4 ECC内存(16根8GB内存条),显卡为RTX 5070 Ti 16GB。

此前半年该用户一直运行20B及以下的小模型,全部装在显存中,即使长时间高负载运行也没出过问题。

这次因数据库任务需要更大模型,切换到35B的Ornith-1.5后,模型部分溢出到系统内存,90分钟后系统崩溃,日志显示第8插槽的内存条ECC错误堆积,拔掉该内存条后恢复正常。

没想到继续重度使用8至9天后,日志显示另一根内存条也即将失效。

用户强调温度不是问题,CPU从未超过80°C,GPU很少超过65°C,还配备了辅助散热,所有内存条均为同一批次匹配条,推测只是老化严重,经不住长时间高强度的连续读取。

不过用户只提到了CPU和GPU温度,并未展示内存温度数据,消费级内存本就不是为长时间连续顺序读取设计的,DDR4的老化和持续高负载叠加,加上内存条本身散热条件有限,很可能是内存损坏的真实原因。

128GB DDR4跑35B大模型!90分钟就烧坏一根、9天后第二根又告急

给TA打赏
共{{data.count}}人
人已打赏
CPU电脑

Intel下代Nova Lake离发布又近一步!USB4 80Gbps+PCIe 5.0确认

2026-9-30 7:30:57

电脑电脑系统

微软确认WSL 3不存在!最新WSL Containers干掉Docker

2026-6-29 15:42:59

0 条回复 A文章作者 M管理员
    暂无讨论,说说你的看法吧
❯
个人中心
购物车
优惠劵
今日签到
有新私信 私信列表
搜索