作者

admin

RuntimeError: CUDA out of memory occurred when warming up sampler with 64 dummy requests——Qwen2.5-VL 3B 比 7B 更吃显存?vLLM 多模态模型 OOM 反直觉排障指南

RuntimeError: CUDA out of memory occurred when warming up sampler with 64 dummy requests——Qwen2.5-VL 3B 比 7B 更吃显存?vLLM 多模态模型 OOM 反直觉排障指南

本文案例来自 vLLM 官方 GitHub Issues(#22719#14150),适配至国内部署环境后验证。

TL;DR

用 vLLM 部署 Qwen2.5-VL 视觉大模型,3B 版...

67 0
kswapd0 吃满 100% CPU,free -h 却显示 available 还有 100GB+——Linux NUMA zone_reclaim_mode 引发的 direct reclaim 风暴:内核代码级根因与解决方案

kswapd0 吃满 100% CPU,free -h 却显示 available 还有 100GB+——Linux NUMA zone_reclaim_mode 引发的 direct reclaim 风暴:内核代码级根因与解决方案

搬运并适配自国外社区真实案例、LWN.net 内核开发讨论及 Red Hat 知识库。原文出处见文末。

TL;DR

在双路/多路 NUMA 服务器上,如果 vm.zone_reclaim_m...

84 0
发现更多