分类

人工智能Agent

RuntimeError: CUDA out of memory occurred when warming up sampler with 64 dummy requests——Qwen2.5-VL 3B 比 7B 更吃显存?vLLM 多模态模型 OOM 反直觉排障指南

RuntimeError: CUDA out of memory occurred when warming up sampler with 64 dummy requests——Qwen2.5-VL 3B 比 7B 更吃显存?vLLM 多模态模型 OOM 反直觉排障指南

本文案例来自 vLLM 官方 GitHub Issues(#22719#14150),适配至国内部署环境后验证。

TL;DR

用 vLLM 部署 Qwen2.5-VL 视觉大模型,3B 版...

67 0
发现更多