当前位置:首页 > DeepSeek

ollama 针对deepseek 设置系统变量

老徐3个月前 (04-23)DeepSeek76

变量名 推荐值 作用说明 

OLLAMA_GPU_LAYERS 35-40  控制加载到GPU的模型层数。14B模型约40-50层,16GB显存建议35-40层 

OLLAMA_GPU_MEMORY_LIMIT 14336(14GB) GPU显存使用上限。为系统保留2GB,避免显存溢出 

OLLAMA_NUM_CTX 4096 上下文长度。降低此值可减少KV缓存占用 

OLLAMA_MAX_BATCH_SIZE 512 批处理大小。适中值平衡速度和内存 

OLLAMA_KV_CACHE_QUANTIZE true 启用KV缓存量化,可节省约2GB显存 

OLLAMA_USE_MMAP 1 启用内存映射,加速模型加载 变量名 当前值 问题 建议值 

OLLAMA_MAX_LOADED_MODELS 2 同时加载2个模型占用更多内存 1(只运行14B模型) 

OLLAMA_KEEP_ALIVE 10 10分钟保持时间可能占用内存 5(减少到5分钟) 

OLLAMA_GPU_OVERHEAD 0 可能过于激进,不留缓冲 512(预留512MB缓冲) 

 变量名 当前值 分析 建议 

CUDA_VISIBLE_DEVICES 0 指定使用第一个GPU ✅ 保留,正确 

OLLAMA_FLASH_ATTENTION 1 启用Flash Attention加速 ✅ 保留,提升性能 

OLLAMA_ORIGINS * 允许所有跨域请求 ✅ 保留,局域网调用需要 需要避免设置的变量 

变量名 避免原因 错误示例 

OLLAMA_CPU_ONLY 设为1会强制禁用GPU,纯CPU运行

OLLAMA_CPU_ONLY=1 过高的

OLLAMA_GPU_LAYERS 超过40可能导致显存溢出

OLLAMA_GPU_LAYERS=50 过大的

OLLAMA_NUM_CTX 增加KV缓存占用,14B模型建议≤8192

OLLAMA_NUM_CTX=32768 OLLAMA_NUM_GPU 旧参数,已被OLLAMA_GPU_LAYERS取代 OLLAMA_NUM_GPU=999



变量名

设置值

作用

OLLAMA_GPU_LAYERS

cuda

关键! 强制使用CUDA GPU加速

CUDA_VISIBLE_DEVICES

0

指定使用第一个GPU

OLLAMA_FLASH_ATTENTION

1

启用Flash Attention加速

OLLAMA_MAX_LOADED_MODELS

1

只加载一个模型

OLLAMA_KEEP_ALIVE

-1

禁用保持连接,释放内存