ollama 针对deepseek 设置系统变量
变量名 推荐值 作用说明
OLLAMA_GPU_LAYERS 35-40 控制加载到GPU的模型层数。14B模型约40-50层,16GB显存建议35-40层
OLLAMA_GPU_MEMORY_LIMIT 14336(14GB) GPU显存使用上限。为系统保留2GB,避免显存溢出
OLLAMA_NUM_CTX 4096 上下文长度。降低此值可减少KV缓存占用
OLLAMA_MAX_BATCH_SIZE 512 批处理大小。适中值平衡速度和内存
OLLAMA_KV_CACHE_QUANTIZE true 启用KV缓存量化,可节省约2GB显存
OLLAMA_USE_MMAP 1 启用内存映射,加速模型加载 变量名 当前值 问题 建议值
OLLAMA_MAX_LOADED_MODELS 2 同时加载2个模型占用更多内存 1(只运行14B模型)
OLLAMA_KEEP_ALIVE 10 10分钟保持时间可能占用内存 5(减少到5分钟)
OLLAMA_GPU_OVERHEAD 0 可能过于激进,不留缓冲 512(预留512MB缓冲)
变量名 当前值 分析 建议
CUDA_VISIBLE_DEVICES 0 指定使用第一个GPU ✅ 保留,正确
OLLAMA_FLASH_ATTENTION 1 启用Flash Attention加速 ✅ 保留,提升性能
OLLAMA_ORIGINS * 允许所有跨域请求 ✅ 保留,局域网调用需要 需要避免设置的变量
变量名 避免原因 错误示例
OLLAMA_CPU_ONLY 设为1会强制禁用GPU,纯CPU运行
OLLAMA_CPU_ONLY=1 过高的
OLLAMA_GPU_LAYERS 超过40可能导致显存溢出
OLLAMA_GPU_LAYERS=50 过大的
OLLAMA_NUM_CTX 增加KV缓存占用,14B模型建议≤8192
OLLAMA_NUM_CTX=32768 OLLAMA_NUM_GPU 旧参数,已被OLLAMA_GPU_LAYERS取代 OLLAMA_NUM_GPU=999
变量名 | 设置值 | 作用 |
|---|---|---|
OLLAMA_GPU_LAYERS |
| 关键! 强制使用CUDA GPU加速 |
CUDA_VISIBLE_DEVICES |
| 指定使用第一个GPU |
OLLAMA_FLASH_ATTENTION |
| 启用Flash Attention加速 |
OLLAMA_MAX_LOADED_MODELS |
| 只加载一个模型 |
OLLAMA_KEEP_ALIVE |
| 禁用保持连接,释放内存 |