跳到正文
原文
XDA Developers· Anurag Singh·· 4 小时前AI 评分57

本地LLM会为未使用的上下文占用内存,降低上下文窗口可释放资源

Your local LLM is quietly wasting RAM on context you never use, and one setting gives it back

AI 导读

本地LLM配置的上下文窗口远超实际提示词与回复长度时,未使用的容量仍会通过KV cache占用额外内存。Ollama以及通过LM Studio的llama.cpp引擎运行的GGUF模型都存在这一问题,可将上下文窗口调低以释放内存。

来源:XDA Developers · xda-developers.com