英伟达新论文:LLM 间可复用提示词缓存
英伟达新论文提出,一个 LLM 可通过简单的线性转换器复用另一模型的提示词缓存,无需重新处理整个提示词。该方法从 500 条校准序列学习,无需反向传播,在 Qwen3、Llama 3.1 和 Ministral 3 的 6 组模型对上,4 组保留了目标模型 73% 至 98% 的基准准确率,转换速度提升 2.7 至 25 倍。
ai
英伟达新论文提出,一个 LLM 可通过简单的线性转换器复用另一模型的提示词缓存,无需重新处理整个提示词。该方法从 500 条校准序列学习,无需反向传播,在 Qwen3、Llama 3.1 和 Ministral 3 的 6 组模型对上,4 组保留了目标模型 73% 至 98% 的基准准确率,转换速度提升 2.7 至 25 倍。