赞
踩
在过去的一年里,大型语言模型(llm)有了飞速的发展,在本文中,我们将探讨几种(量化)的方式,除此以外,还会介绍分片及不同的保存和压缩策略。
说明:每次加载LLM示例后,建议清除缓存,以防止出现OutOfMemory错误。
del model, tokenizer, pipe
import torch
torch.cuda.empty_cache()
如果在jupyter中无法释放显存,请重启这个jupyter notebook。
加载LLM的最直接、最普通的方式是通过
Copyright © 2003-2013 www.wpsshop.cn 版权所有,并保留所有权利。