|
查看: 15|回复: 0
|
[相关教程]
本地跑Llama3-70B量化版:消费级显卡用llama.cpp跑通完整教程
[复制链接]
|

UID2
贡献9 点
钻石7 个
C币993 个
|

折腾了三天终于在一张RTX 3090上把Llama3-70B跑起来了,记录一下过程给想省API钱的兄弟们参考。
70B模型全精度要140G显存,消费级显卡肯定装不下。用llama.cpp的GGUF格式Q4_K_M量化,模型文件压到了40G左右。3090有24G显存,全装进显存不够,llama.cpp支持部分卸载到内存,设n_gpu_layers为40左右,速度大概每秒4到5个token,凑合能用。
具体步骤:先拉模型,HuggingFace上搜Meta-Llama-3-70B-Instruct-GGUF,选Q4_K_M的文件,大概40G。下完之后编llama.cpp,clone下来make一下就行。跑的时候命令是这个:
./main -m llama-3-70b-instruct-q4_k_m.gguf -p 你的问题 -n 512 -t 8 -gqa -ngl 40 -c 4096
ngl 40是往显存里放40层,剩下的走内存。t是CPU线程数,gqa是Llama3需要的分组注意力的参数。上下文窗口c设4096,太大会爆显存。
跑起来之后CPU占用百分之七十多,GPU占用百分之九十。生成速度4.5 token每秒,比调API慢但不用花钱。如果你有两张3090或者用4090 24G,可以ngl拉到60以上,速度能到8到10 token每秒,体验就好很多了。 |
温馨提示:
1、在论坛里发表的文章仅代表作者本人的观点,与本网站立场无关。
2、论坛的所有内容都不保证其准确性,有效性,时间性。阅读本站内容因误导等因素而造成的损失本站不承担连带责任。
3、当政府机关依照法定程序要求披露信息时,论坛均得免责。
4、若因线路及非本站所能控制范围的故障导致暂停服务期间造成的一切不便与损失,论坛不负任何责任。
5、注册会员通过任何手段和方法针对论坛进行破坏,我们有权对其行为作出处理。并保留进一步追究其责任的权利。
6、网络世界也请遵守我国的法律法规!一旦发现违法行为,将立即封存相关信息并报警处理!
|
|
|
|
|
|
|
|
温馨提示:
1、在论坛里发表的文章仅代表作者本人的观点,与本网站立场无关。
2、论坛的所有内容都不保证其准确性,有效性,时间性。阅读本站内容因误导等因素而造成的损失本站不承担连带责任。
3、当政府机关依照法定程序要求披露信息时,论坛均得免责。
4、若因线路及非本站所能控制范围的故障导致暂停服务期间造成的一切不便与损失,论坛不负任何责任。
5、注册会员通过任何手段和方法针对论坛进行破坏,我们有权对其行为作出处理。并保留进一步追究其责任的权利。
6、网络世界也请遵守我国的法律法规!一旦发现违法行为,将立即封存相关信息并报警处理!