大模型的部署和lora微调,以Qwenx:xxB为例(未完成)
大模型部署
使用ollama部署
使用ollama部署Qwen3:0.6B。使用HTTP接入AGENT部署。(但是模型台太小跑不起来)
参数和不同的量化模式
介绍一下不同的量化模式,不同的格式
下载非量化的原始模型 用pytorch的方式调用
优化总体步骤
我们以Qwenx:xxB为例,它支持非常多的语言,但是我们实际用不到,且白白浪费空间和性能。 因此尝试去除不需要的语言的词汇,引入一些需要领域的词汇作为词表,然后微调模型让它更好的发挥性能。
- 去除不需要的词汇
- 加入新增词汇(使用相近含义的词汇加权得出)
- 使用lora训练词汇参数和层参数
- 使用数据集验证训练结果
总结
刚接触还不熟悉