Skip to content

大模型的部署和lora微调,以Qwenx:xxB为例(未完成)

大模型部署

使用ollama部署

使用ollama部署Qwen3:0.6B。使用HTTP接入AGENT部署。(但是模型台太小跑不起来)

参数和不同的量化模式

介绍一下不同的量化模式,不同的格式

下载非量化的原始模型 用pytorch的方式调用

优化总体步骤

我们以Qwenx:xxB为例,它支持非常多的语言,但是我们实际用不到,且白白浪费空间和性能。 因此尝试去除不需要的语言的词汇,引入一些需要领域的词汇作为词表,然后微调模型让它更好的发挥性能。

  1. 去除不需要的词汇
  2. 加入新增词汇(使用相近含义的词汇加权得出)
  3. 使用lora训练词汇参数和层参数
  4. 使用数据集验证训练结果

总结

刚接触还不熟悉