【大模型入门】用大白话讲讲什么是蒸馏,量化,微调?
1. 蒸馏:老师的智慧,学生的速度
模型蒸馏(Model Distillation)最初由 Hinton 等人在2015年提出,其核心思想是通过模型缩减或知识迁移的方式,将一个复杂的大模型(教师模型)的知识传授给一个相对简单的小模型(学生模型)。
蒸馏的方式一般有如下两种:
(一)在教师模型上的结构拆解
我们知道大模型的结构特别复杂,一个大模型往往是由很多包括 注意力层,全连接层等不同的结构构成,简单的类比示意图如下图所示:

大家在测试过程中可能会发现,大模型即使在去掉结构C,只保留结构A,B,D仍然可以保持较好的性能,那新的学生模型就可以把结构C去掉,自然而然大模型的体积会小一些,如下图所示:

像上图一样我们对大模型的结构进行拆解或者改进,在保持大模型性能的基础上,去裁剪大模型的结构来缩小大模型的体积。
从上面的过程中我们可知,这种模型结构的调整一定是在你非常熟悉大模型结构的基础上进行的(一般都是开源大模型,因为开源大模型结构已知),需要很强的人工智能大模型基础能力,对调整者的要求极高,目前也作为一个独立的课题 模型剪枝 被广泛研究。
(二)知识迁移
模型蒸馏的另一种方式是知识迁移,核心思想是将一个复杂的大模型(教师模型)的知识传授给一个相对简单的小模型(学生模型),简单概括就是利用教师模型的预测概率分布作为软标签对学生模型进行训练,从而在保持较高预测性能的同时,极大地降低了模型的复杂性和计算资源需求,实现模型的轻量化和高效化。用示意图直观显示如下:

教师模型: 蒸馏模型的关键是选择参数大,能力强的模型,例如现在爆火的DeepSeek-R1/V3等,如果想训练具备推理能力的大模型,可以用DeepSeek-R1(生成带有think标签的数据), 如果想生成直接说明答案的大模型,可以使用DeepSeek-V3。
生成软标签: 这一部分通常学者们会使用不同种类的数据问题(比如数学类,金融类,计算机类等种种可以覆盖所有知识类别的数据集)输入教师模型得到结果,将结果和问题对应整理成数据集。
训练学生模型: 利用生成的数据集,对其它小模型进行有监督的全部参数的训练从而让小模型得到大模型的知识。
以上就是知识迁移的过程,这也是为什么DeepSeek-R1性能超出大家预期后,“眼馋”的美丽国人说DeepSeek-R1是利用了OpenAI-O1模型的知识进行蒸馏的,大家理性辨认~
(插个眼:笔者以后也会分享发布DeepSeek-R1的蒸馏教程,大家感兴趣可以关注一下哦)
2. 量化:从浮点到整数,轻装上阵
介绍完蒸馏接下来是“量化”大师。这位大师的绝招是“压缩”。大模型由不同的结构组成,不同结构的本质是浮点数矩阵,大模型的计算其实就是不同浮点数矩阵的运算。这些浮点数占用了大量的内存和计算资源。如图所示:

量化就是把浮点数的有效数字的位数进行缩小,举个形象的例子,圆周率我们可以用3.1415926535来表示,然而我们默认3.14也可以表示圆周率,存储3.1415926535要11位数字,存储3.14只需要3位数字,存储位数少了,存储模型的大小也自然小了。在大模型上就相当于把BP16,FP8的格式量化为INT4格式,减少有效位数。

不过量化是有一定缺点的,虽然模型变小了,计算速度也快了,但因为精度变小了,所以在面对一些复杂问题的时候,计算的误差变大,可能会影响一些复杂任务的表现。
3. 微调:小修小补,精益求精
最后我们来介绍微调,微调其实并不是对大模型结构的更改,它适用于如下的场景:大模型虽然强大,但它更多的是平均主义。在某些特定的领域比如法律领域,金融领域等特定的任务上表现一般。那么我们要提升它的表现,就需要使用专业领域的数据集对大模型进行进一步的学习,也就是“微调”。你可以把微调想象成给一辆豪车做改装。虽然车已经很好了,但为了适应不同的路况(任务),微调大师会对发动机(模型参数)进行一些调整,让车跑得更稳、更快。
微调可以分为如下三种:
- 全量参数微调,顾名思义就是对大模型的所有参数进行调整,效果较好,但消耗巨大,而且数据集小容易过拟合。适合你有大量的数据和计算资源的情况。
- 部分微调:冻结大模型部分结构的参数,只对特定结构参数进行修改,比如针对上面的大模型结构图,我们可以把结构A,B,C的参数全冻结,只改变结构D的参数使其来达到想要效果。适用于数据量有限或计算资源有限的情况。
- 适配器微调,在模型中插入小型适配器模块的方法。只把这些适配器模块在微调过程中进行训练,而预训练模型的参数保持不变。你可以把它想象成在车上加装一个小型插件,提升特定功能。拿 LORA 为例,如下图我们只对右侧 LORA全连接模块 进行参数调整,通过它与原始参数结合改变输出,但原始模型参数不会发生变化,适用于数据量有限或计算资源有限的情况。

总结:三位大师,各有所长
今天对大模型蒸馏,量化,微调的介绍就到这里啦。蒸馏大师擅长知识传递,量化大师精于压缩体积,微调大师则专注于精细调整。他们各有千秋,适合不同的场景。
- 如果你想要一个轻便的小模型,蒸馏和量化是不错的选择。
- 如果你需要模型在特定任务上表现更好,微调是你的不二之选。
当然,你也可以把这三位大师结合起来使用,打造一个既轻便又强大的模型。毕竟,谁不想拥有一个既聪明又灵活的AI助手呢?
那么,如何系统的去学习大模型LLM?
作为一名从业五年的资深大模型算法工程师,我经常会收到一些评论和私信,我是小白,学习大模型该从哪里入手呢?我自学没有方向怎么办?这个地方我不会啊。如果你也有类似的经历,一定要继续看下去!这些问题啊,也不是三言两语啊就能讲明白的。
所以我综合了大模型的所有知识点,给大家带来一套全网最全最细的大模型零基础教程。在做这套教程之前呢,我就曾放空大脑,以一个大模型小白的角度去重新解析它,采用基础知识和实战项目相结合的教学方式,历时3个月,终于完成了这样的课程,让你真正体会到什么是每一秒都在疯狂输出知识点。
由于篇幅有限,⚡️ 朋友们如果有需要全套 《2025全新制作的大模型全套资料》,扫码获取~
👉大模型学习指南+路线汇总👈
我们这套大模型资料呢,会从基础篇、进阶篇和项目实战篇等三大方面来讲解。

👉①.基础篇👈
基础篇里面包括了Python快速入门、AI开发环境搭建及提示词工程,带你学习大模型核心原理、prompt使用技巧、Transformer架构和预训练、SFT、RLHF等一些基础概念,用最易懂的方式带你入门大模型。
👉②.进阶篇👈
接下来是进阶篇,你将掌握RAG、Agent、Langchain、大模型微调和私有化部署,学习如何构建外挂知识库并和自己的企业相结合,学习如何使用langchain框架提高开发效率和代码质量、学习如何选择合适的基座模型并进行数据集的收集预处理以及具体的模型微调等等。
👉③.实战篇👈
实战篇会手把手带着大家练习企业级的落地项目(已脱敏),比如RAG医疗问答系统、Agent智能电商客服系统、数字人项目实战、教育行业智能助教等等,从而帮助大家更好的应对大模型时代的挑战。
👉④.福利篇👈
最后呢,会给大家一个小福利,课程视频中的所有素材,有搭建AI开发环境资料包,还有学习计划表,几十上百G素材、电子书和课件等等,只要你能想到的素材,我这里几乎都有。我已经全部上传到CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
相信我,这套大模型系统教程将会是全网最齐全 最易懂的小白专用课!!
更多推荐




所有评论(0)