Skip to content

知识蒸馏 · 技术问答

用法:先口述 60–90 秒,再对照要点。加分句选 1 句。原理细节看 蒸馏知识点。应用侧微调和 LoRA 看 微调面试题

必会

重点 蒸馏的本质是什么?为什么不只说「大模型压成小模型」?

答题要点

  • 更准的说法是知识迁移:让小模型学会大模型已经掌握的判断,压缩是常见结果,不是本质。
  • 没有 Teacher 也能直接用硬标签训小模型,那是压缩思路;蒸馏多出来的价值,是用 Teacher 的输出当更丰富的监督。
  • 工程动机仍是参数少、延迟低、能部署;面试要先说「迁什么」,再说「体积变小」。

加分句:压缩是手段,迁移是本质。只谈参数量,没说清学生学的是决策边界。


重点 蒸馏里软标签、硬标签、温度 T?

答题要点

  • 硬标签:one-hot 标准答案,只告诉「正确类是谁」。
  • 软标签:Teacher 的概率分布,带类间相似度(猫 0.8 / 狗 0.15 / 鸟 0.05)。多出来的那部分叫暗知识。
  • 温度 T:softmax(z / T)。T 越大分布越平,暗知识露得越多。训练常用 3~10,推理回到 T=1。
  • 总损失常是硬标签损失和软标签损失加权,学生既要对标准答案,也要学 Teacher 的分布。

加分句:软标签信息量更大。T 只在蒸馏训练时拉高,上线推理不要用高温。


重点 教师-学生怎么选?参数比离谱怎么办?

答题要点

  • Teacher 尽量强,但要算造数 / API 账;闭源贵就少而精。
  • Student 按部署选:端侧 1.5B~3B,服务器 7B~14B,高性能 32B+。
  • 师生参数比常见 4:1~10:1。跨太大(例如几十倍)学生学不动,就渐进蒸馏,中间加跳板。
  • 开源 Teacher 可自己跑;闭源 Teacher 原则变成「够强 + 造得起」。

加分句:先定学生要部署在哪,再反推 Teacher 和要不要分跳。


重点 怎么把大模型推理能力迁到小模型?

答题要点

  • 大模型时代常见 API 蒸馏:Teacher 对难题生成带完整思维链的答案,学生做 SFT,学的是解题轨迹,不只最终数字。
  • 和经典 KD 的差别:不一定要在线对齐 logits,常先离线造「带推理的数据」再监督微调。
  • 测试时可做预算强制:插入结束思考 token 强制作答,或追加 Wait 再想一步。这是测时技巧,不是训练本身。
  • 另一条线是 Instruct 底座 + GRPO:数据集可以没有现成 <reasoning>,靠格式奖励逼模型把推理写出来。要和「R1 产数据再 SFT」分清。

加分句:迁推理能力,迁的是过程,不是只迁最终答案。


了解

s1 和 R1-Distill 差在哪?

答题要点

  • s1:用强 Teacher API 造少量带推理的数据(量级 1K),SFT 一条学生,证明低成本也能出推理样;测时可用 Budget Forcing。
  • R1-Distill:自家 Teacher 产更大规模数据,SFT 出多个学生规格,部分再 GRPO。
  • 面试别把论文设置说成自己训的。

加分句:s1 是低成本证明;R1-Distill 是按部署档铺产品线。