本文摘要上海交大《动手学大模型》系列之4-数学推理如何让大模型学会数学推理?让我们快速蒸馏一个迷你 R1!本章导览项目内容项目主页https://github.com/Lordog/dive-into-llms本章目录https://github.com/Lordog/dive-into-llms/tree/main/documents/chapter4课件 PDFmath.pdf(见文末附件下载)可运行...
上海交大《动手学大模型》系列之4-数学推理
如何让大模型学会数学推理?让我们快速蒸馏一个迷你 R1!
本章导览
| 项目 | 内容 |
|---|---|
| 项目主页 | https://github.com/Lordog/dive-into-llms |
| 本章目录 | https://github.com/Lordog/dive-into-llms/tree/main/documents/chapter4 |
| 课件 PDF | math.pdf(见文末附件下载) |
| 可运行代码 | sft_math.ipynb(见文末附件下载) |
| 教程原文 | README.md |
教程正文
LLM数学推理
本项目实现了让大规模语言模型(LLM)学习数学推理的代码,主要技术为使用Supervised Finetuning(SFT)来让模型学习DeepSeek-R1生成的回复,从中学习复杂的数学推理技能(如反思、验算等)。
本实验基于DeepMath-103K数据集以及Qwen/Qwen2.5-Math-1.5B模型,带领读者初步尝试在数学任务上的数据蒸馏全流程。
实验目的
- 了解数学相关的数据集的清理和预处理
- 了解微调大模型的基本方法
- 了解使用大模型进行推理的基本方法
- 了解评测模型数学能力的基本方法
环境要求
- Python 3.8+
- PyTorch
- Transformers
- Datasets
- vllm
- 至少40GB显存的GPU
实验文档
打开Jupyter notebook:
jupyter notebook sft_math.ipynbnotebook包含几个主要部分:
- 数据集下载以及预处理
- 模型加载、训练
- 模型生成、评测
- 具体操作和说明请参考notebook。
输出文件
训练过程会产生训练的checkpoint文件,生成完成后会保存生成结果。
注意事项
- 模型和数据需要从huggingface加载,国内可以通过https://hf-mirror.com 镜像进行下载。
- 确保有足够的磁盘空间保存原始模型文件、数据文件以及训练后的checkpoint(请预留至少50GB空间)
- 需要使用至少40GB显存的GPU显卡
本章附件
| 文件 | 类型 | 说明 | 下载 |
|---|---|---|---|
| math.pdf | PDF 课件 | 本章完整讲义幻灯片 | 点击下载 |
| chapter4_scripts.zip | ZIP 源码包 | 本章教程 README + Jupyter Notebook | 点击下载 |
提示:附件托管于海外站点,若因网络原因下载缓慢或失败,请联系站长转存。
返回总介绍:上海交大《动手学大模型》系列(总介绍)
觉得内容不错?我要