上海交大《动手学大模型》系列之4-数学推理

本文摘要上海交大《动手学大模型》系列之4-数学推理如何让大模型学会数学推理?让我们快速蒸馏一个迷你 R1!本章导览项目内容项目主页https://github.com/Lordog/dive-into-llms本章目录https://github.com/Lordog/dive-into-llms/tree/main/documents/chapter4课件 PDFmath.pdf(见文末附件下载)可运行...

上海交大《动手学大模型》系列之4-数学推理

如何让大模型学会数学推理?让我们快速蒸馏一个迷你 R1!

本章导览

项目内容
项目主页https://github.com/Lordog/dive-into-llms
本章目录https://github.com/Lordog/dive-into-llms/tree/main/documents/chapter4
课件 PDFmath.pdf(见文末附件下载)
可运行代码sft_math.ipynb(见文末附件下载)
教程原文README.md

教程正文

LLM数学推理

本项目实现了让大规模语言模型(LLM)学习数学推理的代码,主要技术为使用Supervised Finetuning(SFT)来让模型学习DeepSeek-R1生成的回复,从中学习复杂的数学推理技能(如反思、验算等)。
本实验基于DeepMath-103K数据集以及Qwen/Qwen2.5-Math-1.5B模型,带领读者初步尝试在数学任务上的数据蒸馏全流程。

实验目的

  • 了解数学相关的数据集的清理和预处理
  • 了解微调大模型的基本方法
  • 了解使用大模型进行推理的基本方法
  • 了解评测模型数学能力的基本方法

环境要求

  • Python 3.8+
  • PyTorch
  • Transformers
  • Datasets
  • vllm
  • 至少40GB显存的GPU

实验文档

  1. 打开Jupyter notebook:

    jupyter notebook sft_math.ipynb
  2. notebook包含几个主要部分:

    • 数据集下载以及预处理
    • 模型加载、训练
    • 模型生成、评测
  3. 具体操作和说明请参考notebook。

输出文件

训练过程会产生训练的checkpoint文件,生成完成后会保存生成结果。

注意事项

  • 模型和数据需要从huggingface加载,国内可以通过https://hf-mirror.com 镜像进行下载。
  • 确保有足够的磁盘空间保存原始模型文件、数据文件以及训练后的checkpoint(请预留至少50GB空间)
  • 需要使用至少40GB显存的GPU显卡

本章附件

文件类型说明下载
math.pdfPDF 课件本章完整讲义幻灯片点击下载
chapter4_scripts.zipZIP 源码包本章教程 README + Jupyter Notebook点击下载
提示:附件托管于海外站点,若因网络原因下载缓慢或失败,请联系站长转存。

返回总介绍上海交大《动手学大模型》系列(总介绍)

觉得内容不错?我要

打赏杯咖啡或蜜雪冰城吧
微信扫一扫
微信赞赏码
支付宝扫一扫
支付宝赞赏码
评论 暂无评论
请登录后参与评论