本文摘要LLM 不是单一产品而是一个"家族",选择时先看场景(中文/英文/代码/多模态),再看预算(开源免费/API 按量计费),最后看部署条件(云端 API/本地 GPU/手机端)。

🧠 LLM 大模型全景指南:从入门到体系化认知
适用对象:刚接触 LLM 的学习者
核心目标:用 6 个维度建立 LLM 知识框架,兼顾技术深度与通俗理解
版本说明:本文档数据更新至 2026 年中(基于 SuperCLUE 2026.5、中国 AI 大模型竞争力 TOP20 等公开榜单)。LLM 领域每 2\~3 周就有新版本,版本号请以官方为准。
一、按「系列/厂商」分类 → 谁在造这些模型?
💡 先建立一个核心认知:模型 ≠ 应用。GPT-4、Claude、Qwen 是"模型层"(负责思考生成);ChatGPT、Claude.ai、豆包 App、Cursor 是"应用层"(套在模型外面的软件)。Cursor 这类 AI 编辑器不自己造模型,而是调用 Claude/GPT 等第三方模型。本指南只讲"模型层"。
🌍 海外主要厂商
| 厂商/机构 | 代表系列 | 特点定位 | 典型应用场景 |
|---|---|---|---|
| OpenAI (美国) | GPT-5.x / o3 / GPT-OSS | 综合最强、API 生态最成熟 | 企业级对话、Agent、办公自动化 |
| Anthropic (美国) | Claude 4.x (Opus/Sonnet/Haiku) | 安全对齐强、长上下文、编程体验好 | 法律分析、长文总结、代码 |
| Google (美国) | Gemini 3.x / Gemma(开源) | 多模态原生、超长上下文(2M)、搜索生态 | 搜索增强、视频理解、云集成 |
| Meta (美国) | Llama 4 / 3.3 | 开源标杆、社区微调底座最多 | 本地部署、创业公司基座 |
| Mistral AI (法国) | Mistral Large / Mixtral / Codestral | 欧洲开源、高效小模型、EU 数据合规 | 欧盟企业、端侧、代码(Codestral) |
| xAI (美国) | Grok 4.x | 实时 X 数据、推理/数学强 | 实时问答、社交数据洞察 |
| Cohere (加拿大/美) | Command R+ | 企业 RAG、检索增强、数据可控 | 企业知识库、文档问答 |
| Amazon (美国) | Nova / Titan (Bedrock) | AWS 云原生、多模型平台 | 云上企业集成 |
| Microsoft (美国) | Phi-4 | 小参数高效、端侧友好 | 轻量部署、嵌入式 AI |
| IBM (美国) | Granite | 受监管行业、可信/可审计 | 金融、政务合规场景 |
| Perplexity (美国) | Sonar | 实时联网搜索问答 | 研究检索、事实核查 |
⚠️ 避坑提示:网上常把 Mixtral 误写成 Meta 的模型。Mixtral(MoE 架构代表作)是法国 Mistral AI 出品,Meta 对应的是 Llama 系列,两者完全不同。
🌏 国内主要厂商
| 厂商/机构 | 代表系列 | 特点定位 | 典型应用场景 |
|---|---|---|---|
| 字节跳动 | 豆包 / Seed (2.0) / 即梦 | C 端用户量第一、多模态强、API 性价比极高 | 短视频、内容创作、C 端助手 |
| 阿里巴巴 | 通义千问 / Qwen3.x | 开源生态最强、企业 B 端第一 | 企业私有化、电商、政务 |
| DeepSeek (深度求索) | V4 (Pro/Flash) / R1 | MoE 降本、推理/代码最强、坚持开源 | 编程、量化、科研基座 |
| 智谱 AI (清华) | GLM-5.x / ChatGLM | 长文本/Agent 强、安全合规等级高 | 政企、法律、科研 |
| 百度 | 文心一言 / ERNIE 5.x | 国内最早商用、搜索 + 信创、千帆平台 | 政企私有化、汽车、传媒 |
| 腾讯 | 混元 / 元宝 | 微信/企微生态、办公智能体 | 社交、企业办公、数字人 |
| 月之暗面 | Kimi (K2.6) | 超长上下文(200 万字)、文档解析标杆 | 研报、论文、合同审查 |
| MiniMax | M3 / ABAB | 语音/数字人/视频生成突出、出海强 | 虚拟人、内容出海 |
| 华为 | 盘古 | 行业大模型、昇腾全栈自主可控 | 工业、制造、政务 |
| 科大讯飞 | 星火 (Spark X2) | 语音识别/教育/医疗国内第一 | 教育、车载、医疗 |
| 阶跃星辰 | Step 3.7 | 多模态 + 终端 Agent | 智能终端、多模态交互 |
| 百川智能 | Baichuan | 快速迭代、开源友好 | 企业通用、医疗 |
| 零一万物 (01.AI) | Yi 系列 | 李开复创立、开源 | 开发者、通用场景 |
| 商汤 | 日日新 / SenseNova | 视觉多模态顶尖 | 工业视觉、自动驾驶 |
| 小米 | MiMo | 硬件/AIoT 生态融合 | 手机、智能家居端侧 |
💡 梯队速记:国内"第一梯队"公认是 字节豆包、阿里通义、DeepSeek、智谱;百度、腾讯紧随;其余走垂直细分路线(语音/医疗/视觉/端侧等)。还有美团 LongCat、京东言犀、360 智脑、面壁 MiniCPM(端侧小钢炮)、蚂蚁灵光、快手可灵(视频)等更多垂直玩家。
二、按「技术架构」分类 → 底层原理有什么区别?
| 技术路线 | 核心思想 | 代表模型 | 优势 | 劣势/挑战 |
|---|---|---|---|---|
| Decoder-Only (解码器独大) | 只用 Transformer Decoder 层,单向生成文本 | GPT 全系、Qwen3、Llama 4、Claude 4、Gemini | 训练效率高、推理快、适合对话 | 纯生成,复杂理解需额外技术 |
| Encoder-Decoder / GLM 架构 | Encoder 理解 +Decoder 生成,或用自回归填空(GLM) | T5、GLM-5、ChatGLM | 理解/生成均衡、适合分类摘要 | 架构特殊、生态相对小 |
| MoE (混合专家) | 每次推理只激活部分"专家"子网络,动态路由 | Mixtral 8x22B、DeepSeek-V4、Qwen-MoE、豆包 Seed | 同算力下性能更强、成本低 | 架构复杂、负载均衡难 |
| SSM/Mamba (状态空间模型) | 绕过注意力,用线性复杂度扫描序列 | Mamba-2、Jamba | 长上下文极快、显存占用低 | 生态未成熟、部分任务弱 |
| Agentic / Reasoning (推理增强) | 叠加"思考链"(CoT)、自我反思、工具调用 | OpenAI o3、DeepSeek-R1、QwQ、Claude | 数学/代码/逻辑准确率大增 | 速度慢、成本翻倍 |
🔍 通俗理解:
Decoder-Only= "只会顺着写的写手"Encoder-Decoder/GLM= "先阅读理解再作文的学霸"MoE= "团队里每个问题只派最擅长的专家回答"SSM/Mamba= "靠短期记忆快速扫完全文,不回头回忆"Agentic/Reasoning= "先想清楚步骤再动手的解题大师"
三、按「开源 vs 闭源」分类 → 谁能免费用?谁更强?
| 维度 | 🔓 开源模型 (Open Weight) | 🎁 闭源模型 (Proprietary) |
|---|---|---|
| 代表 | Llama 4、Qwen3、DeepSeek-V4/R1、Mistral/Mixtral、Gemma、GLM-5、Baichuan、Yi、Phi-4 | GPT-5.x、Claude 4.x、Gemini 3.x、Grok 4.x、文心 ERNIE、豆包、混元、星火、MiniMax |
| 获取方式 | HuggingFace 下载权重,本地/云端部署 | 调用 API 或 Web 界面 |
| 费用 | 免费(部分商用需注意许可证) | 按 Token 计费或订阅制 |
| 可定制性 | ✅ 可微调、可改架构、可私有化 | ❌ 黑盒,仅能调参 |
| 数据透明 | 训练数据通常公开 | 不公开 |
| 性能天花板 | DeepSeek-V4/Qwen3 已逼近闭源前沿 | GPT-5/Gemini-3/Claude-4 仍领先(尤其多模态 + 推理) |
| 适用人群 | 开发者、科研、有算力/合规要求的企业 | 中小企业、个人、快速上线 |
⚖️ 趋势判断:开源疯狂追赶——SuperCLUE 2026.5 中 DeepSeek-V4-Pro、Qwen3.7-Max、豆包 Seed 已与海外闭源第一梯队(Gemini-3.1-Pro、GPT-5.5、Claude-Opus-4.8)同处"70+ 分"区间。但闭源在多模态融合、超长上下文、生态整合上仍有代差。"闭源打体验,开源打成本/可控"是现阶段格局。
四、按「国内 vs 海外」分类 → 中英文环境怎么选?
| 维度 | 🌏 国内模型 (豆包/Qwen/DeepSeek/智谱/Kimi/文心/混元…) | 🌍 海外模型 (GPT/Claude/Gemini/Llama/Mistral/xAI) |
|---|---|---|
| 中文理解 | ✅ 显著优势:成语、网络梗、古文、方言适配好 | ⚠️ 大幅改善,但偶有"翻译腔" |
| 长文本 | Kimi(200 万字)、Qwen/Gemini 稍逊但均达百万级 | Gemini 3.x(2M)全球最长 |
| 代码能力 | DeepSeek-V4/通义极强 | GPT-5/Claude 4 仍为行业标杆 |
| 推理/数学 | DeepSeek-R1/V4 追平 o3,GLM-5 强 | OpenAI o3/Grok-4 断层领先 |
| 部署成本 | 72B 模型单卡可跑、量化版消费级显卡可用 | GPT 级需多卡 A100/H100 集群 |
| API 稳定性 | 国内访问快、中文客服及时 | 需专线/合规,时延较高 |
| 合规与数据 | 符合中国数据安全法规(等保/备案) | 部分未过审,注意数据出境 |
🎯 选型建议:
- 中文产品/客服/政务 → Qwen3 / GLM-5 / 文心
- 短视频/内容创作/C 端 → 豆包(字节生态 + 性价比)
- 超长文档(合同/研报/论文) → Kimi / Gemini 3.x
- 编程助手/开发者 → DeepSeek-V4 / GPT-5 / Claude 4
- 数学推理/Agent → o3 / DeepSeek-R1 / GLM-5
- 出海/多语言/欧盟合规 → Mistral / GPT-5
五、按「热度与趋势」分类 → 现在该关注什么?
📊 综合榜参考(SuperCLUE 2026 年 5 月,满分 100)
| 排名 | 模型 | 机构 | 开/闭源 | 总分 |
|---|---|---|---|---|
| - | Gemini-3.1-Pro | 闭源 | 75.7 | |
| - | GPT-5.5 | OpenAI | 闭源 | 74.3 |
| - | Claude-Opus-4.8 | Anthropic | 闭源 | 73.9 |
| 1 | DeepSeek-V4-Pro | 深度求索 | 开源 | 70.5 |
| 1 | Qwen3.7-Max(Thinking) | 阿里 | 闭源 | 70.2 |
| 1 | Doubao-Seed-2.0-pro | 字节 | 闭源 | 70.0 |
| 2 | Kimi-K2.6-Thinking | 月之暗面 | 开源 | 68.7 |
| - | GLM-5.1 | 智谱 | 闭源 | - |
| - | ERNIE 5.1 | 百度 | 闭源 | - |
| - | MiniMax-M3 | MiniMax | 闭源 | - |
| - | Grok-4.3 | xAI | 闭源 | - |
| - | Spark X2 | 讯飞 | 闭源 | - |
| - | Step-3.7 | 阶跃星辰 | 闭源 | - |
🔥 热度解读:海外三强(Google/OpenAI/Anthropic)稳居综合榜首;国内"开源双子星"DeepSeek + 通义千问已追平闭源第一梯队,豆包凭多模态与 C 端规模跻身前列。
📈 发展关键节点(2023→2026)
2023初 GPT-3.5/ChatGPT 引爆全球
2023中 LLaMA 2 开源 → 社区爆发
2024初 Claude 3 + Gemini 1.0 → 多模态元年
2024中 Qwen2/DeepSeek-V2 → 中国模型崛起
2024底 o1 → 推理革命(CoT)
2025初 Kimi 长上下文 → 企业落地加速
2025中 DeepSeek-R1/QwQ → 推理开源化
2026中 GPT-5.5 / Claude 4.8 / Gemini 3.1 / Llama 4 / DeepSeek-V4 → 多强并存、端侧爆发🔮 未来三大趋势:
- 端侧部署普及:手机/PC 本地跑 7B\~30B 模型成标配(量化 INT4/INT8)
- 推理分层:"快思考"(GPT-5 级) + "慢思考"(o3/R1 级) 成行业标配
- Agent 生态爆发:从"对话工具"升级为"自主执行任务的操作员"
六、按「Token 费用」分类 → 到底要花多少钱?
💡 Token 是 AI 时代的"计量货币"。调用 API 时按 token 计费(1 个中文约 1\~2 个 token,1 亿 token ≈ 7500 万字)。价格通常分输入价(你发的提示词)和输出价(模型生成的回答),输出更贵。各厂商还有缓存/批量折扣,实际价格浮动很大。
💰 主流模型 API 参考价(元 / 百万 tokens,2026 年中,输入 / 输出)
| 梯队 | 模型 | 输入价 | 输出价 | 备注 |
|---|---|---|---|---|
| 海外旗舰(最贵) | GPT-5.5 | ¥36 | ¥216 | 顶级效果,价格也顶级 |
| Claude Opus 4.8 | ¥36 | ¥180 | 编程/长文体验佳 | |
| Gemini 3.1 Pro | ¥14.4 | ¥86.4 | 提示超 200K 涨价至约 ¥29/¥130 | |
| 国产/开源旗舰 | Qwen3.7 Max | ¥9 | ¥27 | 阿里闭源旗舰 |
| GLM-5.2 | ¥10 | ¥31.7 | 智谱,中文/Agent 强 | |
| Kimi K2.6 | ¥6.8 | ¥28.8 | 长上下文 | |
| 文心 ERNIE 5.1 | \~¥1 | \~¥4 | 百度,信创场景 | |
| 混元 HY3 | ¥7.2 | ¥28.8 | 腾讯企业 NLP | |
| MiniMax M3 | ¥4.3 | ¥17.3 | 多模态/出海 | |
| 性价比之王 | DeepSeek V4 Pro | ¥3.1 | ¥6.3 | 开源旗舰,质量逼近闭源 |
| DeepSeek V4 Flash | ¥1 | ¥2 | 最便宜的旗舰级 | |
| 豆包 Pro | \~¥0.5 | \~¥2 | C 端/批量极致低价 | |
| 通义千问 Plus | \~¥0.4 | \~¥2.4 | 轻量低价首选 |
⚠️ 价格说明:上表为 2026 年中官方标准价换算(汇率 ≈7.2),仅供参考。真实成本因以下因素差异巨大:
- 缓存折扣:DeepSeek 缓存命中输入可低至 ¥0.03/M(约 40 倍);OpenAI 缓存输入 10 倍便宜
- 批量(Batch):Anthropic/Gemini 批量调用常 5 折
- 上下文长度:Gemini 长提示单价上浮
- 促销:厂商新模型常有限时半价
🔢 震撼结论:最贵的 Claude Opus 与最便宜的国产模型,单价差可达 100\~500 倍。对高频调用(Agent、智能体)场景,国产模型(豆包/DeepSeek/通义)成本优势近乎碾压。但对 90% 日常任务,国产模型效果已与海外旗舰无明显差距——用错模型,你可能多花上百倍的钱。
💡 省钱心法:不要"从一而终"。日常闲聊用免费的豆包/通义;写代码交给 DeepSeek;超长文档用 Kimi/Gemini;只有深度推理/极致质量才上 GPT-5/Claude。多模型组合才是 2026 年最聪明的用法。
📋 速查总表:一张图看懂 LLM 世界
| 维度 | 主流选择 (2026) | 适合谁? |
|---|---|---|
| 综合最强(闭源) | GPT-5.5 / Claude Opus 4.8 / Gemini-3.1-Pro | 追求极致效果的企业/个人 |
| 开源首选 | DeepSeek-V4 / Qwen3-72B / Llama 4 | 国内企业、有 GPU 开发者 |
| 中文/C 端 | 豆包 Seed / 通义千问 / 文心 | 中文产品、内容创作 |
| 长文本 | Kimi(200 万字) / Gemini 3.x(2M) | 金融/法律/科研 |
| 代码开发 | DeepSeek-V4 / GPT-5 / Claude 4 | 程序员、DevOps |
| 推理/数学 | o3 / DeepSeek-R1 / GLM-5 | AI 研究者、量化 |
| 多模态(图文视频) | Gemini 3 / Claude 4 / 豆包·即梦 / 商汤日日新 | 内容创作、电商 |
| 欧洲/合规 | Mistral / Mixtral | 欧盟企业、数据合规 |
| 小模型/端侧 | Phi-4 / Gemma / MiniCPM / MiMo | 手机、嵌入式 |
| Token 费用最低 | 豆包 Pro / 通义 Plus / DeepSeek V4 Flash (¥1\~2/M 输出) | 高频调用、Agent、预算敏感 |
| Token 费用最高 | GPT-5.5 / Claude Opus 4.8 (¥180\~216/M 输出) | 不计成本追求顶级效果 |
📚 学习路径建议 (从零到上手)
第1周:基础概念 → Transformer、Tokenization、Temperature/Top-P采样
第2周:跑通模型 → 下载 Qwen3-7B 或 Llama 4,用 Ollama/vLLM 本地运行
第3周:调用API → OpenAI/Claude/Qwen/Mistral 官方文档,练 Prompt 工程
第4周:微调入门 → LoRA、HuggingFace Transformers 实战
进阶:MoE架构、Agent工具调用、RAG检索增强生成、端侧量化部署📌 核心记忆点:LLM 不是单一产品而是一个"家族"。选择时先看场景(中文/英文/代码/多模态),再看预算(开源免费/API 计费),最后看部署条件(云端 API/本地 GPU/手机端)。记住"模型层 vs 应用层"的区别,就不会把 Cursor、豆包 App 和 GPT 搞混了。
文档生成时间:2026-08-04 | 数据基准:2026 年中公开榜单 | 适用版本:LLM 入门至进阶学习者
觉得内容不错?我要