LLM大模型家族全景:快速了解LLM群体

本文摘要LLM 不是单一产品而是一个"家族",选择时先看场景(中文/英文/代码/多模态),再看预算(开源免费/API 按量计费),最后看部署条件(云端 API/本地 GPU/手机端)。

image.png

🧠 LLM 大模型全景指南:从入门到体系化认知

适用对象:刚接触 LLM 的学习者
核心目标:用 6 个维度建立 LLM 知识框架,兼顾技术深度与通俗理解
版本说明:本文档数据更新至 2026 年中(基于 SuperCLUE 2026.5、中国 AI 大模型竞争力 TOP20 等公开榜单)。LLM 领域每 2\~3 周就有新版本,版本号请以官方为准。

一、按「系列/厂商」分类 → 谁在造这些模型?

💡 先建立一个核心认知:模型 ≠ 应用。GPT-4、Claude、Qwen 是"模型层"(负责思考生成);ChatGPT、Claude.ai、豆包 App、Cursor 是"应用层"(套在模型外面的软件)。Cursor 这类 AI 编辑器不自己造模型,而是调用 Claude/GPT 等第三方模型。本指南只讲"模型层"。

🌍 海外主要厂商

厂商/机构代表系列特点定位典型应用场景
OpenAI (美国)GPT-5.x / o3 / GPT-OSS综合最强、API 生态最成熟企业级对话、Agent、办公自动化
Anthropic (美国)Claude 4.x (Opus/Sonnet/Haiku)安全对齐强、长上下文、编程体验好法律分析、长文总结、代码
Google (美国)Gemini 3.x / Gemma(开源)多模态原生、超长上下文(2M)、搜索生态搜索增强、视频理解、云集成
Meta (美国)Llama 4 / 3.3开源标杆、社区微调底座最多本地部署、创业公司基座
Mistral AI (法国)Mistral Large / Mixtral / Codestral欧洲开源、高效小模型、EU 数据合规欧盟企业、端侧、代码(Codestral)
xAI (美国)Grok 4.x实时 X 数据、推理/数学强实时问答、社交数据洞察
Cohere (加拿大/美)Command R+企业 RAG、检索增强、数据可控企业知识库、文档问答
Amazon (美国)Nova / Titan (Bedrock)AWS 云原生、多模型平台云上企业集成
Microsoft (美国)Phi-4小参数高效、端侧友好轻量部署、嵌入式 AI
IBM (美国)Granite受监管行业、可信/可审计金融、政务合规场景
Perplexity (美国)Sonar实时联网搜索问答研究检索、事实核查
⚠️ 避坑提示:网上常把 Mixtral 误写成 Meta 的模型。Mixtral(MoE 架构代表作)是法国 Mistral AI 出品,Meta 对应的是 Llama 系列,两者完全不同。

🌏 国内主要厂商

厂商/机构代表系列特点定位典型应用场景
字节跳动豆包 / Seed (2.0) / 即梦C 端用户量第一、多模态强、API 性价比极高短视频、内容创作、C 端助手
阿里巴巴通义千问 / Qwen3.x开源生态最强、企业 B 端第一企业私有化、电商、政务
DeepSeek (深度求索)V4 (Pro/Flash) / R1MoE 降本、推理/代码最强、坚持开源编程、量化、科研基座
智谱 AI (清华)GLM-5.x / ChatGLM长文本/Agent 强、安全合规等级高政企、法律、科研
百度文心一言 / ERNIE 5.x国内最早商用、搜索 + 信创、千帆平台政企私有化、汽车、传媒
腾讯混元 / 元宝微信/企微生态、办公智能体社交、企业办公、数字人
月之暗面Kimi (K2.6)超长上下文(200 万字)、文档解析标杆研报、论文、合同审查
MiniMaxM3 / ABAB语音/数字人/视频生成突出、出海强虚拟人、内容出海
华为盘古行业大模型、昇腾全栈自主可控工业、制造、政务
科大讯飞星火 (Spark X2)语音识别/教育/医疗国内第一教育、车载、医疗
阶跃星辰Step 3.7多模态 + 终端 Agent智能终端、多模态交互
百川智能Baichuan快速迭代、开源友好企业通用、医疗
零一万物 (01.AI)Yi 系列李开复创立、开源开发者、通用场景
商汤日日新 / SenseNova视觉多模态顶尖工业视觉、自动驾驶
小米MiMo硬件/AIoT 生态融合手机、智能家居端侧
💡 梯队速记:国内"第一梯队"公认是 字节豆包、阿里通义、DeepSeek、智谱;百度、腾讯紧随;其余走垂直细分路线(语音/医疗/视觉/端侧等)。还有美团 LongCat、京东言犀、360 智脑、面壁 MiniCPM(端侧小钢炮)、蚂蚁灵光、快手可灵(视频)等更多垂直玩家。

二、按「技术架构」分类 → 底层原理有什么区别?

技术路线核心思想代表模型优势劣势/挑战
Decoder-Only (解码器独大)只用 Transformer Decoder 层,单向生成文本GPT 全系、Qwen3、Llama 4、Claude 4、Gemini训练效率高、推理快、适合对话纯生成,复杂理解需额外技术
Encoder-Decoder / GLM 架构Encoder 理解 +Decoder 生成,或用自回归填空(GLM)T5、GLM-5、ChatGLM理解/生成均衡、适合分类摘要架构特殊、生态相对小
MoE (混合专家)每次推理只激活部分"专家"子网络,动态路由Mixtral 8x22B、DeepSeek-V4、Qwen-MoE、豆包 Seed同算力下性能更强、成本低架构复杂、负载均衡难
SSM/Mamba (状态空间模型)绕过注意力,用线性复杂度扫描序列Mamba-2、Jamba长上下文极快、显存占用低生态未成熟、部分任务弱
Agentic / Reasoning (推理增强)叠加"思考链"(CoT)、自我反思、工具调用OpenAI o3、DeepSeek-R1、QwQ、Claude数学/代码/逻辑准确率大增速度慢、成本翻倍

🔍 通俗理解

  • Decoder-Only = "只会顺着写的写手"
  • Encoder-Decoder/GLM = "先阅读理解再作文的学霸"
  • MoE = "团队里每个问题只派最擅长的专家回答"
  • SSM/Mamba = "靠短期记忆快速扫完全文,不回头回忆"
  • Agentic/Reasoning = "先想清楚步骤再动手的解题大师"

三、按「开源 vs 闭源」分类 → 谁能免费用?谁更强?

维度🔓 开源模型 (Open Weight)🎁 闭源模型 (Proprietary)
代表Llama 4、Qwen3、DeepSeek-V4/R1、Mistral/Mixtral、Gemma、GLM-5、Baichuan、Yi、Phi-4GPT-5.x、Claude 4.x、Gemini 3.x、Grok 4.x、文心 ERNIE、豆包、混元、星火、MiniMax
获取方式HuggingFace 下载权重,本地/云端部署调用 API 或 Web 界面
费用免费(部分商用需注意许可证)按 Token 计费或订阅制
可定制性✅ 可微调、可改架构、可私有化❌ 黑盒,仅能调参
数据透明训练数据通常公开不公开
性能天花板DeepSeek-V4/Qwen3 已逼近闭源前沿GPT-5/Gemini-3/Claude-4 仍领先(尤其多模态 + 推理)
适用人群开发者、科研、有算力/合规要求的企业中小企业、个人、快速上线
⚖️ 趋势判断:开源疯狂追赶——SuperCLUE 2026.5 中 DeepSeek-V4-Pro、Qwen3.7-Max、豆包 Seed 已与海外闭源第一梯队(Gemini-3.1-Pro、GPT-5.5、Claude-Opus-4.8)同处"70+ 分"区间。但闭源在多模态融合、超长上下文、生态整合上仍有代差。"闭源打体验,开源打成本/可控"是现阶段格局。

四、按「国内 vs 海外」分类 → 中英文环境怎么选?

维度🌏 国内模型 (豆包/Qwen/DeepSeek/智谱/Kimi/文心/混元…)🌍 海外模型 (GPT/Claude/Gemini/Llama/Mistral/xAI)
中文理解✅ 显著优势:成语、网络梗、古文、方言适配好⚠️ 大幅改善,但偶有"翻译腔"
长文本Kimi(200 万字)、Qwen/Gemini 稍逊但均达百万级Gemini 3.x(2M)全球最长
代码能力DeepSeek-V4/通义极强GPT-5/Claude 4 仍为行业标杆
推理/数学DeepSeek-R1/V4 追平 o3,GLM-5 强OpenAI o3/Grok-4 断层领先
部署成本72B 模型单卡可跑、量化版消费级显卡可用GPT 级需多卡 A100/H100 集群
API 稳定性国内访问快、中文客服及时需专线/合规,时延较高
合规与数据符合中国数据安全法规(等保/备案)部分未过审,注意数据出境

🎯 选型建议

  • 中文产品/客服/政务 → Qwen3 / GLM-5 / 文心
  • 短视频/内容创作/C 端 → 豆包(字节生态 + 性价比)
  • 超长文档(合同/研报/论文) → Kimi / Gemini 3.x
  • 编程助手/开发者 → DeepSeek-V4 / GPT-5 / Claude 4
  • 数学推理/Agent → o3 / DeepSeek-R1 / GLM-5
  • 出海/多语言/欧盟合规 → Mistral / GPT-5

五、按「热度与趋势」分类 → 现在该关注什么?

📊 综合榜参考(SuperCLUE 2026 年 5 月,满分 100)

排名模型机构开/闭源总分
-Gemini-3.1-ProGoogle闭源75.7
-GPT-5.5OpenAI闭源74.3
-Claude-Opus-4.8Anthropic闭源73.9
1DeepSeek-V4-Pro深度求索开源70.5
1Qwen3.7-Max(Thinking)阿里闭源70.2
1Doubao-Seed-2.0-pro字节闭源70.0
2Kimi-K2.6-Thinking月之暗面开源68.7
-GLM-5.1智谱闭源-
-ERNIE 5.1百度闭源-
-MiniMax-M3MiniMax闭源-
-Grok-4.3xAI闭源-
-Spark X2讯飞闭源-
-Step-3.7阶跃星辰闭源-
🔥 热度解读:海外三强(Google/OpenAI/Anthropic)稳居综合榜首;国内"开源双子星"DeepSeek + 通义千问已追平闭源第一梯队,豆包凭多模态与 C 端规模跻身前列。

📈 发展关键节点(2023→2026)

2023初   GPT-3.5/ChatGPT 引爆全球
2023中   LLaMA 2 开源 → 社区爆发
2024初   Claude 3 + Gemini 1.0 → 多模态元年
2024中   Qwen2/DeepSeek-V2 → 中国模型崛起
2024底   o1 → 推理革命(CoT)
2025初   Kimi 长上下文 → 企业落地加速
2025中   DeepSeek-R1/QwQ → 推理开源化
2026中   GPT-5.5 / Claude 4.8 / Gemini 3.1 / Llama 4 / DeepSeek-V4 → 多强并存、端侧爆发

🔮 未来三大趋势

  1. 端侧部署普及:手机/PC 本地跑 7B\~30B 模型成标配(量化 INT4/INT8)
  2. 推理分层:"快思考"(GPT-5 级) + "慢思考"(o3/R1 级) 成行业标配
  3. Agent 生态爆发:从"对话工具"升级为"自主执行任务的操作员"

六、按「Token 费用」分类 → 到底要花多少钱?

💡 Token 是 AI 时代的"计量货币"。调用 API 时按 token 计费(1 个中文约 1\~2 个 token,1 亿 token ≈ 7500 万字)。价格通常分输入价(你发的提示词)和输出价(模型生成的回答),输出更贵。各厂商还有缓存/批量折扣,实际价格浮动很大。

💰 主流模型 API 参考价(元 / 百万 tokens,2026 年中,输入 / 输出)

梯队模型输入价输出价备注
海外旗舰(最贵)GPT-5.5¥36¥216顶级效果,价格也顶级
Claude Opus 4.8¥36¥180编程/长文体验佳
Gemini 3.1 Pro¥14.4¥86.4提示超 200K 涨价至约 ¥29/¥130
国产/开源旗舰Qwen3.7 Max¥9¥27阿里闭源旗舰
GLM-5.2¥10¥31.7智谱,中文/Agent 强
Kimi K2.6¥6.8¥28.8长上下文
文心 ERNIE 5.1\~¥1\~¥4百度,信创场景
混元 HY3¥7.2¥28.8腾讯企业 NLP
MiniMax M3¥4.3¥17.3多模态/出海
性价比之王DeepSeek V4 Pro¥3.1¥6.3开源旗舰,质量逼近闭源
DeepSeek V4 Flash¥1¥2最便宜的旗舰级
豆包 Pro\~¥0.5\~¥2C 端/批量极致低价
通义千问 Plus\~¥0.4\~¥2.4轻量低价首选

⚠️ 价格说明:上表为 2026 年中官方标准价换算(汇率 ≈7.2),仅供参考。真实成本因以下因素差异巨大:

  • 缓存折扣:DeepSeek 缓存命中输入可低至 ¥0.03/M(约 40 倍);OpenAI 缓存输入 10 倍便宜
  • 批量(Batch):Anthropic/Gemini 批量调用常 5 折
  • 上下文长度:Gemini 长提示单价上浮
  • 促销:厂商新模型常有限时半价

🔢 震撼结论:最贵的 Claude Opus 与最便宜的国产模型,单价差可达 100\~500 倍。对高频调用(Agent、智能体)场景,国产模型(豆包/DeepSeek/通义)成本优势近乎碾压。但对 90% 日常任务,国产模型效果已与海外旗舰无明显差距——用错模型,你可能多花上百倍的钱

💡 省钱心法:不要"从一而终"。日常闲聊用免费的豆包/通义;写代码交给 DeepSeek;超长文档用 Kimi/Gemini;只有深度推理/极致质量才上 GPT-5/Claude。多模型组合才是 2026 年最聪明的用法。


📋 速查总表:一张图看懂 LLM 世界

维度主流选择 (2026)适合谁?
综合最强(闭源)GPT-5.5 / Claude Opus 4.8 / Gemini-3.1-Pro追求极致效果的企业/个人
开源首选DeepSeek-V4 / Qwen3-72B / Llama 4国内企业、有 GPU 开发者
中文/C 端豆包 Seed / 通义千问 / 文心中文产品、内容创作
长文本Kimi(200 万字) / Gemini 3.x(2M)金融/法律/科研
代码开发DeepSeek-V4 / GPT-5 / Claude 4程序员、DevOps
推理/数学o3 / DeepSeek-R1 / GLM-5AI 研究者、量化
多模态(图文视频)Gemini 3 / Claude 4 / 豆包·即梦 / 商汤日日新内容创作、电商
欧洲/合规Mistral / Mixtral欧盟企业、数据合规
小模型/端侧Phi-4 / Gemma / MiniCPM / MiMo手机、嵌入式
Token 费用最低豆包 Pro / 通义 Plus / DeepSeek V4 Flash (¥1\~2/M 输出)高频调用、Agent、预算敏感
Token 费用最高GPT-5.5 / Claude Opus 4.8 (¥180\~216/M 输出)不计成本追求顶级效果

📚 学习路径建议 (从零到上手)

第1周:基础概念 → Transformer、Tokenization、Temperature/Top-P采样
第2周:跑通模型 → 下载 Qwen3-7B 或 Llama 4,用 Ollama/vLLM 本地运行
第3周:调用API → OpenAI/Claude/Qwen/Mistral 官方文档,练 Prompt 工程
第4周:微调入门 → LoRA、HuggingFace Transformers 实战
进阶:MoE架构、Agent工具调用、RAG检索增强生成、端侧量化部署

📌 核心记忆点:LLM 不是单一产品而是一个"家族"。选择时先看场景(中文/英文/代码/多模态),再看预算(开源免费/API 计费),最后看部署条件(云端 API/本地 GPU/手机端)。记住"模型层 vs 应用层"的区别,就不会把 Cursor、豆包 App 和 GPT 搞混了。

文档生成时间:2026-08-04 | 数据基准:2026 年中公开榜单 | 适用版本:LLM 入门至进阶学习者

觉得内容不错?我要

打赏杯咖啡或蜜雪冰城吧
微信扫一扫
微信赞赏码
支付宝扫一扫
支付宝赞赏码
评论 暂无评论
请登录后参与评论