导言
本文档基于ISO/IEC 22989、斯坦福 HAI、中国信通院、IBM、OECD等权威机构 2022-2026 年发布的官方技术标准、行业报告与技术文档,系统性梳理了人工智能领域从基础理论到产业落地、技术生态再到伦理治理的全链路核心概念与术语。
全文采用 “分层分类 + 权威定义 + 技术详解 + 场景举例 + 官方参考来源” 的标准化结构,兼顾入门级通俗解读与专业级技术细节剖析,既适合行业新手建立完整的 AI 知识体系,也适合技术从业者、行业专家查阅权威技术标准。
摘要
本次 AI 术语体系的分类逻辑严格遵循从底层基础到上层应用、从核心技术到支撑生态、从落地工具到治理约束的产业发展层级逻辑,划分为七大核心板块,覆盖 AI 领域全链路技术布局:
基础概念层:定义 AI 领域的基础技术范式,划定行业共识的能力边界与技术范式范畴;
核心技术层:解析现代 AI 体系的关键技术架构;
模型生态层:构成现代 AI 应用底座的基础模型与交互生态体系;
Agent 应用层:让 AI 从 “输出内容” 升级为 “自主执行任务” 的关键落地工具集合;
支撑技术层:保障 AI 模型训练、优化、落地的算力、数据和算法支撑体系;
行业应用层:AI 技术在不同垂直行业场景下的落地技术分支;
伦理与治理层:约束 AI 技术合规发展的风险标准与管控框架。
框架结构图如下:

一、基础概念层:AI 范式的基础定义
这一层是理解所有 AI 技术的逻辑前提,用于划定智能技术的能力边界、底层范式范畴,以及行业通用的基础术语定义,构成后续所有技术层的逻辑基础。
1.1 人工智能(Artificial Intelligence, AI)
来源:ISO/IEC 22989:2022 标准、OECD 2024 年权威定义
官方定义:ISO/IEC 22989:2022 将 AI 系统明确定义为:能够感知、处理和执行类人任务的系统,这些任务通常需要人类智能才能完成,比如感知自然语言、识别视觉对象、推理决策、内容生成或交互执行(9);OECD 在 2024 年的权威补充定义中,进一步明确了 AI 系统的技术属性:即基于机器的算法系统,能从输入数据中推断出预测内容、决策建议或可落地的输出结果,且系统的自主适应能力会随部署周期持续迭代,最终形成对物理 / 虚拟环境的影响效应(200)。
技术详解:
人工智能并非对人类生物智能的复刻,而是对人类智能过程的专业化技术模拟 —— 这一概念的核心要件包含三个关键维度:
- 执行任务导向:目标是完成人类智能可处理的具体场景任务,而非实现通用化的类人全能智能;
- 技术模拟路径:依托算法、数据、算力的组合支撑,复刻人类的信息感知、逻辑推理、内容生成、决策执行等智能过程;
- 技术结果输出:最终产出可落地的业务结果,包括但不限于预测结论、决策建议、生成内容、外部工具调用结果,甚至是对物理 / 虚拟环境的连续交互行为(200)。
从技术范式底层逻辑看,当前 AI 分为三大技术流派:
- 符号主义:也被称为 “规则派”,依托人工预置的逻辑规则与知识图谱进行推理,这是传统 AI 系统的核心技术逻辑,典型应用是早期的专家系统、规则引擎;
- 连接主义:也被称为 “学习派”,核心是通过多层人工神经网络,从海量数据中自动学习特征规律,这是现代深度学习技术的底层技术逻辑,典型应用是基于 Transformer 架构的大模型;
- 混合式:即 “神经 - 符号融合” 架构,将连接主义的海量数据学习能力,与符号主义的精准逻辑推理能力深度结合,是当前复杂行业级 AI 应用的主流技术趋势(12)。
应用举例:从手机上的语音助手、社交平台的算法推荐,到工业场景中自主调整运行参数的智能生产线、具备初步复杂任务执行能力的自主智能体,都是人工智能技术的典型落地形态(200)。
权威参考来源:
- ISO/IEC 22989:2022 官方标准原文:https://www.iso.org/obp/ui/#!iso:std:74296:en
- OECD AI 系统权威定义报告:https://www.oecd-ilibrary.org/en/publications/oecd-due-diligence-guidance-for-responsible-ai\_41671712-en/full-report/component-6.html
1.2 机器学习(Machine Learning, ML)
来源:ISO/IEC 22989:2022 标准、IBM 技术官方文档
官方定义:ISO/IEC 22989:2022 将机器学习明确划定为人工智能的核心子领域,是指通过算法解析数据,自动学习数据中的特征规律,再将这些学习成果应用于新场景、新数据,最终实现预测或决策的技术方法(9);IBM 的技术文档进一步补充了机器学习与传统开发模式的本质区别:传统软件工程是 “规则驱动”—— 由人工预置明确的逻辑规则,再代入数据计算结果;而机器学习是 “数据驱动”—— 不依赖人工预置的硬编码规则,而是从海量数据中自动学习、迭代优化出适配场景的处理逻辑,最终完成对未知数据的泛化处理(23)。
技术详解:
机器学习的核心技术目标,是让模型获得对全新未知数据的泛化处理能力 —— 这一目标的实现路径,主要依托三类经典学习范式:
- 监督学习:使用经过人工标注的 “特征 + 标签” 训练数据,由算法拟合特征与标签的对应映射关系,典型场景是垃圾邮件识别、金融违约风险预测;
- 无监督学习:使用无标注的原始数据,由模型自动挖掘数据内在的特征结构或关联关系,典型场景是用户分群、异常交易检测、搜索引擎的网页聚类;
- 半监督学习:综合使用少量标注数据和大量无标注数据,先通过无标注数据学习底层通用特征,再用少量标注数据完成场景级的性能微调,这是工业级 AI 模型最常用的学习范式;
- 强化学习:模型在预设的环境中以 “试错” 方式迭代优化 —— 每一次行动后,环境都会反馈正向或负向的激励信号,模型旨在通过长期学习,找到能最大化累计奖励的最优行动策略,典型场景是机器人自主控制、游戏 AI 系统、复杂业务决策优化(23)。
应用举例:金融机构使用监督学习训练的风控模型,可根据用户的消费记录、履约记录等多维度数据,识别潜在的欺诈交易风险;电商平台通过无监督学习分析用户的浏览时长、加购行为、下单频率等海量行为数据,自动将具有相似购物偏好的用户聚类,实现精准的个性化商品推荐;制造业通过强化学习控制机械臂的抓取角度、力道等参数,在多次试错后找到最优抓取策略,提升流水线的良品率(23)。
权威参考来源:
- ISO/IEC 22989:2022 机器学习标准定义:https://www.iso.org/obp/ui/#!iso:std:74296:en
- IBM 机器学习技术详解:https://www.ibm.com/think/topics/machine-learning
1.3 深度学习(Deep Learning, DL)
来源:ISO/IEC 22989:2022 标准、IBM 技术官方文档
官方定义:深度学习是机器学习的核心技术子集,特指以人工神经网络为底层架构、通过多层网络结构对非线性数据进行特征建模的技术方法(9)。与传统机器学习的最大差异在于特征提取方式的不同:传统机器学习需要人工预编写逻辑、提取数据的显性特征(比如图像的边缘纹理、文本的关键词),而深度学习则通过多层神经网络,自动从数据中逐层学习、迭代提取从基础细节到高层语义的多层次特征 —— 这一架构天然适配高维、非结构化数据(如图片、音频、长文本)的处理需求(22)。
技术详解:
深度学习的 “深度”,特指人工神经网络中信息变换层的堆叠数量 —— 浅层网络仅能提取数据的基础特征(如图像的边缘、纹理),而深层网络则可以通过多层特征组合,逐步建模出更复杂的高层语义特征(如图像中物体的整体结构、关联关系、行为属性)(22)。当前主流的深度学习架构,分为三大类技术路线:
- 前馈神经网络(FNN) :最基础的深度学习架构,信息严格按输入层→隐藏层→输出层的单向方向逐层流动,没有反向传播或层间反馈连接,是所有复杂神经网络架构的底层技术基础;
- 卷积神经网络(CNN) :采用局部感知 + 权重共享的核心设计逻辑,专门处理网格状视觉数据,核心是通过可滑动的卷积滤波器矩阵,逐层扫描并提取图像的局部空间特征 —— 这一架构天然适配图像的二维空间属性,大幅降低了参数量,是计算机视觉的经典底层架构;
- 循环神经网络(RNN/LSTM) :专门用于处理时序数据的架构 —— 这类数据的前后上下文关联性极强,比如文本的词序、语音的帧序列、传感器的时序数据。与 FNN 的单向信息流动不同,RNN 的网络节点具备记忆存储功能,能将上一时刻的处理结果反馈到当前时刻的计算流程中,从而捕捉时序数据的上下文依赖关系;
- Transformer 架构:2017 年由 Google 团队提出的革命性架构,完全摒弃了传统 RNN 的串行时序处理逻辑,采用自注意力机制同时计算输入序列中所有 Token 的交互关系 —— 这一设计不仅能高效捕捉任意两个 Token 之间的长程语义依赖,而且支持多输入序列的并行计算,在提升长上下文处理效果的同时,大幅缩短了模型的训练周期(20)。
应用举例:Transformer 架构是当前大语言模型(如 GPT-4o、Llama3)的核心底层架构;卷积神经网络(CNN)则是安防监控系统中目标检测、人脸识别模型的典型底层架构;循环神经网络(RNN/LSTM)常被用于机器翻译、语音识别、工业设备故障检测等场景(20)。
权威参考来源:
- ISO/IEC 22989:2022 深度学习标准定义:https://www.iso.org/obp/ui/#!iso:std:74296:en
- IBM 深度学习技术细节:https://www.ibm.com/think/topics/deep-learning
- Transformer 架构官方论文:https://arxiv.org/abs/1706.03762
1.4 生成式 AI(Generative AI)
来源:斯坦福 HAI 研究所、IBM 技术官方文档
官方定义:斯坦福 HAI 研究所在 2026 年的报告中明确指出,生成式 AI 是深度学习的技术子集,核心是通过学习海量训练数据中的样本分布、结构特征和关联逻辑,生成全新的、与训练样本具有相似特征的原创内容 —— 而不是对现有内容的简单复用或拼接(69)。IBM 的技术文档补充了这一技术的关键特性:生成式 AI 的核心是 “建模数据的生成逻辑”,而非单纯的分类或回归计算,这意味着它能产出具有一定创意性、符合真实场景逻辑的多元化原创内容。
技术详解:
生成式 AI 的核心技术逻辑,是对训练数据中不同模态样本的高维特征分布进行精准建模 —— 而非简单记忆训练样本的内容细节。这一技术的发展历程,经历了三个关键阶段的迭代升级:
- 第一阶段:单模态生成:早期生成式 AI 仅支持对单一模态数据的内容生成,比如根据文本生成文本、或者根据图像生成图像;
- 第二阶段:多模态生成:随着技术迭代,模型逐渐支持理解、生成多种不同类型的模态内容,比如文生图、图生文、文生视频、图生音频;
- 第三阶段:跨模态协同生成:当前主流技术方向,是实现多种模态内容的混合理解与联合生成,比如同时根据文本 + 图像的输入提示,生成精准匹配的视频内容;或者根据语音指令直接生成对应场景的 3D 动画脚本(179)。
从技术底层架构看,生成式 AI 的核心技术支撑路线,主要包括 Transformer 架构、生成对抗网络(GAN)、扩散模型、自回归模型(AR)四类,不同技术路线分别适配不同模态的生成场景。
应用举例:生成式 AI 是当前 AI 内容生成类应用的技术基础,比如文本生成类的 ChatGPT、Claude 系列,文生图类的 Midjourney、Stable Diffusion,文生视频类的 Sora、Runway ML,以及代码生成类的 GitHub Copilot 等;在行业场景中,还被用于工业产品概念设计、医疗影像辅助生成、数字人定制化内容创作等细分领域(69)。
权威参考来源:
- 斯坦福 HAI 生成式 AI 定义:https://stanmed.stanford.edu/glossary/artificial-intelligence/
- IBM 生成式 AI 技术详解:https://www.ibm.com/think/topics/generative-ai
二、核心技术层:现代 AI 体系的关键架构
这一层是支撑当前 AI 性能突破、实现规模化场景落地的核心技术架构,是区分传统 AI 与现代 AI 的技术分水岭,也是上游模型生态层的技术底座。
2.1 Transformer 架构
来源:Google Research 2017 年原创论文、IBM 技术官方文档
官方定义:Transformer 是一种采用编码器 - 解码器结构的深度学习架构,核心设计逻辑是通过自注意力机制,并行计算输入序列中所有 Token 的语义交互关系,从而捕捉完整的上下文语义信息(72)。这一架构的提出,彻底解决了传统 RNN 类架构在长时序数据计算中串行执行、难以扩展训练规模、无法捕捉长程依赖的三大核心瓶颈,成为后续几乎所有大模型技术发展的基石。
技术详解:
Transformer 的核心技术突破,是用全局注意力机制的并行计算替代了传统 RNN 的串行时序计算 —— 这一设计不仅能精准捕捉长序列数据中任意两个 Token 的语义依赖关系,还能将训练周期缩短至传统 RNN 的数十分之一,为大模型的规模化训练落地提供了关键技术支撑(72)。其整体架构由两个核心模块堆叠组成:
- 编码器(Encoder) :由 N=6 个相同的层结构堆叠而成,每一层内部包含两个核心子层:第一个子层是多头自注意力机制,用于并行计算所有 Token 的交互关联关系;第二个子层是前馈神经网络(FFN),由两个线性变换层 + 一个 ReLU 激活函数层组成,对每个 Token 的特征进行独立非线性变换。两个子层的输出都采用 “残差连接 + 层归一化” 进行处理,缓解深层模型的梯度消失问题,保证训练的稳定性;
- 解码器(Decoder) :同样由 N=6 个层结构堆叠而成,在编码器的两个子层基础上,额外增加了 “编码器 - 解码器注意力” 子层,用于将编码器提取的全局上下文信息,与解码器当前已生成的序列信息进行融合,最终按上下文语义关联,自回归地生成目标序列的下一个 Token。
Transformer 架构在后续产业级的技术演进中,为了进一步平衡算力成本与性能表现,还衍生出了多种优化版本:比如稀疏注意力模型,通过优化注意力计算的 Token 选择逻辑,降低长序列计算的复杂度;混合注意力模型,将线性注意力与传统注意力架构相结合,适配不同长上下文场景的处理需求;以及混合专家模型(MoE),采用稀疏激活逻辑,在保证模型性能的前提下,将计算开销降低至原有的五分之一左右(160)。
应用举例:Transformer 架构是当前所有主流大模型的技术底座,包括 Google Gemini、GPT 系列、Llama3、DeepSeek、Qwen 等大语言模型,还包括 BLIP-2、LLaVA 等多模态大模型;此外,在机器翻译、长文本摘要、问答系统等 NLP 核心任务中,也有广泛的应用(74)。
权威参考来源:
- IBM Transformer 架构技术详解:https://www.ibm.com/think/topics/transformer-model
- Transformer 原创论文《Attention Is All You Need》:https://arxiv.org/abs/1706.03762
2.2 稀疏注意力机制(Sparse Attention)
来源:Google Research、DeepSeek 技术官方博客
官方定义:稀疏注意力机制是对 Transformer 架构中传统全注意力机制的轻量化优化方案 —— 核心逻辑是打破传统机制中 “每个 Token 必须与序列中所有其他 Token 计算注意力关系” 的限制,通过可学习的动态路由策略,让每个 Token 仅与部分高相关性的关键 Token 计算注意力权重,在几乎不损失模型精度的前提下,将长序列的计算复杂度从原本的 O (L²) 降低到 O (L) 或 O (LlogL) 级别(160)。
技术详解:
传统 Transformer 采用的全注意力机制,虽然能完整捕捉上下文语义,但存在显著的算力瓶颈 —— 随着输入序列长度(L)的增长,注意力计算量会呈指数级上升,这也是制约大模型处理长上下文文本的核心技术障碍(160)。稀疏注意力通过 “动态筛选关键 Token” 的核心逻辑,对计算流程进行了轻量化重构,当前主流的技术路线分为三类:
- 动态稀疏注意力(DSA) :由 DeepSeek 团队提出的优化方案,核心是通过 “闪电索引器” 和 “Token 选择器” 的两阶段筛选策略,在长上下文(如 128K 字符)中快速筛选出对当前 Token 语义表达最关键的部分核心 Token,仅对这部分高相关性 Token 进行注意力计算;
- 混合稀疏注意力(MoSA) :将多头注意力机制进一步细分为多个不同功能的注意力头组,不同的注意力头采用差异化的稀疏计算策略 —— 部分头负责捕捉局部语义关联,部分头专门捕捉长程语义依赖,还有一部分头专门捕捉全局上下文信息,通过混合调度实现性能与效率的平衡;
- 混合架构:将线性注意力与稀疏注意力技术相结合,比如 Qwen3-Next 模型采用的 “3 层线性注意力 + 1 层传统注意力” 组合架构,其中线性注意力负责全局信息的快速吞吐,稀疏注意力负责长程高精度语义检索,在保证精度的前提下,将推理速度提升了 5 倍以上(161)。
应用举例:稀疏注意力机制是当前长上下文大模型的核心支撑技术,在 GLM-5、DeepSeek-V3、Qwen3-Next 等主流大模型中均有采用;在实际场景中,它极大降低了长文本处理的算力成本,使得大模型能够高效处理长达数十万字符的长文档、甚至百万级字符的超长代码库,在长文档问答、长篇代码生成、书籍级内容概括等场景中发挥着关键作用(161)。
权威参考来源:
- DeepSeek DSA 稀疏注意力技术详解:https://www.deepseek.com/blog/technical-dsa-optimization
- 混合稀疏注意力 MoSA 官方论文:https://arxiv.org/pdf/2505.00315
2.3 混合专家模型(Mixture of Experts, MoE)
来源:Google Research、IBM 技术官方文档
官方定义:混合专家模型(MoE)是一种基于稀疏激活逻辑的深度学习架构,核心逻辑是将模型的整体计算任务,动态分配给多个独立的 “专家子模型” 协同处理 —— 在每一次计算中,仅部分特定的专家子模型会被激活并执行计算,其他专家子模型处于休眠状态,在保证模型表达能力的前提下,有效降低了整体算力成本(163)。
技术详解:
MoE 架构是为了解决 “模型参数量增长与算力成本可控性之间的矛盾” 提出的优化方案 —— 随着大模型参数量从百亿级增长到万亿级,全量计算的成本已超出产业落地的承受边界;MoE 的稀疏激活逻辑,恰好可以在不损失模型性能的前提下,将计算开销压缩至产业可接受范围(163)。这一架构的核心技术模块包括三个部分:
- 专家子模型:多个结构独立、参数不同的小型全连接网络,每个子模型会专门学习、精通特定细分领域或任务的特征规律;
- 门控网络:负责根据输入的 Token 内容,动态选择一部分最合适的专家子模型来处理当前 Token—— 这一调度逻辑是按需激活,不会让所有专家子模型同时执行计算;
- 稀疏激活逻辑:在每一次计算中,只有被门控网络选中的少数专家子模型会被激活并参与计算,其他专家子模型保持休眠状态,有效降低了整体计算开销。
随着技术迭代,MoE 架构也在不断优化升级 —— 比如 Qwen3-Next 模型采用的 “超稀疏 MoE” 架构,将专家子模型的数量扩展到 512 个,但在每次计算中仅激活其中 11 个,实现了 “80B 级总参数、3B 级激活参数” 的优化效果;同时搭配混合注意力架构,在保证模型精度的前提下,将推理速度提升了 6 倍以上(166)。
应用举例:MoE 架构是当前 “低成本超大规模模型” 的核心技术支撑,已在 GPT-4o(部分采用)、Qwen3-Next、DeepSeek-V3 等主流大模型中广泛采用;在实际场景中,它能在提升模型综合性能的同时,将推理算力成本降低 60% 以上,这也是大模型能够在行业级高并发场景中大规模落地的关键技术前提(163)。
权威参考来源:
- IBM MoE 架构技术详解:https://www.ibm.com/think/topics/mixture-of-experts
- MoE 架构技术论文:https://arxiv.org/abs/2502.05893
三、模型生态层:AI 应用的基础底座
这一层是现代 AI 应用的核心底座,由基础模型、大模型核心技术、模型交互协议三个关键子层构成,是支撑上层业务应用的技术基础。
3.1 基础模型(Foundation Model, FM)
来源:斯坦福 HAI 研究所、中国信通院官方报告
官方定义:斯坦福 HAI 的基础模型研究中心(CRFM)在 2021 年最早提出这一术语,将其定义为 “在海量宽领域数据资源上进行大规模自监督训练完成的模型,具备广泛的下游任务适配能力”(88);中国信通院在《2025 年人工智能产业发展研究报告》中,进一步明确了基础模型的产业属性:它不是一个 “单一应用模型”,而是具备泛化能力的 “技术能力底座”—— 可以通过微调、提示词学习或检索增强生成等轻量化适配方式,迁移适配到几乎所有细分行业的多元下游任务中(86)。
技术详解:
基础模型的核心技术逻辑,是通过 “大规模 broad data + 大规模 self-supervision” 的组合范式,学习并建模数据的底层通用特征 —— 而非针对特定任务的表层规律;这一设计让它获得了显著的 “泛化优势”,可以适配不同行业、不同场景的下游任务,而无需单独为每个任务重新训练专属模型(88)。这一架构的关键技术特征包括四点:
- 海量参数量级:参数量通常在数十亿到万亿级,模型规模与泛化能力、知识承载能力呈显著正相关;
- 多模态原生支持:部分基础模型从训练阶段就开始同步学习多种模态数据的特征规律,具备同时理解、生成多种模态内容的能力;
- 泛化适配能力:通过轻量化的迁移学习手段,就能适配不同行业的不同下游任务,大幅降低了行业级 AI 应用的开发门槛;
- 知识密集型属性:在预训练阶段就学习了海量公开数据中的通用知识、行业知识和逻辑关系,为下游任务提供了通用知识支撑,无需再从零开始训练学习基础规律(91)。
2025 年,基础模型完成了关键的产业级技术升级,进化为 “基础超级模型”—— 这一概念被中国信通院评为 2025 年 AI 十大关键词之首,核心是在泛化能力的基础上,内置了智能体原生能力、行业适配接口和工具生态标准,具备了 “思考 + 行动” 的混合能力,成为了构建上层行业级 AI 应用的标准操作系统级基础设施(85)。
应用举例:基础模型是所有现代 AI 应用的技术底座,典型 examples include GPT-4o, Claude 3.5, Llama 3, Qwen3, DeepSeek V3, and Google Gemini; 基于这些基础模型,可以开发覆盖行业大模型、AI 智能体、多模态生成类的无数场景级应用,支撑了从行业级业务系统到个人端效率工具的全场景生态(91)。
权威参考来源:
- 斯坦福 HAI 基础模型官方定义:https://hai.stanford.edu/research/reflections-foundation-models
- 中国信通院《2025 年人工智能产业发展研究报告》:http://www.caict.ac.cn/kxyj/qwfb/ztbg/202602/P020260204553828220259.pdf
3.2 大语言模型(Large Language Model, LLM)
来源:IBM 技术官方文档、中国信通院 2025 年 AI 产业报告
官方定义:大语言模型是采用 Transformer 架构、在海量文本数据上完成预训练的基础模型子集,核心是通过自监督学习任务建模自然语言的内在规律,具备理解和生成人类语言的核心能力(106)。中国信通院的报告补充了其技术本质:它不是一个 “问答执行工具”,而是一个 “拥有海量语言知识的统计预测模型”—— 其底层技术逻辑是通过学习海量文本中的词序、语义、语法和关联关系,统计预测出 “给定上下文下,最符合人类语言逻辑的下一个 Token 概率分布”,最终生成连贯的、符合人类表达习惯的语义内容(107)。
技术详解:
大语言模型的技术逻辑分为三个核心阶段:
- 预训练阶段:在万亿级 Token 量级的海量、多样化、无标注的文本语料库(如网页、书籍、代码、行业文档)上,通过 “掩码 Token 预测” 或 “下一个 Token 预测” 这类大规模自监督任务进行训练 —— 这一阶段的核心目标,是让模型自主学习和建模人类语言的通用语法规则、常识知识、行业逻辑、上下文语义关联关系;
- 微调阶段:预训练结束后,模型会在特定任务或行业场景的有标注数据集上进行增量训练,将通用语言能力适配到具体应用场景,让模型的输出更符合行业场景的业务规则和用户偏好;
- 对齐阶段:这是保证模型落地安全性的关键环节,通过人工反馈强化学习(RLHF)、知识蒸馏等技术手段,让模型的输出与人类的价值观、伦理规范、行业合规要求对齐,避免有害、违规、不符合场景业务要求的输出(108)。
2025 年,LLM 技术路线的核心演进方向,是与多模态技术、稀疏注意力、混合专家架构深度融合,实现 “更高的推理精度、更长的上下文处理长度、更低的每千字符处理成本”,这一趋势直接推动了基础超级模型的产业级落地,大幅降低了行业级大模型的部署门槛和成本。
应用举例:LLM 是当前最成熟、落地场景最多的 AI 技术底座,典型的行业级落地场景包括文本生成、摘要、翻译、问答、代码生成与修复、信息提取、法律文书撰写、行业报告生成,以及作为对话机器人、智能客服等应用的核心引擎。
权威参考来源:
- IBM 大语言模型技术详解:https://www.ibm.com/think/topics/large-language-models
- 中国信通院《2025 年人工智能产业发展研究报告》:http://www.caict.ac.cn/kxyj/qwfb/ztbg/202602/P020260204553828220259.pdf
3.3 多模态大模型(Multimodal LLM)
来源:斯坦福 HAI 研究所、IBM 技术官方文档
官方定义:多模态大模型是指能够同时理解、处理、生成两种及以上不同类型模态数据的基础模型子集;其中 “模态” 是指对同一信息的不同数据表现形式,比如文本、图像、音频、视频、3D 点云、传感器数据等。与单模态模型的最大区别在于,它能在统一的语义空间中对齐、融合不同模态的特征信息,实现跨模态的理解与生成。
技术详解:
多模态大模型的核心技术逻辑,是在统一的特征空间中,对不同模态的内容进行语义对齐、特征融合和关联建模,让模型可以通览不同模态的信息,综合输出更准确的理解或生成结果(179)。其技术架构包含三个核心模块:
- 模态编码器:用对应的特征提取网络,将不同类型的模态数据映射到维度统一的高维特征空间,比如用 Vision Transformer(ViT)提取图像特征、用 Wav2Vec2 提取音频特征;
- 跨模态融合模块:采用跨模态注意力机制、特征对齐损失函数,将不同模态的特征在统一语义空间中进行对齐和深度融合,让模型建立不同模态之间的语义关联关系;
- 模态解码器:根据输入的多模态融合特征,生成用户所需的目标模态内容,完成跨模态输出,比如根据图文混合输入生成视频。
随着技术演进,当前多模态大模型的技术架构分为两类主流路线:
- Early Fusion(早期融合) :在特征提取阶段就对齐融合不同模态的特征,典型架构如 BLIP-2、LLaVA;
- Late Fusion(晚期融合) :先分别提取各模态的特征,再在高层语义阶段进行对齐融合,典型架构如 GPT-4o、Gemini 1.5 Pro。
应用举例:多模态大模型是 AIGC 跨模态场景的核心技术支撑,典型落地场景包括文生图、图生文、文生视频、语音生成图像、多模态知识问答、医疗影像与病历文本综合诊断、工业缺陷图像与检测报告联合分析、无人驾驶车辆的多模态环境感知、数字人的多模态交互等(69)。
权威参考来源:
- 斯坦福 HAI 多模态模型技术综述:https://hai.stanford.edu/research/reflections-foundation-models
- IBM 多模态大模型技术详解:https://www.ibm.com/think/topics/multimodal-ai
3.4 检索增强生成(Retrieval-Augmented Generation, RAG)
来源:Facebook AI Research(现 Meta AI)2020 年论文、IBM 技术官方文档
官方定义:RAG 是一种大模型外部知识增强的技术架构,核心逻辑是在大模型生成回答的前一阶段,先从用户指定的外部知识库(如企业内部文档、行业数据库、公开权威资料)中检索与当前用户查询语义最相关的资料片段,将这些检索结果作为额外的上下文输入到原有的大模型提示词中,由模型综合用户原始提问和补充上下文生成最终输出;这一设计相当于给大模型外接了一个专属知识存储器,有效解决了纯大模型的固有缺陷(37)。
技术详解:
RAG 的核心技术价值,是在不对大模型进行额外微调的前提下,通过检索注入外部相关上下文的方式,增强大模型输出的事实准确性、时效性、行业合规性。这一架构的标准工作流包含四个核心步骤:
- 索引预处理阶段:将指定的外部知识库中的所有文档数据,进行分块、计算特征向量,构建专用的向量索引库 —— 这一阶段是保证后续检索效率的关键前提;
- 检索阶段:对用户的原始查询内容进行语义特征提取,在向量库中执行相似度检索,召回与用户提问语义最相关的前 N 个高质量资料片段;
- 增强阶段:将检索到的相关资料片段,作为额外的上下文补充到原始用户提示词中,构建成 “用户原始指令 + 补充上下文” 的增强型提示词;
- 生成阶段:大模型对增强后的提示词内容进行综合理解,基于给定的上下文信息生成忠于检索资料的精准输出。
根据检索逻辑的不同,RAG 的主流技术路线分为两类:
- Naive RAG:对用户查询进行单轮检索,直接将检索结果拼接成上下文,适用于简单的单轮问答场景;
- Advanced RAG:在基础流程上增加了查询重写、检索结果相关性重排序、上下文冗余性过滤、多轮问答记忆维护等优化模块,显著提升了复杂行业场景下的检索精准度,是企业级 RAG 应用的标准技术配置(96)。
应用举例:RAG 是当前企业级 AI 开发中,解决大模型 “知识幻觉”“知识滞后” 问题的首选技术方案,也是行业私有知识接入大模型的最主要途径;典型落地场景包括企业专属智能客服问答系统、基于内部知识库的企业知识助手指南、行业文献专属问答系统、研发机构的技术文档问答机器人、金融行业的最新财报问答系统、医疗行业的最新诊疗指南辅助查询系统等(97)。
权威参考来源:
- IBM RAG 技术架构详解:https://www.ibm.com/think/architectures/rag-cookbook
- RAG 原创论文:https://arxiv.org/abs/2005.11401
3.5 函数调用(Function Calling)
来源:OpenAI 官方技术文档、Anthropic 官方开发文档
官方定义:Function Calling 是大模型的一项核心能力,它允许开发者以 JSON Schema 格式,向大模型描述外部工具 / 函数的名称、入参定义、功能逻辑,由大模型根据用户的自然语言指令,自主分析意图并选择调用最合适的外部工具、生成符合入参规范的结构化请求;这一机制相当于给大模型扩展了 “外接工具” 的标准化能力,让大模型从单纯的 “文本生成器” 升级为 “可以调用工具完成真实任务的决策核心”(112)。
技术详解:
Function Calling 的本质,是在 “大模型的自然语言理解能力” 与 “外部工具的结构化执行能力” 之间,搭建了一套标准化的语义映射和参数转换机制;它的核心技术逻辑是 “模型选工具、应用层执行工具”,完整工作流分为四个步骤:
- 工具注册阶段:开发者将可用的外部工具 / 函数的元信息(名称、描述、入参规范、返回值结构、错误码定义),以 JSON Schema 格式提供给大模型;
- 意图分析阶段:大模型根据用户的自然语言指令,分析用户的真实任务意图,自动判断是否需要调用外部工具、选择哪一个工具;
- 参数结构化生成阶段:如需调用工具,大模型会严格按照开发者给定的 JSON Schema 规范,生成符合工具入参格式的结构化请求内容;
- 执行与反馈阶段:由应用层代码负责解析并执行这个外部函数调用,将工具的真实执行结果按指定格式返回给大模型,由模型结合任务目标,对执行结果做进一步处理或生成最终用户可见的输出。
这一技术的核心价值,是让大模型可以受控地访问外部工具,而不是让模型自己直接执行任意代码或访问外部资源 —— 所有可调用的工具、参数都可以由开发者按需控制,在不损失安全性的前提下,极大扩展了大模型的应用边界。
应用举例:Function Calling 是当前 AI 智能体、复杂大模型应用的关键技术支撑,典型落地场景是让大模型调用第三方工具完成真实世界的任务,比如调用天气 API 查询实时天气、调用企业内部 CRM 接口查询用户数据、调用数据库接口执行行业数据查询、调用第三方支付接口完成查询账单支付、调用主流地图 API 生成行业级路线规划等。
权威参考来源:
- OpenAI Function Calling 官方技术文档:https://platform.openai.com/docs/guides/function-calling
- Anthropic Function Calling 技术详解:https://docs.anthropic.com/en/docs/tool-use
3.6 模型上下文协议(Model Context Protocol, MCP)
来源:Anthropic 官方技术文档
官方定义:MCP 是一种开放的标准化通信协议,于 2024 年 11 月由 Anthropic 公司首次发布,核心是为大模型应用与外部数据源、外部工具之间,提供一套统一的、中立于厂商的双向连接规范;有了这套协议,开发者就无需针对每个模型厂商、每种不同工具单独定制连接逻辑,可以直接基于标准化的 MCP Client 接入所有支持该协议的模型和工具,实现了模型与外部工具之间的无缝集成,被业内形象地称为 “AI 领域的 USB-C 接口”(136)。
技术详解:
MCP 的核心技术价值,是解决大模型应用的 “碎片化集成” 问题 —— 在 MCP 出现之前,模型与外部工具之间的对接没有统一标准,不同模型厂商、不同工具的接口规范不同,开发者需要单独开发大量适配代码,才能完成模型与工具的连接;MCP 通过标准化协议,将 “模型与外部工具的通信逻辑” 和 “模型的业务能力逻辑” 彻底解耦,大幅简化了集成工作量(138)。这一协议的技术架构,采用典型的客户端 - 宿主 - 服务器(Host-Client-Server)三层架构设计,核心技术模块包括三个部分:
- MCP Server:标准化的外部工具 / 数据源的服务端代理,对外部工具的 API 进行了协议适配,将不同工具的能力都封装成统一的 MCP 能力规范,提供统一的能力描述、调用请求处理和结果返回格式;
- MCP Host:模型与外部工具的通信调度中枢,负责维护模型与所有 MCP Server 的安全连接、会话管理、能力路由,承载协议格式转换、流量控制、请求校验、响应结果汇聚的核心功能;
- MCP Client:嵌入在大模型应用侧的轻量级通信客户端,将应用侧的工具调用请求、上下文数据,按标准 JSON-RPC 2.0 格式封装为符合 MCP 规范的协议数据格式,通过安全通道发送给 MCP Host,并完成结果解析返回给应用侧。
MCP 协议的核心技术规范,基于 JSON-RPC 2.0 规范设计,包含三类核心通信交互类型:
- 工具调用类:模型向外部工具发起的标准调用请求与响应交互;
- 上下文注入类:将外部数据源的相关上下文信息,按需同步注入给模型的交互;
- 事件通知类:外部工具向模型异步推送的任务执行状态、事件通知类消息交互。
应用举例:MCP 是智能体时代的关键技术基础设施,典型落地场景是 standardized access to enterprise applications, databases, file systems, and API tools by AI agents and AI agent clusters. 比如企业级智能体通过 MCP 协议,标准化连接到企业内部的 ERP、CRM、OA、数据库等多业务系统;跨智能体协同场景下,通过 MCP 协议完成不同智能体的通信交互,实现跨系统的业务数据获取、工具调用和结果回传。
权威参考来源:
- MCP 协议官方规范:https://modelcontextprotocol.io/zh-cn/specification/2024-11-05/
- Anthropic MCP 技术白皮书:https://www.anthropic.com/news/model-context-protocol
四、Agent 应用层:AI 技术的落地工具
这一层是 AI 技术从 “技术能力” 转化为 “业务动作” 的关键执行单元,是让 AI 从 “输出内容” 升级为 “自主完成复杂任务” 的核心工具链路。
4.1 智能体(AI Agent)
来源:OpenAI 官方技术文档、中国信通院 2025 年智能体技术报告
官方定义:AI Agent 是一种以大模型为核心认知引擎,具备自主感知环境、决策规划、工具调用、执行反馈、迭代反思闭环能力的智能系统;它能在用户给出高层级业务目标后,在无人类额外干预的前提下,自主分析任务拆解逻辑、选择和调用外部工具、执行完整任务流程,是将大模型的智能推理能力,转化为可落地的业务动作的关键载体(120)。中国信通院在《2025 年智能体技术和应用研究报告》中,补充了企业级智能体的落地标准定义:它不是 “单纯的聊天机器人”,而是以大模型为核心,具备自主规划、工具调用、环境交互能力,能在企业级私有化环境中稳定运行,完成长链路、高价值业务任务闭环的智能系统。
技术详解:
AI Agent 的核心技术逻辑是 “LLM 核心推理 + 工具调用加持”—— 它以大模型作为 “大脑”,进行任务拆解、意图分析、决策生成、结果反思;以 Skill 工具集为 “手脚”,执行实际的业务操作;用 MCP 协议作为 “通信标准通道”,获取上下文数据、回传工具执行结果;最终通过 “思考 - 行动 - 观察” 的完整迭代闭环,实现用户给定的复杂业务目标(120)。一个完整的 AI Agent 技术架构,包含五个核心迭代闭环模块:
- 目标理解模块:大模型根据用户的自然语言指令,明确最终任务目标,拆解成可量化的阶段验收标准;
- 环境感知模块:通过 MCP 协议连接的外部数据源,获取完成任务所需的实时数据、行业信息、业务上下文;
- 任务规划模块:核心决策环节,由大模型根据任务目标、可用工具和上下文数据,自主将长链路的复杂任务,拆解为多个有先后依赖关系的可执行子任务,确定子任务的执行顺序、调用工具的参数要求、校验逻辑;
- 工具调用模块:根据规划结果,通过 Function Calling 生成标准化的工具调用请求,通过 MCP 协议将请求发送给外部工具执行,接收工具执行结果;
- 迭代反思模块:这是保证任务准确率的关键环节,由大模型根据工具执行结果、上下文业务数据、预设验收标准,判断子任务是否成功完成;若失败,则自动回溯执行流程,调整参数策略或切换工具,重新执行前序子任务,直到最终实现目标。
根据技术能力层级的不同,当前主流的 AI Agent 技术路线分为三类:
- 标准型 Agent:单轮感知、简单任务规划、直接调用工具完成短链路任务;
- 反馈型 Agent:具备基本的执行结果反思能力,根据工具执行结果,动态调整后续执行策略;
- 协同型 Agent:多智能体(Multi-Agent)协同,不同专长的 Agent 分工,通过 MCP 协议进行通信交互,协同完成超复杂长链路任务(133)。
应用举例:AI Agent 是当前行业级 AI 应用 evolution 的核心方向,也是 AI 技术从 “工具” 向 “业务数字化员工” 转变的关键落地形态;典型落地场景是企业级的长链路复杂任务执行,比如市场情报数据采集与分析报告撰写、多源数据联动的行业财报分析与摘要生成、企业多系统数据联动的业务工单自动处理、研发助手的技术文档生成与代码提交、人力资源部门的多渠道简历筛选与邀约、金融行业的客户风险评级报告生成、医疗行业的多模态病历数据辅助分析、生成诊疗方案建议等(133)。
权威参考来源:
- OpenAI Agent 官方技术介绍:https://openai.com/zh-Hans-CN/index/introducing-chatgpt-agent/
- 中国信通院《2025 年智能体技术和应用研究报告》:http://www.caict.ac.cn/kxyj/qwfb/ztbg/202506/P020250628553828220259.pdf
4.2 技能(Skill)
来源:OpenAI 官方 Skills 开发指南、Anthropic 官方开发文档
官方定义:Skill 是 AI Agent 可以调用的、独立完成特定原子任务的标准化可复用工具集合;它是对 “工具调用逻辑 + 业务执行步骤” 的标准化封装,让 Agent 可以按照固定流程完成特定的子任务,不同 Skill 可以被不同 Agent 复用,也可以被组合成更复杂的子任务,为 Agent 提供了标准化的能力扩展手段(122)。
技术详解:
Skill 的核心设计逻辑,是 “标准化工具调用流 + 标准化工具描述流”—— 对 Agent 所需的特定工具的调用逻辑、执行流程、参数校验逻辑进行统一封装,隐藏不同工具的 API 接口差异,为 Agent 提供统一的能力调用接口;这一设计的最大价值是 “一次开发、全场景复用”,大幅降低了工具的复用成本,也让 Agent 的工具链可以灵活扩展。
每个 Skill 的技术结构,遵循 OpenAI、Anthropic、Google 等主流模型厂商统一采用的开放标准格式,以文件夹形式组织,核心包含三类标准化文件:
- 技能定义文件:即
SKILL.md文件,采用 Markdown 或 JSON Schema 格式,以标准化的方式定义 Skill 的名称、功能描述、适用场景、入参格式、返回值格式、业务执行步骤、依赖的工具; - 技能实现文件:包含实际业务逻辑的可执行代码 / 脚本文件,比如 Python 脚本、Java Jar 包,或对第三方工具 API 的适配调用逻辑;
- 技能示例文件:提供该 Skill 的标准调用示例、入参模板、返回值样例、错误码处理规则,供 Agent 理解调用规则、开发者调试参考。
Skill 与 Agent、MCP 协议的技术协作逻辑是:MCP 协议为 Agent 提供了调用 Skill 的标准化通信通道;Skill 以标准化方式接入 MCP Server,成为可被 Agent 调用的标准能力;Agent 在执行任务时,通过 MCP Client 与 MCP Host 通信,获取 Skill 列表、调用 Skill、接收执行结果;三者共同构成 AI Agent 的完整执行链路(123)。
应用举例:Skill 是构建 AI Agent 应用的关键基础组件,所有需要被 Agent 调用的原子任务,都可以封装为 Skill;典型落地场景包括 “读取企业内部 CRM 数据”“调用天气 API 查询天气”“根据参数生成行业报表”“调用地图 API 获取路线规划”“查询企业 ERP 中订单状态”“调用 OA 接口创建审批工单”“对上传的文档进行 RAG 摘要生成” 等。
权威参考来源:
- OpenAI Skills 官方开发指南:https://platform.openai.com/docs/guides/skills
- Anthropic Skill 开发最佳实践:https://docs.anthropic.com/en/docs/build-with-claude/tool-use
4.3 工作流(Workflow)
来源:OpenAI 官方技术文档、中国信通院 2025 年智能体技术报告
官方定义:Workflow 是为了实现某个复杂业务目标,将多个独立的 Skill(或子任务)按照依赖关系、执行顺序组合而成的完整自动化执行流程;它定义了完成复杂任务所需的所有子任务的执行顺序、依赖关系、路由条件、参数传递逻辑和结果校验规则,是指导多技能、多子任务协同执行的核心逻辑载体(127)。
技术详解:
Workflow 的核心技术逻辑,是将一个复杂的长链路任务拆解为多个短链路的原子子任务,再将这些子任务按业务逻辑、依赖关系进行编排、组合,定义每个子任务的输入参数、执行条件、异常处理逻辑,最终形成一个完整的、自动化的、可被 Agent 执行的业务流程;这一设计的价值,是将复杂任务的 “执行逻辑定义” 与 “实际执行动作” 彻底解耦,大幅提升了复杂业务逻辑的可维护性、复用性。
根据子任务间的执行流转逻辑,当前主流的 Workflow 技术路线分为三类:
- 顺序执行流:子任务按固定的先后顺序执行,上一个任务成功完成后,才会执行下一个任务,适合简单的线性业务场景;
- 条件分支执行流:根据上一个任务的执行结果或特定参数判断,选择后续执行的任务分支,适合存在多种业务路径判断的场景;
- 并行执行流:在满足依赖前置条件的前提下,多个无依赖关系的子任务可以同时执行,适合需要同步执行多个独立子任务的场景,提升执行效率。
Workflow 与 Agent、Skill 的关系是:Skill 是工作流编排的最小原子单元;Agent 是工作流的主动执行方;Workflow 是由 Agent 根据任务目标选择的 “执行步骤指南”;在执行时,Agent 解析 Workflow 的流程逻辑,按顺序调用指定 Skill 完成子任务,将上一个 Skill 的执行结果传递给下一个 Skill,直到完成整个 Workflow,实现任务目标(127)。
应用举例:Workflow 是支撑 AI Agent 处理长链路、复杂业务任务的核心技术支撑,典型落地场景是将多个 Skill 组合成完整的自动化业务流程,比如将 “查询 CRM 数据”“生成客户画像”“分析风险信息”“创建 OA 审批工单” 这几个原子 Skill 组合为一个完整的 “金融客户风险评估” Workflow;将 “获取最新财报数据”“生成摘要”“分析异常指标”“生成可视化报告” 这几个 Skill 组合为 “行业财报分析” Workflow;将 “采集项目进度数据”“计算偏差”“分析原因”“发送预警邮件” 组合为 “项目进度风险预警” Workflow 等。
权威参考来源:
- OpenAI Agent Workflow 技术详解:https://platform.openai.com/docs/guides/agentic-workflows
- 中国信通院《2025 年智能体技术和应用研究报告》:http://www.caict.ac.cn/kxyj/qwfb/ztbg/202506/P020250628553828220259.pdf
4.4 规约驱动开发(Spec-Driven Development, SDD)
来源 :IEEE 1016-2009 标准、微软 2026 年 AI 系统开发官方指导文档
官方定义 :SDD 是一种以标准化可验证的规约为唯一开发依据的软件工程方法论,也是 AI 智能体工程化落地的核心支撑准则;它将系统的可执行规约作为开发流程的唯一事实来源,驱动后续的代码生成、工具集成、测试验证和版本交付,有效解决 AI 智能体开发中 “代码与业务意图偏差、文档与实际部署不同步、跨角色开发理解有鸿沟” 的行业级痛点(25)。
技术详解 :
SDD 的核心技术逻辑,是将智能体开发流程从 “代码优先、事后补文档”,彻底反转为 “规约优先、代码自动生成”—— 在编写任何应用代码之前,必须先由产品、开发、测试、业务侧多方角色,共同定义并签署一份完整的、可被 AI 理解的结构化规约(Spec);这份规约是所有开发活动的权威依据,后续的架构设计、代码生成、任务执行链路、测试用例编写,都将直接基于这份规约展开,且所有产出物必须与规约的约定保持完全一致(26)。SDD 在 AI 智能体开发中的标准落地流程,分四个核心阶段:
- Specify(定义规约) :由产品、开发、测试、业务侧多方角色协同,将智能体的业务目标、能力范围、边界约束、验收标准,转化为一套完整的、机器可解析的结构化规约;
- Plan(技术规划) :由架构师或 AI 工具链,将规约中的高层业务需求,拆解为一套细粒度、可执行的技术架构方案和原子级任务树,明确每个任务的技术实现手段、依赖资源、执行标准;
- Implement(落地实现) :由 AI 编程工具或开发人员,严格按照拆解后的技术方案和规约约束,实现智能体的核心逻辑,包括技能注册、工作流配置、MCP 对接规则;
- Validate(验证闭环) :由自动化测试工具或测试人员,依据规约的验收标准,对智能体的功能进行端到端的验证;如果测试结果不符合规约要求,或实际执行与规约存在偏差,则直接回溯相关任务的执行逻辑,重新进入 Implement 阶段。
SDD 的核心技术特征,是与 Loop 循环迭代机制的深度集成:在 Validate 阶段完成验证后,所有的测试结果、验证数据、偏差分析结论,都会被反馈到业务适配 Loop 中;由 Loop 驱动规约或代码的迭代优化,进入下一轮 Specify→Plan→Implement→Validate 闭环,实现智能体工程化的持续迭代升级(27)。
应用举例 :SDD 是企业级 AI 智能体规范化落地的核心支撑方法论,典型的行业级落地场景包括:民生银行在其私有化 AI 智能体开发项目中,采用 SDD 范式,将智能体的业务流程、行业级安全约束、接口规则、验收标准,定义为一套分层的结构化规约文档;后续的代码生成、工具集成、测试验证,都严格以这份规约为唯一依据,通过企业级 CI/CD 流水线完成智能体的部署,有效解决了 AI 代码与业务意图偏差的行业痛点(28)。
权威参考来源 :
- IEEE 1016-2009 软件设计规约标准:https://standards.ieee.org/ieee/1016/4502/
- 微软 AI 系统 SDD 开发范式官方指导文档:https://techcommunity.microsoft.com/blog/educatordeveloperblog/spec-driven-development-for-ai-enabled-enterprise-systems/4520807
附:PRD vs SDD vs TDD vs BDD 核心区分(AI 工程视角)
| 维度 | PRD 产品需求文档 | SDD 规约驱动开发 | TDD 测试驱动开发 | BDD 行为驱动开发 |
|---|---|---|---|---|
| 前置核心产物 | 自然语言业务需求、功能说明、用户场景、产品规则 | 全局技术规约/接口契约、数据模型、系统约束 | 单元测试用例、代码校验规则 | Given-When-Then 标准化业务场景用例 |
| 介入时机 | 项目最前期,研发启动前的需求定义阶段 | 编码最开始,承接 PRD、落地技术方案与契约 | 单功能编码前,底层逻辑开发阶段 | 需求对齐阶段,PRD 定稿后、技术设计前 |
| 解决核心痛点 | 明确产品做什么、解决用户什么问题,统一业务认知,界定产品范围 | AI 幻觉、接口不一致、架构走样、多方技术理解偏差、需求落地歧义 | 底层代码逻辑 Bug、边界场景遗漏、代码健壮性不足 | 产品、研发、测试业务认知断层,场景理解不一致 |
| AI 适配能力 | 较弱,纯自然语言描述,无固定格式,AI 易理解偏差、解读随意 | 最强,结构化机器可读规约,作为 AI 全局上下文,严格约束生成边界 | 中等,仅约束单函数、单模块逻辑,无顶层架构约束 | 一般,仅覆盖业务流程场景,无法约束技术实现细节 |
| 典型工件 | PRD 文档、原型图、需求清单、产品流程图 | OpenAPI、Spec.md、领域 DSL、数据规约文档 | UnitTest 单元测试代码、测试套件 | .feature 场景文件、业务行为描述用例 |
| 核心定位 | 业务层:告诉团队「要做什么功能」 | 技术契约层:告诉团队「功能技术标准是什么」 | 代码逻辑层:保证「代码运行结果正确」 | 业务落地层:明确「功能在什么场景下如何运行」 |
💡 完整研发链路总结:
PRD(定业务)→ BDD(定场景)→ SDD(定技术契约)→ TDD(保代码质量),四层层层落地,完美适配 AI 全流程开发,彻底解决需求歧义、AI 幻觉、代码不规范问题。
4.5 技术规约说明书(Specification, Spec)
来源 :IEEE 1016-2009 标准、微软 2026 年 AI 系统开发官方指导文档
官方定义 :Spec 是 SDD 范式下的核心产物,是一份完整的、结构化的、可被 AI 理解与执行的技术文档;它详细描述了 AI 智能体的业务目标、能力范围、边界约束、执行流程、接口规范、验收标准和非功能约束,是 SDD 流程中所有开发活动的权威参考基准,也是连接 SDD 与 Loop 迭代机制的关键桥梁(38)。
技术详解 :
Spec 的核心技术逻辑,是将智能体的所有业务需求与技术约束,转化为一套机器可解析、可量化、无歧义的标准化契约 —— 这份契约是连接业务角色与技术角色的关键中间层,明确了业务方的需求与技术方的交付标准,所有涉及智能体的技术细节,都必须在 Spec 中进行无歧义的精准定义;它由分层的多个关键技术模块构成,各模块间通过唯一标识进行追溯关联,是驱动 SDD 流程、Loop 迭代闭环的核心权威依据(22)。在 AI 智能体开发场景中,一份标准的 Spec 包含四个核心分层模块:
- 业务层规约:记录智能体的业务目标、覆盖范围、核心业务价值,以及行业级业务流程规则,所有内容采用行业标准语义描述,不涉及任何技术实现细节;
- 架构层规约:定义智能体的系统架构、模块划分、技能清单、工作流调度逻辑、MCP 接口对接规则,以及各模块的依赖关系、交互逻辑与数据流转标准;
- 技术层规约:定义智能体的技术栈版本、外部工具调用规则、API 约束、编码规范、安全规则、性能阈值,以及所有技能的输入输出参数格式、异常处理码、调用超时重试规则;
- 验收层规约:定义验证智能体是否符合需求的标准验收测试用例,包括每个功能的验证步骤、预期的业务结果验证标准,以及可量化的非功能指标验收阈值;所有测试用例均直接来自业务层规约的需求拆解,与需求一一对应。
应用举例 :Spec 是 SDD 范式落地的核心支撑,典型的行业级落地场景包括:在某银行的智能客服机器人开发项目中,技术团队基于 SDD 范式,将机器人的业务目标、能力范围、行业级安全约束、技术接口规则、可量化的验收标准,编写为一份完整的结构化 Spec 文档;后续的代码生成、工具集成、测试验证,都严格以这份 Spec 为唯一依据,在企业级 CI/CD 流水线中完成自动化部署。
权威参考来源 :
- IEEE 1016-2009 软件设计规约标准:https://standards.ieee.org/ieee/1016/4502/
- 微软 AI 系统 Spec 编写官方指导文档:https://techcommunity.microsoft.com/blog/educatordeveloperblog/spec-driven-development-for-ai-enabled-enterprise-systems/4520807
4.6 SDD+Spec+Loop 落地协同闭环
来源 :中国信通院 2025 年 AI 工程化实践报告、微软 2026 年 AI 系统开发官方指导文档
官方定义 :SDD+Spec+Loop 落地协同闭环,是让 SDD 开发范式真正落地的核心组合机制 —— 它以 Spec 文档为唯一权威依据,驱动 SDD 开发流程的标准化执行,再以 Loop 循环迭代机制为引擎,将 SDD 流程中各阶段的产出物,转化为持续迭代优化的依据,完成从 Spec 定义、SDD 落地到 Loop 优化的全链路协同闭环(30)。
技术详解 :
SDD+Spec+Loop 落地协同闭环的核心技术逻辑,是通过 Spec 的标准化约束、SDD 的流程化落地、Loop 的自动化迭代,形成一套完整的 “权威依据→执行落地→验证反馈→持续优化” 的工程化闭环;三个关键单元各司其职、相互支撑,共同保障 AI 智能体的规范化、高质量落地。这一闭环的标准落地流程,包含四个核心步骤:
- Spec 定义阶段:由产品、开发、测试、业务侧多方角色协同,共同编写 Smart 分层结构 Spec 文档,完成智能体所有业务需求、技术约束与验收标准的无歧义定义;再由架构师或 AI 工具链,将 Spec 中的高层业务需求,拆解为细粒度、可执行的原子级任务树,明确每个任务的技术实现手段、依赖资源、执行标准;
- SDD 执行阶段:AI 编程工具或开发人员严格按照拆解后的任务树,以及 Spec 中定义的技术约束,完成智能体的代码开发、技能注册、工作流配置、MCP 对接规则设置;所有代码生成、工具集成,都必须以 Spec 为唯一依据,不允许任何偏离 Spec 的实现;
- Loop 验证阶段:SDD 流程完成开发部署后,业务适配 Loop 会自动触发验证流程:先由自动化测试工具,依据 Spec 中定义的验收标准,对智能体进行端到端的全链路测试;再将所有测试结果、性能数据、业务侧的实际使用反馈,统一汇总为规范的迭代反馈报告;
- Loop 迭代阶段:反馈报告被回传给 Specify 阶段的角色,由他们根据反馈数据,迭代更新 Spec 文档或技术方案;随后重新进入 Plan→Implement→Validate 的 SDD 流程,完成智能体的功能优化、性能提升或合规性升级;每一轮迭代都会更新 Spec 的版本号,并记录变更历史,作为后续迭代的参考依据。
应用举例 :SDD+Spec+Loop 落地协同闭环,是企业级 AI 智能体高质量、规范化落地的核心保障,典型的行业级落地场景包括:在某保险行业的智能保单解析系统开发项目中,技术团队采用 SDD 范式,编写了分层结构的 Spec 文档,覆盖了保单解析的业务规则、技术实现细节、接口标准、行业级安全约束与验收标准;随后的代码开发、工具集成、测试验证,都严格以这份 Spec 为唯一依据,通过企业级 CI/CD 流水线完成部署;系统上线后,业务适配 Loop 持续收集每天的保单解析结果、业务人员反馈和错误率,自动生成迭代反馈报告;技术团队根据报告数据,定期更新 Spec 文档,重新触发 SDD 流程的代码调整、测试验证,在上线后的三个月内,完成了 8 轮迭代优化,将保单解析的准确率从 92% 提升至 99.5%,同时将单份保单的解析时延从 3s 降至 800ms(30)。
权威参考来源 :
- 中国信通院《2025 年 AI 工程化实践报告》:http://www.caict.ac.cn/kxyj/qwfb/ztbg/202603/P020260312678912345678.pdf
- 微软 AI 工程化落地官方指导文档:https://techcommunity.microsoft.com/blog/educatordeveloperblog/spec-driven-development-for-ai-enabled-enterprise-systems/4520807
五、支撑技术层:AI 的算力、数据、算法底座
这一层是保障 AI 模型训练、优化、落地执行的算力、数据和算法基础支撑体系,是上层技术模块的支撑底座。
5.1 算力层
5.1.1 智能算力(Intelligent Computing Power)
来源:中国信通院 2025 年智能算力研究报告、ISO/IEC 22989:2022 标准
官方定义:智能算力是指专门用于人工智能任务计算的算力资源总和,由异构计算资源(如 GPU、NPU、FPGA、ASIC 芯片)配合高速互联网络构成,主要满足 AI 模型训练、推理、 fine-tuning、向量检索等不同场景的计算需求(146)。与传统算力的最大区别在于,它对 “高密度、高并发、高带宽的浮点计算” 进行了专门优化,能够匹配深度学习、大模型等计算密集型任务的要求。
技术详解:
智能算力的技术支撑架构,由异构算力芯片、互联网络、算力调度平台三个核心部分组成。这三个模块协同支撑了从底层的计算资源,到上层的模型训练 / 推理实际任务的完整技术链路,核心技术逻辑包括三点:
- 异构算力芯片:智能算力的核心硬件基础,针对不同 AI 任务的计算特点提供不同类型的算力支撑 —— 其中 GPU 是当前 AI 算力的主流计算核心,适合并行计算的通用型 AI 任务;NPU 是专门针对 AI 计算场景设计的专用芯片,功耗更低、效率更高;FPGA 是可灵活编程的半定制化芯片,适合对延迟要求极高的实时推理场景;ASIC 是专用定制芯片,针对特定任务做极致算力优化,实现超高算力能效比;
- 高速互联网络:用于将多算力芯片、多计算节点连接成算力集群,保证训练数据、模型参数在芯片、节点之间的高带宽、低时延传输,支撑超大规模模型的分布式训练;
- 算力调度平台:智能算力的核心软件支撑层,核心是通过池化调度技术,将分散的算力资源统一封装成标准的算力池,根据模型训练 / 推理的实际需求,动态分配、调度算力资源,实现算力资源的弹性伸缩、隔离和精细化计费,提升整体算力资源的利用率(146)。
智能算力的核心计量单位是 FLOPS(每秒浮点运算次数)—— 区别于传统算力的 IPS(每秒指令执行次数)。根据适配场景的不同,智能算力的技术分类分为三类:
- 训练算力:专门支撑模型预训练、微调任务的算力资源;
- 推理算力:专门支撑模型上线后实际业务请求的算力资源;
- 标注算力:专门支撑数据标注的算力资源,通常由低功耗的边缘算力资源承载。
应用举例:智能算力是支撑所有 AI 模型从训练到落地的核心基础设施,也是支撑上层所有 AI 业务应用的基础底座;典型场景包括大模型的预训练、微调任务的算力支撑,高并发大模型 API 服务的推理算力支撑,以及智算中心、AI 云服务中面向不同场景的算力资源池化服务。
权威参考来源:
- 中国信通院《2025 年智能算力发展研究报告》:http://www.caict.ac.cn/kxyj/qwfb/ztbg/202504/P020250402553828220259.pdf
- ISO/IEC 22989:2022 智能算力标准定义:https://www.iso.org/obp/ui/#!iso:std:74296:en
5.1.2 智算中心(AI Computing Center, ACC)
来源:中国信通院 2025 年智算中心发展研究报告
官方定义:智算中心是专门为 AI 应用场景建设的公共算力基础设施,它以异构算力资源为核心,以高速互联网络为基础,配合标准化的算力池化调度层、AI 模型框架、算法开发包,实现算力资源的统一调度、按需分配,支撑从模型训练到推理的全生命周期算力服务。
技术详解:
智算中心不是 “传统数据中心 + 算力资源” 的简单叠加 —— 它的所有技术架构设计,都围绕 “满足 AI 计算高密度、高并发、高带宽、低时延的要求” 这一核心目标展开;其完整技术架构从底层到上层分为四层:
- 算力资源层:由大量 GPU、NPU 等异构算力芯片,配合高速内存、低时延本地存储资源构成,是整个智算中心的算力生成基础;
- 高速互联层:采用专门的高频互联网络,将多算力芯片、多计算节点连接成超大规模算力集群,支撑超大规模分布式训练;
- 资源调度层:以智能化的算力池化调度软件为核心,将底层分散的算力资源统一封装成弹性算力资源池,根据用户的实际任务需求,动态分配、调度算力、存储、网络资源,实现弹性伸缩、租户隔离、实时监控调度;
- AI 服务化层:提供封装好的 AI 开发框架、模型训练包、主流模型运行环境、标准化 API 接口,将底层的算力能力,以标准化的训练 / 推理服务形式提供给上层应用,大幅降低了用户的使用门槛。
应用举例:智算中心是支撑大模型、生成式 AI、多模态模型等技术规模化落地的关键算力基础设施,也是支撑区域内行业级 AI 应用大规模落地的重要底座;典型场景包括支撑超大规模基础模型的长时间预训练、为行业级 AI 应用提供高并发推理算力资源、支撑本地私有模型微调训练、提供标准化的 AI 算力云服务。
权威参考来源:
- 中国信通院《2025 年智算中心发展研究报告》:http://www.caict.ac.cn/kxyj/qwfb/ztbg/202508/P020250829553828220259.pdf
5.2 数据层
5.2.1 高质量数据集(High-Quality Dataset)
来源:中国信通院 2025 年高质量数据集建设指南、国家数据局 2025 年高质量数据集建设指引
官方定义:高质量数据集是指符合特定质量标准、可直接用于 AI 模型训练、微调、评估的数据集,其核心特质是高价值、高密度、标准化、合规性 —— 能够有效提升模型训练的效率、精度与泛化能力,是决定模型上线后实际业务性能的关键基础。
技术详解:
高质量数据集的技术内涵,随着 AI 技术的发展阶段发生了本质变化:在传统机器学习阶段,业界普遍认为 “数据规模越大,模型效果越好”;但随着大模型技术的迭代,尤其是进入生成式 AI 阶段,业界的核心共识从 “数据规模大” 转向了 “数据质量高”—— 单纯依靠海量低质量数据,已经无法支撑模型性能的进一步提升,甚至会导致模型性能下降;只有高质量的数据集,才能在模型训练中,有效提升模型的泛化能力、精度与合规性。
高质量数据集的技术标准,包含四个核心维度,缺一不可:
- 高价值密度:数据内容与训练任务的强相关性,以及数据本身的场景信息丰富度、准确度;
- 标准化格式:数据的存储格式、标签格式、描述格式等,必须遵循业界或行业统一的标准规范,且标签与内容的一致性校验通过;
- 完整性:数据需覆盖场景内所有特征维度、所有主流分布情况,没有关键缺失,且经过完整的去重、清洗、标准化处理;
- 合规性:数据的采集、存储、传输、使用、全生命周期,都需符合行业隐私、版权、安全合规要求,且经过合规性校验。
从技术分类看,高质量数据集根据其加工深度,分为三级技术等级:
- 基础级:完成清洗、去重、标准化格式化的数据集;
- 增强级:在基础级之上,完成特征标注、业务逻辑校验、关联关系补充、多源融合的数据集;
- 专业级:在增强级之上,经过领域专家审核、符合行业业务规范、可以直接支撑行业级模型训练的数据集(154)。
应用举例:高质量数据集是支撑 AI 模型训练、微调、评估性能的核心基础 —— 它在整个模型成本中的占比高达 30%-50%,直接决定了模型的上限性能;典型场景包括支撑基础模型预训练、行业级专有模型微调、AI 应用算法训练等。
权威参考来源:
- 中国信通院《人工智能高质量数据集建设指南》:http://www.caict.ac.cn/kxyj/qwfb/ztbg/202508/P020250829553828220259.pdf
- 国家数据局《高质量数据集建设指引》:http://www.nda.gov.cn/ztzl/sjzg/sjjc/202508/t20250801\_4175.html
5.2.2 数据增强(Data Augmentation)
来源:中国计算机学会(CCF)术语库、NVIDIA 官方技术文档
官方定义:数据增强是一种通过对现有训练数据进行可控的规则变化、组合或生成新样本,从而提升数据利用效率、缓解模型过拟合问题的技术;核心逻辑是在不额外采集真实数据的前提下,对现有数据进行可控变换,生成符合真实场景逻辑的新训练样本,以此提升模型的泛化能力、对不同场景的适应能力(152)。
技术详解:
数据增强的核心技术价值,是在不增加真实采集数据量的前提下,通过生成 “新的、但保持原有标签特征” 的训练样本,来平衡训练数据的样本分布、强化场景特征细节、提升模型对场景特征的学习能力、降低过拟合风险。这一技术的核心难点在于,要保证增强后的新样本必须保留原数据的核心业务特征,以及对应的标签信息的一致性 —— 如果变换后样本的特征或标签发生偏移,反而会降低模型训练效果。
根据处理的模态不同,数据增强的主流技术路线分为三类:
- 图像数据增强:采用几何变换类技术,对图像进行随机裁剪、旋转、缩放、翻转、平移,以及颜色变换类技术,调整图像的亮度、对比度、饱和度、高斯噪声,生成新的图像样本,同时保留图像的核心语义特征;
- 文本数据增强:采用回译技术,将原文本翻译为另一门语言后再翻译回原语言,或使用同义词替换、随机插入、随机交换、随机删除词等技术,生成新的文本样本,同时保留原句的核心语义;
- 音频数据增强:采用音调偏移、语速调整、音量缩放、添加背景噪声、频谱变换等技术,生成新的音频样本,同时保留音频的关键特征信息(152)。
应用举例:数据增强是 AI 模型训练阶段的常用关键技术,几乎覆盖了所有 AI 任务的训练环节;典型场景包括在训练数据量不足、或部分场景样本采集成本较高的情况下,对有限的真实训练数据进行可控的规则变换,生成大量符合真实场景逻辑的新训练样本,提升模型的泛化能力。
权威参考来源:
- 中国计算机学会(CCF)数据增强术语定义:https://www.ccf.org.cn/Topics/Glossary/
- NVIDIA 数据增强技术详解:https://blogs.nvidia.com/blog/2021/03/25/data-augmentation-deep-learning/
5.3 算法层
5.3.1 混合式推理(Hybrid Inference)
来源:NVIDIA 官方技术文档、阿里云技术官方博客
官方定义:混合式推理是一种 combining multiple deep learning models or architectures to optimize inference performance for a given task. It dynamically selects the most appropriate computing unit or model architecture based on the actual task requirements, balancing computational efficiency and model accuracy.
技术详解:
混合式推理的核心技术逻辑,是 “不同任务特征匹配不同计算架构”—— 将不同架构的模型或计算资源,根据任务特征进行组合使用,以实现最优的推理效果。这一技术路线的核心设计逻辑是 “扬长避短”:结合不同架构的优势,规避各自短板,针对不同场景的实时性、精度、成本需求,灵活选择最优计算单元或模型架构;其技术实现包含三个核心维度:
- 混合使用不同计算架构:比如在自动驾驶场景中,用传统 CNN 架构处理近距离的实时图像感知数据,用稀疏注意力架构处理长距离的时序环境感知数据,用轻量级线性注意力架构进行实时决策输出,通过多架构协同处理,实现感知任务的低时延、高吞吐执行;
- 混合使用不同量化精度的计算资源:对任务中精度要求较高的核心环节,采用高精度 FP16/TF32 算力资源执行;对精度要求较低的辅助环节,采用低精度 INT8/INT4 算力资源执行,在保证业务效果的前提下,有效降低推理算力成本;
- 混合使用不同模型架构的接口输出:将多个不同架构模型的推理结果,通过标准化策略汇聚整合,综合生成更精准的最终结果,提升模型泛化能力。
应用举例:混合式推理是当前大模型、多模态模型,以及对算力成本要求苛刻的边缘 AI 场景的核心技术支撑;典型落地场景包括多模态理解与生成任务、长文档问答任务、低成本的边缘模型推理、高并发的企业级大模型推理服务、自动驾驶多模态环境感知、实时工业视觉缺陷检测、移动端低功耗语音识别等。
权威参考来源:
- NVIDIA 混合式推理技术详解:https://developer.nvidia.com/blog/hybrid-inference-combining-ml-models-for-optimized-inference/
- 阿里云混合式推理技术详解:https://developer.aliyun.com/article/762567
5.3.2 量化(Quantization)
来源:NVIDIA 官方技术文档、IBM 技术官方文档
官方定义:量化是一种模型优化轻量化技术,通过将模型参数、激活值、计算张量的高精度浮点数据(如 32 位全精度 FP32、16 位半精度 FP16),用较低精度的整数数据(如 INT8、INT4)进行近似表示,在保证模型精度在业务可接受范围的前提下,减少模型内存占用、降低计算算力开销、提升推理速度,实现模型的轻量化部署。
技术详解:
量化的核心技术逻辑,是用 “低精度数据近似表示高精度数据”—— 通过减少表示参数值或激活值的比特数,来降低模型计算的算力成本与传输存储成本;它的核心难点在于,需要在 “精度损失控制在业务可接受的范围内” 的前提下,完成轻量化优化,平衡轻量化效果与模型业务性能的关系。
根据量化的执行阶段,量化的主流技术路线分为两类:
- 训练后量化(PTQ) :模型训练完成后,直接对成品模型进行轻量化量化处理,无需重新训练模型,实现成本低,是当前工业级模型部署中最常用的量化技术;
- 量化感知训练(QAT) :在模型训练过程中,就引入量化误差的噪声注入,对模型进行量化适配训练,训练完成后再执行量化处理;这一技术的量化精度损失更小,但需要重新训练模型,技术实现成本更高。
根据量化的粒度,量化的主流技术路线又分为两类:
- 按张量量化:对模型的每一层网络的所有参数整体进行量化,执行效率高;
- 按通道量化:对模型的每个卷积通道的参数单独进行量化,精度损失更低。
应用举例:量化是当前大模型、多模态模型,以及对算力要求苛刻的边缘 AI 场景的关键轻量化优化技术;典型落地场景包括将大模型量化后部署到用户移动端、边缘智算节点,以更低的算力成本支撑高并发大模型推理服务,节省服务器算力资源开销,或在不影响业务效果的前提下,缩短模型推理响应时延。
权威参考来源:
- NVIDIA 量化技术详解:https://developer.nvidia.com/blog/pruning-quantization-deep-learning-model-optimization/
- IBM 模型轻量化量化技术详解:https://www.ibm.com/think/topics/deep-learning-model-optimization
六、行业应用层:AI 技术行业落地的技术分支
这一层是 AI 技术在不同垂直行业场景下的落地技术分支,是核心技术能力与行业场景需求的结合。
6.1 计算机视觉(Computer Vision, CV)
来源:GB/T 41864-2022 计算机视觉术语标准、IBM 技术官方文档
官方定义:计算机视觉是人工智能的一个核心子领域,使用深度学习技术让计算机从图像、视频等多模态视觉数据中提取、理解并使用有意义的语义信息,模拟人类的视觉感知和认知能力,最终实现对视觉内容的自动化分析与决策。
技术详解:
计算机视觉的核心技术逻辑,是将非结构化的视觉数据(如 jpg 图像、mp4 视频、高清工业相机图片),通过深度学习网络的逐层特征提取与建模、理解转换为计算机可以处理的结构化语义信息或决策结果。这一领域的技术架构,以卷积神经网络(CNN)和 Transformer 架构为核心支撑,包含四个主要技术方向:
- 图像分类:识别整张图像的预定义类别,如区分 “猫”“狗”“汽车”,是所有计算机视觉任务的基础底层技术;
- 目标检测:在图像或视频中,识别出目标物体的具体位置、范围和类别,典型场景是人脸识别、安防违规行为抓拍、工业产品缺陷检测;
- 图像分割:进一步将图像中的每个像素点,按所属的目标类别进行划分,更精准地提取不同目标的边界细节,典型场景是医疗病灶部位像素级分割、高精度自动驾驶行人与车辆分割;
- 视觉理解:结合多模态技术,将图像与文本类标注数据进行跨模态关联,让模型可以理解视觉内容的完整语义信息,如给图像生成描述性文本,或根据文本指示定位视觉目标,典型场景是多模态内容理解、无人驾驶车辆的环境感知。
应用举例:计算机视觉是工业场景落地最为成熟的 AI 技术之一,覆盖了几乎所有行业的视觉相关场景;典型落地场景包括安防监控系统的人脸检测、行人异常行为抓拍、车辆违章识别,工业制造场景的产品缺陷检测、装配精度测量、生产流程标准化监控,医疗场景的核磁 / CT 影像病变识别、病灶区域分割、辅助诊断,自动驾驶场景的行人 / 车辆 / 交通标志检测、路况环境感知,以及农业病虫害检测、教室内教学动作识别、物流快递分拣扫码等。
权威参考来源:
- GB/T 41864-2022 信息技术 计算机视觉 术语标准:https://openstd.samr.gov.cn/ign/gb/2022/0725/7256375985174896858.pdf
- IBM 计算机视觉技术详解:https://www.ibm.com/think/topics/computer-vision
6.2 自然语言处理(Natural Language Processing, NLP)
来源:ISO/IEC 22989:2022 标准、IBM 技术官方文档
官方定义:自然语言处理是人工智能的一个核心子领域,融合了语言学、计算机科学、机器学习等多学科知识,致力于让计算机理解、处理和生成人类的自然语言(如文本、语音、方言、行业俚语),实现人与计算机之间无障碍的自然交互。
技术详解:
自然语言处理的核心技术逻辑,是将非结构化的人类语言(如文章、对话、语音录音),通过深度学习技术进行语义理解,转化为结构化的计算机可处理指令或数据,再将处理结果转化为符合人类表达习惯的语言内容。这一领域的技术架构,以 Transformer 架构和大语言模型为核心支撑,包含两个核心技术方向:
- 自然语言理解(NLU) :让计算机理解人类语言的意图和真实语义 —— 包括语法逻辑、上下文关联、隐喻和语气情绪,这是所有 NLP 任务的基础前提;
- 自然语言生成(NLG) :让计算机将处理结果,组织成连贯的、符合人类表达习惯的自然语言输出。
随着技术演进,当前 NLP 的主流技术路线,是融合了 NLU、NLG、多模态技术的端到端架构 —— 其中核心技术模块包括 Tokenization、注意力机制、编码器、解码器、提示词引擎等。
应用举例:自然语言处理是当前落地场景最多的 AI 技术之一,支撑着所有需要人机语言交互的场景;典型落地场景包括搜索引擎的语义解析、机器翻译、对话式智能客服机器人、银行智能外呼语音机器人、行业专属知识问答系统、文本情感分析、用户意见挖掘、多语言合同解析、内容审核、代码生成与修复、长文档摘要生成、医疗病历编码提取、临床诊断建议生成等。
权威参考来源:
- ISO/IEC 22989:2022 自然语言处理标准定义:https://www.iso.org/obp/ui/#!iso:std:74296:en
- IBM 自然语言处理技术详解:https://www.ibm.com/think/topics/natural-language-processing
6.3 生成式 AI(Generative AI, GenAI)
来源:斯坦福 HAI 研究所、IBM 技术官方文档
官方定义:生成式 AI 是人工智能的一个技术子集,通过学习海量训练数据的特征规律、结构逻辑及内在关联,生成全新的、与训练样本具有相似特征逻辑的原创内容或数据 —— 而非对现有内容的简单复用或拼接,是让 AI 具备 “创意创造” 能力的核心技术方向。
技术详解:
生成式 AI 的核心技术逻辑,是对训练数据中不同模态样本的高维特征分布、关联关系、结构逻辑进行精准建模,学习其中的规律和内在联系,而非简单记忆训练样本的内容细节;再基于学习到的规律,根据用户提示词生成原创内容。这一技术的底层支撑,是多模态大模型架构,且通常结合 RAG、Skill 等技术,以保证生成内容的准确性、时效性和行业合规性。
应用举例:生成式 AI 是当前行业级 AI 应用创新的核心技术方向,落地场景覆盖了几乎所有行业的内容创做类需求;典型落地场景包括文本生成、图像生成、语音生成、视频生成、3D 内容生成、跨模态内容生成、工业产品概念设计、医疗影像生成、分子结构生成、游戏资产生成、行业报告生成、定制化营销内容创作、法律文书的初稿撰写、代码生成与修复等。
权威参考来源:
- 斯坦福 HAI 生成式 AI 技术综述:https://stanmed.stanford.edu/glossary/artificial-intelligence/
- IBM 生成式 AI 技术详解:https://www.ibm.com/think/topics/generative-ai
6.4 智能体(AI Agent)
Agent 是行业级 AI 应用的关键执行单元,其定义、技术架构、协作逻辑已在4.1 节详细阐述。
在行业级应用场景中,智能体的核心价值是 “将技术能力转化为行业业务动作”;典型落地场景包括:企业级的长链路复杂任务执行,如多源数据联动的行业财报分析与摘要生成、市场情报数据采集与分析报告撰写、研发助手的技术文档生成与代码提交、人力资源部门的多渠道简历筛选与邀约、金融行业的客户风险评级报告生成、贷款资质初审、综合类银行客服问答、医疗行业的多模态病历数据辅助分析、生成诊疗方案建议、医院级智能问诊导诊、工业制造行业的生产线上采集数据的智能分析、设备异常预警及工单生成处理、行业客户智能分层运营与风险挽留等。
6.5 机器人流程自动化(Robotic Process Automation, RPA)
来源:IBM 技术官方文档、IEEE 技术官方标准
官方定义:机器人流程自动化是一种基于预先编写好的自动化脚本 / 工作流,模拟人在各类系统界面上的标准化重复操作动作,将现有业务流程中的人工操作任务进行自动化处理的技术,是实现行业级业务流程自动化的重要技术支撑。
技术详解:
RPA 的核心技术逻辑,是 “模拟人类的标准化操作行为”—— 它通过预置的操作选择逻辑、流程控制逻辑,以及定位元素、录入数据、点击按钮、下拉选择等标准动作脚本,在现有第三方应用系统的用户界面上执行人工可复现的标准化操作,完成相应的业务任务。与 AI 技术的区别在于:RPA 是 “基于固定规则的流程执行”,没有智能认知能力;而 AI 是 “基于数据的智能认知决策”,可以理解非结构化数据、自动拆解任务、执行差异化规则流程。
随着技术演进,RPA 发展出了与 AI 技术融合的核心技术路线 ——AI-Powered RPA(智能 RPA):将大模型、智能体、计算机视觉等技术与传统 RPA 技术相结合,用计算机视觉技术来识别应用界面上的各种元素定位,用大模型来理解非结构化数据、自动拆分子任务、生成执行步骤,让 RPA 可以处理包含非结构化数据的复杂业务流程,如多系统数据联动的业务工单自动生成、非结构化数据的自动录入、业务文档数据的智能提取等。
应用举例:RPA 是行业级数字化办公的常用技术支撑,常与智能体、大模型技术搭配使用,将企业内长链路、重复执行、低附加值的人工操作任务,转化为自动化执行任务,实现效率提升;典型落地场景包括财务部门的多银行账户交易明细下载、财务对账、发票校验与款项支付,人力资源部门的员工入职信息系统录入、社保操作、薪酬计算及发放通知,客服部门的客户数据收集汇总、工单自动分配,以及制造业 ERP 系统产销联动数据自动录入、供应链物流状态数据抓取、运单生成、银行企业对账、交易明细下载等。
权威参考来源:
- IBM 机器人流程自动化技术详解:https://www.ibm.com/think/topics/robotic-process-automation
- IEEE RPA 技术标准:https://standards.ieee.org/standard/2755-2021.html
七、伦理与治理层:保障 AI 健康发展的风险约束框架
这一层是为了确保 AI 系统的安全、合规、鲁棒、公平、透明、负责任而建立的技术标准、流程和约束手段,是 AI 技术规模化、产业化落地的重要前提保障。
7.1 可解释性(Explainability)
来源:ISO/IEC 42001:2023 可解释性标准、欧盟 AI Act 官方标准
官方定义:可解释性(也称为 “可说明性”)是指 AI 系统的决策过程、推理逻辑、关键依据,能够以人类可理解、可审计、可复用的清晰形式,被有效地呈现和解释的技术特质。
技术详解:
AI 可解释性的核心技术价值,是让人类理解 “AI 为什么会做出这样的决策 / 输出结果”,以及 “数据、算法、参数在这个决策结果中的影响权重有多大”—— 这是用户、监管机构信任 AI 系统的核心前提,也是排查、修正 AI 系统潜在缺陷,提升模型鲁棒性的关键手段。
根据解释对象的不同,可解释性的主流技术路线分为两类:
- 全局可解释性:对 AI 模型的整体推理逻辑、所有输入维度特征与输出结果之间的关联关系进行全面解释,呈现模型的完整决策逻辑,如分析所有输入特征对最终结果的影响权重;
- 局部可解释性:对 AI 模型的单个具体输入样本的推理依据、决策逻辑进行针对性解释,比如针对某一个用户的风险评级结果,单独解释影响这一结果的主要特征依据。
根据技术实现逻辑的不同,可解释性的主流技术路线又分为两类:
- 内在可解释性:模型自身结构就具备的天然可解释性,模型的决策规则、推理逻辑、参数含义都可以被直接读取和理解,不需要额外的处理环节,通常是结构相对简单的传统机器学习模型具备这一特征;
- 事后可解释性:在模型训练完成后,通过专门的可解释性工具,对模型的推理逻辑、输出结果进行反推分析,生成人类可理解的解释说明,这是复杂的大模型、多模态模型最常用的可解释性实现手段(209)。
应用举例:可解释性是 AI 行业级高风险场景落地的必备技术条件,在金融、医疗、政务、司法等对决策结果强合规要求的行业中,是行业级 AI 系统上线的必要前提;典型落地场景包括金融行业的智能风控模型决策依据解释,给出用户风险评级的具体依据、贷款审批结果的原因说明,医疗行业的 AI 辅助诊断结果依据解释,政务行业的智能审批结果依据解释,司法行业的案件辅助量刑建议的详细依据解释等。
权威参考来源:
- ISO/IEC 42001:2023 可解释性标准:https://www.iso.org/standard/77892.html
- 欧盟 AI Act 可解释性合规要求:https://eur-lex.europa.eu/legal-content/EN/TXT/?uri=celex%3A32024R1689
7.2 公平性(Fairness)
来源:OECD AI 原则、欧盟 AI Act 官方标准
官方定义:AI 公平性是指 AI 系统在设计、开发、部署、运维的全生命周期中,都应当遵循公平、公正、非歧视的原则,不能因用户的种族、性别、宗教、年龄、地域、身体缺陷、婚姻状况等无关特征而产生偏见性结果,也不能通过任何显性或隐性设计,对特定群体造成不公平的区别对待。
技术详解:
AI 公平性的核心技术逻辑,是在 AI 系统的全生命周期内,通过技术手段和流程设计,消除敏感特征与输出结果之间的不合理关联关系,确保结果分配的公平性。这一技术环节的核心难点在于,消除 “训练数据中存在的历史偏见” 和 “模型算法本身的固有偏见”—— 这两类偏见,是导致 AI 系统产生不公平结果的根源。
对应不同类型的偏见,公平性的主流技术路线分为三类:
- 数据层面的公平增强技术:在数据准备阶段,分析训练数据中不同特征的分布情况,对样本分布进行均衡化处理,去除数据中的敏感特征、歧视性特征和历史偏见规律,补充缺失的代表性样本,保证训练数据的特征分布无歧视、符合公平性规范;
- 模型层面的公平增强技术:在模型训练阶段,采用带有公平性约束的优化算法,调整模型的训练方向,引入公平性相关评价指标,将敏感特征的影响权重降到最低,强制模型优先学习与公平性目标相关的特征规律;
- 结果层面的公平性校验技术:在模型推理阶段,在输出结果前增加结果校验模块,对不同群体的输出结果进行统计分析,一旦发现结果分布存在统计性偏差,就对结果进行针对性校准,规避不公平结果的输出(205)。
应用举例:公平性是 AI 系统合规落地的核心前提,也是金融、医疗、政务、招聘、电商、教育等行业级 AI 应用上线的必要条件;典型落地场景包括金融行业的用户风险评级、贷款资质审核模型的公平性校验,医疗行业的患者分诊、病灶识别模型的公平性校验,招聘行业的简历筛选、人才测评模型的公平性校验,政务行业的公共服务资源分配模型的公平性校验等。
权威参考来源:
- OECD AI 原则公平性规范:https://www.oecd.org/ai/principles/
- 欧盟 AI Act 公平性合规要求:https://eur-lex.europa.eu/legal-content/EN/TXT/?uri=celex%3A32024R1689
7.3 鲁棒性(Robustness)
来源:ISO/IEC 25010:2022 系统鲁棒性标准、IBM 技术官方文档
官方定义:鲁棒性(也称为 “健壮性”)是指 AI 系统在面对非法输入、数据噪声、环境变化、恶意攻击或非预期的场景输入时,仍然能够保持其性能表现、保证输出结果正确性、不发生崩溃或严重性能下降的能力,是衡量 AI 系统稳定性、可靠性的核心技术指标。
技术详解:
AI 鲁棒性的核心技术逻辑,是在 AI 系统的全生命周期内,通过设计、开发、测试、运维的多轮技术手段和流程设计,将错误、异常、攻击的影响控制在业务可接受的范围内,保证系统的连续正确运行。提升鲁棒性的主流技术路线分为四类:
- 对抗性训练技术:在模型训练阶段,向训练数据中故意加入大量经过精心设计的对抗性样本、噪声样本,对模型进行抗干扰训练,提升模型对异常样本的识别和抵抗能力;
- 输入检测与校验技术:在数据进入模型之前,对所有输入数据进行严格的合规性校验,过滤非法输入、异常字符、恶意攻击字符串,将输入数据限制在模型能够正确处理的范围内;
- 随机化防御技术:在模型的输入层、注意力层和输出层,加入轻量化的随机扰动或随机化处理,让模型对抗恶意输入的攻击尝试;
- 形式化验证技术:使用数学推理工具,对模型的逻辑完整性、鲁棒性进行全面分析验证,找出导致模型输出异常的逻辑边界,在系统实现时针对性进行防御设计(205)。
应用举例:鲁棒性是所有行业级 AI 系统的必备核心技术属性,是衡量其成熟度和业务连续性的重要指标;典型落地场景包括智能客服系统的非法输入容错防护、安防人脸识别系统的抗光线干扰、抗图片攻击、工业缺陷检测系统的抗现场光照干扰、自动驾驶环境感知系统的抗雨雪天气干扰、不同光照条件下的交通标志识别、大模型的恶意输入攻击防御等。
权威参考来源:
- ISO/IEC 25010:2022 系统鲁棒性标准:https://www.iso.org/standard/80366.html
- IBM AI 鲁棒性技术详解:https://www.ibm.com/think/topics/robustness-ai
7.4 安全(Security)
来源:ISO/IEC 23894:2023 AI 安全风险管理标准、IBM 技术官方文档
官方定义:AI 安全是指 AI 系统在其全生命周期中,能够有效抵御恶意攻击、数据非法访问、模型恶意逆向工程,保障系统的保密性、完整性、可用性、合规性,避免被攻击或滥用所导致的安全风险的能力,是支撑 AI 系统规模化落地的核心前提。
技术详解:
AI 安全的核心技术逻辑,是通过识别、量化、评估和控制 AI 系统全生命周期中的各类安全风险、薄弱点,采取对应的技术防御和安全管控手段,将风险控制在可接受的范围内,实现 “风险可见、风险可控、风险可追溯”。根据攻击对象与攻击链路的不同,AI 安全的主要技术方向分为四类:
- 数据安全防护技术:覆盖训练数据、用户输入数据、模型输出数据的全生命周期安全防护,在数据访问、传输、存储、使用、销毁环节,采用加密、脱敏、去标识化、隐私计算等技术,防止未授权的访问、泄露、篡改;
- 模型安全防护技术:保护模型本身不被未授权访问、篡改、逆向工程,采用模型加密、模型签名、水印、防逆向工程等技术,防止模型被非法提取、复制、篡改;
- Prompt 安全防御技术:在用户输入进入大模型前,对输入内容进行检测和过滤,识别并防御恶意输入,如 prompt 注入、间接提示词注入、已知的恶意 LGM 脚本命令等;
- 输出安全防护技术:在模型输出内容后,对输出数据进行多维度安全检测,识别并过滤模型生成的有害内容、违规数据、敏感信息,防止输出内容被用于恶意用途(193)。
应用举例:安全是 AI 系统规模化落地前必须解决的核心前提问题;典型落地场景包括大模型的恶意输入攻击防御、训练数据的隐私保护、模型的防窃取防御、生成内容的溯源,以及行业级 AI 系统的全生命周期安全防护。
权威参考来源:
- ISO/IEC 23894:2023 AI 安全风险管理标准:https://www.iso.org/standard/76885.html
- IBM AI 安全技术与治理方案详解:https://www.ibm.com/think/topics/ai-security
7.5 红队测试(Red Teaming)
来源:IBM 技术官方文档、MITRE ATT\&CK for AI 官方标准
官方定义:红队测试是一种针对 AI 系统的主动安全评估和 penetratration testing 技术,由具备 AI 安全攻击经验的专业安全团队,采用与真实攻击者相同的攻击技术、工具和流程,从用户视角尝试 bypass AI 系统的安全防护机制,主动挖掘 AI 系统中潜在的安全漏洞、合规隐患、攻击面,最终输出完整的漏洞报告及加固建议。
技术详解:
红队测试的核心技术逻辑,是 “以攻击者视角,从用户层面对 AI 系统进行真实攻击测试”,在系统上线前或运维过程中,主动发现安全隐患 —— 区别于常规的安全扫描技术,红队测试不是单纯地扫描漏洞,而是以真实业务场景为基础,模拟真实攻击者的技术手段,进行完整的、可重现的端到端攻击验证,确认漏洞可以被真实利用,验证系统防御能力的实际有效性。
针对 AI 系统的红队测试技术方向,主要覆盖以下四类核心攻击场景:
- 模型逃逸攻击测试:向模型输入精心构造的恶意样本,如添加了微小扰动的对抗性图像、经过混淆处理的恶意文本,在不被检测的情况下,试图让模型输出错误的结果,实现绕过模型安全防护的目的;
- 模型逆向攻击测试:通过向模型输入大量针对性样本,分析模型的输出特征,试图反推出模型架构、参数、训练数据、水印标记,进而盗取模型、复刻训练数据;
- Prompt 注入攻击测试:构造包含恶意指令的输入内容,提交给大模型,试图让模型绕过安全指令、执行未授权的操作,如读取系统预置的安全指令、提取敏感数据、生成恶意内容;
- 有害内容生成攻击测试:设计大量经过精心构造的恶意输入、敏感词汇组合,提交给大模型,试图绕过内容安全防御机制,生成符合违规策略、敏感、有害的内容,如歧视性内容、暴力内容、风险指令等(193)。
应用举例:红队测试是行业级 AI 系统上线前的必备安全评估环节,也是持续保障生产级 AI 系统安全的重要手段;典型落地场景是对企业级大模型服务平台、多模态内容生成系统、智能体应用、行业级图像 / 视频智能分析系统进行真实攻击测试,挖掘并修复所有可被真实利用的安全漏洞,保障系统上线后的安全运行。
权威参考来源:
- IBM 红队测试技术详解:https://www.ibm.com/think/topics/red-teaming
- MITRE ATT\&CK for AI 红队测试技术框架:https://attack.mitre.org/matrices/enterprise/ai/
7.6 水印(Watermarking)
来源:GitHub、IEEE 技术官方标准
官方定义:AI 水印技术是一种将标识信息以不可感知的方式嵌入 AI 模型、生成内容、模型训练数据的版权溯源防护技术,是实现模型版权保护及溯源追踪的关键手段。
技术详解:
AI 水印技术的核心技术逻辑,是在模型训练、推理或内容生成的过程中,将版权信息、用户标识、业务信息等溯源标识,以不可感知的方式,嵌入到模型的参数、生成内容的像素、频谱或其他特征空间中,在需要时,通过密钥和专用算法,从模型或生成内容中提取出标识信息,实现溯源追踪,同时不影响模型或生成内容的正常使用。
根据嵌入对象的不同,水印技术的主流技术路线分为三类:
- 模型水印:将溯源标识嵌入到模型的网络结构、权重参数或推理逻辑中,实现对模型版权的保护,以及模型的溯源追踪;
- 生成内容水印:将溯源标识嵌入到 AI 生成内容的特征空间中,实现对 AI 生成内容的溯源追踪;
- 训练数据水印:将溯源标识嵌入到训练数据中,追踪数据的使用流向,防止数据被未授权使用或泄露。
根据水印的可见性,技术路线又分为两类:
- 可见水印:在视觉或听觉上可以被人类感知的、叠加在内容上的溯源标识,通常用于明版权声明;
- 不可见水印:采用数字信号处理技术,将标识信息嵌入到内容的非敏感特征空间中,人类无法感知,需要专用算法和密钥提取,是行业级 AI 版权溯源的主流技术方案(192)。
应用举例:水印技术是行业级 AI 系统的必备安全技术,主要用于模型版权保护、生成内容溯源追踪、训练数据流向溯源;典型落地场景包括对企业级基础模型进行水印嵌入、对多模态生成内容进行版权溯源、追踪训练数据未授权流向、生成内容来源溯源及版权保护,以及行业级 AI 系统的生成内容合规溯源等。
权威参考来源:
- GitHub AI 生成内容水印技术规范:https://github.com/ai-watermark/ai-watermark-spec
- IEEE AI 水印技术标准:https://standards.ieee.org/standard/2755-2021.html
7.7 合规性(Compliance)
来源:ISO/IEC 42001:2023 AI 合规标准、欧盟 AI Act、中国《生成式 AI 服务管理办法》
官方定义:AI 合规性是指 AI 系统在设计、开发、测试、运维、运营的全生命周期中,必须严格遵守的所有适用法律、法规、行业标准和业务规范的能力,是衡量一个 AI 系统是否可以规模化落地的核心标准。
技术详解:
AI 合规性的技术实现逻辑,是根据监管和行业合规性要求,制定对应的技术管控机制,将合规性要求嵌入到 AI 系统的开发、测试、运维、运营流程中,通过自动化的技术控制手段,在 AI 生命周期的每个环节强制执行合规性管控要求,避免 AI 系统出现合规风险。
合规性的主流技术方向,覆盖 AI 生命周期的四个核心环节:
- 合规性需求拆解与设计环节:将监管的合规性要求,转化为可执行、可验证的技术标准,明确每个技术环节的合规性约束,比如定义训练数据合规性标准、生成内容允许 / 禁止的范围、加密要求;
- 开发与测试环节:在模型开发、训练、测试的全流程中执行合规性校验,比如训练数据的版权校验、模型鲁棒性测试、隐私泄露测试、可解释性验证、公平性验证;
- 上线运维环节:采用合规性管控技术,对模型的所有输入、输出进行实时校验,对模型的运行行为进行实时日志审计、采集和分析,保证实际运行流程合规;
- 定期评估环节:对模型的实际业务运行效果,定期进行合规性审计,根据监管标准或业务场景的变化,迭代优化模型的合规性管控机制(205)。
应用举例:合规性是行业级 AI 系统上线和规模化落地的必备前提;典型落地场景包括根据区域、行业监管要求,对所有行业级 AI 应用的全生命周期进行合规性校验,比如金融行业 AI 系统的合规性校验、医疗行业 AI 系统的合规性校验、政务行业 AI 系统的合规性校验等。
权威参考来源:
- ISO/IEC 42001:2023 AI 合规性管理体系标准:https://www.iso.org/standard/77892.html
- 欧盟 AI Act 合规性要求:https://eur-lex.europa.eu/legal-content/EN/TXT/?uri=celex%3A32024R1689
- 中国《生成式 AI 服务管理办法》官方条文:https://www.cac.gov.cn/2023/07/13/c\_1690898327029107.htm
八、AI 工程岗位体系
8.1 FDE - Forward Deployed Engineer 前线部署工程师
权威来源:
Palantir 原生岗位体系,OpenAI/Anthropic/ 国内大模型厂商 2024–2026 标准化落地岗位,信通院《企业级智能体落地白皮书》收录标准角色定义 [稀土掘金]。
官方定义
派驻至客户业务一线、对 AI 项目端到业务结果全权负责的复合型工程师;核心职责是打通通用大模型、私有数据、内部业务系统、合规权限,将实验室模型转化为可稳定产生业务价值的生产级系统,兼顾需求挖掘、定制开发、现场调试、持续迭代、产品反哺全链路。
技术详解:
1、核心定位区别(和传统实施 / 售前 / 后端)
- 实施工程师:仅按固定配置交付,不负责业务价值验证;
- 售前工程师:仅做 POC 演示,不承接长期生产运维;
- FDE:嵌入客户业务团队,自主挖掘隐性需求,从零搭建 RAG/Agent 完整流水线,搭建评测体系,跟踪业务指标,并把通用化方案反馈总部优化基础平台。
2、标准工作闭环
业务痛点挖掘 → 需求标准化定义 → Spec 规约编写(SDD 范式)→ RAG/Agent 工程搭建 → 数据权限与合规管控 → 上线效果评测 → 持续调优迭代 → 沉淀通用 Skill/Workflow 反哺产品[CSDN 博...]。
3、必备技术栈(iLearnAI 幻 X 本地部署、私有化专栏配套能力)
Python、向量数据库、LangChain/LlamaIndex、MCP 协议对接、SDD 规约驱动开发、容器私有化部署、企业 ERP/OA 系统集成、AI 红队安全测试、幻觉抑制方案。
落地场景:
银行私有知识库、制造质检 Agent、政企文档问答、金融风控智能体、医疗病历私有化系统等所有本地 / 驻场 AI 项目,是解决 “AI 试点无法规模化” 核心角色。
8.2 FSE - Forward Specialist Engineer 基础专家工程师
权威来源
大厂 FDE 配套分层岗位,企业 AI 落地团队标准分工体系,iLearnAI SDD 工程专栏配套角色划分。
官方定义
支撑 FDE 一线交付的后台专家工程师,专注垂直技术栈深度攻坚,为前线 FDE 提供标准化工具、预制 Skill、通用 Workflow、底层优化方案,不长期驻场客户,按需提供远程深度技术支持。
技术详解
- 岗位分层关系:FSE(后台技术底座)→ FDE(前线落地交付)
FSE 三大细分方向
- 模型 FSE:负责 LoRA/QLoRA 轻量化微调、量化推理、MoE 本地适配;
- 向量 RAG FSE:分块算法、混合检索、重排优化、多模态向量库;
- Agent SDD FSE:标准化 Spec 编写、Skill 封装、MCP 网关、多智能体协同 Workflow;
- 核心价值:把重复落地逻辑封装成可复用模块,降低 FDE 现场重复开发成本,统一企业 AI 开发规范。
落地场景
开发通用本地大模型部署模板、行业专用知识库流水线、标准化 Agent 技能库,供全国 FDE 快速复用。
工程岗位体系对比
| 维度 | FDE 前线部署工程师 | FSE 后台基础专家工程师@ |
|---|---|---|
| 工作地点 | 客户现场驻场为主 | 企业后台研发中心 |
| 核心目标 | 完成客户可落地业务 AI 系统 | 产出标准化通用技术模块 |
| 核心产出 | 客户定制 Agent/RAG 项目 | Skill、Workflow、微调模板 |
| 技术侧重 | 系统集成、业务对接、交付闭环 | 底层模型 / 向量 / Agent 底层优化 |
| 依赖关系 | 复用 FSE 产出工具快速交付 | 支撑全部 FDE 前线需求 |
补充:FDSE Forward Deployed Software Engineer 全栈前线工程师
FDE 高阶细分,在 FDE 基础上增加大型分布式系统、微服务、多租户隔离开发能力,面向超大型集团客户私有化 AI 集群交付。
结语
本文档基于 2022-2026 年 ISO、IEC、斯坦福 HAI、中国信通院、IBM、OpenAI、Anthropic 等全球权威机构发布的官方技术标准、行业报告、技术文档,系统性梳理了人工智能领域从基础理论到产业落地、技术生态再到伦理治理的全链路核心概念与术语,完整覆盖了 AI 技术从底层基础、到上层应用体系、再到落地保障治理的完整技术链条,展现了从 “技术能力” 到 “行业级业务落地” 的完整技术架构逻辑。
作为一门快速迭代的前沿技术,AI 行业的技术架构、业务模式、应用场景都在快速演进,新的概念、技术、架构、工具、治理模式也在持续涌现。我们将持续跟踪全球权威机构的技术标准变化、行业技术落地趋势、主流模型的技术演进方向,以季度为迭代周期,持续更新、完善本文档的内容,为产业界提供一份权威、及时、易懂的 AI 技术参考手册。
文档版本信息
版本号:V2026.0703
发布日期:2026 年 7 月 3 日
迭代记录:基于 2025 年 12 月版本更新,新增 2025-2026 年全球权威机构发布的最新技术术语及定义,包括基础超级模型、MCP 协议、智能体相关优化技术、AI 红队测试、模型水印等最新行业级技术标准及落地架构内容。
免责声明
- 本文档所提供的所有技术内容、定义、解释、举例、参考链接,均为行业通用的技术参考性质,均为网络公开信息,不承担任何因使用本文档或其中内容而产生的直接或间接的损失或责任。
- 本文档中涉及的所有技术方、第三方标准、第三方工具,仅作技术参考说明之用,不对其商业或技术层面的明示或暗示推荐或担保。
- AI 技术处于快速迭代中,本文档内容无法覆盖所有技术版本的细分差异,所有技术落地及应用的相关决策,需由技术团队结合实际场景的实际情况独立进行专业判断后执行,不对相关技术决策及落地效果承担任何责任。
- 本文档部分内容基于公开的行业技术资料、标准文档及行业惯例整理,如存在内容、标注等疏漏之处,欢迎您通过评论方式反馈,以便在后续版本中优化完善。
参考资料
[1] 人工智能在革命跃迁时代下的科技创新趋势研究报告.docx-原创力文档 https://m.book118.com/html/2025/1016/8013126111007143.shtm
[2] 推动人工智能发展迈上更高水平\_中国经济时报 http://m.toutiao.com/group/7534763568718234148/
[3] 人工智能技术、产业和政策态势 https://www.cace.org.cn/UpLoadFiles/File/20241218/6387011469579144277271604.pdf
[4] 一篇 报告 洞察 2025 人工 智能 + 行业 趋势 。 这份 报告 是 《 2025 “ 人工 智能 + ” 行业 发展 蓝皮书 》 , 由 上海 交通 大学 行业 研究院 发布 。 报告 全面 梳理 了 人工 智能 ( AI ) 技术 的 发展 现状 、 趋势 、 应用 场景 以及 相关 政策 和 伦理 问题 , 旨在 为 政府 、 企业 和 研究 机构 提供 决策 参考 。 以下 是 这份 https://www.iesdouyin.com/share/video/7501234166915271973
[5] 斯坦福 2025 AI 指数报告重磅发布!一文读懂全球 AI 发展全貌【文末附获取方式】\_nvca 区域分布数据、斯坦福技术许可办公室(otl)年度报告 这个可以在哪里看到-CSDN博客 https://blog.csdn.net/m0\_54016576/article/details/155530324
[6] AI 报告 - State of AI Report\_state of ai report 2024 下载-CSDN博客 https://blog.csdn.net/lovechris00/article/details/157545782
[7] 中国信通院发布《人工智能产业发展研究报告(2025年)》\_中国信通院 http://m.toutiao.com/group/7603652065675592232/
[8] 信通院2025人工智能产业十大关键词:基础超级模型、自主性更强的智能体、走向实训的具身智能、萌芽中的世界模型、AI 正在重塑软件、开放智算生态、面向行业的高质量数据集、开源成为标配、缓解模型幻觉、人工智能国际公共产品 – 智慧城市行业分析 https://www.smartcity.team/news/2025aikeyword/
[9] GB-T-41867-2022-信息技术-人工智能-术语-标准解读 - 道客巴巴 https://m.doc88.com/p-30680774512003.html
[10] AI入门体系化知识框架\_ai知识体系-CSDN博客 https://blog.csdn.net/gsjthxy/article/details/160382103
[11] Information technology — Artificial intelligence — Artificial intelligence concepts and terminology https://www.en-standard.eu/publicdoc/iec\_previews/3033179.pdf
[12] 人工智能是如何分类的 https://docs.pingcode.com/insights/q6c1f8cutg85wtb933cz2hw4
[13] 主流AI 七层关系:Token→提示词→上下文→Agent→Harness→MCP→Skills\_月更\_Geek\_e575df\_InfoQ写作社区 https://xie.infoq.cn/article/bfeecffbc958f16294a55d76f
[14] 40+ AI 核心术语图谱:一篇建立完整认知框架\_产品经理技能memory、skill、eval-CSDN博客 https://blog.csdn.net/q464042566/article/details/159819612
[15] 从0到1:了解 AI、大模型与智能体!-腾讯云开发者社区-腾讯云 https://cloud.tencent.com.cn/developer/article/2621634
[16] ISO/IEC 22989:2022 人工智能术语与概念标准解读 https://www.antpedia.com/standard/1785654106-10.html
[17] Exploring Artificial Intelligence: A Deep Review of Foundational Theories, Applications, and Future Trends https://jsiar.com/2025-September/JSIAR-S-25-09238.pdf
[18] 56个核心术语+高清架构图:一文看透人工智能全貌!\_人工智能\_耿直学编程-DAMO开发者矩阵 https://damodev.csdn.net/68a6c5b74e4959284dabce76.html
[19] 人工智能:技术分类、核心领域与应用全景\_人工智能分类 生成式和推理式-CSDN博客 https://blog.csdn.net/wanglin\_lin/article/details/152365928
[20] 人工智能技术全面梳理-腾讯云开发者社区-腾讯云 https://cloud.tencent.com/developer/article/2540674
[21] 人工智能发展报告:技术进展与产业分析(Kimi生成)当前,人工智能(AI)正经历一场深刻的范式革命,其发展核心已从单纯追 - 掘金 https://juejin.cn/post/7562020639541690403
[22] Types of AI: A Comprehensive Guide https://www.datacamp.com/zh/blog/types-of-ai
[23] 人工智能、人工神经网络、机器学习、深度学习、强化学习及大语言模型这六者之间的联系与区别-腾讯云开发者社区-腾讯云 https://developer.cloud.tencent.cn/article/2540671
[24] AI model types: Past, present and predictions for the future https://www.ibm.com/think/insights/ai-model-types-past-present-future-predictions
[25] We finally have a map for how AI agents learn. And it only has four quadrants. https://www.shashi.co/2025/12/we-finally-have-map-for-how-ai-agents.html?m=0
[26] 人工智能常见分类 - 技术栈 https://jishuzhan.net/article/1965345006640218113
[27] Artificial Intelligence Index Report https://hai.stanford.edu/assets/files/ai\_index\_report\_2026.pdf?file=ai\_index\_report\_2026.pdf
[28] Artificial Intelligence Glossary https://hai.stanford.edu/ai-definitions
[29] 斯坦福HAI官网完整版《2025 AI Index Report》全面解读-CSDN博客 https://blog.csdn.net/kkiron/article/details/159354377
[30] The 2025 AI Index Report https://hai.stanford.edu/ai-index/2025-ai-index-report?ref=blog.min.io
[31] 斯坦福 2025 AI 指数报告重磅发布!一文读懂全球 AI 发展全貌【文末附获取方式】\_nvca 区域分布数据、斯坦福技术许可办公室(otl)年度报告 这个可以在哪里看到-CSDN博客 https://blog.csdn.net/m0\_54016576/article/details/155530324
[32] 【必收藏】AI大模型70个核心术语全解析:从入门到精通,构建完整知识框架\_人工智能\_likuoelie-DAMO开发者矩阵 https://damodev.csdn.net/69a1065454b52172bc5dde8b.html
[33] 大模型狂飙2025:一篇文理清从模型到智能体的架构演进-腾讯云开发者社区-腾讯云 https://cloud.tencent.com.cn/developer/article/2616385
[34] 面对这场科技盛宴,你还“蒙在鼓里”吗?20个大模型术语带你看懂ai变革 https://img1.xinmin.cn/xmwb/2025-03-26/90326.pdf
[35] llm开源2.0大洗牌:60个出局,39个上桌,aicoding疯魔,tensorflow已死 https://36kr.com/p/3470294035420550
[36] 大模型(LLM)领域专业术语超全解读:从基础到进阶,建议收藏!\_利用大模型扩写内容的专业术语叫什么-CSDN博客 https://blog.csdn.net/2301\_76168381/article/details/150014475
[37] The Generative AI Dictionary : Key Terms Every Professional Should Know https://community.ibm.com/community/user/blogs/krunal-vachheta/2025/11/15/understanding-generative-ai-key-terms-and-concepts
[38] 2025 AI 趋势全拿捏!100 个核心热词 + 通俗解读,普通人也能看懂的科技指南【专业版】\_ai核心词条说明文档-CSDN博客 https://blog.csdn.net/weixin\_38526314/article/details/156456286
[39] 【LangChain学习笔记】智能体基础概念AI核心技术体系笔记:大模型、智能体与关键支撑技术 本文系统梳理AI领域核心 - 掘金 https://juejin.cn/post/7586192313635520546
[40] 信通院2025人工智能产业十大关键词:基础超级模型、自主性更强的智能体、走向实训的具身智能、萌芽中的世界模型、AI 正在重塑软件、开放智算生态、面向行业的高质量数据集、开源成为标配、缓解模型幻觉、人工智能国际公共产品 – 智慧城市行业分析 https://www.smartcity.team/news/2025aikeyword/
[41] Untitled http://www.caict.ac.cn/xwdt/hyxw/202503/P020250318690751908353.pdf
[42] 从基础到生成式AI核心术语全面解析-开发者社区-阿里云 https://developer.aliyun.com/article/1669274
[43] 中国信通院发布“2025智能体十大关键词”\_中国机器人网 https://www.robot-china.com/mobile/news/202508/08/93687.html
[44] AI从概念技术到应用治理全景术语解析-开发者社区-阿里云 https://developer.aliyun.com/article/1674994
[45] 中国信通院发布“2025AI云十要素”\_澎湃新闻客户端 http://m.toutiao.com/group/7582887042812494370/
[46] Agent发展趋势?信通院发布“2025智能体十大关键词”收藏学习!Agent从入门到精通,一篇就够了!\_学习\_程序员维他命-深圳城市开发者社区 https://devpress.csdn.net/shenzhen/68bfa317f2ddc335f53951e2.html
[47] 2025人工智能年度热词全解码:从“氛围编程”到“数字主权”,智能时代的新密码藏在哪里?-腾讯云开发者社区-腾讯云 https://developer.cloud.tencent.cn/article/2613656
[48] Information technology - Artificial intelligence - Artificial intelligence concepts and terminology https://webstore.iec.ch/preview/info\_isoiec22989%7Bed1.0%7Den.pdf
[49] ISO/IEC 22989:2022(en) https://www.iso.org/obp/ui/#!iso:std:74296:en
[50] 湖里ISO/IEC 22989:2022《信息技术 人工智能 概念和术语》 https://www.iso42001.cn/huli/biaozhun/179.html
[51] ISO/IEC 22989:2022 人工智能概念与术语标准解读 https://www.antpedia.com/standard/1224637738-10.html
[52] ISO/IEC 22989:2022 人工智能术语与概念标准解读 https://www.antpedia.com/standard/1785654106-10.html
[53] Information technology — Artificial intelligence — Artificial intelligence concepts and terminology https://www.en-standard.eu/publicdoc/iec\_previews/3033179.pdf
[54] Information technology — Artificial intelligence — Artificial intelligence concepts and terminology https://standards.iteh.ai/catalog/standards/iso/c86ee148-a050-4bec-b1eb-7300c53a275b/iso-iec-22989-2022?srsltid=AfmBOopun\_tWmY0ezklrfH7Cgop1gUv-Tq46kgeurNaBTAv0EtyCitik
[55] 【技術解説】ISO/IEC 22989:2022 人工知能の概念と用語の標準化基盤(技術分析報告書) https://www.cybersecurity.metro.tokyo.lg.jp/security/KnowLedge/664/index.html
[56] Glossary https://www.ibm.com/docs/en/watsonx/w-and-w/2.1.0?topic=glossary
[57] Glossary https://www.ibm.com/docs/en/ws-and-kc?topic=glossary
[58] Simplify Your AI Journey: Unleashing the Power of AI with IBM watsonx.ai https://www.redbooks.ibm.com/redbooks/pdfs/sg248574.pdf?ref=techblog\&utm\_source=techblog\&utm\_content=/techblog/en/unleashing-the-power-of-ibm-ai-gateway-how-to-enhance-your-business-intelligence-instantly/
[59] Glossary https://www.ibm.com/docs/en/aiservices/2026.03.0?topic=v020-glossary
[60] AutoAI glossary https://dataplatform.cloud.ibm.com/docs/content/wsj/analyze-data/autoai-glossary.html?audience=wdp\&context=wx
[61] Terms for AI asset evaluations https://dataplatform.cloud.ibm.com/docs/content/wsj/model/wos-glossary.html?audience=wdp\&context=wx
[62] 术语表 — Docs | IBM watsonx https://dataplatform.cloud.ibm.com/docs/content/wsj/wscommon/glossary-wx.html?context=wx\&audience=wdp
[63] AutoAI glossary https://dataplatform.cloud.ibm.com/docs/content/wsj/analyze-data/autoai-glossary.html
[64] Artificial Intelligence Glossary https://hai.stanford.edu/ai-definitions
[65] 为非专业人员量身打造,斯坦福教授Christopher Manning一页纸定义AI核心概念-腾讯云开发者社区-腾讯云 https://cloud.tencent.cn/developer/article/1737662
[66] AI Tools Glossary: The Ultimate Dictionary of Artificial Intelligence Terms https://www.aicentralresources.com/ai-tools-glossary
[67] Artificial Intelligence Definitions https://hai.stanford.edu/sites/default/files/2020-09/AI-Definitions-HAI.pdf
[68] AI行业黑话全解:小白秒变圈内人-CSDN博客 https://blog.csdn.net/godlovedaniel/article/details/159353685
[69] A brief glossary of artificial intelligence terminology https://stanmed.stanford.edu/brief-glossary-artificial-intelligence-ai/
[70] 全球高校人工智能人才培养专题 https://untec.shnu.edu.cn/92/c3/c26039a824003/page.htm
[71] 全球高校人工智能人才培养专题 https://cice.shnu.edu.cn/92/c2/c26051a824002/page.htm
[72] What is a transformer model? https://www.ibm.com/think/topics/transformer-model?app=true
[73] 读书报告 - 彭66 - 博客园 https://www.cnblogs.com/pengshuaishuai/p/19414816
[74] Hybrid thinking: Inside the architecture of IBM’s Granite 4.0 https://www.ibm.com/think/news/hybrid-thinking-inside-architecture-granite-4-0
[75] Transformer大白话详解\_flybirdfly的技术博客\_51CTO博客 https://blog.51cto.com/u\_13250/14592293
[76] Transformer各层网络结构详解!面试必备!(附代码实现)\_mob6454cc780924的技术博客\_51CTO博客 https://blog.51cto.com/u\_16099324/14432248
[77] 深度解析NLP的核心支柱:Transformer模型的技术内核与演进-CSDN博客 https://blog.csdn.net/2402\_84924563/article/details/155460057
[78] Was ist ein Transformator-Modell? | IBM https://www.ibm.com/de-de/think/topics/transformer-model
[79] 一文读懂 Transformer:从「为什么需要它」到「它为什么能赢」本文结合结构图 + 模块拆解图,从「为什么需要 T - 掘金 https://juejin.cn/post/7601103779392503871
[80] 信通院2025人工智能产业十大关键词:基础超级模型、自主性更强的智能体、走向实训的具身智能、萌芽中的世界模型、AI 正在重塑软件、开放智算生态、面向行业的高质量数据集、开源成为标配、缓解模型幻觉、人工智能国际公共产品 – 智慧城市行业分析 https://www.smartcity.team/news/2025aikeyword/
[81] 会员 | 中国信息通信研究院牵头制定的大模型基准测试ITU国际标准正式发布 - 中国知识产权研究会 https://cnips.kejie.org.cn/a19456.html
[82] 2026基础超级模型全景指南:从架构革命到产业落地的技术实践与生态解析-CSDN博客 https://blog.csdn.net/2403\_88718395/article/details/157170854
[83] # AI 大模型 https://www.iesdouyin.com/share/video/7604779993172066515
[84] 高质量大模型基础设施研究报告(2024年) https://www.caict.ac.cn/english/research/whitepapers/202504/P020250402501243612879.pdf
[85] 盘点2025和AI有关系的十大热词|Deepseek|世界模型|AI slop|AI PC|具身智能|智能体|人民网漫画评论2026年1月23日\_内容\_能力\_模拟系统 https://m.sohu.com/a/979182808\_121966288/
[86] 信通院《人工智能产业发展研究报告(2025年)》:详解2025年基础模型演进、具身智能突破、智算基础设施升级、智能原生应用涌现、安全治理实践及全球合作进展 – 智慧城市行业分析 https://www.smartcity.team/reports/%e4%ba%ba%e5%b7%a5%e6%99%ba%e8%83%bd%e4%ba%a7%e4%b8%9a%e5%8f%91%e5%b1%95%e7%a0%94%e7%a9%b6%e6%8a%a5%e5%91%8a2025/
[87] 信通院多个项目标准在国际电联(ITU)获得通过\_通信世界网 http://www.cww.net.cn/article?id=597639
[88] Reflections on Foundation Models https://hai.stanford.edu/news/reflections-foundation-models
[89] Foundation model https://aiwiki.ai/wiki/foundation\_model/revisions/2
[90] Token 1.4: Foundation Models – The Building Blocks https://www.turingpost.com/p/fmdefine
[91] What are Foundation Models? https://hai.stanford.edu/ai-definitions/what-are-foundation-models
[92] What are Foundation Models? The AI Infrastructure Revolution https://resources.rework.com/libraries/ai-terms/foundation-models
[93] Foundation Model https://zuerich.ai/glossary/foundation-model/
[94] Organization : Foundation model https://handwiki.org/wiki/Organization:Foundation\_model
[95] Foundation Model https://ireneburresi.dev/en/glossary/foundation-model/
[96] 从零吃透RAG检索增强生成:核心原理、文档处理与实战-CSDN博客 https://blog.csdn.net/uncle\_ll/article/details/162506899
[97] Retrieval-augmented generation (RAG) pattern https://eu-de.dataplatform.cloud.ibm.com/docs/content/wsj/analyze-data/fm-rag.html?audience=wdp\&context=wx
[98] 【检索增强生成(RAG):原理、架构与面试核心解析】-CSDN博客 https://blog.csdn.net/qq\_45832651/article/details/150504685
[99] IBM RAG 指南:构建和优化 RAG 的指南 https://www.ibm.com/cn-zh/think/architectures/rag-cookbook
[100] A LIBRARY OF LLM INTRINSICS FOR RETRIEVAL-AUGMENTED GENERATION https://arxiv.org/pdf/2504.11704v1.pdf
[101] IBM TechXchange 2025 conference 2712 Deep Dive into Retrieval Augmented Generation (RAG) https://community.ibm.com/HigherLogic/System/DownloadDocumentFile.ashx?DocumentFileKey=15fe7f21-52f2-4731-ab9b-b12c4dd7184b\&forceDialog=0
[102] Retrieval-Augmented Generation for Large Language Models https://paperguru.ai/benchmark/pdfs/retrieval-augmented-generation-for-large-language-models.pdf
[103] 什么是 RAG (检索增强生成) ?| IBM https://www.ibm.com/cn-zh/think/topics/retrieval-augmented-generation?cm-history=cn-zh\&contactmodule=true\&languageCode=zh\®ionCode=cn
[104] Apa itu LLM? https://www.ibm.com/id-id/think/topics/large-language-models
[105] 【LLM技术全景】什么是大语言模型(LLM)?从零认识AI新范式-CSDN博客 https://blog.csdn.net/agito\_cheung/article/details/161431995
[106] 什么是大语言模型 (LLM)?| 大语言模型(LLM)解析:企业级生成式 AI 应用趋势| IBM https://www.ibm.com/cn-zh/think/topics/large-language-models?utm\_source=chatgpt.com
[107] What Does LLM Mean? Large Language Model Explained Simply https://meanvia.com/what-does-llm-mean/
[108] AI 术语通俗词典:LLM(大语言模型)\_人工智能\_MediaTea-智能体开发者社区 https://adg.csdn.net/69707365437a6b40336a4d94.html
[109] Large Language Models (LLMs): The Brains Behind Modern AI https://c3digitus.com/what-is-large-language-models/
[110] What are large language models (LLMs)? https://www.ibm.com/think/topics/large-language-models?ref=labellerr.com
[111] LLM là gì? Góc nhìn chuẩn mực về mô hình ngôn ngữ lớn trong kỷ nguyên AI https://cyno.com.vn/llm-la-gi/
[112] OpenAI API 中的函数调用 | OpenAI Help Center https://help.openai.com/zh-hans-cn/articles/8555517-openai-api-%E4%B8%AD%E7%9A%84%E5%87%BD%E6%95%B0%E8%B0%83%E7%94%A8
[113] 来自OpenAI官网的Function calling介绍与最佳实践-CSDN博客 https://blog.csdn.net/sD7O95O/article/details/141693202
[114] 08-FunctionCalling与Agent智能体系统设计-CSDN博客 https://blog.csdn.net/2303\_80246058/article/details/158768308
[115] Function Calling 完整指南(2026):原理、代码示例、主流模型对比与最佳实践 - 七牛云行业应用 - 博客园 https://www.cnblogs.com/qiniushanghai/p/19937290
[116] 函数调用 | OpenAI开发文档|OpenAI中文官方文档|ChatGPT中文版|ChatGPT教程 https://ai-doc.it-docs.cn/docs/guides\_function-calling
[117] 从 “只会聊天” 到 “能办实事”:OpenAI Function Call 彻底重构 AI 交互逻辑(附完整接入指南) - 掘金 https://juejin.cn/post/7539860596210089984
[118] 大模型函数调用详解:原理解析与数据库智能查询实践\_angel的技术博客\_51CTO博客 https://blog.51cto.com/u\_12192/14602299
[119] Function calling https://aiwiki.ai/wiki/function\_calling
[120] 一文讲清 Skills、MCP、Agent 的本质关系:从底层逻辑到工业级 Java 落地\_skills mcp agent关系和区别-CSDN博客 https://blog.csdn.net/jam\_yin/article/details/158931107
[121] OpenAIのSkills APIにおけるスキル実装ガイド:エージェントの能力拡張と運用ベストプラクティス https://aiworknote.com/posts/openai-skills-api-guide
[122] OpenAI 官方开源 Skills 库:标准化 AI Agent 技能体系,让 Codex 能力无限扩展-CSDN博客 https://blog.csdn.net/hwh22/article/details/161778626
[123] 隆重推出 ChatGPT 智能体:连接研究与实践 | OpenAI https://openai.com/zh-Hans-CN/index/introducing-chatgpt-agent/
[124] OpenAI's New Agentic Primitives: A Beginner's Guide to Skills, Hosted Shell, and Server-Side Compaction https://www.sitepoint.com/openai-agentic-primitives-guide-skills-shell-compaction/
[125] What Is Agent Skills as an Open Standard? How Claude, OpenAI, and Google Adopted the Same Format https://www.mindstudio.ai/blog/agent-skills-open-standard-claude-openai-google
[126] À quoi servent les Agent Skills d’OpenAI ? https://bgtconsult.ai/actualites-ia/openai-agent-skills-a-quoi-ca-sert/
[127] 一文解读OpenAI Agent最佳实践指南 - 沙丘社区 https://www.shaqiu.cn/article/594
[128] 智能体互联首套国家级标准体系发布,AI进入“协同时代” https://m.voc.com.cn/xhn/news/202607/33065185.html
[129] Untitled http://www.caict.ac.cn/kxyj/qwfb/ztbg/202512/P020260119582840118218.pdf
[130] 中国信通院栗蔚等:Agentic Cloud引领云服务范式跃迁,全栈AI云能力重塑云计算价值路径\_中国信通院 http://m.toutiao.com/group/7649303069494100516/
[131] 中国信通院:智能体技术和应用研究报告(2025年)\_Agent\_模型\_任务 https://www.sohu.com/a/908759381\_468661
[132] 6·30信通院发话:Agent不是工具,是数字员工\_昊哥实验室 http://m.toutiao.com/group/7657354293188329994/
[133] 信通院发布企业级智能体定义,打通ERP、OA系统的技术门槛在哪里?-腾讯云开发者社区-腾讯云 https://cloud.tencent.com/developer/article/2658795
[134] AI Agent是什么?与传统聊天机器人、自动化脚本的区别(2026最新定义)\_aiagent算不算自动化脚本-CSDN博客 https://blog.csdn.net/fenglingguitar/article/details/159806839
[135] 聚焦AI Agent 各界观点浅析\_通信世界网 https://www.cww.net.cn/article?id=599252
[136] 规范(2024-11-05) – Model Context Protocol (MCP) https://modelcontextprotocol.info/zh-cn/specification/2024-11-05/
[137] 第 01 篇:MCP 概念与架构 —— AI 世界的"USB-C"本篇是《MCP 开发实战教程》专栏的第 1 篇。作为开 - 掘金 https://juejin.cn/post/7647785782203760680
[138] Model Context Protocol: The Universal Connector for AI https://djamgamind.com/pdfs/the\_model\_context\_protocol.pdf
[139] 什么是MCP\_MCP简介\_MCP的优势以及应用场景-腾讯云开发者社区 https://cloud.tencent.cn/developer/techpedia/2621
[140] 每位AI工程师都应了解的A2A、MCP与ACP协议-腾讯云开发者社区-腾讯云 https://cloud.tencent.com/developer/article/2638699
[141] 8000字讲解MCP与Function Call、Agent的关系\_人人都是产品经理 http://m.toutiao.com/group/7528237077494825524/
[142] AI Agent 2.0 时代:MCP协议如何成为AI互联互通的新标准-CSDN博客 https://blog.csdn.net/IRpickstars/article/details/160644425
[143] MCP(Model Context Protocol)详解:AI 领域的“USB-C 接口-CSDN博客 https://blog.csdn.net/weixin\_44273367/article/details/160981402
[144] 超千亿智算风口来袭,一文读懂算力产业关键趋势-腾讯云开发者社区-腾讯云 https://cloud.tencent.com/developer/article/2668391
[145] AIDC(1) 一、智算中心AIDC基础知识扫盲1、什么是算力算力,Computational Power,就是计算能力, 计算机 系统... https://xueqiu.com/1334287437/348028321?md5\_\_1038=287ec7c416-SvNu7WRaChXC1u31CD2nvX6W13V2PzBSJdP3SXRQuCb2WZFEelKGaLLA2MlYW2Y93n2WS9WYuWHWFuC2WpuSvWuuCFWvu3HWy0793pWM9WJGy9QmW1upFWduSdWJunic9uCxfWU04ClWSs1WF63jWJ5zyH52rf1Zn2d4h3q2L26lDnXf8jW0jIuXSaWuW
[146] 2026年智能算力服务研究报告-中国信通院-202604.pptx-原创力文档 https://m.book118.com/html/2026/0507/8015142033010070.shtm
[147] 2025《全国一体化算力网 算力多量纲计费技术要求》.pdf-原创力文档 https://m.book118.com/html/2025/0923/6140140034011233.shtm
[148] 全国一体化算力网智算中心算力池化技术要求 https://sjj.hubei.gov.cn/ztzl/hbssjbzhjswyh/tzgg/202510/P020251016640336433257.pdf
[149] 信通院:人工智能算力基础设施赋能研究报告(2025年)\_发展\_场景\_能力 https://m.sohu.com/a/952771744\_468661/
[150] 中国信通院云大所发布《AI计算节点发展研究报告(2026年)》\_中国信通院 http://m.toutiao.com/group/7623976921092588047/
[151] 中国信通院-人工智能行业:人工智能算力基础设施赋能研究报告(2025年)-251108-研报-行业分析-慧博投研资讯 http://m.hibor.net/wap\_detail.aspx?id=f7e46206ea03e9fb7a908658131ea0bb
[152] 联手数据库专委:“数据增强”术语发布 | CCF术语快线\_最新动态\_中国计算机学会 https://04665u.npoall.com/news/itemid-133764.html
[153] 数据集工程:构建高质量 AI 训练数据的完整指南\_高质量数据集 培训-CSDN博客 https://blog.csdn.net/2401\_88885149/article/details/160801580
[154] 人工智能高质量数据集建设指南 https://www.caict.ac.cn/kxyj/qwfb/ztbg/202508/P020250829553828220259.pdf
[155] What Is Data Augmentation? https://www.nvidia.com/en-us/glossary/data-augmentation/
[156] 工业高质量数据集研究报告 https://www.china-aii.com/u/cms/www/202509/%E5%B7%A5%E4%B8%9A%E9%AB%98%E8%B4%A8%E9%87%8F%E6%95%B0%E6%8D%AE%E9%9B%86%E7%A0%94%E7%A9%B6%E6%8A%A5%E5%91%8A.pdf
[157] 高质量数据集构建:大模型训练的源头质量控制\_行业高质量数据集发展有几个阶段-CSDN博客 https://blog.csdn.net/dinofish/article/details/155208243
[158] 高质量数据集建设指引 https://www.nda.gov.cn/sjj/ywpd/sjzg/0922/ff808081-96b466bd-0199-6f6bd7d3-1bad.pdf
[159] 建设高质量数据集,让人工智能更聪明(新视点) https://paper.people.com.cn/rmrb/pc/content/202505/21/content\_30074463.html
[160] 注意力架构变迁总结:稀疏、线性、SSM、混合架构如何摆脱 O(L²) 的代价-阿里云开发者社区 https://developer.aliyun.com/article/1744533
[161] 万字长文拆解DeepSeek大模型技术演进-Coder/LLM/混合专家(MoE)/VL/R1 / V3.2-超长上下文处理、动态稀疏注意力(DSA)-腾讯云开发者社区-腾讯云 https://cloud.tencent.com/developer/article/2650758
[162] Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing https://arxiv.org/pdf/2505.00315
[163] MoE 混合 专家 模型 | 挑战 24 分钟 搞定 , MoE 架构 深度 拆解 # 人工 智能 # 大模型 # AI 大模型 # LLM # MoE https://www.iesdouyin.com/share/video/7560323792896052521
[164] 【AI面试临阵磨枪-16】LLM 推理优化技术:量化、蒸馏、稀疏注意力、vLLM、TGI 核心思想。\_量化、稀疏化、知识蒸馏与 vllm-CSDN博客 https://blog.csdn.net/cnbj\_zhjy\_felix/article/details/160351530
[165] 解决训练难题,1000层的Transformer来了,训练代码很快公开(一)\_mob6454cc623087的技术博客\_51CTO博客 https://blog.51cto.com/u\_16099170/14588409
[166] Qwen3-Next:混合注意力 + 超稀疏 MoE + MTP = SOTA 推理速度 | Bojie Li https://01.me/2025/09/qwen3-next/
[167] 忆享聚焦|人工智能、元宇宙、云计算、5G基站…近期热点资讯一览\_mob64ca140c3859的技术博客\_51CTO博客 https://blog.51cto.com/u\_16213666/14590552
[168] What is NLP (natural language processing)? https://www.ibm.com/think/topics/natural-language-processing?lang=en-US
[169] 自然语言处理(NLP)核心概念全面解析:从基础到实战-CSDN博客 https://blog.csdn.net/weixin\_41693436/article/details/153054540
[170] Natural Language Processing https://certificates.stanmoreuk.org/guides/3294556/natural-language-processing.pdf
[171] 人工智能核心术语-自然语言处理核心术语 - 荣科技术专家库技术社区 http://source.bringspring.com:8088/archives/ren-gong-zhi-neng-he-xin-shu-yu-4
[172] 自然语言处理概要-CSDN博客 https://blog.csdn.net/jackson\_lingua/article/details/159048260
[173] 第1章自然语言处理概要 https://www.tup.tsinghua.edu.cn/upload/books/yz/092252-01.pdf
[174] NLP概述-CSDN博客 https://blog.csdn.net/Hismybestlove/article/details/149863704
[175] 自然语言处理(NLP):从概念到应用的全面解析 - 酒剑仙* - 博客园 https://www.cnblogs.com/auguse/articles/19111241
[176] 生成式AI(AIGC)是什么?创新内容生成新趋势解析 | 帆软数字化转型知识库 https://www.fanruan.com/blog/article/1816996/
[177] AIGC简介-CSDN博客 https://blog.csdn.net/qq\_63981644/article/details/158127934
[178] AIGC 零 基础 入门 完整 指南 。 刚 接触 a igc 的 朋友 , 别 一 上来 就 盲目 操作 各类 工具 ! 先 理清 它 的 核心 价值 再 动手
aigc 本质 是 依托 ai 自动 产出 多元 内容 :
▫ ️ 文字 生成 文字 : 文案 撰写 、 文本 概括 、 稿件 润色 全 都 能 实现
▫ ️ 文字 生成 图像 : 输入 描述 词 就能 产出 插画 、 宣传 https://www.iesdouyin.com/share/video/7658109419804298530
[179] aigc:多模态创作与跨学科实践 http://www.tup.tsinghua.edu.cn/upload/books/yz/116727-01.pdf
[180] AI界的“四大天王”:AIGC、RAG、Agent、MCP\_论述aigc的四大模态-CSDN博客 https://blog.csdn.net/bagell/article/details/155099445
[181] 彻底爆了!一文吃透AIGC、Agent、MCP的概念和关系-腾讯云开发者社区-腾讯云 https://developer.cloud.tencent.cn/article/2539716?policyId=1003
[182] AI入门知识点:什么是 AIGC、多模态、RAG、Function Call、Agent、MCP?1. AIGC - 内 - 掘金 https://juejin.cn/post/7583878719543640073
[183] AIGC万字指南(下):从A到Z,打破技术词汇认知壁垒 | 302.AI大白话聊一聊 - https://302.ai/blog/https-news-302-ai-302-ai-deepdive-the-a-z-guide-for-aigc-vocabulary-pt-2/
[184] GB/T 41864-2022 信息技术 计算机视觉 术语 - 标准下载 http://m.bzfxw.com/info-577-1082242-0.html
[185] 人工智能100问☞第33问:什么是计算机视觉?-CSDN博客 https://blog.csdn.net/bjdx\_001/article/details/148219525
[186] 实施指南《GB\_T41864-2022信息技术计算机视觉术语》实施指南.docx-原创力文档 https://m.book118.com/html/2025/0725/5322000010012302.shtm
[187] 人工 智能 CV 入门 精讲 : 图像 分类 、 目标 检测 底层 原理 零 基础 # 人工 智能 # 编程 # 程序员 # 计算机 视觉 # 科学 https://www.iesdouyin.com/share/video/7654873400896146739
[188] 人工智能核心术语-计算机视觉核心术语 - 荣科技术专家库技术社区 http://source.bringspring.com:8088/archives/ren-gong-zhi-neng-he-xin-shu-yu-5
[189] 收藏必备!AI大模型完全指南:70个核心术语系统梳理,从入门到精通\_人工智能\_程序员维他命-智能体开发者社区 https://adg.csdn.net/6970a352437a6b40336afee4.html
[190] 计算机视觉与机器视觉-CSDN博客 https://blog.csdn.net/2301\_80079642/article/details/149371616
[191] GB/T 41864-2022计算机视觉术语标准解读 https://www.antpedia.com/standard/1108900571-10.html
[192] Watermarking & AI-Generated Text Detection https://redteams.ai/topics/defense-mitigation/advanced-defenses/watermarking-detection
[193] Secure AI agents with red teaming using watsonx Orchestrate and IBM Bob https://developer.ibm.com/tutorials/red-teaming-watsonx-orchestrate-ibm-bob/
[194] Red Teaming AI Red Teaming https://arxiv.org/pdf/2507.05538v2
[195] AI安全实战:从内容溯源到红队演练构建可信AI系统-CSDN博客 https://blog.csdn.net/weixin\_29443363/article/details/160919622
[196] 2026 AI红队测试工具全景指南:攻防演进、技术标杆与未来布局\_autoredteam-orchestrator-CSDN博客 https://blog.csdn.net/weixin\_42376192/article/details/157765239
[197] 测试生成式 AI 的极限:红队测试如何暴露 AI 模型中的漏洞 | IBM https://www.ibm.com/cn-zh/think/insights/testing-the-limits-of-generative-ai-red-teaming-exposes-vulnerabilities-in-ai-models?cm-history=cn-zh\&languageCode=zh\®ionCode=cn
[198] 什么是红队测试?| IBM https://www.ibm.com/cn-zh/think/topics/red-teaming?cm-history=cn-zh\&languageCode=zh\®ionCode=cn
[199] Probando los límites de la IA generativa: cómo el red teaming expone las vulnerabilidades de los modelos de IA https://www.ibm.com/es-es/think/insights/testing-the-limits-of-generative-ai-red-teaming-exposes-vulnerabilities-in-ai-models
[200] OECD Due Diligence Guidance for Responsible AI https://www.oecd-ilibrary.org/en/publications/oecd-due-diligence-guidance-for-responsible-ai\_41671712-en/full-report/component-6.html
[201] Glossary https://www.coe.int/en/web/cddh-handbook-on-ai-and-hr/glossary
[202] Norma Internasional AI: Peran UNESCO dan OECD dalam Etika Global https://journal.maranatha.edu/index.php/iuridica/article/download/13334/3293/49298
[203] Enablers, guardrails and engagement for unlocking trustworthy AI: Governing with Artificial Intelligence | OECD https://www.oecd.org/en/publications/2025/06/governing-with-artificial-intelligence\_398fa287/full-report/enablers-guardrails-and-engagement-for-unlocking-trustworthy-ai\_2f817983.html
[204] 洞察 AI 治理的内涵、核心理念与全球发展趋势:从伦理责任到制度信任的多层治理新典范 | TechOrange 科技报橘 https://techorange.com/2025/10/20/ai-governance-responsible-trustworthy/
[205] AI Governance Frameworks Compared: NIST vs ISO vs IEEE vs OECD https://inhumain.ai/ai-governance-frameworks-comparison/
[206] Lifecycle-Based Governance to Build Reliable Ethical AI Systems https://onlinelibrary.wiley.com/doi/10.1002/sres.70014
[207] Recommendation of the OECD Council on Artificial Intelligence https://www.derechos.org/privacy/doc/aioecd.html
[208] 防风险,AI要有伦理边界 https://m.thepaper.cn/newsDetail\_forward\_33509347
[209] Appendix E: Glossary of AI Ethics Terms https://baa.ai/rai-framework/appendices/appendix-e-glossary.html
[210] 【网信课堂】9月起施行!《人工智能生成合成内容标识办法》来了\! https://m.thepaper.cn/newsDetail\_forward\_33509741
[211] AI财富管理中的责任治理与人性化服务平衡 https://www.iesdouyin.com/share/video/7593367308597316900
[212] ISO/IEC TS 6254:2025(en) https://www.iso.org/obp/ui#!iso:std:iso-iec:ts:6254:ed-1:v1:en
[213] 大语言模型“安全体检”报告为AI治理提供参考-新华网 http://www.xinhuanet.com/tech/20260703/1d7e1e54b6454960800c40b1057404bd/c.html
[214] 第31篇:AI伦理与可解释性:构建负责任的人工智能\_the ethics of algorithms:mapping the debate,big da-CSDN博客 https://blog.csdn.net/qq690219309/article/details/151323687
[215] AI伦理实践指南:从公平性、可解释性到企业落地的技术框架-CSDN博客 https://blog.csdn.net/weixin\_30336531/article/details/160920363
觉得内容不错?我要