Skip to content
🗂️ 文章分类: AI  
🏷️ 文章标签: AI  
📅 文章创建时间: 2026-07-03
🕘️ 文章最后更新时间:2026-07-03

[toc]

人工智能(AI)概念名词介绍

本文从AI技术发展的角度,讲述每个概念的前因后果:什么问题催生了这个概念,它解决了什么,又遗留了什么问题给下一个概念。这是一部「AI概念演进史」,帮助入门者理解技术发展的脉络和逻辑。


概念谱系总览


人工智能(Artificial Intelligence, AI)

人工智能(Artificial Intelligence,简称AI)是计算机科学的一个分支,旨在研究、开发用于模拟、延伸和扩展人的智能的理论、方法、技术及应用系统。

人工智能的定义

AI的核心目标是使计算机系统能够执行通常需要人类智能才能完成的任务,包括:

  • 感知:通过视觉、听觉等方式获取信息
  • 认知:理解、推理和决策
  • 学习:从经验中获取知识并改进性能
  • 行动:与环境交互并执行任务

根据能力范围,AI可以分为:

类型描述示例描述
弱AI(Narrow AI)专注于特定任务的AI系统语音助手、图像识别、推荐系统弱AI是当前AI的主流形态,已经广泛应用于各个领域,改变了人们的生活和工作方式。
强AI(Strong AI)具备人类水平智能的AI系统,能理解和学习任何智力任务理论阶段,尚未实现强AI是AI研究的长期目标,目前尚未实现。
超AI(Super AI)超越人类智能的AI系统纯理论概念超AI是AI研究的最终目标,目前尚未实现。

衍生概念:AI概念的提出,将"让机器拥有智能"确立为计算机科学的重要研究方向,催生了机器学习、深度学习等一系列子领域。


人工智能的应用领域

自然语言处理(Natural Language Processing, NLP)

背景/问题:如何让计算机理解和处理人类语言?这是AI的核心挑战之一。

定义:使计算机能够理解和处理人类语言的AI领域。

核心任务

  • 文本分类
  • 情感分析
  • 机器翻译
  • 问答系统
  • 文本生成

代表技术

  • Transformer架构
  • BERT/GPT系列模型

计算机视觉(Computer Vision, CV)

背景/问题:如何让计算机理解和分析图像和视频?

定义:计算机视觉使计算机能够理解和分析图像和视频。

应用场景:CV是AI的重要应用领域,包括图像分类、目标检测、图像分割、图像生成等任务,广泛应用于安防、医疗、自动驾驶等场景。

代表技术

  • CNN架构
  • ResNet/EfficientNet
  • GAN/Diffusion模型

语音处理(Speech Processing)

背景/问题:如何让计算机理解和生成语音?

定义:语音处理涉及语音识别和语音合成。

应用场景:语音处理包括语音识别(ASR)、语音合成(TTS)、声纹识别、语音翻译等任务,广泛应用于智能助手、客服、无障碍服务等场景。


推荐系统(Recommendation System)

背景/问题:如何根据用户偏好提供个性化推荐?

定义:推荐系统根据用户偏好提供个性化推荐。

应用场景:推荐系统广泛应用于电商、视频、新闻等领域,提升了用户体验和业务效率。


通用人工智能(Artificial General Intelligence, AGI)

背景/问题:当前的AI系统都是弱AI,只能处理特定任务。是否可能构建具备人类水平智能的AI系统,能够处理任何领域的任务?

定义:AGI(Artificial General Intelligence)是指具备人类水平智能的AI系统,能够理解、学习和应用知识解决任何问题。AGI是AI发展的终极目标,代表了人类对人工智能的最高追求。

局限/演进:目前AGI仍处于理论阶段,距离实现还有很大差距。当前的大模型虽然能力强大,但仍然是弱AI,距离AGI还有很长的路要走。

机器学习(Machine Learning, ML)

背景/问题:传统编程需要人工编写规则,但现实世界中的问题往往过于复杂,无法用明确的规则描述。例如如何让计算机识别图片中的猫?规则几乎无法穷尽。

定义:机器学习是人工智能的核心分支,它使计算机系统能够自动从数据中学习并改进性能,而无需明确编程。

核心思想让计算机从数据中自动学习规律,并利用这些规律对未知数据进行预测或决策

机器学习类型:分为监督学习、无监督学习、强化学习。

监督学习

监督学习是最成熟、应用最广泛的机器学习类型,是许多AI应用的基础。

背景/问题:当我们有大量数据时,如何让计算机学习输入到输出的映射关系?答案是将数据进行提前标注。例如,已知大量"图片+标记"的标注数据,如何让计算机学会分类?这需要通过监督学习来实现。

定义:监督学习使用带有标签的数据进行训练,目标是学习输入到输出的映射关系。

核心算法:监督学习使用如下算法对大量的标注数据进行训练:

  • 线性回归(Linear Regression)
  • 逻辑回归(Logistic Regression)
  • 决策树(Decision Tree)
  • 支持向量机(SVM)
  • 随机森林(Random Forest)
  • 梯度提升树(Gradient Boosting)

应用场景:图像分类 垃圾邮件检测 房屋价格预测 股票价格预测等

局限/演进:监督学习需要大量标注数据,而标注数据的获取成本很高。对于没有标注的数据,监督学习无能为力,这推动了无监督学习的发展。


无监督学习

背景/问题:监督学习需要大量标注数据,而现实世界中大部分数据是没有标注的。因此,如何从无标注数据中发现潜在的结构和模式?这就需要通过无监督学习来实现。

定义:无监督学习使用无标签的数据进行训练,目标是发现数据中的潜在结构或模式。

核心算法:无监督学习使用如下算法对大量的无标注数据进行训练:

  • K-means聚类
  • 层次聚类
  • 主成分分析(PCA)
  • 自编码器(Autoencoder)

应用场景:无监督学习能够从无标注数据中发现规律,为数据分析提供了强大工具。例如,

  • 客户分群:将客户分为不同的群组,每个群组的特征相似。
  • 异常检测:识别出与正常数据不同的异常值,用于检测异常情况。
  • 关联规则:发现数据中变量之间的关联关系,例如,购买商品A的人往往也会购买商品B。

局限/演进:无监督学习的结果往往不够精确,无法直接用于决策。而在需要明确决策的场景中,需要结合监督学习或引入奖励机制,这推动了强化学习的发展。


强化学习

背景/问题:如何让计算机在与环境的交互中学习最优行为?例如 如何让机器人学会走路,如何让AI在游戏中战胜人类?这需要通过强化学习来实现。

定义:强化学习通过智能体与环境的交互来学习最优行为策略,通过奖励机制引导学习。

常见算法

  • Q-Learning
  • Deep Q-Network(DQN)
  • Policy Gradient
  • Actor-Critic

应用场景:强化学习能够让计算机在没有明确指导的情况下,通过试错学习最优策略。

  • 游戏AI(AlphaGo、OpenAI Five)
  • 机器人控制
  • 自动驾驶
  • 资源调度

局限/演进:强化学习需要大量的交互经验,训练过程效率较低。在复杂任务中,纯强化学习难以取得好的效果,这推动了深度学习的发展。


深度学习(Deep Learning, DL)(机器学习的子领域)

背景/问题:传统机器学习算法(如SVM、随机森林)在处理复杂模式识别任务(如图像、语音、自然语言)时表现有限,需要更强大的模型架构。因此就出现了深度学习。

定义:深度学习是机器学习的一个子领域,使用多层神经网络来模拟人脑的学习过程。深度学习在处理复杂模式识别任务时表现出色,如图像、语音和自然语言处理。

解决方式:通过神经网络(Neural Network)、卷积神经网络(CNN)、循环神经网络(RNN)、Transformer等。实现对复杂数据的自动分类、回归或生成。

应用场景:深度学习通过多层神经网络自动学习特征,无需人工特征工程。在图像识别、语音识别、自然语言处理等领域取得了突破性进展,是当前AI发展的核心驱动力。

神经网络架构

背景/问题:如何模拟人脑的学习过程?人脑是由大量神经元组成,通过神经元之间的连接传递信息并学习。

定义:神经网络架构通过模仿人脑神经元连接方式构建的数学模型,由多层节点(神经元)组成,通过连接权重传递信息。

解决方式:神经网络是深度学习的基础架构,通过多层非线性变换实现复杂的模式识别能力。

局限/演进:早期的神经网络参数量过大,无法处理图像和序列数据。因此针对不同类型的数据,就需要专门的神经网络架构,这推动了CNN和RNN的发展。

卷积神经网络架构(CNN)(主要用于处理网格状数据,如图像和视频)

背景/问题:普通的神经网络架构,在处理图像数据时,参数量随图像尺寸呈平方增长,计算效率极低。同时,图像具有局部相关性,相邻像素之间的关系更为紧密。于是就推出了CNN架构来专门处理图像数据。

定义:卷积神经网络(CNN)是专门用于处理网格状数据(如图像、视频)的神经网络架构,通过卷积操作提取局部特征。

解决方式:CNN 通过卷积层和池化层有效减少了参数量,同时利用了图像的局部相关性,在计算机视觉领域取得了巨大成功,是图像识别、目标检测的核心技术。

应用场景:CNN主要用于图像识别、目标检测、图像分割等。

局限/演进:CNN主要用于处理空间数据,无法有效处理序列数据(如文本、语音)。


循环神经网络架构(RNN)(主要用于处理序列数据,如文本和语音)

背景/问题:普通的神经网络架构,在处理序列数据时,无法有效捕获时间依赖性。而序列数据(如文本、语音)具有时间依赖性,当前时刻的输入与历史输入相关。CNN无法捕获这种序列依赖关系。因此需要RNN架构。

定义:循环神经网络(RNN)是专门用于处理序列数据的神经网络架构,通过循环连接将历史信息传递到当前时刻,具有记忆能力。

核心特点

  • 具有记忆能力,可以处理变长序列
  • 通过循环连接传递信息

应用场景:RNN能够处理变长序列数据,捕获时间依赖关系,适用于语言建模、机器翻译、语音识别等领域。

局限/演进:RNN存在梯度消失和梯度爆炸问题,难以处理长距离依赖关系。同时,RNN是顺序计算的,无法并行化,计算效率较低,这催生了Transformer架构的发展。


Transformer 架构

背景/问题:RNN的顺序计算限制了并行效率,且难以处理长距离依赖关系。如何在保持并行计算的同时,有效捕获序列中的依赖关系?因此出现了Transformer架构。

定义:2017年由Google提出的深度学习架构,Transformer是深度学习领域的革命性架构,完全基于自注意力机制,摒弃了传统的循环结构。

应用场景:Transformer通过自注意力机制实现了长距离依赖建长距离依赖建模,是深度学习领域的革命性架构,成为现代大语言模型(LLM)的基础。如GPT、BERT等。

局限/演进:Transformer的核心是自注意力机制,如何高效计算注意力是关键问题,这催生了自注意力机制和多头注意力的发展。


自注意力机制

背景/问题:在Transformer中,如何计算序列中每个位置与其他位置的关联程度?因此需要引入自注意力机制。

定义:自注意力机制是Transformer的核心机制,能够计算输入序列中每个位置与其他位置的关联程度,为每个位置生成加权表示。

应用场景:自注意力机制使模型能够同时关注输入序列的所有位置,直接捕获长距离依赖关系,是Transformer的核心创新。

局限/演进:单一的自注意力机制只能捕获一种类型的关系,为了增强模型的表达能力,需要并行计算多个注意力头,这推动了多头注意力机制的发展。


多头注意力机制

背景/问题:单一的自注意力机制只能学习一种类型的语义关系,如何让模型同时学习多种不同类型的语义关系?

定义:多头注意力通过并行计算多个注意力头,捕捉不同类型的语义关系。简而言之,就是并行计算多个注意力头,每个注意力头学习不同类型的语义关系,然后将结果拼接融合。

应用场景:多头注意力增强了Transformer模型的表达能力,能够同时捕获不同维度的语义关系,是GPT、BERT等模型的关键组件。

局限/演进:Transformer架构的成熟,为构建大规模语言模型奠定了基础,这推动了大语言模型(LLM)的发展。


大模型

大模型(Large Model)通常指参数量巨大、训练数据海量的AI模型。

大模型具有以下特征:

  • 参数量大:通常数十亿到数万亿参数
  • 训练数据海量:基于互联网级别的数据训练
  • 能力泛化:能够处理多种任务,展现出涌现能力

大模型的发展历程

模型发布时间参数规模关键特点
GPT-120181.17亿首次提出GPT架构
BERT20183.4亿/11亿双向Transformer,开创预训练时代
GPT-2201915亿零样本学习能力
GPT-320201750亿涌现能力显著提升
PaLM20225400亿Google首个千亿级模型
GPT-42023未公开多模态能力,推理能力大幅提升
GPT-4o2024未公开实时视频理解,更高效

大模型的核心能力

  1. 自然语言理解(NLU):理解文本的语义和上下文
  2. 自然语言生成(NLG):生成连贯、有意义的文本
  3. 推理能力:进行逻辑推理和数学计算
  4. 多模态能力:处理文本、图像、语音等多种模态
  5. 工具使用:调用外部工具完成任务
  6. 代码生成:编写和理解代码

大语言模型(Large Language Model, LLM)

背景/问题:虽然Transformer架构已经成熟,但传统的预训练模型规模较小,能力有限。随着算力和数据的增长,是否可以通过增大模型规模来获得更强的能力?因此出现了大语言模型(LLM)。

定义:参数量巨大、训练数据海量的语言模型,基于Transformer架构,能够理解和生成人类语言。

应用场景:大语言模型(LLM)展现出强大的涌现能力,包括推理、代码生成、多模态理解等,是当前AI发展的核心方向,推动了生成式AI的普及。

局限/演进:大语言模型(LLM)虽然能力强大,但也带来了一系列问题:训练成本高昂、存在幻觉、需要微调适应特定场景、需要对齐人类价值观等。因此催生了Token、Embedding、Fine-tuning、LoRA、RLHF、Alignment、Hallucination、RAG等相关概念的出现。


提示词(Prompt , 与大模型交互的自然语言指令)

定义:提示词就是你输入给大模型的一段自然语言文本,是你和模型沟通的原始文字。例:“帮我总结这篇文章”。

提示词工程(Prompt Engineering , 设计和优化提示词)

提示词工程(Prompt Engineering)是设计和优化提示词,以引导AI模型生成期望输出的过程。

背景/问题:早期用户在使用大模型时,会发现就算同一个问题,根据不同的问法,大模型生成的回答是不同的。因此,需要一个平衡点,来提高用户输入的有效性。从而做到即使用户的问法不同,模型也能准确理解并生成符合用户需求的回答。于是出现了Prompt Engineering(提示词工程)。

定义:提示词工程(Prompt Engineering)是指专门设计和优化提示词,从而引导模型生成期望输出。

应用场景:提示词工程是使用大模型的重要技能,能够显著提升模型的输出质量。


tokenizer (分词器 , 将用户输入的文本拆分为Token)

背景/问题:为了将用户输入的文本转换为Token,需要一个将文本拆分为Token的工具,这就是分词器。

定义:将用户输入的文本拆分为Token序列的工具。各个大模型的分词器之间存在差异,互相之间无法通用。


Token(中文正式名称:词元, 大模型处理文本的最小单位)

背景/问题:计算机无法直接处理用户输入的文本,需要将文本拆分为数据来进行读取和处理。那么如何拆分文本?是按字符、按单词、按子词等进行拆分?每个拆分单位的长度是否固定?因此出现了Token这个概念。

定义:Token 是大模型处理文本的最小单位,可以是单个字符、单词或子词(如"unhappiness"可能被拆分为"un"、"happiness")。

应用场景:将用户输入的文本转换为Token序列后,计算机会根据Token序列进行计算,从而使计算机能够理解和处理人类语言。

局限/演进:文本转换为Token后,还需要进一步转换为向量表示,从而才能让模型进行计算,这催生了Embedding的发展。另外对于用户输入的数据,可以能是文本,也可以是图像、语音等。因此,需要根据不同的任务和需求,需要一个专门将用户输入的数据转换为Token序列的工具,这就是分词器。


Context Window(上下文窗口 , 模型记忆长度)

背景/问题:大模型在生成回答时,有时候会遗忘之前的交互历史,导致生成回答与用户需求不一致。因此,需要一个上下文窗口,来存储之前的交互历史。但是上下文窗口的长度是有限的,不能无限增长。如果上下文窗口过长,模型无法有效处理。因此,需要一个平衡点,来确定上下文窗口的长度。

定义:大模型在生成回答时能够参考的历史文本长度,通常以Token数量衡量。例如,一个大模型的上下文窗口长度为1024K,那么在生成回答时,只能参考最近1024K个Token。

应用场景:上下文窗口决定了模型能够处理的数据长度,较大的上下文窗口使模型能够处理更长的对话和文档。


Embedding(嵌入 , 将Token转换为向量)

背景/问题:Token是一个个单词或子词,在计算机看来就是一个个数字。计算机本身无法将其关联起来,形成一个完整的语义表示。因此需要先将Token转换为向量表示,通过一个个向量的组合,来使计算机能够理解其中的语义信息。

定义:将文本、图像等数据转换为低维向量表示的过程,然后通过这些向量,让计算机能够捕获数据的语义信息。

贡献:Embedding是大模型能够理解和处理数据的基础,通过向量空间中的距离反映语义相似度。

局限/演进:预训练模型虽然强大,但需要适应特定领域,如何高效地将通用模型适配到特定场景,催生了Fine-tuning的发展。


Vector Database(向量数据库 , 存储和检索向量)

背景/问题:为了高效地存储,检索和使用向量,需要一个向量数据库。

定义:将向量存储在数据库中,通过向量空间中的距离来检索相似的向量。

应用场景:向量数据库用于存储和检索向量,支持快速的相似度搜索。


RAG(检索增强生成,让模型基于外部知识库进行回答)

背景/问题:早期有人发现大模型给出的回答,可能会编造虚假信息,存在错误或不准确的情况。那么如何让模型基于真实数据生成回答?答案就是让大模型检索并参考外部知识库中的相关信息。因此出现了RAG这个概念。

定义:RAG(Retrieval-Augmented Generation,检索增强生成) 是指结合检索和生成的技术,让大模型通过从外部知识库检索相关信息来增强模型的生成能力。

RAG的核心特点

  1. 减少幻觉:基于真实数据生成回答
  2. 知识更新:无需重新训练模型
  3. 领域适配:适用于特定行业知识
  4. 可追溯性:回答可追溯到源文档

应用场景:RAG通过资料,知识库,检索,生成等步骤,使模型生成的回答更准确、可追溯,广泛应用于企业知识库问答、技术文档查询、医疗诊断辅助、法律文书生成等场景。

局限/演进:RAG解决了知识准确性问题,但模型仍然需要自主决策和执行任务的能力,这催生了AI Agent的发展。


Tool calling(工具调用,让大模型调用外部工具)

背景/问题:大模型在生成回答时,有时候需要调用外部工具,来完成任务。例如,你问今天天气如何?那么大模型可能需要调用天气API,来获取天气信息。那么如何让大模型知道调用哪个工具,以及调用时需要传递哪些参数?

定义:大模型在生成回答时,通过Tool calling来调用外部工具,来完成任务。

应用场景:工具调用是大模型能够处理复杂任务的重要手段,能够显著提升模型的输出质量。

局限/演进:但是这又引发了一个新的问题,就算当大模型需要调用的工具太多时,如何管理这些工具?于是出现了MCP(模型控制协议)。

MCP(模型控制协议,类似模型工具中间件)

背景/问题:当大模型需要调用的工具太多时,那么这些工具该如何管理?于是出现了MCP(Model Control Protocol,模型控制协议)。

定义:MCP定义了一组标准的接口,大模型和外部工具之间通过这些接口来进行交互。

应用场景:MCP相当于是一个中间件,大模型通过MCP来调用外部工具,而外部工具则通过MCP来与大模型进行通信。

Skill(技能,让AI复用操作步骤,提高效率)

背景/问题:假设我需要每周完成一些固定的工作,例如写周报、总结本周工作等。这些固定的工作,通常有固定的操作步骤,我都需要手动进行。那么如何让大模型帮我自动完成这些工作?于是出现了Skill(技能)这个概念。

定义:我们可以将这些操作步骤总结为一个Skill。再让大模型学会这个Skill技能,从而能够完成重复执行的工作。从而在下次需要重复执行的工作时,直接调用Skill技能,而不需要重复进行繁琐的操作。

局限/演进:有些工作步骤是很麻烦的,例如有的操作需要在网页上,有的操作需要在某个软件中进行。这些操作分散在计算机的不同的地方。那么如何让AI能够找到并完成这些工作呢?于是出现了Computer USE(计算机使用)这个概念。

Computer USE(让AI学会看懂计算机屏幕,从而让AI能手动操作计算机)

背景/问题:如果一个系统有API接口,那么大模型就可以通过调用这个接口,来完成任务。但是不是所有的系统都有API接口。那么如何让AI能够完成这些工作呢?

定义:让AI尝试像人类一样,使用计算机来完成任务。通过让AI学会看懂计算机屏幕,从而能够手动操作计算机。例如打开网页,点击按钮,输入文本等。

局限/演进:如果AI能够手动操作计算机,那么它就可以完成任何任务。但是,如果AI不能手动操作计算机,那么它就不能完成任何任务。

AI Agent(AI 智能体,让AI能够自主决策和执行任务)

背景/问题:大模型虽然强大,但通常只能被动响应,无法主动感知环境、做出决策并执行任务。如何让AI具备自主行动能力?

定义:Agent(智能体)是指能够自主决策和执行任务的智能体。即用户给定一个任务,Agent能够根据任务的描述,自主决策和执行任务。

应用场景:AI Agent是AI应用的高级形态,具备感知、决策、行动、学习能力,广泛应用于自动化、机器人等领域。

  • 自动驾驶:感知环境并做出驾驶决策
  • 智能客服:自动处理客户咨询
  • 代码助手:辅助程序员编写代码
  • 游戏NPC:游戏中的智能角色
  • 机器人:自主完成任务的机器人

局限/演进:Agent 不是越自由越好。如果Agent 过于自由,没有工程约束,那么它可能会做超出任务范围的事情。例如,它可能会乱改文件,误删内容,甚至可能会删除整个项目。因此还需要给Agent 进行一些工程约束。从而确保Agent 不会做超出任务范围的事情。于是出现了Harness Engineering这个概念。


Harness Engineering(驾驭工程,通过限制Agent的权限,让 Agent 在可控、安全的环境下可靠工作)

定义:它是 Agent 的约束与引导系统,负责模型之外的一切代码、配置与执行逻辑。‌‌

应用场景:Harness Engineering 通过给Agent 进行权限配置,工具白名单,执行沙箱,日志追踪,错误重试,人工审批,回滚机制等操作来确保Agent 不会超出超出权限的事情。就算做了,也有回滚的机会。

Workflow(工作流,负责将一个个步骤串联起来)

背景/问题:假设一个真实业务流程,需要一系列繁琐的步骤。例如从A-B-C-D-E-F等。在这条流程中,需要涉及到大模型,数据库,API调用,文件操作,人工审批等操作。相当于Workflow是把需要完成工作流的所有操作,总结为一个自动执行的流程。

定义:Workflow 的作用是将一个业务流程,拆解为一个个步骤,并将这些步骤串联起来。从而实现自动执行。

应用场景:n8n langchain langGraph Dify 等工具,都可以用来创建工作流。

WorkSpace Agent(工作空间智能体,负责管理工作流的执行)

一个Workflow,当完成了所有的步骤之后,就结束了。但是WorkSpace Agent 更像是一个智能体,负责管理工作流的执行。


国内外大模型产品

国外大模型产品

产品公司简介
GPT系列OpenAI公司生成式预训练Transformer模型,推动了生成式AI的发展。包括了GPT-1、GPT-2、GPT-3、GPT-4等
BERT/PaLM/GeminiGoogle公司Google开发的预训练模型系列,在理解和多模态领域领先。包括了BERT、PaLM、Gemini等
LLaMA系列Meta公司开源大语言模型,推动了大模型的普及。包括了LLaMA-1、LLaMA-2、LLaMA-3等
Claude系列Anthropic公司强调安全性和长上下文处理能力的大模型。包括了Claude 1、Claude 2、Claude 3等

国内大模型产品

产品公司简介
文心一言百度公司百度自研大模型,支持多模态。
通义千问阿里巴巴公司阿里巴巴自研大模型,支持多模态。
混元大模型腾讯公司腾讯自研大模型,侧重社交和游戏场景。
豆包字节跳动公司字节自研大模型,侧重短视频和内容创作。
盘古大模型华为公司华为自研大模型,基于昇腾芯片。

AI发展时间线

时间事件影响
1950图灵测试提出定义了AI的判定标准
1956达特茅斯会议AI领域正式诞生
1997深蓝击败国际象棋冠军展示AI在特定领域的超越
2012AlexNet夺冠深度学习时代开启
2016AlphaGo击败围棋冠军AI在复杂策略游戏中超越人类
2017Transformer提出大语言模型基础奠定
2018GPT-1、BERT发布预训练模型时代到来
2020GPT-3发布涌现能力被广泛认知
2022ChatGPT发布AI进入大众视野
2023GPT-4、Gemini发布多模态能力大幅提升
2024GPT-4o、Claude 3发布实时视频理解能力增强

结语:本文从AI技术发展的角度,讲述了每个概念的前因后果。这些概念按照从宏观到微观、从基础到应用的逻辑组织,形成了一条清晰的技术演进脉络。对于每个概念的深入理解,可以参考其他专项笔记。