Skip to content
🗂️ 文章分类: AI  
🏷️ 文章标签: 大模型  
📅 文章创建时间: 2026-03-13
🕘️ 文章最后更新时间:2026-03-13

[toc]

大语言模型(LLM)笔记

大语言模型(LLM) 介绍

大语言模型(LLM) 是一个经过海量文本数据训练的深度学习模型,它能够理解和生成人类语言。也是构成AI Agent的基础。

大语言模型通过分析互联网上的海量文本,学习到语言的统计规律和知识,当它收到输入时,会根据学习到的规律,生成最合理的续写。

如图所示,大语言模型(LLM) 的工作过程。 ai_202603131004.png

大语言模型的"大"体现在以下几个方面:

  • 参数规模大: 模型内部有数百亿甚至上万亿个可调节的旋钮(即参数)。这些参数记录了学到的语言知识。
  • 训练数据大:用于训练的文本数据量巨大,是整个互联网公开信息的精华。通过分析海量文本数据,学习到语言的统计规律和知识。

大语言模型的局限性

  • 大语言模型本身无法获取实时数据,只能根据训练时的知识生成文本。
  • 大语言模型在训练过程中可能会受到训练数据中的偏见影响,导致模型生成的文本中存在偏见。
  • 大语言模型是一个黑盒子模型,很难解释模型是如何生成文本的。这使得模型的透明度和可解释性较差。

大语言模型(LLM) 底层: Transformer 架构

LLM 的惊人能力,离不开其底层核心技术——Transformer 架构。

Transformer 架构是一种基于自注意力机制的神经网络架构,它能够处理序列数据(如文本),并在序列中进行并行计算。

Transformer的核心思想

Transformer的核心思想是利用自注意力机制,将输入文本中的每个元素与其他元素进行注意力计算,从而捕捉到文本中不同元素之间的关系。

举个例子:假设你要求大语言模型写一篇关于太阳系的文章。

  • 输入处理:大语言模型会将输入文本(如"写一篇关于太阳系的文章")先拆分为token(如"写"、"一篇"、"关于"、"太阳系"、"的"、"文章"),然后将每个token转换为模型可以理解的向量表示。
  • 理解上下文:由于大语言模型内部已经提前学习了海量文本数据,它在学习的过程中,会根据上下文的信息,已经理解了每个token的含义。例如,它知道"关于"通常是描述或介绍的关键词,而"太阳系"则是一个描述的关键词,"文章"则是一个生成文本的token关键词。并且它还会根据当前token,找出其他与之相关的关联词(如太阳,行星什么的)。即进行重复关联。
  • 组织语言:大语言模型根据重复关联得到的信息,进行组织和生成文本。例如,它可能会根据"关于"和"太阳系"的关联,生成"太阳系是一个由太阳、行星、卫星等组成的天体系统"。

Transformer 的工作方式如图所示

ai_202603131020.png