大语言模型入门:LLM 定义、原理与应用场景

大语言模型是基于大量数据训练或预训练的深度学习模型。它通过 token 预测和 Transformer 自注意力理解并生成文本,帮助读者梳理 LLM 原理、能力与应用场景。

大语言模型入门:LLM 定义、原理与应用场景

什么是大语言模型 LLM?

大语言模型也称 LLM,是基于大量数据训练或预训练的超大型深度学习模型。它的核心能力是理解自然语言,并生成自然语言、类似人类的文本,或其他类型的内容。

在不同语境中,大语言模型也可能被称为基础模型、统计语言模型或高级 AI 系统。这些说法侧重点不同:有的强调它可以作为多类任务的基础,有的强调它从数据中学习语言规律,有的强调它属于 AI 系统。但它们的共同点比较清楚:模型经过大量数据训练,能够围绕语言内容进行理解、生成和处理。

要点: 入门理解 LLM 时,不必先纠结某一种术语。更重要的是抓住三个关键词:大量数据训练、语言理解、内容生成。

大语言模型的几个常见表述

表述侧重点可以怎样理解
大语言模型模型规模、语言能力和生成能力面向自然语言理解与生成的 AI 模型
LLMLarge Language Model 的常用缩写与“大语言模型”指向同一类模型
基础模型可作为多类任务基础的模型经过大量数据训练后,可支持多种下游任务
统计语言模型基于数据学习语言规律根据上下文预测后续内容或完成语言任务

用 token 预测理解 LLM 的工作方式

LLM 生成内容时,可以理解为:在给定上下文的基础上,预测一个 token 或一系列 token。这些 token 组合起来,可能形成一句话、一段话,甚至更长的文本。

token 是什么?

Token 可以是字词、子字词,也可以是其他形式的词元。它是模型处理文本时使用的基本单位,并不一定等同于人类阅读时看到的一个完整汉字、一个中文词或一个英文单词。

当用户输入一段问题或指令时,模型会先把输入转换为可处理的 token 序列,再结合上下文逐步预测后续 token。

为什么说 LLM 像是在“续写上下文”?

一个直观类比是:当你读到一句未完成的话时,会根据前文判断接下来更可能出现什么内容。LLM 的生成过程也类似,它会结合输入上下文,连续预测后续 token,并将这些 token 组织成最终输出。

需要注意的是,这个类比只是帮助理解。LLM 并不是简单地从固定答案库中复制结果,而是基于训练中学习到的语言规律和当前上下文生成内容。

LLM 的核心原理涉及 Transformer 与自注意力

LLM 通常基于深度学习架构,其中 Transformer 是理解其工作方式的重要基础。基础资料通常会把 Transformer 解释为由带有自注意力功能的编码器和解码器组成的神经网络结构。

Transformer 在 LLM 中起什么作用?

Transformer 可以帮助模型处理序列化的文本信息,并在上下文中建立 token 之间的关联。对语言任务来说,模型需要理解前后文关系,再决定下一步应生成什么内容。

自注意力为什么重要?

自注意力机制可以让模型在处理上下文时,关注与当前生成内容更相关的信息。也就是说,模型不是机械地按顺序读取每个 token,而是会在上下文中建立不同 token 之间的关联权重。

从输入到输出的简化流程

步骤发生了什么作用
输入文本用户输入问题、指令或上下文给模型提供任务目标和语境
切分 token文本被转换为 token 序列形成模型可处理的基本单位
上下文建模模型分析 token 之间的关系理解当前语境中的关键信息
预测 token模型预测一个或一系列后续 token生成回答、续写或处理结果
生成输出token 被组织为可读内容返回自然语言或其他内容形式

大语言模型能做什么?

大语言模型的核心能力包括理解自然语言、生成自然语言,以及生成类似人类的文本。基于这些能力,它可以用于自动生成文本内容、翻译文本和其他内容,也可以执行多种自然语言处理任务。

能力类型典型输入输出形式
文本生成主题、要求、上下文或提示词回答、说明、草稿、摘要等文本
翻译待转换的文本或内容目标语言文本或目标表达形式
自然语言处理任务一段文本、问题或处理要求理解、分类、改写、提取或生成结果
内容生成文本提示或结构化要求文本以及其他类型内容的生成结果

要点: LLM 的能力集中在语言理解、语言生成和基于上下文的内容处理上。只要任务主要围绕文本和自然语言展开,就可能与 LLM 能力相关。

常见应用场景可以从用户需求出发

理解大语言模型的应用场景,不宜只记住一串名词。更实用的方法是从用户需求出发,看输入是什么、模型如何处理、最终输出什么。

用户需求解决方式输出结果
想快速生成一段文本用户提供主题、要求或上下文,模型根据 token 预测生成内容回答、说明、草稿、摘要等文本
想把内容转换为另一种语言或表达用户输入待翻译或待转换文本,模型生成目标形式翻译文本或改写后的内容
想对文本进行理解和处理用户输入文本和任务要求,模型围绕自然语言处理任务生成结果提取、归纳、分类、改写或回答
想基于上下文连续生成内容用户提供较完整的背景和约束,模型结合上下文继续生成连贯的段落、说明或任务结果

这些场景的共同点是:输入通常与文本或自然语言有关,输出也通常需要模型生成、转换或处理语言内容。

如何判断一个任务是否适合使用大语言模型?

判断一个任务是否适合使用大语言模型,可以从输入、输出和任务方式三个角度入手。LLM 更适合处理以自然语言、文本或可转成文本的内容为主的任务。

输入是否以语言内容为主

如果任务输入是问题、说明、文档、对话、指令或其他可转成文本的信息,通常更容易被 LLM 处理。相反,如果任务完全依赖固定规则或结构化字段匹配,未必需要使用 LLM。

输出是否需要生成或处理语言

如果期望输出是回答、摘要、翻译、改写、解释或其他文本结果,LLM 往往更合适。因为这类任务需要模型理解上下文,并生成连续的语言内容。

任务是否依赖上下文理解

LLM 的生成过程与上下文和 token 预测密切相关。如果任务需要结合上下文进行推断、续写或组织语言,而不是只返回固定模板结果,就更符合 LLM 的能力范围。

简短检查清单

  • 输入是否清楚,是否包含必要上下文?
  • 期望输出是否明确,例如生成、翻译、改写或处理文本?
  • 任务是否属于文本生成或 NLP 任务范围?
  • 结果是否需要结合上下文,而不是只做固定规则匹配?
  • 输出是否允许模型以自然语言组织结果?

如果以上问题大多回答为“是”,那么该任务通常可以考虑使用大语言模型来处理。