什么是大语言模型(LLM)?

大语言模型(Large Language Model)是基于海量文本训练、能够理解和生成自然语言的深度学习模型,ChatGPT 就是最著名的代表。

一句话定义

大语言模型(Large Language Model,简称 LLM) 是一种在海量文本数据上训练出来的深度学习模型,核心能力是预测下一个词——通过不断预测,最终能够理解指令、回答问题、生成文章。

核心特点

  • 规模大:参数量从数十亿到数万亿;
  • 通用性强:一个模型能处理翻译、写作、编程、问答等众多任务;
  • 基于 Transformer:目前主流 LLM 都采用 Transformer 架构。

常见误解

❌ 误解:LLM 是"搜索引擎",从数据库里找答案。

实际上 LLM 是基于概率生成文本,它不"查"资料,而是"编"文本——这也是它会产生"幻觉"(Hallucination)的原因。

相关概念

概念关系
预训练(Pre-training)在海量数据上训练基础能力
微调(Fine-tuning)在特定任务数据上进一步训练
上下文窗口(Context Window)模型一次能"看到"的文本长度
幻觉(Hallucination)模型生成看似合理但不正确的内容

延伸阅读

想深入了解,推荐阅读 Transformer 原论文《Attention Is All You Need》。

评论(0)

还没有评论,来抢沙发吧~

发表评论

评论需审核通过后展示