什么是大语言模型(LLM)?
大语言模型(Large Language Model)是基于海量文本训练、能够理解和生成自然语言的深度学习模型,ChatGPT 就是最著名的代表。
一句话定义
大语言模型(Large Language Model,简称 LLM) 是一种在海量文本数据上训练出来的深度学习模型,核心能力是预测下一个词——通过不断预测,最终能够理解指令、回答问题、生成文章。
核心特点
- 规模大:参数量从数十亿到数万亿;
- 通用性强:一个模型能处理翻译、写作、编程、问答等众多任务;
- 基于 Transformer:目前主流 LLM 都采用 Transformer 架构。
常见误解
❌ 误解:LLM 是"搜索引擎",从数据库里找答案。
实际上 LLM 是基于概率生成文本,它不"查"资料,而是"编"文本——这也是它会产生"幻觉"(Hallucination)的原因。
相关概念
| 概念 | 关系 |
|---|---|
| 预训练(Pre-training) | 在海量数据上训练基础能力 |
| 微调(Fine-tuning) | 在特定任务数据上进一步训练 |
| 上下文窗口(Context Window) | 模型一次能"看到"的文本长度 |
| 幻觉(Hallucination) | 模型生成看似合理但不正确的内容 |
延伸阅读
想深入了解,推荐阅读 Transformer 原论文《Attention Is All You Need》。
还没有评论,来抢沙发吧~