外观
模型资料汇总
原文提示
上游原文的这一章节仍在持续完善。
本节汇总具有代表性的大语言模型。数据参考 Papers with Code 和 Zhao 等人(2023)。
模型
| 模型 | 发布年份 | 说明 |
|---|---|---|
| BERT | 2018 | 基于 Transformer 的双向编码表征 |
| GPT | 2018 | 通过生成式预训练改善语言理解 |
| RoBERTa | 2019 | 稳健优化的 BERT 预训练方法 |
| GPT-2 | 2019 | 语言模型是无监督的多任务学习者 |
| T5 | 2019 | 用统一的文本到文本 Transformer 探索迁移学习极限 |
| BART | 2019 | 用于生成、翻译和理解的去噪序列到序列预训练 |
| ALBERT | 2019 | 用于语言表征自监督学习的轻量 BERT |
| XLNet | 2019 | 面向理解与生成的广义自回归预训练 |
| CTRL | 2019 | 用于可控生成的条件 Transformer 语言模型 |
| ERNIE | 2019 | 通过知识融合增强表征 |
| GShard | 2020 | 使用条件计算与自动分片扩展大型模型 |
| GPT-3 | 2020 | 语言模型是少样本学习者 |
| LaMDA | 2021 | 面向对话应用的语言模型 |
| PanGu-α | 2021 | 支持自动并行计算的大规模中文自回归预训练模型 |
| mT5 | 2021 | 大规模多语言文本到文本预训练模型 |
| CPM-2 | 2021 | 具有成本效益的大规模预训练语言模型 |
| T0 | 2021 | 多任务提示训练支持零样本任务泛化 |
| HyperCLOVA | 2021 | 对数十亿参数韩语生成式预训练模型的深入研究 |
| Codex | 2021 | 评估使用代码训练的大语言模型 |
| ERNIE 3.0 | 2021 | 用于理解与生成的大规模知识增强预训练 |
| Jurassic-1 | 2021 | 技术细节与评估 |
| FLAN | 2021 | 微调后的语言模型是零样本学习者 |
| MT-NLG | 2021 | 用 DeepSpeed 和 Megatron 训练 5,300 亿参数的生成式模型 |
| Yuan 1.0 | 2021 | 面向零样本与少样本学习的大规模预训练模型 |
| WebGPT | 2021 | 结合人类反馈与浏览器的问答系统 |
| Gopher | 2021 | 语言模型扩展:训练 Gopher 的方法、分析与发现 |
| ERNIE 3.0 Titan | 2021 | 探索更大规模的知识增强预训练 |
| GLaM | 2021 | 使用混合专家高效扩展语言模型 |
| InstructGPT | 2022 | 通过人类反馈训练模型遵循指令 |
| GPT-NeoX-20B | 2022 | 开源自回归语言模型 |
| AlphaCode | 2022 | 达到竞赛水平的代码生成 |
| CodeGen | 2022 | 支持多轮程序合成的开放代码模型 |
| Chinchilla | 2022 | 固定计算预算下,较小模型使用更多数据训练可能优于单纯扩大模型 |
| Tk-Instruct | 2022 | 通过声明式指令泛化到 1,600 多项自然语言任务 |
| UL2 | 2022 | 统一语言学习范式 |
| PaLM | 2022 | 使用 Pathways 扩展语言建模 |
| OPT | 2022 | 开放的预训练 Transformer 语言模型 |
| BLOOM | 2022 | 1,760 亿参数的开放多语言模型 |
| GLM-130B | 2022 | 开放的双语预训练模型 |
| AlexaTM | 2022 | 使用大型多语言序列到序列模型进行少样本学习 |
| Flan-T5 | 2022 | 扩展指令微调语言模型 |
| Sparrow | 2022 | 通过有针对性的人类评判改善对话智能体对齐 |
| U-PaLM | 2022 | 以额外 0.1% 计算量超越原有扩展规律 |
| mT0 | 2022 | 通过多任务微调实现跨语言泛化 |
| Galactica | 2022 | 面向科学的大语言模型 |
| OPT-IML | 2022 | 从泛化角度扩展指令元学习 |
| LLaMA | 2023 | 开放且高效的基础语言模型 |
| GPT-4 | 2023 | GPT-4 技术报告 |
| PanGu-Σ | 2023 | 通过稀疏异构计算迈向万亿参数模型 |
| BloombergGPT | 2023 | 面向金融的大语言模型 |
| PaLM 2 | 2023 | 相比 PaLM 改善多语言与推理能力,并提高计算效率 |