跳转到正文

模型资料汇总

原文提示

上游原文的这一章节仍在持续完善。

本节汇总具有代表性的大语言模型。数据参考 Papers with CodeZhao 等人(2023)

模型

模型发布年份说明
BERT2018基于 Transformer 的双向编码表征
GPT2018通过生成式预训练改善语言理解
RoBERTa2019稳健优化的 BERT 预训练方法
GPT-22019语言模型是无监督的多任务学习者
T52019用统一的文本到文本 Transformer 探索迁移学习极限
BART2019用于生成、翻译和理解的去噪序列到序列预训练
ALBERT2019用于语言表征自监督学习的轻量 BERT
XLNet2019面向理解与生成的广义自回归预训练
CTRL2019用于可控生成的条件 Transformer 语言模型
ERNIE2019通过知识融合增强表征
GShard2020使用条件计算与自动分片扩展大型模型
GPT-32020语言模型是少样本学习者
LaMDA2021面向对话应用的语言模型
PanGu-α2021支持自动并行计算的大规模中文自回归预训练模型
mT52021大规模多语言文本到文本预训练模型
CPM-22021具有成本效益的大规模预训练语言模型
T02021多任务提示训练支持零样本任务泛化
HyperCLOVA2021对数十亿参数韩语生成式预训练模型的深入研究
Codex2021评估使用代码训练的大语言模型
ERNIE 3.02021用于理解与生成的大规模知识增强预训练
Jurassic-12021技术细节与评估
FLAN2021微调后的语言模型是零样本学习者
MT-NLG2021用 DeepSpeed 和 Megatron 训练 5,300 亿参数的生成式模型
Yuan 1.02021面向零样本与少样本学习的大规模预训练模型
WebGPT2021结合人类反馈与浏览器的问答系统
Gopher2021语言模型扩展:训练 Gopher 的方法、分析与发现
ERNIE 3.0 Titan2021探索更大规模的知识增强预训练
GLaM2021使用混合专家高效扩展语言模型
InstructGPT2022通过人类反馈训练模型遵循指令
GPT-NeoX-20B2022开源自回归语言模型
AlphaCode2022达到竞赛水平的代码生成
CodeGen2022支持多轮程序合成的开放代码模型
Chinchilla2022固定计算预算下,较小模型使用更多数据训练可能优于单纯扩大模型
Tk-Instruct2022通过声明式指令泛化到 1,600 多项自然语言任务
UL22022统一语言学习范式
PaLM2022使用 Pathways 扩展语言建模
OPT2022开放的预训练 Transformer 语言模型
BLOOM20221,760 亿参数的开放多语言模型
GLM-130B2022开放的双语预训练模型
AlexaTM2022使用大型多语言序列到序列模型进行少样本学习
Flan-T52022扩展指令微调语言模型
Sparrow2022通过有针对性的人类评判改善对话智能体对齐
U-PaLM2022以额外 0.1% 计算量超越原有扩展规律
mT02022通过多任务微调实现跨语言泛化
Galactica2022面向科学的大语言模型
OPT-IML2022从泛化角度扩展指令元学习
LLaMA2023开放且高效的基础语言模型
GPT-42023GPT-4 技术报告
PanGu-Σ2023通过稀疏异构计算迈向万亿参数模型
BloombergGPT2023面向金融的大语言模型
PaLM 22023相比 PaLM 改善多语言与推理能力,并提高计算效率

ChatGPT 中文使用指南 · MIT 许可 · 隐私政策