行业研究报告

大模型简史综述 -从Transformer(2017)到DeepSeek-R1(2025)

2025-03AI大模型22

「语言模型」(LMs)和「大型语言模型」(LLMs)这两个术语虽然经常被互换使用, 但实际上它们基于规模、架构、训练数据和能力指代不同的概念。 子集,其规模显著更大,通常包含数十亿个参数(例如,GPT-3 拥有 1750 亿个参

报告摘要

「语言模型」(LMs)和「大型语言模型」(LLMs)这两个术语虽然经常被互换使用, 但实际上它们基于规模、架构、训练数据和能力指代不同的概念。 子集,其规模显著更大,通常包含数十亿个参数(例如,GPT-3 拥有 1750 亿个参

核心要点

  1. 1. 什么是语言模型 (Language Models)?
  2. 1.1 大型语言模型(LLMs)
  3. 1.2 自回归语言模型 (Autoregressive Language Models)
  4. 1.3 生成能力
  5. 2. Transformer革命 (2017)

报告信息

文件全名
大模型简史综述 -从Transformer(2017)到DeepSeek-R1(2025)-22页.pdf
适合读者
战略规划行业研究员
核心数据
  1. 「文本」预测下一个「字」(或token/sub-word)的「概率分布」(propability
  2. 从预测的概率分布中随机采样一个字。
  3. 开始,如下图,模型通过迭代预测下一个词,直到生成完整的序列或达到预定的停止条
核心议题
大模型LLMGPT语言模型

常见问题

《大模型简史综述 -从Transformer(2017)到DeepSeek-R1(2025)》主要包含哪些内容?

「语言模型」(LMs)和「大型语言模型」(LLMs)这两个术语虽然经常被互换使用, 但实际上它们基于规模、架构、训练数据和能力指代不同的概念。 子集,其规模显著更大,通常包含数十亿个参数(例如,GPT-3 拥有 1750 亿个参核心数据:「文本」预测下一个「字」(或token/sub-word)的「概率分布」(propability;从预测的概率分布中随机采样一个字。;开始,如下图,模型通过迭代预测下一个词,直到生成完整的序列或达到预定的停止条。

这份报告覆盖哪一年、篇幅多大?

覆盖 2025 年,全文约 22。

这份报告是免费的吗?如何获取?

本报告免费查阅,登录资料宝后即可在线获取完整内容。

这份报告适合哪些读者?

适合战略规划、行业研究员等读者参考。

报告涉及哪些关键议题?

重点分析了大模型、LLM、GPT、语言模型等议题。

继续阅读

同分类报告

查看全部
📱 登录