资讯详情

资讯详情

建站行业动态 · 设计趋势 · 数字化升级干货

<七>从3秒记忆到过目不忘——语言模型的三代进化

<七>从3秒记忆到过目不忘——语言模型的三代进化 上篇https://www.cnblogs.com/webor2006/p/22389647学了语言模型是什么——就是对下一个词出现的概率进行数学建模。但这事说起来简单做起来一点都不简单。怎么建这个模计算机怎么记住前面说过的话这篇看看语言模型是怎么一步一步从只能记住 3 个词进化到能理解整本书的。一、第一代N-gram 模型(1990年代-2000年代)最早的语言模型非常朴实叫N-gram 模型(1990年代-2000年代的主流)。它的思路简单到粗暴预测下一个词只看前面 N-1 个词。公式也很直接大白话解释一下P(下一个词 | 前一个词) 前一个词和下一个词一起出现的次数 / 前一个词出现的次数比如一个 2-gram 模型(只看前 1 个词)如果训练数据里 猫会 后面是 爬树 —— 出现了 500 次 猫会 后面是 抓老鼠 —— 出现了 300 次 猫会 后面是 飞 —— 出现了 2 次 ​ 那模型就记住了P(爬树|猫会) P(抓老鼠|猫会) P(飞|猫会)听起来挺合理的对吧但问题很快就来了。想象这个句子昨天下午我去超市买了一堆东西结账的时候发现忘带钱包了尴尬得不行。回到家才发现其实口袋里一直有______要填这个空你得知道前面说的是忘带钱包不是没带钱——钱可能在口袋。但 N-gram 只看前面 2~3 个词它只能看到一直有根本不知道前面在说忘带钱包的事。就像一个记忆只有 3 秒的人你跟他说了 10 句话他只记得最后半句。理解不了复杂的对话说两句就跑偏。二、第二代RNN/LSTM(2010年代早期)为了解决记不住的问题研究者搞出了RNN(循环神经网络)。RNN 的核心创新是加了一个隐藏状态——可以理解为模型边读边做笔记。每读一个词就更新一下笔记。理论上只要笔记记得好它就能记住整个历史。但实际上呢信息在传递过程中会衰减。每经过一层信息都要乘以一个小于 1 的系数(比如 0.9)传 1 层后0.9^1 0.9 → 还剩 90% 传 10 层后0.9^10 ≈ 0.35 → 只剩 35% 传 100 层后0.9^100 ≈ 0.00003 → 几乎没了就像传话游戏——十个人排成一排传一句话第 1 个人今晚去万达吃火锅记得带充电宝和优惠券 第 2 个人今晚去万达吃火锅记得带充电宝 ← 优惠券丢了 第 3 个人今晚去万达吃火锅 ← 充电宝也丢了 第 5 个人今晚去吃火锅 ← 万达没了 第 10 个人今晚吃饭 ← 只剩俩字传着传着信息就消失殆尽了。为了解决这个问题又搞出了LSTM(长短期记忆网络)。它加了三个门遗忘门哪些旧信息可以忘了输入门哪些新信息值得记住输出门当前应该关注什么就像你听课做笔记——你不会把老师说的每个字都记下来。你会判断哪个是重点(输入门)哪个可以划掉(遗忘门)哪些要画星号(输出门)。这一搞把记忆从 10~20 个词提升到了 100~200 个词。就像一个记忆从 3 秒变成 20 分钟的人——能看懂一集动漫了但一部两小时的电影还是不行。三、第三代Transformer(2017年至今)2017 年Transformer横空出世。它用一种叫Self-Attention(自注意力)的机制彻底解决了记不住的问题。这里先建个框架Transformer 和 Self-Attention 后面会单独拆开细学现在有个整体印象就行。以前的模型是传话模式——信息一个接一个往后传传着传着就丢了。Transformer 把模式改了不传话了所有人围着一张圆桌坐下你想跟谁说话直接说每个人都听得到每个人。就像一个圆桌会议。A 说昨天我在公园遇到了老张B 说他看起来很开心C 说他在上海工作——不管谁说、说什么、离你多远你全能直接听到。不需要中间人转述。Transformer 更厉害的地方在于它不仅让所有词互相听到还能让每个词智能地关注重点。比如要预测老张__——模型会自动把注意力分配给开心(情绪线索)、上海(地点线索)、公园(场景线索)、老张(指代对象)。它能同时抓住多个维度的信息综合判断。具体来说当模型处理老张这个词时它对前面各个词的注意力分配大概是这样的老张对各个词的注意力权重 ────────────────────────── 昨天 2% ← 不太相关 公园 5% ← 场景线索 遇到了 3% 老朋友 8% 老张 65% ← 指代对象高度相关 上海 5% ← 地点线索 工作 7% 很开心 5% ← 情绪线索 ──────────────────────────它不会只盯着一个词而是从多个维度同时抓取信息综合起来做出判断。这就是为什么 ChatGPT 能记住几万字的上下文——因为它站在 Transformer 的肩膀上从传话游戏变成了圆桌会议。GPT-4 支持 128,000 个 token 的上下文靠的就是这层能力。Self-Attention 有四个核心优势无损传递任意两个词之间直接连接不需要中间人转述智能筛选自动计算哪些词重要把注意力放在关键位置并行计算所有词可以同时处理不像 RNN 必须一个一个来无限长度(理论上)不管句子多长每个词都能直接看到所有其他词ChatGPT 就是基于 Transformer 的语言模型。从传话到群聊这不只是技术升级是范式的革命。四、大语言模型为什么非得这么大经常听到大语言模型(LLMLarge Language Model)这个词。这个大到底是什么意思大就是参数多。来看一组数字GPT-1 (2018): 1.17 亿参数 GPT-2 (2019): 15 亿参数 GPT-3 (2020): 1750 亿参数 GPT-4 (2023): 约 1.8 万亿参数 GPT-4o (2024): 约 1.8 万亿参数 GPT-5 (2025): 约 2 万亿参数从 GPT-1 到 GPT-5参数增长了约17000 倍。光是从 GPT-1 到 GPT-3仅仅两年时间参数就涨了约 1500 倍。这还不算训练数据——GPT-2 读过约 40GB 文本(相当于 80 本百万字小说)GPT-3 读了 570GB(1140 本)GPT-4/5 的具体数据没有公开但只会更大。除了 OpenAI这两年大家比较熟悉的还有这些DeepSeek-V3 (2024): 6710 亿参数(MoE 架构激活 370 亿) DeepSeek-V4-Flash: 未公开参数速度更快 Qwen2.5 (2024): 720 亿参数(阿里通义千问) Google Gemini 3 (2025): 1 万亿参数 Claude 4 (Anthropic, 2025): 约 1.5 万亿参数DeepSeek 可能大家印象最深——2025 年初那波热度让很多人都知道了国产大模型也能做到世界一流水平。为什么要这么大因为上篇学的那个大力出奇迹效应规模达到某个临界点后能力会突然跃升。不是大一点好一点的线性增长而是过了某个坎模型突然就会了——这种现象叫涌现能力。后面会专门学到这里先有个印象。所以大不是虚荣是必需。没有这个大就没有 ChatGPT 的智能。那多大算大行业里有个约定俗成的分界线小语言模型(SLM小于 100 亿参数)如 ChatGLM-6B、Mistral-7B、LLaMA-2-7B轻量级能在个人电脑或手机上跑中型(100 亿~1000 亿)如 LLaMA-2-70B、Qwen-72B需要多块 GPU但仍能本地部署大语言模型(LLM大于 1000 亿)如 GPT-3/4/5需要巨型计算集群通常只能通过云服务访问这个区分决定了能力边界也决定了用在哪儿对于 ChatGPT 来说它确实是一个大语言模型。不过有个有意思的趋势小而精正在崛起。以前觉得模型越大越好但最近发现小模型也可以很强。比如 Qwen2.5-7B 在很多任务上表现不输大模型手机就能跑Llama-3.2-3B 只有 30 亿参数日常问答也够用了。这说明大不是唯一的路。更好的训练方法、数据质量、模型架构同样重要。未来大概率是大小共存大模型做通用智能助手小模型做手机端、隐私敏感场景的专用任务。五、GPT 和 ChatGPT不是一个东西最后学一个容易搞混的点。GPT 是模型ChatGPT 是产品。GPT-1、GPT-2、GPT-3、GPT-3.5、GPT-4、GPT-4o、GPT-5——这些是技术名称指的是基础语言模型。它们只经过预训练核心能力就是预测下一个词只会接龙。参数规模从 1.17 亿一路涨到 2 万亿数据量从 40GB 涨到不敢公开但本质没变——都是下一个词预测器。如果你直接问 GPT-3怎么做红烧肉它可能这样接——怎么做红烧肉这个问题很多人问过。首先你需要准备五花肉……或者怎么做红烧肉我也不知道我从来没做过饭……它只是在接龙不知道你在提问不知道要给出答案。为什么会这样因为纯语言模型的训练目标只有一个——预测下一个词。它在海量互联网文本里见过各种开头有文章以怎么做红烧肉这个问题……开头有论坛帖子是怎么做红烧肉我也不知道……有网页列举怎么做红烧肉怎么……它把输入当成一篇文章的开头顺着往下写。它不知道你在问问题也不知道要给出答案。而 ChatGPT(对话模型)会这样回应做红烧肉可以参考以下步骤准备食材五花肉 500g、冰糖、八角、桂皮、生抽、老抽、料酒焯水五花肉切块冷水下锅加姜片和料酒煮开后撇去浮沫捞出备用炒糖色锅里放少许油加冰糖小火慢炒炒到琥珀色时下肉块翻炒上色炖煮加生抽、老抽、八角、桂皮倒入热水没过肉大火烧开转小火炖 40 分钟收汁开大火收汁汤汁浓稠后出锅你是第一次做吗要不要我讲得再细一点它理解了你在提问知道要给出结构化的步骤甚至还会反问引导对话继续。ChatGPT 不一样。ChatGPT 不是模型名是产品名。它的公式是ChatGPT 基础模型 对话训练举个具体的例子就清楚了早期 ChatGPT GPT-3.5 对话训练后来 ChatGPT GPT-4 对话训练现在 ChatGPT GPT-4o/GPT-5 对话训练同一个公式换不同的基础模型就是不同时期的 ChatGPT。但这个对话训练到底包含什么拆开来看是两个步骤SFT(监督微调)拿人工标注的问题-标准答案数据来训练让模型学会问答模式RLHF(人类反馈强化学习)让人给模型的多个回答打分排序再用强化学习优化让输出更符合人类偏好后面会细学这两个步骤现在知道它们的存在就行。简单说GPT 只会接龙ChatGPT 学会了聊天。产品化的最后一公里比技术突破更重要。这篇学了语言模型的三代进化。N-gram 只能看前面几个词RNN/LSTM 能记 100~200 个词但信息会衰减Transformer 用 Self-Attention 彻底解决了记忆问题。模型做大之后参数从 1 亿到 2 万亿新的能力自己冒出来。最后容易搞混的一点GPT 只会接龙ChatGPT 是加了对话训练之后才会聊天的。下一篇见加油

相关资讯