新闻详情

新闻详情

首页 / 资讯中心 / 详情

为什么聊久了 AI 就忘事?上下文窗口 Context Window 详解

发布时间:2026/10/7 10:22:41来源:尧图网络
为什么聊久了 AI 就忘事?上下文窗口 Context Window 详解
为什么聊久了 AI 就忘事上下文窗口 Context Window 详解导语你跟 AI 聊到第 50 轮它突然不认得开头说过的话——这不是它记性差是上下文窗口Context Window到顶了。本文讲清它是什么、为什么有限、以及怎么用代码看清它的边界。一、背景 / 为什么需要它做对话产品时最常见的投诉“AI 前面明明答应过后面全忘了。“很多人第一反应是骂模型笨。其实问题出在上下文窗口——它是模型一次性能处理的文字量上限”不是记忆而是一个固定大小的阅读框”。你每次发的每句话、它回的每句话都变成 Token 堆在一起送进模型。这个能一起送进去的最大长度就是上下文窗口。比如 8 万 Token 的窗口差不多能塞下一篇中篇小说但一旦超出最早的内容就会被挤出去。二、核心概念 / 原理关键认知上下文窗口不是记忆是一个固定大小的阅读框。窗口越大模型每算一步要同时比对的内容越多算力和钱都往上飙。所以厂商不是不能做大是在够用和烧钱之间找平衡——这就是为什么不同模型窗口差那么多。更反直觉的一点是AI 在两次请求之间其实什么都不记得。你每次发消息对模型都是一次全新开始所谓它记得对话是聊天软件把历史记录又原样发回给它了。一旦软件不再发旧记录开新会话、或超窗口被截断它立刻变初见。flowchart TD A[输入] -- B[处理] B -- C[输出] C -- E[模型只读框内内容] mermaid graph LR A[新消息进入] -- B{窗口未满?}B -- 是 -- C[原样拼进上下文] B -- 否 -- D[挤出最老的 Tokenbr或压缩成摘要] C -- E[模型只读框内内容] D -- E E -- F[框外内容模型忘了]把重要前提藏在开头然后指望它一直记得是典型误区。正确做法是把关键约束写在最新一条消息里或定期重述。三、动手实操用 tiktoken 看清窗口边界3.1 环境与版本Python 3.11tiktoken 0.7OpenAI 官方分词器用来数 Token以cl100k_base编码近似演示不同模型编码不同数量级一致3.2 关键代码下面演示一段长文本到底占多少 Token以及超出窗口会被截断的模拟。importtiktoken# 3.1 初始化编码器cl100k_base 是 GPT-3.5/4 系常用编码enctiktoken.get_encoding(cl100k_base)# 3.2 模拟一段聊了很久的对话历史history用户我叫小王帮我记一下今天只干了三件事。\nhistory(AI好的记下了。\n*200)# 假装有 200 轮来回history用户我刚说今天干了几件事# 3.3 数 Tokentokensenc.encode(history)print(总 Token 数,len(tokens))# 3.4 模拟 8 万 Token 窗口的截断行为WINDOW80_000iflen(tokens)WINDOW:kepttokens[-WINDOW:]# 只保留最后 8 万最早的被挤出print(超出窗口保留最新 Token 数,len(kept))else:kepttokens# 3.5 看框外的内容是否还在decodedenc.decode(kept)print(窗口内还能看到小王吗,小王indecoded)预期结果200 轮来回后总 Token 数远超 8 万截断后保留的窗口里开头的小王/三件事已被挤出小王 in decoded大概率为False——这就是聊久了就忘事的代码级证据。四、常见坑 / 避坑清单把上下文窗口当长期记忆它只是临时阅读框关会话即清空。真要长期记住用户得上外部记忆RAG、向量库、用户档案别指望窗口。重要前提写在开头一旦对话变长被截断开头约束最先丢。把关键规则写进系统提示词并在最新消息里复重述。盲目堆大窗口窗口翻倍推理的每一步注意力计算成本近似平方级上升延迟和账单都会爆。够用就好超出的用检索/摘要补。以为它忘是模型丢数据其实是客户端没把旧记录递回去新会话、被截断。排查健忘先看发送侧是否带了 history。五、总结上下文窗口 一次性可读的最大 Token 数是阅读框不是记忆。超限后最早内容被挤出或压缩表现就是聊久了忘事。两次请求之间模型不记得任何事记忆靠客户端回传 history。关键约束放系统提示词 最新消息复重述长期记忆交给外部方案。最后以上就是本文的全部内容希望对你有帮助。AI 的上下文窗口和记忆机制这块我会接着在 CSDN 专栏《AI基础知识分享》里拆。点个关注新文不漏看。
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

【外设】之大彩串口显示屏 2026/10/6 15:16:42

【外设】之大彩串口显示屏

大彩串口屏初步使用 1 .官网下载 STM32 屏幕 GUI 设计资料 http://www.gz-dc.com/category/typeid/4112 找到 STM32 Keil 工程,移植相关代码因项目而异进行移植,由于项目简单,本人只对用到的指令接口进行修改。 比如:注意事项&…

阅读更多 →
无法下载Windows系统iso文件 2026/10/7 8:13:40

无法下载Windows系统iso文件

当我遇到这个问题的时候,我打开了一个网站: 登录 然后我打算下载的时候: 突然那个官方的连接就可以下载了:

阅读更多 →
【清华代码熊】DeepSeek V4.1 Flash 后训练详解 2026/10/6 15:18:24

【清华代码熊】DeepSeek V4.1 Flash 后训练详解

📌 上期解析了 DeepSeek V4.1 Flash 模型架构改进,本期解析 DeepSeek V4.1 Flash 预训练/后训练技术: 🌟 预训练:45T 文本 多模态混合语料、直接训练 sparse attention(取消 DeepSeek V4 的 dense 冷启动&…

阅读更多 →
Shuffle-R1: Efficient RL framework for Multimodal Large Language Models via Data-centric Dynamic ... 2026/10/6 16:48:59

Shuffle-R1: Efficient RL framework for Multimodal Large Language Models via Data-centric Dynamic ...

文章主要内容和创新点 主要内容 本文聚焦于多模态大语言模型(MLLM)强化学习(RL)训练中的效率问题,提出了一个名为Shuffle-R1的框架。研究发现,当前RL训练存在两个关键缺陷: 优势值坍缩(Advantage Collapsing):批次中大多数优势值集中在零附近,导致有效梯度信号被淹…

阅读更多 →
PRvL: Quantifying the Capabilities and Risks of Large Language Models for PII Redaction 2026/10/4 14:31:34

PRvL: Quantifying the Capabilities and Risks of Large Language Models for PII Redaction

一、文章主要内容总结 本文聚焦于利用大型语言模型(LLMs)实现个人身份信息(PII)脱敏的研究,旨在解决传统脱敏方法(如基于规则的系统、领域特定命名实体识别(NER)模型)泛化能力差、跨格式/跨语境适应性弱的问题。 研究通过全面评估多种LLM架构(包括密集型LLM(D-LLM…

阅读更多 →
LLaVA-RE: Binary Image-Text Relevancy Evaluation with Multimodal Large Language Model 2026/10/6 16:58:56

LLaVA-RE: Binary Image-Text Relevancy Evaluation with Multimodal Large Language Model

文章主要内容和创新点 主要内容 本文聚焦于二进制图像-文本相关性评估任务(判断图像与文本“相关”或“不相关”),针对该任务中文本格式多样、相关性定义随场景变化等挑战,提出了基于多模态大语言模型(MLLM)的解决方案LLaVA-RE。 模型设计:LLaVA-RE基于LLaVA 1.5架构,…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉