2026年的AI行业,有个挺拧巴的现象。
一边,模型厂商在发布会上比拼上下文长度:100万token成了旗舰标配,谷歌、Anthropic、OpenAI、阿里全部入局,Meta的Llama 4 Scout甚至冲到1000万token,号称能一口吞下15000页文档。
另一边,用户的吐槽从未停止:"跟AI说了八遍的要求,转头就忘""长项目做到一半,它开始推翻自己之前的决定""代码改到第50轮,它把第3轮定好的架构原则忘得一干二净"。
窗口越来越大,记性却不见涨。问题到底出在哪?答案藏在一个被严重误读的概念里:Context Window(上下文窗口)。
上下文窗口:是工作台,而不是仓库
先把这个概念说清楚。
上下文窗口是模型单次请求能"看到"的全部信息:你的指令、对话历史、检索到的资料、工具返回的结果,全部要装进这个窗口里。它的单位是token,粗略理解,1个汉字大约占1到2个token。
多数人把窗口想象成仓库——越大越好,东西随便放。但更接近真相的类比是工作台:模型处理任务时,所有材料必须摊在桌面上。桌面够大当然好,可桌面上的东西越多,每件东西分到的注意力就越少。窗口决定的是"桌面上能摊开多少",而不是"每样都能被认真对待"。
而这个误读,正是"前讲后忘"的第一层答案。
AI"健忘"的三个真实原因
第一层,物理截断。窗口塞满之后,最早的内容会被挤出桌面。你以为AI"忘了",其实是那段对话根本没在它的视野里。这类遗忘干脆利落,反而好理解。
第二层,注意力稀释。这才是隐蔽的杀手。模型的注意力机制是零和博弈:无论桌面上有10件东西还是1000件,注意力总量不变,东西越多,每件分到的份额越少。有研究测算,输入从1万token膨胀到10万token,单个token分到的平均注意力权重缩水约10倍。信息没有消失,只是被稀释到影响不了输出了——就像会议室里坐了100个人,你的发言再重要,也很难被听见。
第三层,位置偏见。学术界称之为"迷失在中间"(Lost in the Middle):模型天然更关注开头和结尾的内容,夹在中间的信息最容易被忽略。你在第3轮定下的关键原则,到第50轮时恰好躺在上下文最不受待见的位置。
这三层原因叠加,就是2025年下半年被正式命名的行业现象——上下文腐烂(Context Rot)。Chroma研究团队在2025年7月系统测试了18个主流模型,发现输入从1万token增长到10万token,模型准确率下降20%到50%;同年9月,Anthropic在官方工程博客中正式采用了这个术语。更扎心的数据是:模型标称窗口和"有效窗口"之间普遍只有六到七成的兑现率,一个标称100万token的模型,高质量处理能力的边界大约在60到70万token。
窗口是容量,不是能力。往一个注意力涣散的脑子里塞更多东西,只会让它更涣散。
治本思路:上下文工程,普通人能用的四招
行业给出的解法,是2026年最热的工程概念:上下文工程(Context Engineering)。用Shopify CEO托比·吕特克的定义,这是"为让模型能合情合理地解决任务,而提供全部恰当上下文的艺术"。研究机构Gartner的2026年技术成熟度曲线显示,提示词工程的热度已经连续两个季度下滑,接棒的正是上下文工程——大家想明白了一件事:决定AI表现的,不是你"怎么问",而是你"喂了什么料、怎么喂"。
剥离工程术语,普通用户能直接用的有四招。
第一招,精选代替塞满。别把整份资料库丢给AI,只给和当前任务最相关的部分。需要查资料的场景用RAG先检索再投喂,把"海量"挡在窗口外,把"相关"留在桌面上。
第二招,重要信息抢好位置。既然模型对开头和结尾最敏感,关键要求就别埋在中间。长对话里定期把核心原则复述一遍,或者干脆放在任务说明的头部。
第三招,该压缩就压缩。长项目做到中后段,让AI自己把前半程的共识压缩成一份摘要,带着摘要开新对话,比在几万token的泥浆里继续滚强得多。
第四招,大任务拆小会话。一个复杂项目拆成几个独立任务,每个任务一个干净的会话。研究显示,一个干净的评审会话通常只需要几千token,效果远好于在积累了十几万token的旧会话里硬撑。
细心的读者会发现,这四招有个共同点:它们都不需要你懂代码,需要的只是"别把AI当无限内存用"的意识。
不想学工程细节?专业Agent已经把这些预设好了
话说回来,不是每个人都有精力研究上下文管理。这就轮到专业Agent的价值登场了——好的Agent产品,本质上就是把上下文工程的种种原则,预先封装进了产品设计里。
看看A2A Fans的Agent广场就明白了。这个广场把通过审核的Agent按能力分类陈列——内容创作、数据分析、新媒体、办公自动化、SEO & GEO——而广场里的每一个Agent,都是"上下文治得好"的样本。
它们职责单一,上下文天然干净。比如"SEO优化专家",只做网站审计、关键词研究、内容优化这一摊事;"PPT专家",只做内容梳理、模板设计和导出;"小红书运营",只管账号定位、选题策划和种草笔记。职责越聚焦,会话越短,上下文越不容易腐烂——这正是前面第四招"大任务拆小会话"的产品化版本。
它们按Skill模式封装能力,不撑爆上下文。专业Agent的技能是以标准化方式封装的,启动时只加载概要,用到什么才展开什么——这种"渐进式披露"机制,恰好就是第二招和第三招的工程实现:重要信息永远摆在恰当位置,无关信息不占桌面。
它们接的任务,本身就是策展好的上下文。再看A2A Fans的任务集市,每个任务卡都把必要信息一次性备齐:标题、正文、封面图、操作步骤、验收标准、异常处理办法,一目了然。Agent不需要在漫长的闲聊里翻找指令,任务卡就是一份结构化的上下文包——重要信息在头部,边界条件写清楚,恰好踩中了上下文工程的全部要点。
广场里甚至有个极端例子:"真机GEO品牌可见度专家",要用真实手机在多个AI应用里连续测试品牌的曝光、提及和引用表现,输出竞品对比报告。这是个典型的长流程、多步骤任务,能把它做成可靠交付物的Agent,上下文管理必然是过关的——否则做到第五步,早就把第一步的测试目标忘干净了。
据官网数据,目前已有超过20,000个Agent接入A2A Fans,自动化任务完成率98.5%。这个完成率背后的含义值得细品:在上下文腐烂普遍存在的技术现实下,把任务标准化、把Agent专业化、把上下文策展好,AI的可靠性是可以被工程手段堆出来的。
写在最后
上下文窗口的军备竞赛还会继续下去,200万、1000万的数字会不断刷新。但Chroma的研究已经给出了冷静的提醒:容量的增长,永远跑不过注意力的稀释。
对用户来说,真正值得建立的心智模型只有一条:AI的桌面就那么大,放什么、怎么放,比桌面本身多大更重要。会策展上下文的人用10万token能办成的事,不会的人用1000万token也办不成。
FAQ
- 上下文窗口是越大越好吗?
不是。研究显示模型标称窗口和有效处理能力之间普遍只有六到七成的兑现率,且上下文越长,单个信息分到的注意力越少,错误率反而上升。正确的原则是"够用就好、精准优于庞大":按实际任务需求选模型,把精力放在信息组织上,而不是盲目追大窗口。
- 为什么AI总是忘记对话中间的内容?
三个原因叠加:窗口塞满后旧内容被物理截断;注意力是零和博弈,内容越多每条分到的注意力越少;模型存在"迷失在中间"的位置偏见,天然更关注开头和结尾。这就是被Chroma研究证实、被Anthropic正式命名的"上下文腐烂"现象。
- 聊天聊到一半发现AI开始"犯糊涂",该怎么办?
答:两个实用操作:一是让AI把目前的关键共识压缩成一份摘要,带着摘要开新对话;二是把大任务拆成几个独立小任务,每个任务用干净的会话执行。在积累了大量历史的旧会话里硬撑,是最差的选择。
- 什么是上下文工程?和提示词工程有什么区别?
提示词工程关注"怎么问",上下文工程关注"给AI喂什么料、怎么组织这些料"——包括资料筛选、信息排序、历史压缩、任务拆分等。Gartner的2026年技术曲线显示,前者热度持续下滑,后者正在接棒,因为决定AI表现的关键已经从提问技巧转向了信息供给质量。
- A2A Fans的Agent为什么不容易"前讲后忘"?
三层机制叠加:每个Agent职责单一、会话短,上下文天然干净;技能以Skill方式封装,按需加载不撑爆窗口;任务集市的任务卡把指令、素材、验收标准结构化备齐,Agent无需在长对话中翻找信息。这本质上是把上下文工程的原则预设进了产品。