上下文Context 是什么
在开启大模型探索之旅时,有一个词我们一定会反复听到,那就是“上下文”,英文叫做 Context。今天,我们就来揭开它的神秘面纱。
我喜欢把它形容为连接对话的“记忆之绳”。正是这根绳子,把我们和 AI 说的每一句话串联起来,让交流不再是零散的片段,而是一个有灵魂的整体。
从定义上讲,AI 上下文是指模型在生成当前回答时,能够“记得”并引用的信息范围。这就像我们在现实生活中聊天,你必须记得前三分钟聊了什么,才能听懂对方现在说的“那个东西”到底指代什么。如果 AI 没有上下文,它就像一个只有七秒钟记忆的鱼,无法进行深度的多轮交流。
上下文的核心作用,就是让 AI 实现连贯、逻辑一致的表达。只有理解了前文的语境,模型才能给出精准的反馈,而不是答非所问。

上下文的基石:Token(词元)
连接对话的“记忆之绳”,我们要想搞清楚这根绳子有多长、多粗,就得先认识它的基本编织单元——Token,也就是我们常说的“词元”,这是所有大语言模型计量信息长度的基石。
一整本像《三体》这样的小说,Token 的数量是呈指数级增长的。当我们说一个模型的上下文窗口是 128K 时,指的就是它一次性能处理约 12.8 万个 Token 的信息量。所以,这里的核心逻辑非常明确:Token 的消耗量直接决定了 AI 的单次记忆上限。
上下文长度的进化:从文本片段到全量知识库
AI上下文长度的突破是以指数级速度发生的。从 GPT-3 时代的 4k Token,也就是几页纸的长度,到 GPT-4 飞跃至 128k,再到现在动辄百万级别的 Token 容量。这种跨越意味着模型从只能记住一个段落,变成了可以背诵几本书。

那么长上下文具体怎么用呢?比如,你可以直接投喂一整部长篇小说,让 AI 精准提取错综复杂的人物关系网;或者让它通读整个项目代码库,实现跨文件的逻辑重构。这些在以前是无法想象的。
这种能力的提升,让 AI 从一个“短期记忆”的聊天机器人,真正变成了一个能够深入理解复杂业务的“数字专家”。
但是,窗口越大真的就代表效果越好吗?
大海捞针:长上下文的局限
虽然现在的模型支持处理极长的内容,但长上下文并不等同于“完美记忆”。这种局限性在技术圈有一个生动的比喻,叫做“大海捞针”实验。首先要关注的是“Lost in the Middle”现象。
AI 模型通常对文档的首尾部分记忆深刻,但对于藏在中间的信息,识别率会显著下降。就像我们背诵长课文,开头和结尾总是最熟,中间却容易卡壳。

如上面的示意图,它展示了注意力的分布情况。可以看到中间区域呈现明显的凹陷,这意味着如果你把核心指令放在长文档的腰部,AI 极有可能“视而不见”。
其次是效率问题。Token越多,模型在推理时的计算开销就越大,响应延迟也会显著增加。为了处理不必要的超长文本,我们需要支付更高的金钱和时间成本。
最后,当 Prompt(提示词)过长时,AI 会产生“幻觉”或忽略核心指令。由于干扰信息太多,它可能会忘记你最初提出的要求。
所以,学会高效地管理上下文,是每一位 AI 使用者的必修课。
如何管理上下文
想要做好上下文管理,我梳理了以下实用三板斧:
第一斧:精简 Prompt。很多人喜欢把背景写得极长,但过多的冗余描述反而会干扰 AI 的判断。我们要学会修剪,只保留核心的约束和关键指令,让 AI 的注意力能精准聚焦。
第二斧:结构化表达。相比于大段的文字,AI 更喜欢整齐、有序的信息。我非常建议大家使用 Markdown 语法,通过清晰的段落标记建立层级结构,这样 AI 就能更高效地理解复杂的上下文。
第三斧:分段处理。如果一个任务确实非常庞大,不要试图在一个 Prompt 里塞进所有东西。把长任务拆解成多个子任务,分阶段执行,这样不仅能降低单次交互的 Token 消耗,还能大幅提升每一步的执行质量。

我们要时刻记住:Token 是计费和算力的基本单位。管理上下文,本质上就是在跟 Token 玩一场“节省游戏”。掌握了这些,你就能在有限的窗口里发挥出 AI 的最大潜力。
展望未来,大模型技术正沿两大路径并行演进:一端依托原生超长上下文持续打磨模型内生记忆与理解能力,另一端依靠 RAG 检索增强生成技术外接全域知识库。内生上下文与外部检索构成产业落地双轮,相辅相成、优势互补,不断拓宽大模型的能力上限与商业化落地空间。关于 RAG 体系细节,后续我再单独整理分享,本次分享到此结束。
掌握Context,开启与人工智能深度对话的未来