跳转至

第 3 章 提示词与上下文工程:模型究竟在看什么?

在第 2 章中,我们看到 Agent 是如何通过 ReAct 循环(思考 → 执行 → 观察) 步步推进任务的。

但在那一章的结尾,我们留下了一个让人不安的悬念:
Agent 每执行一步,外部工具返回的大段文本、文件内容、甚至报错日志,都会源源不断地塞进会话历史里。随着循环一圈一圈地转动,模型眼前的文字越来越多。

这时候,很多人会遇到一系列诡异的现象: - 跑着跑着,Agent 突然忘了最初要干什么; - 你明明叮嘱过“不要碰某个重要文档”,它转头就给覆盖了; - 你让它写个“专业大气的读书汇报”,它交出来的东西充满一股空洞廉价的 AI 味; - 你试图通过在聊天框里疯狂追加要求来纠正它,结果它越改越乱,最后彻底失控。

为什么会这样?

要真正驾驭 Agent,我们需要推开狭隘的“提示词魔法”,理解一个在现代 AI 应用中最为关键的认知底座——上下文工程(Context Engineering)。


1. 聊天框的幻觉:模型看到的远不止你发的那句话

很多人习惯把发给 AI 的输入统称为 Prompt(提示词)。在一个小小的聊天对话框里,我们很容易产生一种错觉:“我此刻在输入框里敲下的这行字,就是指挥 AI 的全部。”

这是一种极其天真的幻觉。

从大语言模型的底层数学逻辑来看:

$$ \text{下一个词的概率} = \Pr[\text{token} \mid \text{上下文(Context)}] $$

模型在决定下一步是调用工具、查阅资料、修改文档还是回复你时,它的“视野”从来不是你刚发的那一行字,而是此刻摆在它面前的整张巨大工作台——整个上下文(Context)。

在这张工作台上,堆放着来自各个角落的内容:

  1. 底座系统的原生规矩:调度 Agent 运行的外围环境预先注入的角色设定与工具清单;
  2. 项目的全局家规:比如存放在项目根目录里的规则文件,规定了这个项目要遵守的习惯、禁用行为和格式要求;
  3. 按需加载的技能手册(Skills):处理特定任务(如制作幻灯片、检索文献)时临时查阅的操作指南;
  4. 你和它在之前几十轮互动中积累的所有历史记录;
  5. 外部工具实时搬回来的原料:刚刚读进来的整份开题报告、数据表格、或是命令行的执行反馈。

你在聊天框里敲下的那句“帮我把第三部分润色一下”,可能只占整张工作台不到 1% 的篇幅。真正左右模型下一步动作的,往往是那 99% 的背景信息与既有事实。

明白什么是上下文,你才会建立起第一个工程直觉:驾驭 Agent 的第一步,不是挖空心思去编一句神仙咒语,而是学会管理它眼前的整张工作台。


2. 写清楚“完成”是什么:承担一切“不明确”的后果

很多同学在使用 AI 处理日常任务(写报告、做展示、整理数据)时,最常有的抱怨是“AI 做的东西太死板”、“缺乏灵魂”、“像个半成品”。

典型的对话往往是这样的:

同学:“帮我做一个关于大学生情绪健康的现代风格展示页面/文案。”
Agent:一阵忙活,交出来一份平铺直叙、堆满套话和刺眼渐变色的东西。
同学:“这也太俗气了!我要的是排版高级、数据详实、有高级留白感的那种!”

AI 违抗你的命令了吗?没有。它完全履行了字面上的要求。

愿望、规范与实现的落差

在任何任务的执行中,都存在三个层面的落差: 1. 真实愿望(Intent):你脑海中隐秘的、充满审美偏好和细节期望的美好构想; 2. 书面规范(Spec):你真正写进上下文里的具体要求与边界; 3. 最终实现(Impl):Agent 实际交付出来的产物。

你省略的所有细节,本质上都是把决定权拱手让给了模型。

而模型是一个基于全人类语料统计概率运转的机器。当你给出的约束极度模糊时,它别无选择,只能沿着统计概率最高、最不易出错的默认路径滑下去——也就是语料库里的“平均大众脸”。

这就像给新生儿取名:如果你只要求“取一个好听的名字”,模型算出来的最高概率组合大概率是新时代的“子涵”或“浩宇”。你不能怪 AI 平庸,因为你的指令没有为它排除掉平庸。

一个核心洞察:我们常说的“模型性能好”,到底好在哪里?

这里隐藏着一个极具启发性的认知:

我们在日常评测中常说“这个模型比那个模型更聪明”、“某某模型性能更强”,其实很大程度上是在说:这个模型在“自由发挥”的部分,更懂得如何讨好人类的预期。

当你的指令留有空白时: - 普通模型:在留白处填满了平庸、机械的应付之词。你说“写个介绍”,它给你列五句干瘪的要点;你说“做个页面”,它排得像十年前的分类信息网。 - 优秀模型:在没有明确说明的留白处,它默认选择的排版审美更具现代感,默认写的文字逻辑更连贯,默认调用的代码更优雅可读,默认梳理的文献能精准抓住核心矛盾。

所谓“模型更懂人话”,本质上是它的统计先验分布更贴近人类社会中的优秀品味。

但这绝不意味着你可以偷懒。即便世界上最顶尖的模型,也不可能读心。在关键的核心需求上,“写清楚你的指令,承担一切不明确的后果” 依然是不可撼动的铁律。

消除形容词,给出客观验收标准

如果你想要一份高质量的交付,就要尽量戒掉模糊的形容词: - ❌ 模糊愿望:“帮我把这份问卷分析写得专业一点,排版好看一点。” - ✅ 明确规范:“重点分析‘年级’与‘睡眠时长’的交叉分布;前言用三句话交代样本背景;结论部分分点列出三条对策;全文用 Markdown 表格展示均值与标准差。”

判断你的指令是否清晰,有一个最简单的试金石:让你的同班同学只看你的要求和最终产物,他能否客观判定任务算不算“完成了”?


3. 规则的注意力竞争:为什么不能“每犯一次错就打一个补丁”?

在管理 Agent 时,很多人都会不自觉地陷入一个陷阱:规则膨胀(Rule Bloat)。

想象一个日常场景: 1. 你让 Agent 帮你整理一份读书笔记,顺口提了一句:“文字精炼一点,不要带客套话。” 2. 结果它整理完之后,文末自作聪明地加了一行大字:【注:本文已按要求去除一切客套话】。 3. 你哭笑不得,立刻愤怒地在提示词里追加一条规则:“严禁在文末输出任何自我解释性的标注!” 4. 第二天,它在写摘要时又漏掉了关键参考文献,你又追加一条:“必须按 APA 格式列出所有文献,一条都不许漏!” 5. 第三天,它写长了,你又加一条:“字数必须严格卡在 800 字以内!”

两周之后,你的要求清单变得像法典一样冗长复杂,里面堆满了各种“切记”、“务必”、“严禁”。

结果呢?Agent 并没有变得更听话,反而开始频繁漏掉最基本的任务。

为什么提示词打补丁一定会崩溃?

  1. 规则也在争夺有限的注意力:模型的上下文容量虽然很大,但它处理复杂约束的注意力预算是有限的。当清单堆砌到二三十条时,模型在推导下一步时根本无法同时兼顾所有条件,往往顾此失彼。
  2. 规则之间容易暗生冲突:“详尽展开背景”与“严格控制字数”打架,“语气活泼幽默”与“严谨学术风格”互斥,模型在矛盾中极易陷入胡言乱语。

上下文工程的精髓:做减法与分层管理

真正懂得使用 Agent 的人,从来不会试图在一张纸上写尽天下规矩。他们懂得分层治理:

  • 底线家规保持极简:最核心的原则(比如使用的语言、交付的基本格式)保持极简,长期常驻;
  • 任务技能按需加载:只有在遇到特定专业任务时,才把对应的操作指南(Skill)拿出来给它看,用完即收;
  • 善用客观环境,而不是靠嘴劝诫:如果要求格式规范,直接给它一个排好版面的标准模板让它填空,远比在提示词里用五百字描述“什么叫优美排版”有效得多。

4. 一个反直觉的真相:为什么有范例的环境比一张白纸容易得多?

很多同学以为:让 AI 在一个完全空白的文件夹里从零写一份全新的策划案,肯定比让它去修改一份结构复杂的老项目要简单。

现实往往恰恰相反。

给 Agent 一张白纸,让它凭空创作,它常常在前两步看起来很惊艳,但越往下写越发散,段落风格前后不一,格式东拼西凑,最终变成一堆平庸而杂乱的文字垃圾。

但如果你给它的是一份已经写好了规范前言、排版工整、结构清晰的往期优秀报告,让它去补充第三章,它交出来的成果往往极具水准,甚至与前文浑然一体。

为什么会有这种巨大反差?

因为已有的规范环境,本身就是最强大的无声提示词!

  • 人类学习也是如此:给你一张白纸写商业计划书,你可能抓耳挠腮无从下笔;但如果学长给你一份获得了大奖的模板,你照着目录结构和论述口吻填补内容,效率和质量都会成倍提高。
  • 对大语言模型而言,已有的优秀范例(示例、排版、格式规范)会直接占据它视野中最重要的上下文位置。它不需要在海量可能性中盲目摸索,只需要照猫画虎(Few-Shot Learning),沿着已有上下文的惯性自然续写。

优秀的上下文工程,本质上就是为 Agent 搭建好一个整洁有序的“施工现场”。


5. 本章总结与下一站

在这一章里,我们彻底告别了对“单句提示词”的盲目迷信:

  1. 全景视野:决定 Agent 行为的不是聊天框里的那句话,而是包含角色预设、项目规则、历史记录与外部材料的整张 上下文工作台(Context)。
  2. 拒绝留白:写清楚你的指令,承担一切不明确的后果。越是核心的目标,越要有客观可检验的验收标准。
  3. 理解性能:所谓的“好模型”,是它在留白自由发挥处能交出更高审美的默认答卷;但这绝不意味着你可以放弃精确表达。
  4. 分层治理:停止用自然语言无休止地打补丁。保持全局规则精简,按需加载专业技能,用现成的范本与环境规范输出。

读到这里,一个极其自然的问题已经呼之欲出:

既然我们不能把所有的规矩都一股脑塞在临时对话里;
既然上下文需要分层治理——需要有长期的“项目家规”,需要有按需领取的“技能工具包”;

那么,在真实的工作和项目中,这些规矩到底应该保存在哪里?全世界的 AI 助手又是通过什么样的通用标准来阅读它们的?

下一章,我们将正式接触现代 Agent 体系中最重要的两份基石规范——项目的员工手册 AGENTS.md,与即插即用的技能包 Agent Skills。