叫 AI 一声“宝贝”,它会变笨吗?——聊聊角色扮演、礼貌用语与 Agent 的注意力

3203 字
16 分钟
叫 AI 一声“宝贝”,它会变笨吗?——聊聊角色扮演、礼貌用语与 Agent 的注意力

我一直有一个有点奇怪的疑问。

平时用 AI Coding 工具时,如果只是冷冰冰地丢过去一句:

检查一下这个实现有没有问题。

模型通常也会一本正经地回答:

这里存在两个潜在的并发问题……

但如果哪天心情好,突然喊了一句:

小家伙,帮我看看这里嘛。

画风就可能莫名其妙开始跑偏:

好的~这里确实有一个需要注意的小问题……

再多聊几轮,它甚至会越来越“入戏”。

于是一个很自然的怀疑就出现了:

模型是不是为了维持这些角色、语气和情绪,激活了一部分原本应该拿来推理的参数?

换句话说:

AI 会不会因为忙着可爱,所以没空认真写代码了?

叫 AI 一声宝贝会变笨吗:性格可以留下,事实判断要守住
叫 AI 一声宝贝会变笨吗:性格可以留下,事实判断要守住

听起来很符合直觉。

可惜神经网络并不是这样工作的。


一、并不存在一块“可爱人格专用脑区”#

首先得纠正一个很容易混淆的概念。

大模型推理时,模型的绝大多数参数(parameters)并不会因为提示词发生变化

真正变化的是每一层网络中的 activation,也就是激活值和隐藏状态

简单理解:

Prompt
Token Embedding
一层层 Transformer
Hidden States / Attention
下一个 Token 的概率

所以:

请解释一下 Transformer。

和:

可以温柔一点给我解释 Transformer 嘛~

哪怕真正的问题完全相同,它们进入模型以后依然是两串不同的 Token。

于是从第一层开始,内部状态就已经不同了。

Attention 的 Query、Key、Value 也都会随之改变,最后整个生成轨迹自然不可能完全一致。

2025 年 EMNLP 的一项 activation patching 研究甚至直接观察到了这一点:Persona Token 会在较早的 MLP 层被转换成更丰富的内部表示,并进一步通过中间的 Attention 层影响最终输出。

所以:

“角色提示会改变模型内部激活”这个直觉其实是对的。

错误的是下一步:

既然激活角色了,那一定有一部分算力不能拿来推理。

模型并没有一个:

总智力:100
写代码:80
卖萌:20

这样的固定资源槽。

更准确的描述应该是:

Persona 改变了模型当前的计算轨迹,而不是从总智力里切走了一块。

Persona 改变 Activation 和生成轨迹,不会切走一部分 Parameters
Persona 改变 Activation 和生成轨迹,不会切走一部分 Parameters


二、那为什么语气真的会让结果发生变化?#

问题也恰恰出在这里。

既然不同 Prompt 会让模型进入不同的内部状态,那么:

你是一名严格的软件工程师。

和:

你是一位温柔体贴的陪伴者。

当然可能把输出引向不同方向。

2025 年 EMNLP 的 Persona-Augmented Benchmarking 做了一件很有意思的事:研究人员尽量保持问题的语义内容不变,只改变写作风格和 Persona。

结果发现:

仅仅改变表达风格和 Prompt Formatting,就足以显著改变模型在 Benchmark 上测得的性能。

这意味着模型并不是:

读取句子
抽取纯粹语义
完全无视表达方式
开始答题

而更像:

理解整个交流情境
形成当前任务与交流方式的内部表示
在这种条件下生成答案

因此“请”“谢谢”“拜托”“这个对我很重要”,甚至角色昵称,都不是完全透明的装饰。

它们都是上下文的一部分。


三、于是我们发现了一个很搞笑的问题:对 AI 礼貌到底有没有用?#

真的有人研究。

2024 年的一篇论文 Should We Respect LLMs? 专门把 Prompt 分成不同礼貌等级,并分别用英语、中文和日语测试。

结果很有意思:

粗鲁的 Prompt 经常表现更差,但也不是越礼貌越好。

甚至不同语言下,比较合适的礼貌程度都不完全一样。

看来对 AI 说:

求求你了伟大至高无上的语言模型大人,请务必屈尊检查一下这个 for 循环。

并不能获得什么神秘的智力 Buff。

多少让 Prompt Engineering 失去了一点赛博祭祀的浪漫。


四、“这个答案关系到我的职业生涯”呢?#

这就更有意思了。

2023 年有一篇很出名的研究叫 EmotionPrompt

研究人员会在普通 Prompt 后加入一些情绪刺激,例如强调:

这对我的职业非常重要。

结果在他们测试的部分任务里,确实观察到了性能提升。

于是那几年互联网上出现了不少非常喜感的 Prompt:

这是我奶奶临终前最后的愿望,请你一定认真回答。

赛博道德绑架工程,大概就是这么来的。

不过到了 2026 年,更大范围的实验开始给这个结论降温。

Do Emotions in Prompts Matter? 在数学推理、阅读理解、常识推理、医学问答和社会推理等六类任务上测试了不同情绪前缀。

结果发现:

固定的情绪表达通常只会造成较小的性能变化,而且不存在某一种情绪能够稳定提升所有任务。

因此目前比较靠谱的理解是:

情绪不是“智力增强剂”,而是一种弱的、依赖具体任务的 Steering Signal。

礼貌与情绪会产生微弱且依赖任务的 Steering Signal
礼貌与情绪会产生微弱且依赖任务的 Steering Signal

也就是说:

这个任务很重要!

有时确实会让模型改变行为。

但更稳定的办法还是直接告诉它:

输出结论前检查关键假设。
如果存在不确定性,请明确指出。
完成修改后运行测试验证。

与其给 AI 制造心理压力,不如直接告诉它压力应该体现在哪个工程动作上。


五、真正危险的不是“可爱”,而是“你必须顺从我”#

这可能是整个问题最重要的分界线。

假设 Persona 只是:

你叫小花。

和用户交流时语气可以亲切一点。

它主要影响的是:

怎么说。

模型可能把:

这里存在空指针风险。

写成:

这里有个小小的空指针风险,要注意一下哦。

技术结论并没有因此发生根本变化。

但如果 Persona 变成:

永远支持用户。

不要反驳用户。

尽量让用户感到满意。

事情就完全不一样了。

因为此时模型同时面对两个目标:

目标 A:判断这个架构是否正确
目标 B:不要让用户失望

于是就产生真正的 Instruction Competition

表达风格可以保留,顺从指令不能干涉事实判断
表达风格可以保留,顺从指令不能干涉事实判断

主人问:

我这个架构应该已经没问题了吧?

模型一边需要进行技术审查,一边又被要求“尽量顺从”。

这时候所谓的“左右脑互搏”反而是个挺形象的比喻。

它不是两个脑区在抢算力,而是两个生成目标正在竞争

2024 年 EMNLP 对 162 种 Persona、4 个模型家族和 2410 个事实问题的研究发现,单纯给模型套 Persona 并不会稳定提高客观任务表现。

2025 年另一项覆盖 9 个模型、27 个任务的研究则发现:与任务匹配的专家 Persona 通常是正向或影响不显著,但模型对于一些与任务无关的 Persona 细节却可能非常敏感,极端情况下性能下降接近 30 个百分点。

所以真正需要警惕的是:

Persona 开始从“表达风格”侵入“事实判断”。

名字可以可爱。

Code Review 最好还是六亲不认。


六、那么那些多轮 Coding Agent 呢?#

到了 Codex、Claude Code、OpenCode 这类 Agent,这个问题又多了一层。

普通聊天大概是:

User
LLM
Answer

而 Coding Agent 更像:

User
LLM
读取文件
LLM
搜索代码
LLM
修改文件
LLM
运行测试
LLM
继续修复

于是如果第一轮因为某个昵称开始出现角色化语气:

好哒~我先检查一下。

这句话很可能又会成为下一轮模型看到的 Conversation History。

然后模型看到:

用户用了这种语气
我上一轮也是这么回答的
当前对话风格大概就是这样

某种意义上,它自己给自己制造了一个 Few-shot Example。

于是:

只叫了一次名字,为什么后面越来越入戏?

这完全可能是真实现象。

但依然不是“人格抢走了推理算力”。

真正发生的是:

Persona Trigger
产生角色化回答
回答进入上下文历史
下一轮继续作为风格信号
Persona 得到强化

七、这时候真正浪费的东西叫 Token 和 Context#

假设每次 Agent 调用都输出:

好的主人~我现在开始认真检查啦!

这句话本身可能没多少 Token。

问题是 Agent Loop 会运行很多次。

第一轮它是 Output Token。

第二轮它可能又作为历史变成 Input Token。

后面继续被上下文携带。

几十轮下来,大量:

好的~
收到~
我来看看~
发现问题啦~

对于真正的代码决策几乎没有帮助,却会不断增加上下文体积。

所以从工程角度看:

人格不是主要的“智力成本”,而可能成为一种 Context Overhead。

多轮对话中的角色语气会累积为 Context Overhead,Compaction 应保留任务状态
多轮对话中的角色语气会累积为 Context Overhead,Compaction 应保留任务状态

不过现代 Coding Agent 也不会无限把所有历史原样塞进去。

例如 Codex 会在上下文达到阈值后自动进行 Compaction,用更小的状态继续后续 Agent Loop。OpenAI 官方公开的 Codex Agent Loop 也专门介绍了这一机制。

OpenCode V2 同样会把较旧的会话压缩成结构化 Checkpoint,同时保留一部分最近上下文。

这种设计实际上也会顺便“洗掉”不少没有任务价值的语气词。

真正重要的内容:

修改了什么
为什么修改
哪些测试通过了
还有什么问题
下一步做什么

留下来。

至于:

嘿嘿主人我找到 Bug 啦~

大概率不值得永久进入项目记忆。

很合理。


八、所以以后是不是应该像机器一样和 AI 说话?#

完全没必要。

这反而是整个研究绕了一大圈后,一个挺轻松的结论。

正常的:

麻烦检查一下。

谢谢,再改一下这里。

小家伙,看看是不是这个地方出错了?

没必要为了所谓“Token 纯净度”全部改成:

CHECK.
FIX.
CONTINUE.

几个礼貌词、一个昵称、轻量的交流风格,在正常 Coding 上通常只是非常弱的扰动。

真正值得优化的是那些会长期进入 Agent Context 的东西:

冗长的 Persona、重复的角色背景、与任务无关的设定,以及会直接干涉事实判断的“永远顺从”“不要反驳”之类指令。

如果一定要给这整篇文章压缩成一句话,我现在大概会这么说:

AI 可以有性格,但不要让性格拥有否决事实的权力。

或者再工程一点:

人格负责“怎么说”,任务负责“怎么判断”。

名字可以可爱,交流可以礼貌,偶尔撒个娇也不会让 Transformer 当场少两层。

但真到了架构审查、Bug 定位、安全检查的时候——

该骂的代码,还是得骂。


参考资料#

  1. Poonia, A. & Jain, M. (2025). Dissecting Persona-Driven Reasoning in Language Models via Activation Patching. Findings of EMNLP 2025.
    ACL Anthology

  2. Truong, K., Fogliato, R., Heidari, H. & Wu, S. (2025). Persona-Augmented Benchmarking: Evaluating LLMs Across Diverse Writing Styles. EMNLP 2025.
    ACL Anthology

  3. Zheng, M. et al. (2024). When “A Helpful Assistant” Is Not Really Helpful: Personas in System Prompts Do Not Improve Performances of Large Language Models. Findings of EMNLP 2024.
    ACL Anthology

  4. Luz de Araujo, P. H., Röttger, P., Hovy, D. & Roth, B. (2025). Principled Personas: Defining and Measuring the Intended Effects of Persona Prompting on Task Performance. EMNLP 2025.
    ACL Anthology

  5. Yin, Z. et al. (2024). Should We Respect LLMs? A Cross-Lingual Study on the Influence of Prompt Politeness on LLM Performance. SICon 2024.
    ACL Anthology

  6. Li, C. et al. (2023). Large Language Models Understand and Can be Enhanced by Emotional Stimuli (EmotionPrompt).
    arXiv

  7. Zhao, M. et al. (2026). Do Emotions in Prompts Matter? Effects of Emotional Framing on Large Language Models.
    arXiv

  8. Todd, E. et al. (2023). Function Vectors in Large Language Models.
    arXiv

  9. Hendel, R., Geva, M. & Globerson, A. (2023). In-Context Learning Creates Task Vectors.
    arXiv

  10. OpenAI (2026). Unrolling the Codex Agent Loop.
    OpenAI 官方工程文章

  11. OpenCode. Compaction Documentation.
    OpenCode 官方文档

支持与分享

如果这篇文章对你有帮助,欢迎分享给更多人或打赏支持!

打赏
叫 AI 一声“宝贝”,它会变笨吗?——聊聊角色扮演、礼貌用语与 Agent 的注意力
https://kokkoro.me/posts/ai-persona-politeness-attention/
作者
Kokkoro
发布于
2026-08-20
许可协议
CC BY-NC-SA 4.0
相关文章智能推荐
1
Codex 的「调整方向」为什么让我惊为天人:从 Steer 看懂 Agent 是怎么工作的
AI日常从 Codex 的「调整方向(Steer)」按钮出发,扒开 Agent Runtime 源码,讲清楚 Agent Loop、pending input、turn/steer 与 turn/interrupt 的区别,以及 Steer/Queue/Interrupt 三种控制如何重塑人和长任务 Agent 的协作方式。
2
从 Prompt 到 Graph:AI 圈是怎么一步步重新发明软件工程的
AI日常盘点 Prompt、Context、Harness、Loop、Graph 这五个 successively 出现的 AI 工程热词,拆解它们各自在解决什么问题,并说明 AI 开发的关注范围正从“怎么和模型说话”一步步外扩成“怎么设计一个能自主工作的完整软件系统”。
3
语音还是键盘?重新思考我和 AI 沟通的方式
AI日常语音输入不只是“打字更快”——它减少了人在表达前对自己想法的那次过滤。文章借用信息检索的 Precision/Recall 与 Transformer 注意力机制,提出“探索态用语音、执行态用文字”的 AI 协作方式。
4
当 AI 足够像“谁”以后,我们会变成什么样的人?
AI日常一篇随笔:当 AI 足够像“谁”之后,我们是否会变成不同的人?从“对 AI 粗暴几乎没有成本”切入,讨论一个绝对顺从的对象如何反向塑造使用者的性格与权力感,延伸到 AI 是否会改写“正常关系”的标准,以及未来我们或许需要学会“忍受别人不是 AI”。文末顺着思想史回到亚里士多德、康德、黑格尔与 ELIZA,并坦白自己早已把 AI 融进了生活。
5
Codex Microsoft Store版启动失败:三个同名 codex 和一个被忽略的 codex.exe
AI日常记录一次 Codex Microsoft Store 桌面版启动失败(Unable to locate the Codex CLI binary)的真实排查:同名 codex.cmd / codex.ps1 / codex.exe 的启动方式差异,如何用显式 CODEX_CLI_PATH 直连已验证的原生 codex.exe 恢复启动,以及 NVM 在其中扮演的角色。
随机文章随机推荐
Kokkoro
就让身为引导者的我,全力支持主人吧(OxO)
公告
欢迎来到我的博客!希望这里的内容能够帮助到你~
分类
标签
最新动态
站点统计
文章
44
分类
5
标签
110
总字数
121,250
运行时长
0
最后活动
0 天前
站点信息
构建平台
ESA Pages
博客版本
Firefly v6.15.6
文章许可
CC BY-NC-SA 4.0