返回全部文章
文章

为什么同一个 Prompt 会得到不同答案?

作者:

用一份场地预约记录,区分措辞变化和事实变化。固定输入、重复检查关键条件,让 AI 的回答更可靠,而不只追求逐字相同。

一张折叠消息卡展开成两个排列不同的面板,中间由青柠色封扣连接

你让 AI 把场地预约记录整理成一段简短通知。第一次先写日期,第二次先写房间,这两种写法可能都能用。但如果其中一次把“暂时保留”改成“已经订好”,差别就不只是文风了。

判断回答是否可靠,应看它有没有保住这项任务必需的事实和条件。AI 可以提供不同表述,验收要求却应该稳定。逐字相同不是唯一目标;一句错话重复三次,也不会因此变对。

先看究竟是哪一类差别

下面是一份虚构记录:

工作坊:2026 年 9 月 18 日,14:00—15:30,上海时间。
B 房间目前只是暂时保留,尚未确认。
最多容纳 12 人。
Mei 将在 9 月 16 日 12:00 前确认房间,时间均为上海时间。
确认之前不要邀请参与者。

这份记录可以有不同的合格摘要:

工作坊拟于 9 月 18 日上海时间 14:00—15:30 举行,最多 12 人。B 房间目前暂时保留,Mei 将在 9 月 16 日上海时间中午 12:00 前确认。请等确认后再发邀请。

也可以先提醒下一步:

请先等 Mei 确认房间,再发邀请;确认期限为 9 月 16 日上海时间中午 12:00。B 房间目前为暂时保留,拟用于 9 月 18 日上海时间 14:00—15:30 的工作坊,人数上限为 12 人。

这两段是为本文编写的示例,不是某个模型重复运行的记录。信息顺序变了,预约状态、时间、人数和行动要求没变。“B 房间已经订好,可以发邀请”则不合格。

先把差别分清,再决定要不要改提示词。换一种说法可以接受;漏掉条件需要补回;多出日期或确认状态,则必须回查原文。

你看到的那句话,不一定是全部输入

一次请求除了刚输入的文字,还可能包含之前的对话、附件和其他说明。在同一个长对话里重发一句话,与在新对话中只发送这句话,并不是相同条件。中途补过一句“语气再确定一点”,也可能影响助手如何表达尚未确认的事。

文本生成方式本身也可能带来变化。模型使用称为 token 的小段文字,生成时可以从候选的后续片段中进行选择。Google 的提示设计说明介绍了影响这一选择的参数。因此,两次回答不同,并不能单凭这一点证明你改过输入,或服务商换过模型。

模型和应用设置同样值得记录。保存界面显示的模型名称和测试日期,但不要从语气反推后台设置。界面没有提供某个参数时,写“未显示”即可,不必猜测它的 temperature(温度参数)是多少。

用一份固定材料,重复检查相同条件

把原始记录和下面的要求保存在一起:

请把下面的记录整理成不超过 180 个汉字的内部通知。
保留活动日期、时间和时区、人数上限、房间状态、
负责确认的人、确认期限,以及发送邀请的前提。
不能把暂时保留改成已经确认。不要增加原文没有的事实。
只输出通知。

【粘贴原始记录】

在三个新对话里,使用相同的可见设置、要求和原始记录。三次只是容易执行的排查练习,不足以估算模型的错误率。不要在几轮之间加入反馈后,还把它们当成完全相同的输入。

每次保存完整回答,并记录应用、可见模型名称、日期、是否新建对话、附件及能检查到的相关设置。然后逐项核对:

检查项应保留的信息
活动时间9 月 18 日,14:00—15:30,上海时间
人数最多 12 人,不是已有 12 人报名
房间状态暂时保留,尚未确认
确认安排Mei;9 月 16 日上海时间 12:00 前
邀请房间确认后再发

这是供读者执行的方法,表格是核对依据,不代表某款应用已经通过测试。写法不同的答案可以全部合格;看起来十分稳定的答案,也可能一直漏掉同一条件。

修正具体错误,不必把整段推倒重来

如果一次回答把房间写成已确认,可以直接反馈:“原文只是暂时保留,请恢复这一状态,并保留确认后才能发邀请的要求。”修改后重新检查所有条件,包括之前已经写对的部分。

不要把“温度调到零”当成通用解决办法。Google 当前建议 Gemini 3.x 保持默认采样设置,并提醒改动参数可能影响部分任务的表现。OpenAI 的旧版 Completions 接口文档也只承诺尽力通过 seed 帮助复现,而非保证每次结果一致。这个旧接口的参数不能直接套用到所有当前模型或聊天应用。上述文档核对日期为 2026 年 9 月 14 日。

如果需要的是一段已经批准、必须保持原样的邀请文字,就保存并复用那个版本。只有日期等事实变化时,再让 AI 修改指定字段,按新资料核对改动。反复生成一段已经验收的文字,只会增加需要重新审核的内容。

参考资料