向ChatGPT提问并收到回答时,很容易以为它只是找到某处存储的正确答案并展示给你,就像在Naver或Google输入搜索词后找到文档一样。但AI并不是这样工作的。正因为这个误解,才会出现“AI撒谎了”“AI前后说法不一致”等令人困惑的体验。本系列第一篇,先把这个误解讲清楚。
搜索引擎负责查找,AI负责生成
搜索引擎和AI的区别,就像图书管理员和讲故事的人之间的区别。
搜索引擎是图书管理员。你问“济州岛美食店”,它就从书架上找出相关文档,原样交给你。无论文档写了什么,它都不会改变内容,也不会凭空捏造不存在的文档。如今搜索结果顶部常会出现AI摘要,但那部分是讲故事的人写的,不是图书管理员写的。记住这一点就够了。
ChatGPT这类AI更像讲故事的人。收到问题后,它不是从某处找来文档,而是**当场生成新的句子。**你收到的回答,是世界上原本没有存储过的文字,刚刚才生成出来。因此,这类AI被称为生成式AI。
那么,它是根据什么来生成的?关键原理就在这里。
原理只有一个:预测下一个词
ChatGPT的基础是一项名为LLM(Large Language Model,大型语言模型)的技术。名字听起来很厉害,但它只做一件事:预测能够自然接在已有文本后面的下一个词。
想想智能手机键盘的自动补全。输入“今天天气”后,键盘可能会推荐“不错”。LLM把这种自动补全扩展到了超乎想象的规模。它阅读互联网书籍、文章和网页中的数万亿个词,学习“这类文字后面会出现这类说法”的模式,因此不仅能续写一两个词,还能完整写出一份报告。
AI生成回答的过程就是这样:接收你的问题,选出最可能接在后面的一个词,再把这个词包含进去,继续选择下一个词。每秒重复几十次,直到完成句子。
“看起来合理的话”为什么会显得聪明?
你可能会疑惑:“全部只是预测下一个词?那它怎么还能翻译和总结?”
秘密在于规模。要准确预测下一个词,归根结底需要了解世界。要预测“朝鲜王朝的第4代国王是”后面的词,就得懂历史;要续写“这段代码的Bug是”,就得懂编程。在学习海量文本的过程中,知识和推理模式被压缩进了模型。
不过,它的存储方式与搜索引擎不同。文档不是完整保存的,而是以模式融入数千亿个数字(参数)中。这与人类记忆很相似。我们也无法逐字取出去年读过的书,却可以谈论它的内容。因此,AI的知识更接近“内容大概是这样”,而不是对原文的准确引用。
同一个问题每次得到不同回答的原因
AI选择下一个词时,并不会只选择排名第一的候选词。它会在高概率候选中加入少量随机性进行选择。如果每次都只选第一名,回答会变得机械又千篇一律,所以系统会刻意引入变化。
所以,同一个问题问两次,可能得到不同的回答。这不是故障,而是设计如此。如果把它当成搜索引擎,就会问“为什么答案变了?”;如果把它当成句子生成器,就很自然了。
这种特性会根据使用方式成为优势。如果不满意回答,可以重新生成另一个版本;在需要像头脑风暴一样获得多种方案时尤其有用。
为什么不该询问最新新闻,以及例外情况
LLM的知识会停留在训练完成的时间点。这个时间点称为知识截止(knowledge cutoff,知识截止时间)。训练结束后世界发生的事情不在模型中。原则上,它不知道昨天的新闻、今天的汇率或本周上映的电影。
不过,现在的服务会用网页搜索功能弥补这一限制。遇到需要最新信息的问题时,AI会先进行搜索,再根据找到的文档生成回答。这就像从图书管理员那里取得资料的讲故事的人。虽然很多服务会自动搜索,但询问最新信息时,最好确认回答是否真的附有来源链接。如果想更确定,可以补充一句:“请在网上搜索后告诉我。”这种用法会在第4篇中详细介绍。
总结
- AI不是查找存储的正确答案,而是在当场生成句子
- 原理是预测下一个词,而海量训练让这种预测像知识一样发挥作用
- 同一个问题得到不同回答不是故障,而是设计如此
- 知识停留在训练时间点,最新信息则通过网页搜索功能补足
但这个原理也有阴暗面。如果AI的目标不是“说出正确答案”,而是“生成看似合理的句子”,就意味着它也能生成看似合理却完全错误的内容。事实上,它确实会这样做,而且非常自信。下一篇将介绍如何识别和应对AI编造的谎言,也就是幻觉。

![[AI使用说明 #1] ChatGPT不是搜索引擎:AI生成回答的原理 封面图](/assets/images/posts/2749fa60-515f-449b-8e14-21906ac32b10/ai-not-search-engine-1.jpg)