Codex 50% 的回答没有来源支撑,你还在复制粘贴吗?

当 AI 回答很顺时,如何保留最小核验动作?流畅不等于可信——本文给你一份「最小核验清单」和可直接复制的 Codex 核验提示词,把信任加一道门槛。

📝
本文整理转载自 X 作者 @Moting284(撸猫不掉毛) 的长文《Codex 50% 的回答没有来源支撑,你还在复制粘贴吗?》,由 API 快连排版,版权归原作者所有。原文链接
AI-learning verification: check before you trust
AI 学习核验:信任之前,先核验(Check before you trust)

凌晨两点,你让 Codex 解释一个技术概念。

它给你 800 字,结构完美,逻辑清晰,配了 3 个代码示例。你复制进笔记。第二天发现,核心结论是错的——文档链接打不开,代码跑不通。

这不是你第一次遇到,也不会是最后一次。

一、越顺的答案,越容易让人放松警惕

AI 的迷惑性来自一种错位:它输出的是语言,你接收到的却是权威感。一个回答只要足够顺、足够完整、足够像专家,就会让人下意识放松警惕。

📊
Stanford HAI 审查了 4 个生成式搜索引擎对 1450 个问题的回答,结论很刺眼:约 50% 的生成陈述缺少支持性引用约 25% 的引用并不能真正支持对应说法。更刺眼的是——那些看起来更流畅、更有用的回答,反而更可能没有被来源支撑。

你以为顺滑是可信度,其实只是 AI 会组织语言。

二、顺滑不是可信度

OpenAI 把 hallucination(幻觉)解释为:模型生成了看起来合理、但实际不真实的陈述。重点不是模型「故意骗人」,而是很多训练和评测方式会奖励模型猜答案,而不是奖励它承认不知道。

流畅回答和事实可靠是两个指标。你真正要警惕的是:AI 把不确定内容说成确定内容。

🎓
Harvard Kennedy School 的研究说得更直接:用户会因为 AI 回答的流畅性、连贯性和权威语气而产生信任,从而降低核验动作。AI 并没有传统意义上的「知道自己在说什么」——所以不能把语气当成证据

你信的不是事实,你信的是流畅感。

三、有链接也不够,要看来源是否支撑结论

很多人以为:AI 只要给了链接,就比没给链接可靠。其实不是。链接本身只能证明它会「贴来源」,不能证明这个来源真的支撑它那句话。

真正的核验动作要多走一步:把 AI 的关键结论拆成一句一句,然后问——这句话能不能在来源里找到依据。如果来源只是相关,但没有证明这句话,那它仍然是未确认信息。

引用核验分三问:

  • 链接存在吗? 打不开、跳转异常、标题不对,先标红。
  • 来源可靠吗? 作者、机构、发布时间、主题是否和 AI 说的一致。
  • 来源真的支持这句话吗? AI 那句话,能不能在来源中找到直接或合理的依据。

AI 会贴链接,不等于它验证过链接。

四、最小核验清单:只查关键 3-5 个判断

核验不是让你怀疑一切,是让你给信任加一个门槛。不要核验整段话,只核验会影响理解或行动的关键结论。

AI 学习核验清单(7 步):

  • 1. 先判断风险:只是理解概念 → 简单核验;要写进文章、转述给别人、用于决策 → 严格核验;涉及价格、入口、模型能力、法律、医疗、金融、隐私安全 → 必须官方确认。
  • 2. 拆出关键结论:不核验整段,只核验关键 3-5 个判断。每个判断都问——如果这句错了,会不会影响我的理解或行动?会影响就必须核验,不影响可以跳过。
  • 3. 查来源是否存在:链接能不能打开?来源方、标题、作者、发布时间是否匹配?是官方、论文、权威媒体,还是个人经验?
  • 4. 查来源是否支撑结论:来源里是否真的说了这件事?AI 有没有把相关内容过度概括?引用是否只是「看起来相关」?
  • 5. 标出不确定点:没有来源 = 未确认;只有单一来源 = 待交叉验证;来源过旧 = 待更新确认;属于推断 = 不能写成事实。
  • 6. 高风险内容回到官方:产品功能、价格、入口、模型能力 → 查官方文档;法律、医疗、金融 → 查权威机构并咨询专业人士;隐私安全 → 查服务条款、隐私政策、管理员设置。
  • 7. 保留核验记录:保存来源链接,标注访问日期,写清楚哪些是来源确认、哪些是自己的理解。
📋
Before:看到 AI 回答 → 觉得顺 → 复制粘贴 → 第二天发现错了。  After:看到 AI 回答 → 拆出 3-5 个关键判断 → 查来源 → 标不确定点 → 安心使用。

五、哪些内容必须查官方

不是所有内容都需要同样严格的核验,但有些内容,AI 说得再顺,也必须回到官方:

内容类型为什么必须查官方
产品功能AI 可能描述的是旧版本或相似产品
价格定价会变,促销有时效
入口UI 会改,路径会调整
模型能力新版本发布快,能力边界变化快
法律地区不同,条款不同,不能用推断
医疗风险大,必须权威机构 + 专业人士
金融涉及资金,必须官方确认
隐私安全涉及数据权限,必须查服务条款

六、让 Codex 帮你标出不确定点

核验不是反 AI,而是把 AI 从「答案机器」改成「学习助手」:AI 负责加速整理,你负责决定哪些信息值得相信。Codex 的实用点是——可以把核验要求写进提示词或 AGENTS.md,让「标来源、不确定点、待官方确认项」变成默认流程。

场景 1:快速查概念

提示词
请用 3 句话解释 X,每句话后标来源。

场景 2:深度研究

提示词
请先全网检索,再回答。输出必须分成 5 部分:1. 已确认结论 每条结论后标来源链接 没有来源支撑的结论不要写进这里2. 来源清单 列出来源方、链接、发布时间或更新时间 优先使用官方文档、研究论文、权威机构和可信媒体3. 不确定点 哪些内容只是推断、概括、经验判断或可能过时? 哪些地方不同来源说法不一致?4. 需要官方确认的信息 涉及产品功能、价格、入口、模型能力、法律、医疗、财务、隐私安全时,单独列出 找不到官方来源,就写「待官方确认」5. 我的手动核验清单 列出最需要我亲自打开来源确认的 3-5 件事如果找不到可靠来源,请直接写「未找到可靠来源」,不要补一个看起来合理的答案。

场景 3:产品功能确认

提示词
请只用官方文档回答,并标注文档更新时间。

七、把核验写进 AGENTS.md

Codex 的好用之处,不只是它能写得顺,而是你可以把核验要求变成工作规则。比如在项目的 AGENTS.md 里写清楚:凡是做全网检索,必须标来源;凡是涉及产品入口、价格、模型能力,必须以官方最新说明为准;凡是找不到来源,必须写「待确认」。

这样做的意义不是让 AI 永远不犯错,而是让错误更容易被你看见。对普通人来说,这比让 AI 多写一段解释更重要。

可放进 AGENTS.md 的规则:

AGENTS.md
## Fact-checking rules- 做联网检索、素材整理、文章写作时,必须标出来源链接和来源方- 涉及产品功能、价格、入口、模型能力、法律、医疗、财务、隐私安全的信息,必须标为「需要官方确认」,并优先查官方文档- 对无法确认的信息,不要写成事实;标注「未确认」或「待核验」- 输出最终结论前,列出 3-5 条最需要人工复核的关键信息

AI 可以帮你提速,但不能替你承担相信的后果。没有来源的说法,先不要进笔记;没有官方确认的产品信息,先不要拿来指导操作;没有交叉验证的结论,先不要转述给别人。

🛡️
核验是你和 AI 之间的最后一道防线。这道防线,AI 帮不了你。
想在 Codex 里跑「先检索、必标来源」的核验流程?在 API 快连 用一个统一的 Key,把 base_url 指向 apikl.com,就能在 Codex 里同时调用 Claude(claude-opus-4-8)和 Codex(gpt-5.5),配合本文的核验提示词一起用。打开控制台创建 Key →