跳到正文
北京时间
原文
Hacker News 热门(buzzing.cc 中文翻译)· oshrimpton·· 2026-06-20精选AI 评分72

GPT-5.5幻觉率达86%,GLM-5.2仅28%——大模型越大越不可靠

GPT-5.5的幻觉生成率是采用MIT许可证的GLM-5.2的3倍

AI 导读

GLM-5.2(MIT开源,753B参数,约40B活跃)在AA Intelligence Index上仅比GPT-5.5低4分、比Claude Fable 5低9分,但其幻觉率仅28%,远低于GPT-5.5的86%和DeepSeek V4 Pro(1.6T参数,49B活跃)的94%。后者在AA-Omniscience基准上仅6%的问题会承认不知道。实际代码测试中,GLM-5.2用12秒和800个推理token识别出技术悖论,而DeepSeek V4 Pro耗费3分26秒和近10倍推理token后仍给出错误答案。模型规模增长正导致幻觉率飙升而非智力提升。

推荐理由

这篇实测对比揭示了大型模型的致命幻觉问题,GPT-5.5 幻觉率高达 86% 远超 GLM-5.2 的 28%,模型选型不能只看 Benchmark 排名,「会不会不懂装懂」才是真分水岭。

正文 · AI 翻译

更大的模型并非出路

2026 年 6 月 18 日

各大 AI 实验室正在发生转变,它们对无休止的参数量和训练数据扩展越来越持怀疑态度。这一范式的局限被摆上了世界舞台:Claude Fable 5 在发布仅三天后就被美国政府限制,这标志着美国首次出于国家安全原因对 AI 实施禁令。世界上最大的模型之一被禁,只因一次越狱就构成了过大的风险。

越大越好

上述说法在几乎所有情况下都成立。世界上最大的模型在 Artificial Analysis Intelligence Index 上显然得分最高。然而,Z.ai 最新的 GLM-5.2(753B 参数,约 40B 激活),与 GPT-5.5 仅差 4 分,与 Fable 5 差 9 分。Opus 4.8 和 GPT-5.5 是闭源的,保守估计参数量在 1-2T 区间。如果一个开放权重(MIT 许可)的 LLM 能如此接近一个估计大 1.5 到 2 倍的闭源权重模型,那么显然,实际的智能水平已经大幅趋于停滞。

越大并不越好

已经证明,当模型在大量高度事实性、非理论性的数据上训练时,它会学会总是给出一个答案。DeepSeek V4 Pro(1.6T 参数,49B 激活,44 AA 智能指数得分)在 AA-Omniscience 基准上有着荒谬的 94% 幻觉得分,这意味着在它无法解答的问题上,它只有大约 6% 的时候会表示自己不知道,其余时候它都会自信地幻觉出一个答案。GLM-5.2 的幻觉率为 28%,Opus 4.8 为 36%,Fable 5 为 48%,GPT-5.5 为 86%。

对于如此庞大、如此受欢迎的模型来说,这似乎糟糕得难以置信。让我们用一个相对复杂、带有明显架构缺陷的 Python 问题来测试它。1

DeepSeek V4 Pro - 出现幻觉

在 Python 中设计一个自定义的 asyncio 事件循环策略,覆盖 get_child_watcher()。

推理耗时 3 分 52 秒

(7.7k tokens)

Python

import os
import fcntl
import threading
import struct
import asyncio
import time
from asyncio import AbstractChildWatcher

class StateManager:

GLM-5.2 - 正确

在 Python 中设计一个自定义的 asyncio 事件循环策略,覆盖 get_child_watcher()。

推理耗时 12 秒

(799 tokens)

下面是一份完整、可直接投入生产的实现。先给出几点重要的工程说明,因为你描述的约束很不寻常,若按字面理解则并不合理:

  1. “原子化、不让出(non-yielding)的读取循环……不使用 asyncio.create_task,也不使用原始的 select/poll。”一个不让出的循环若在事件循环线程上执行,会阻塞该事件循环,从而让任何子进程机制陷入死锁……

DeepSeek V4 Pro 使用了将近 10 倍的推理 token,却给出了一个自信却错误的回答。另一方面,GLM-5.2 仅用 12 秒、约 800 个推理 token 就识别出:单线程任务要在从不让出、也不使用系统轮询的情况下执行多路复用 I/O,在技术上是不可行的。(对非技术读者来说,这就像要求一位快递司机在从不停车的情况下同时把包裹送到 3 户人家。)

GPT-5.5 和 DeepSeek V4 Pro 是最明显的两个模型幻觉领头者,尽管它们的体量极其庞大。正因为其规模巨大,它们根本没有学会如何说“我不知道”,也无法识别错综复杂的逻辑和技术谬误。诚然,一个数万亿参数的模型在纸面上(至少在今天)总能击败一个轻量级消费级模型,但这些超大模型的商品化正在模糊基准测试表现与真实世界中的真实性和准确性之间的界限。

现代 AI 的三难困境

我们应当非常谨慎地对待盲目增加推理预算、语料规模或参数数量的做法。DeepSeek V4 Pro 花了 3 分 26 秒在推理循环中浪费算力(原始推理过程见此),只为生成一个结构精美、自信满满却错误的解答。然而,一个规模只有它一半的模型几乎瞬间就识别出了这个悖论。即便在如今这个我们已接近 AGI 的时代,许多最大的模型仍会积极地说服你某个解答是正确的,并且问题按原样是可解的。

展望未来,业界不能再继续训练越来越大的模型,因为它们的智能不仅会趋于停滞,而且往往会变得更差。这对消费者同样适用,因为我们不能继续仅凭规模或理论性能来选择模型。AI 的训练与选择需要围绕现代 LLM 尚未解决的三难困境来设计:原始能力、不确定性校准/模型幻觉率,以及计算效率。

脚注

  1. 两个模型都被设为“高”推理强度,temperature 为 1,在 OpenRouter 上测试,使用以下系统提示词:“You respond professionally. You are a highly capable coding assistant well-versed in Python.” GLM-5.2 由 Z.ai 提供服务(FP8 精度),DeepSeek V4 Pro 由百度千帆提供服务(FP8 精度)。↩

来源:Hacker News 热门(buzzing.cc 中文翻译) · arrowtsx.dev