法律基准加了幻觉门槛后排名大洗牌:Muse Spark 本来领先,过滤幻觉后掉到第二,GPT-6 Astra 几乎不缩水。看各家法律任务幻觉差距挺有意思。
#幻觉
共 20 条 · 7 天 5 条 · 30 天 6 条
信息流里打上「幻觉」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月9日
Harvey LAB-AA v1.1 加入幻觉检查,Grok 4.7 以 9.4% 登顶法律基准
10月8日
10月7日
10月6日
9月23日
8月18日
8月11日
Claude Haiku 幻觉问题遭吐槽,性能被 GPT-5.6-Luna 超越
Simon Willison 说 Claude Haiku 幻觉多,不如 GPT-5.6-Luna,还会污染 Claude Code 抓网页,用起来要小心。
7月31日
7月14日
6月26日
Hallucination in World Models is Predictable and Preventable
这篇论文用具体数据和实验证明世界模型的幻觉本质是数据覆盖问题,还给出了实用的检测和缓解方法。
6月25日
6月16日
6月10日
PhantomBench:首个大规模“不存在概念”基准,揭示语言模型幻觉率高达86.7%
做AI安全或模型评估的团队,这个基准直接戳中了当前模型最致命的弱点——它们连“不存在的东西”都分不清,建议用PhantomBench测测自家模型。
5月29日
论文10:13
Gary Marcus:LLM 的幻觉源于概率重构,非训练数据Marcus 戳破了“幻觉只靠清洗数据就能解决”的迷思,做 AI 安全或法律 AI 的团队值得深思——模型概率本质才是硬伤。
5月26日
Google 新论文:LLM 应停止假装确定,诚实表达不确定性
这篇论文点破了 LLM 幻觉的核心矛盾——不是知识不够,而是不知道什么时候该说“不确定”。做 AI 产品、智能体或对话系统的团队,看完会对“诚实比正确更重要”有更深理解,建议直接读原文。
5月15日
产品22:35
谷歌AI健身教练捏造8.4公里跑步记录,反怪用户漏记AI健康教练的幻觉问题直接挑战付费订阅价值,健身手环用户和AI健康应用开发者值得关注——谷歌能否在正式上线前修复这一致命缺陷。
IT之家原文
5月13日