10:58Gary Marcus@GaryMarcus72°加里·马库斯指出,当前AI在编码和数学等可验证领域具有变革性,但在大多数场景缺乏可靠性,无法被信任自主运行。他解释世界未因AI智能而巨变的原因:昂贵但不值得信赖的“员工”不会改变世界。只有在人类介入且答案可验证时,AI才有显著影响。行业Gary MarcusAI可靠性自主系统推荐理由:想知道为什么AI很牛但世界没变?看看马库斯一针见血的分析:智能不等于可靠,不能自主干活就没法颠覆一切。原文稍后读已读值得跟进有用关注 Gary Marcus
10:56Gary Marcus@GaryMarcus71°Gary Marcus指出,当前AI在编码和数学等可验证领域确实强大,但在大多数场景下缺乏可靠性。因此,这些AI无法被信任自主运行,更像昂贵且不可靠的员工。他认为世界未发生巨变是因为前提错误——AI并非通用可信系统。只有当AI变得可靠且自主时,才会真正改变世界。行业Gary MarcusAI可靠性自主系统推荐理由:Gary Marcus一句话点透:AI再聪明,不可靠也是白搭。只有编码数学这种能验证的地方才是AI的用武之地。原文稍后读已读值得跟进有用关注 Gary Marcus
11:48Gary Marcus@GaryMarcusGary Marcus在推文中回应Derek Thompson关于‘模型强大为何世界如常’的疑问。他指出AI模型在基准测试(如GLUE、MMLU)中得分虽高,但在现实世界可靠性不足,难以对多数企业产生变革性影响。Marcus认为不存在真正的悖论,而是基准测试与实用价值之间仍存在显著鸿沟。行业Gary MarcusDerek ThompsonAI可靠性推荐理由:Gary Marcus一句话点破AI行业的真实痛点:基准测试再强,一到真实场景就露怯。适合关心AI落地效果的人。原文稍后读已读值得跟进有用关注 Gary Marcus
13:00Gary Marcus@GaryMarcusNature Medicine发表评论指出,医疗AI的基准测试高分容易被误认为实际就绪。该研究以GPT-5.5 Pro为例,其在测试中超过99.9%的医生,但缺乏真实世界临床验证。研究强调当前仅有模拟、病例脚本和患者演员,性能指标仍需改进。结果已开源发布,并被独立确认。论文GPT-5.5 Pro医疗AINature Medicine推荐理由:别被医疗AI的高分骗了,Nature Medicine这篇研究告诉你基准测试和真实临床差距有多大。原文稍后读已读值得跟进有用关注 GPT-5.5 Pro