AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

AI可靠性

共 4 条相关 AI 资讯
7月27日
10:58
10:58Gary Marcus@GaryMarcus
72°
加里·马库斯指出,当前AI在编码和数学等可验证领域具有变革性,但在大多数场景缺乏可靠性,无法被信任自主运行。他解释世界未因AI智能而巨变的原因:昂贵但不值得信赖的“员工”不会改变世界。只有在人类介入且答案可验证时,AI才有显著影响。
行业Gary MarcusAI可靠性自主系统

推荐理由:想知道为什么AI很牛但世界没变?看看马库斯一针见血的分析:智能不等于可靠,不能自主干活就没法颠覆一切。
原文
10:56
10:56Gary Marcus@GaryMarcus
71°
Gary Marcus指出,当前AI在编码和数学等可验证领域确实强大,但在大多数场景下缺乏可靠性。因此,这些AI无法被信任自主运行,更像昂贵且不可靠的员工。他认为世界未发生巨变是因为前提错误——AI并非通用可信系统。只有当AI变得可靠且自主时,才会真正改变世界。
行业Gary MarcusAI可靠性自主系统

推荐理由:Gary Marcus一句话点透:AI再聪明,不可靠也是白搭。只有编码数学这种能验证的地方才是AI的用武之地。
原文
7月20日
11:48
11:48Gary Marcus@GaryMarcus
Gary Marcus在推文中回应Derek Thompson关于‘模型强大为何世界如常’的疑问。他指出AI模型在基准测试(如GLUE、MMLU)中得分虽高,但在现实世界可靠性不足,难以对多数企业产生变革性影响。Marcus认为不存在真正的悖论,而是基准测试与实用价值之间仍存在显著鸿沟。
行业Gary MarcusDerek ThompsonAI可靠性

推荐理由:Gary Marcus一句话点破AI行业的真实痛点:基准测试再强,一到真实场景就露怯。适合关心AI落地效果的人。
原文
7月6日
13:00
13:00Gary Marcus@GaryMarcus
Nature Medicine发表评论指出,医疗AI的基准测试高分容易被误认为实际就绪。该研究以GPT-5.5 Pro为例,其在测试中超过99.9%的医生,但缺乏真实世界临床验证。研究强调当前仅有模拟、病例脚本和患者演员,性能指标仍需改进。结果已开源发布,并被独立确认。
论文GPT-5.5 Pro医疗AINature Medicine

推荐理由:别被医疗AI的高分骗了,Nature Medicine这篇研究告诉你基准测试和真实临床差距有多大。
原文
精选全部日报登录