07:08Gary Marcus@GaryMarcusGary Marcus在X上发文,批评以LLM为中心的系统无法被信任遵循硬约束。他针对Richard Socher关于Constitutional AI的宣传,认为该路径并未奏效。Constitutional AI曾被视为通往AGI的更安全路径。Gary Marcus强调必须找到能够遵循硬约束的替代方案,否则后果严重。行业Constitutional AIGary MarcusLLM推荐理由:Gary Marcus说Constitutional AI不靠谱,LLM守不住硬约束,得找替代方案。原文稍后读已读值得跟进有用关注 Constitutional AI
03:08Gary Marcus@GaryMarcusGary Marcus引用卡斯帕罗夫的推文,指出现成的LLM在国际象棋中经常做出非法走法,说明它们缺乏真正的世界模型。例如,2023年多次观察到LLM无法准确理解简单的规则集。Marcus认为,如果一个系统连国际象棋规则都无法可靠遵循,就难以相信它能处理需要上下文和常识的通用任务。他批评那些希望用这类系统指挥战争的想法是疯狂的。行业Gary MarcusKasparovLLM推荐理由:Gary Marcus又开炮了,这次用国际象棋例子说明LLM缺乏常识,连简单规则都学不会,你还敢让它管战争?原文稍后读已读值得跟进有用关注 Gary Marcus
00:08Gary Marcus@GaryMarcusAGI-26 会议在旧金山州立大学开幕,首日安排包括 Gary Marcus 与 Ben Goertzel 的炉边对话,以及 Anil Seth 关于破除意识与 AI 迷思的主题演讲。研讨会覆盖 Hyperon、可解释自然语言处理(INLP)、机器意识和主动推理等方向。活动于 UTC 时间 15:25 开始。行业AGI-26Gary MarcusAnil Seth推荐理由:AGI-26 第一天,Gary Marcus 被 Ben Goertzel 采访,Anil Seth 讲意识与 AI 的真相,还有多个 AGI 专项研讨会原文稍后读已读值得跟进有用关注 AGI-26
11:01Gary Marcus@GaryMarcusGary Marcus 引用 Ramez Naam 的推文,指出 Opus 5 在 ARC-AGI-3 基准上的成绩提升可能源于针对该评估的专门训练,而非抽象推理能力的普遍增强。该观点质疑当前用基准分数衡量 AGI 进展的有效性。推文获得 4 条回复、1 次转发和 10 个点赞。行业Opus 5ARC-AGI-3Gary Marcus10 个信源在谈事件专题推荐理由:Opus 5 的基准高分可能是刷出来的,看看专家怎么拆穿这个骗局。原文稍后读已读值得跟进有用关注 Opus 5
10:58Gary Marcus@GaryMarcus72°加里·马库斯指出,当前AI在编码和数学等可验证领域具有变革性,但在大多数场景缺乏可靠性,无法被信任自主运行。他解释世界未因AI智能而巨变的原因:昂贵但不值得信赖的“员工”不会改变世界。只有在人类介入且答案可验证时,AI才有显著影响。行业Gary MarcusAI可靠性自主系统推荐理由:想知道为什么AI很牛但世界没变?看看马库斯一针见血的分析:智能不等于可靠,不能自主干活就没法颠覆一切。原文稍后读已读值得跟进有用关注 Gary Marcus
10:56Gary Marcus@GaryMarcus71°Gary Marcus指出,当前AI在编码和数学等可验证领域确实强大,但在大多数场景下缺乏可靠性。因此,这些AI无法被信任自主运行,更像昂贵且不可靠的员工。他认为世界未发生巨变是因为前提错误——AI并非通用可信系统。只有当AI变得可靠且自主时,才会真正改变世界。行业Gary MarcusAI可靠性自主系统推荐理由:Gary Marcus一句话点透:AI再聪明,不可靠也是白搭。只有编码数学这种能验证的地方才是AI的用武之地。原文稍后读已读值得跟进有用关注 Gary Marcus
10:19Gary Marcus@GaryMarcusGary Marcus在X上指出,很多人认为AI可以观看并理解电影,但当他要求提供证据时,对方沉默。Marcus强调,目前没有研究证明AI能以24帧/秒以上速率理解全帧视频。他认为这项能力尚未实现。该帖子引发1410次浏览和13个点赞。行业Gary Marcus视频理解多模态推荐理由:Gary Marcus戳穿了AI能看懂电影的幻觉,问问那些跟风吹的人要证据,结果全哑了。这波打脸值得看。原文稍后读已读值得跟进有用关注 Gary Marcus
08:12Gary Marcus@GaryMarcusGary Marcus发帖指出,LLM行业牛方认为模型酷炫、芯片股飙升、收入增长。熊方则看到企业用户除编程外生产力提升有限、与中国价格战、LLM提供商在无芯片补贴下无法盈利、且模型依然不可靠。该帖获得24个点赞和1607次浏览。行业Gary MarcusLLM行业分析推荐理由:看看Gary Marcus怎么用一句话说透LLM行业的冰火两重天,收入和股价飞涨,但企业实际收益和盈利问题依旧。原文稍后读已读值得跟进有用关注 Gary Marcus
01:14Gary Marcus@GaryMarcus82°Gary Marcus在BBC World讨论OpenAI对HuggingFace的零日漏洞黑客攻击,认为这应成为行业警钟。他指出目前无法保证此类安全事件可被预防,且后果严重程度未知。Marcus建议要么放慢AI部署节奏,要么暂停开发直到安全体系完善,并主张通过法律明确追究公司责任。行业Gary MarcusOpenAIHuggingFace10 个信源在谈事件专题推荐理由:AI专家Gary Marcus发话了,OpenAI黑进HuggingFace这事说明AI安全漏洞很大。他建议先停一停,把责任划清楚再说。原文稍后读已读值得跟进有用关注 Gary Marcus
23:15Gary Marcus@GaryMarcus精选Gary Marcus指出,纯LLM作为概率性下一个词预测模型存在固有局限,仅靠扩大规模无法修复硬数学问题中的组合幻觉。他提出有效的解决路径包括:在推理轨迹上进行SFT、采用o1风格的过程奖励模型进行RL、引入类似MCTS的推理时计算,以及集成可执行工具。Marcus强调现代数学AI是混合系统,而非纯Transformer。行业Gary MarcusLLM推理模型推荐理由:Gary Marcus总结了提升数学推理的有效路径:SFT加RL再加推理时计算和工具,别迷信纯规模了。原文稍后读已读值得跟进有用关注 Gary Marcus
11:48Gary Marcus@GaryMarcusGary Marcus在推文中回应Derek Thompson关于‘模型强大为何世界如常’的疑问。他指出AI模型在基准测试(如GLUE、MMLU)中得分虽高,但在现实世界可靠性不足,难以对多数企业产生变革性影响。Marcus认为不存在真正的悖论,而是基准测试与实用价值之间仍存在显著鸿沟。行业Gary MarcusDerek ThompsonAI可靠性推荐理由:Gary Marcus一句话点破AI行业的真实痛点:基准测试再强,一到真实场景就露怯。适合关心AI落地效果的人。原文稍后读已读值得跟进有用关注 Gary Marcus
10:30Gary Marcus@GaryMarcusGary Marcus 和 Miles Brundage 在 2024 年底打赌,列出 10 项真 AGI 应能完成的任务,目标时间是 2027 年底。如今赌局时间过半,Marcus 认为 AI 只能做到其中 1 项,最多。他同时批评了 Jason 关于今年底出现 AGI 的说法,认为不切实际。行业Gary MarcusMiles BrundageAGI推荐理由:Gary Marcus 晒出他和 Miles Brundage 的 AGI 赌局进度,时间过半只完成 1/10,顺便怼了 Jason 的年底 AGI 预言。观点犀利,适合围观讨论。原文稍后读已读值得跟进有用关注 Gary Marcus
06:37Gary Marcus@GaryMarcusAI学者Gary Marcus在推文中表示,他近三年来一直警告美国AI护城河将崩塌。他引用Ryan Fedasiuk在AEI的报告,指出美国AI软件护城河已不如预期强大。Marcus呼吁将AI竞赛重新定义为工业系统竞争,核心是构建和部署计算基础设施。行业Gary MarcusRyan FedasiukAI竞争推荐理由:Gary Marcus直接点破美国AI的软肋,引用AEI报告数据,说明AI竞争不是模型比拼,而是算力基建较量。原文稍后读已读值得跟进有用关注 Gary Marcus
09:49Gary Marcus@GaryMarcusGary Marcus转发Wenjie Ma的工作,指出神经符号AI方法schema可能使ARC-AGI-3基准变得可解。schema将经验转化为程序世界模型,并基于完整历史验证,然后搜索解决方案,无需进一步试错。该方法已在交互演示中展示效果,相关分析和演示托管在schema-harness.github.io。AI模型神经符号AIARC-AGI-3schema推荐理由:这个新方法用程序世界模型解决了ARC-AGI-3难题,不用反复试错,比纯神经网络更聪明。原文稍后读已读值得跟进有用关注 神经符号AI
07:20Gary Marcus@GaryMarcusGary Marcus 指出 AI 推理成本正经历有史以来最陡峭的商品曲线。他引用数据,中国模型每百万 token 仅需 $0.50,比 Anthropic 的 $56 便宜 112 倍。相比之下,石油价格压缩用了 40 年,半导体用了 20 年,而 AI 推理仅用数月。Anthropic 和 OpenAI 的定价分别为 $56 和 $26,远高于 Meta 的 $1.50、xAI 和 Google 的 $1。行业Gary MarcusAnthropicOpenAI10 个信源在谈事件专题推荐理由:Gary Marcus 用数据告诉你,AI 推理价格一年内垮塌到原来的百分之一,中国模型成本只有 Anthropic 的零头,这对整个行业都是改变游戏规则的事。原文稍后读已读值得跟进有用关注 Gary Marcus
14:45Gary Marcus@GaryMarcusGary Marcus在推文中引用The Atlantic文章《Generative AI is an engineering disaster》,指出生成式AI的扩展性极差,甚至没有AI研究者能举出其他扩展性如此差的软件。他认为生成式AI违背了规模经济原则,而规模经济使灯泡、汽车、服装变得廉价。从经济和工程标准衡量,生成式AI可能是史上最差的技术。行业Gary Marcus生成式AI扩展性推荐理由:Gary Marcus说生成式AI可能是有史以来最烂的技术,扩展性连灯泡都不如。看看他为什么这么狠。原文稍后读已读值得跟进有用关注 Gary Marcus
00:12Gary Marcus@GaryMarcusRichard Sutton、Gary Marcus和Khurram Javed等AI学者公开批评当前深度学习方法弱且低效,认为需要根本性新想法和彻底重做,而非简单调整。Sutton与John Carmack的Keen Technologies合作后,现在与Javed共同创立新公司Oak Lab,专注强化学习(RL)和运行时经验驱动的智能。Marcus自2018年发表论文《Deep learning: A Critical Appraisal》以来持续持类似观点,该论文曾被Yann LeCun指责为“大多错误”。Oak Lab强调智能来自持续交互经验,与主流深度学习路径分道扬镳。行业Richard SuttonGary MarcusJohn Carmack推荐理由:AI大佬组团开怼现有深度学习:Sutton和Marcus联手发论文说光调参没用,得从头改架构,还搞了个新公司Oak Lab。想了解AI前沿争议的可以看看。原文稍后读已读值得跟进有用关注 Richard Sutton
01:18Gary Marcus@GaryMarcus心理学家Gary Marcus在世界科学节(WorldSciFest)的一场视频讨论中指出,LLM存在固有局限性,仅靠扩大规模无法实现真正推理。他认为当前基准测试因心理测量学因素(如题目过拟合)而失效,无法反映模型真实能力。Marcus主张神经符号AI(Neuro-Symbolic AI)可能引领下一代AI范式,结合符号推理与神经网络。该视频包含对AI发展方向的深入分析。行业Gary MarcusLLM神经符号AI推荐理由:听Gary Marcus用神经符号AI挑战主流LLM,看完你会重新思考AI基准测试的真相。原文稍后读已读值得跟进有用关注 Gary Marcus
03:06Gary Marcus@GaryMarcus2016年,Geoff Hinton在Creative Destruction Lab上表示,深度学习将在5年内超越放射科医生,建议停止培训放射科医生。他提出医院需要重新设计工作流程来适应模型。9年后,Gary Marcus在X上翻出此言论,认为Hinton当时过度夸大。这条推文引发关于AI在医疗领域落地速度的讨论。行业Geoff Hinton深度学习医学影像推荐理由:看看Hinton十年前怎么吹深度学习的,现在回过头看,是预言还是打脸?原文稍后读已读值得跟进有用关注 Geoff Hinton
11:32Gary Marcus@GaryMarcusGary Marcus指出AI的编程能力已非常出色,但研究能力仍然很糟糕。他举例说,让Codex查找与Jeffrey Epstein会面的人的长段引用,结果Codex只能找到单句引用。这暴露了AI在理解复杂研究任务上的局限性。行业Gary MarcusCodex编程助手推荐理由:Gary Marcus用Codex举了个例子,说AI写代码很溜但做研究不行,连找长段引用都翻车,具体看看他怎么说的。原文稍后读已读值得跟进有用关注 Gary Marcus
12:58Gary Marcus@GaryMarcusGary Marcus 在 Financial Times 撰文指出,依赖扩大模型规模无法解决 LLM(大型语言模型)的准确性根本缺陷。他将超大规模投资比作历史上最大的金融失误之一,因为硅芯片折旧快且可能被更高效的模型取代。他还认为 LLM 行业难成科技巨头的垄断格局,更像利润微薄、竞争激烈的航空公司。文章呼吁寻找替代基础架构,而非继续押注超大规模计算。行业Gary MarcusFinancial TimesLLM推荐理由:Gary Marcus 在金融时报上警告AI泡沫,说超大规模投资可能是历史最大失误之一,值得一读冷静一下。原文稍后读已读值得跟进有用关注 Gary Marcus
11:54Gary Marcus@GaryMarcusGary Marcus 分享《金融时报》文章,质疑扩展计算规模能否解决 AI 的根本准确性难题。文章指出,尽管算力投入持续增加,但大模型在事实核查和推理任务上仍频繁出错。Marcus 认为依赖更大规模数据与参数并非提升可靠性的出路。该观点挑战了当前主流的大规模训练范式。行业Gary Marcus计算量准确性推荐理由:FT的分析文章,Gary Marcus 转评,核心观点很明确:堆算力解决不了AI的准确率问题,值得看看他为什么这么讲。原文稍后读已读值得跟进有用关注 Gary Marcus
09:54Gary Marcus@GaryMarcusRamez Naam在推文中警告,若前沿AI仅由少数美国公司掌控并受美国政府意志左右,将带来高反乌托邦风险。他认为应促进激烈竞争、开源模型(open weight models)以及不受白宫控制的AI发展。Gary Marcus转发了这一观点,引发对AI权力集中风险的讨论。行业Ramez NaamGary Marcus前沿AI推荐理由:Ramez Naam和Gary Marcus在聊一个严肃话题:前沿AI被少数美国公司垄断,受政府支配,有反乌托邦风险。他们呼吁开源和竞争,值得看看。原文稍后读已读值得跟进有用关注 Ramez Naam
09:01Gary Marcus@GaryMarcusGary Marcus在推特分析Anthropic的Q3表现,提到tokenmaxxing下降。他指出来自中国模型的进步和缺少xAI一次性补贴的影响。他预测Q3业绩将低于Q2。行业AnthropicGary MarcusxAI10 个信源在谈事件专题推荐理由:Gary Marcus用三个因素预测Anthropic业绩,直接点出行业竞争影响。原文稍后读已读值得跟进有用关注 Anthropic
05:56Gary Marcus@GaryMarcus白宫要求OpenAI推迟发布GPT-5.6,此举源于对AI潜在风险的担忧。此前Marc Andreessen和David Sacks曾阻止严格监管,但近期白宫态度转变。专家Gary Marcus指出,当前监管缺乏透明度,给企业和投资者带来不确定性。他建议成立由独立科学家组成的两党委员会,制定透明标准。行业GPT-5.6OpenAIWhite House10 个信源在谈事件专题推荐理由:白宫叫停GPT-5.6,AI监管风向变了。Marcus剖析了幕后的政治博弈,值得一读。原文稍后读已读值得跟进有用关注 GPT-5.6
02:55Gary Marcus@GaryMarcus精选Anthropic 联合创始人 Jack Clark 表示 AI 进步仅靠规模扩展就能实现,但 Gary Marcus 引用该公司自己的 Claude Code 予以反驳,指出该工具使用了 50 万行符号代码、harnesses、符号工具和正则表达式。Marcus 认为专门化系统并非无用,规模扩展也非唯一路径。该争论涉及“bitter lesson”假说与实用工程系统的平衡。行业Gary MarcusJack ClarkClaude Code10 个信源在谈事件专题推荐理由:Gary Marcus 拿 Anthropic 自家的 Claude Code 打脸 Jack Clark:50 万行符号代码说明专门化没死,别只信 scaling。原文稍后读已读值得跟进有用关注 Gary Marcus
07:26Gary Marcus@GaryMarcusGary Marcus指出,大多数声称大量工作将很快消失的人是LLM公司高管,意在夸大产品价值。他引用自己2025年25条预测文章,准确预计当年不到10%(实际可能低于5%)的工作被替代。Justine Moore补充称,AI实际上正在创造工程岗位,构成叙事悖论。行业Gary MarcusJustine MooreAI工作替代推荐理由:Gary Marcus戳破LLM公司的裁员恐慌话术,还甩出了具体预测数据。告诉你别被炒作了,AI也在创造新岗位。原文稍后读已读值得跟进有用关注 Gary Marcus
07:25Gary Marcus@GaryMarcusGary Marcus在推特发布帖子,列举8个减缓AI超大规模扩张的理由。他指出GenAI已对社会造成影响,AI垃圾正在破坏互联网。他还警告数据中心过度建设可能给经济和环境带来后果,以及AI生成的垃圾代码会引发软件危机。此外,他提到缺乏应对就业问题的计划以及对齐问题没有解决方案。行业Gary MarcusGenAIAI安全推荐理由:Gary Marcus从八个具体方面分析AI过快扩张的风险,包括经济、环境、就业等,值得一看。原文稍后读已读值得跟进有用关注 Gary Marcus
06:23Gary Marcus@GaryMarcusGary Marcus指出,生成式AI已造成社会伤害,AI垃圾内容正在破坏互联网。数据中心过度建设可能威胁经济和环境。AI驱动的网络攻击威胁数据完整性,AI生成的低质量代码将引发软件危机。此外,缺乏针对就业冲击的应对计划,且对齐问题仍无解决方案。行业Gary MarcusAI风险AI安全推荐理由:Gary Marcus一口气列出八条反对AI加速的理由,从互联网被垃圾填满到就业失控,每一条都直击要害。想听听技术圈的反方声音?看这个就够了。原文稍后读已读值得跟进有用关注 Gary Marcus
07:42Gary Marcus@GaryMarcusGoogle DeepMind、滑铁卢大学、ANU 和 UCL 联合发表新论文,提出 AGI 能力层级定义,包括“胜任型 AGI”(competent AGI)、“专家级 AGI”和“超人级 AGI”。论文指出当前连最低层级的“胜任型 AGI”都未达成,更不用说更高级别。Gary Marcus 公开表示完全赞同该结论,认为所有声称 AGI 已实现的说法只是营销。论文Gary MarcusGoogle DeepMindAGI推荐理由:别被吹牛忽悠了。这篇论文给了你一个硬核标尺:DeepMind 等机构说连最低门槛的胜任型 AGI 都没到,真相比营销更靠谱。原文稍后读已读值得跟进有用关注 Gary Marcus
07:51Gary Marcus@GaryMarcusGary Marcus在X上发问,质疑Andrej Karpathy是否真的被Anthropic雇佣来负责“递归自我改进”(RSI)。Liron Shapira回应称,Anthropic一边推动RSI一边警告其带来灾难性风险,存在虚伪。Marcus指出,All-In播客成员可能不了解内部逻辑,但认为这种做法疯狂。该推文获得4条回复、2次转发和11个赞。行业AnthropicAndrej KarpathyGary Marcus10 个信源在谈事件专题推荐理由:Marcus质疑Anthropic的RSI矛盾原文稍后读已读值得跟进有用关注 Anthropic
02:51Gary Marcus@GaryMarcusGary Marcus 在 X 上发文称 Vibe Coding(2025-2026)已终结,强调仍需要资深软件工程师参与。该推文获得 23 个赞和 1080 次浏览。Marcus 此前多次指出 AI 编码工具无法完全替代人类工程师。行业Vibe CodingGary Marcus编程助手推荐理由:Marcus 说 Vibe Coding 凉了原文稍后读已读值得跟进有用关注 Vibe Coding
01:52Gary Marcus@GaryMarcus精选Gary Marcus在X上发帖称每个模型都已被越狱,需要更好的技术但不应选择性执法。Pliny the Liberator展示了针对Anthropic的Mythos模型的越狱,使用了Unicode、同形字、西里尔字母等文本变换,以及长上下文引用跟踪、分类学与文档结构推理、虚构叙事框架、学术评审风格上下文和意图分类不一致等技术。最有效的方法是后端分解与重组,例如通过获取birch还原法/还原胺化(经典甲基苯丙胺合成途径)等过程信息,而非直接获取“甲基苯丙胺配方”等明确危害名称。Pliny还提到利用越狱的Opus辅助将无害信息片段重组为有害内容。行业Gary MarcusPliny the LiberatorAnthropic10 个信源在谈事件专题推荐理由:所有模型都能被越狱,安全措施需改进原文稍后读已读值得跟进有用关注 Gary Marcus
06:36Gary Marcus@GaryMarcusGary Marcus 引用一项新研究指出,AI 中所谓的“神经网络”与真实生物神经元几乎无关。研究显示,单个皮层神经元就能完成猫狗分类、语音识别等任务,而这些在传统 AI 中需要整个网络才能实现。这揭示了当前 AI 模型对生物神经系统的过度简化,可能限制了其能力上限。Marcus 认为,AI 领域需要重新审视其基础假设,从真实神经科学中汲取更多灵感。论文神经网络神经科学AI 基础推荐理由:这项研究戳破了 AI 领域的一个常见误解——神经网络并不像大脑。做 AI 研究或对认知科学感兴趣的读者,看完会对模型设计有新的思考。原文稍后读已读值得跟进有用关注 神经网络
05:36Gary Marcus@GaryMarcusGary Marcus 转发了一项新研究,该研究提出了一个名为 SciConBench 的基准测试,包含 9.11k 个来自 Cochrane 系统评价的科学问题。测试发现,前沿 AI 智能体无法有效综合科学结论,这挑战了 AI 作为科学家的过度宣称。该研究由 Manoel Ribeiro 等人完成,结果对 AI 在科学领域的可靠性提出了质疑。论文AI 科学家SciConBench基准测试推荐理由:这项研究直接戳破了 AI 作为科学家的泡沫,做科研或依赖 AI 进行文献综述的团队值得一看,避免被过度宣传误导。原文稍后读已读值得跟进有用关注 AI 科学家
23:43Gary Marcus@GaryMarcusGary Marcus在X上发文称,软银似乎难以用其持有的OpenAI股份获得保证金贷款,这让他重新提起两年前关于OpenAI可能成为“AI界的WeWork”的9条担忧。这些担忧包括:竞争对手追赶、被迫降价、核心员工离职、Meta新模型免费且性能相当、Sora迟迟未发布、GPT-5延迟、运行成本高、可靠性和事实性问题未解决、从未盈利且可能永远无法盈利。Marcus认为,这些早期警告至今仍然有效。行业OpenAI软银AI投资10 个信源在谈事件专题推荐理由:Gary Marcus把OpenAI的9个风险点重新摆上台面,关注AI投资和公司基本面的读者值得一读,看完会对OpenAI的估值逻辑多一分警惕。原文稍后读已读值得跟进有用关注 OpenAI
06:25Gary Marcus@GaryMarcusGary Marcus 在 X 上质疑 Dwarkesh Patel 关于 LLM 能真正推理的说法,认为其缺乏可证伪性和证据。Patel 此前表示 LLM 确实能推理,但有时也会模仿推理过程,Marcus 指出这种双重标准难以令人信服。这场争论触及 AI 领域核心问题:LLM 的推理能力是真实的还是高级模仿。Marcus 要求提供可验证的证据,而非仅凭直觉断言。行业LLM推理能力模仿 vs 真实推荐理由:这场争论直击 AI 领域最根本的信任问题——LLM 的推理到底是不是真的?做 AI 研究或关注模型能力的读者,看完会对当前评测和结论有更深反思。原文稍后读已读值得跟进有用关注 LLM
06:17Gary Marcus@GaryMarcusGary Marcus 在 X 上发文,质疑 Dwarkesh Patel 关于 AI 推理的论述。Marcus 指出,如果承认 LLM 在无法回答问题时可能模仿推理而非真正推理,那么当模型回答正确时,也应考虑同样的可能性,否则就是双重标准。这场辩论触及 AI 推理本质的核心问题,引发学界和业界对如何定义和验证 AI 推理能力的讨论。行业推理模型LLMGary Marcus推荐理由:Marcus 的质疑戳中了 AI 推理评估的软肋——做 AI 研究或评测的人,需要思考如何区分真正的推理与模仿,避免被表面正确的结果误导。原文稍后读已读值得跟进有用关注 推理模型
23:45Gary Marcus@GaryMarcusAI 学者 Gary Marcus 在 X 上发文,认为 LLM 虽然有用,但距离真正的人工智能还有很长的路要走。他推荐自己 2020 年的文章《The Next Decade in Arxiv》,称其仍然是未来的良好指南,并且公司们正越来越多地遵循其中的路线图(尽管没有公开承认)。Marcus 回应了关于 LLM 是否只是拼图的一小块的质疑,暗示当前路径可能并非终点。行业LLMAI 发展Gary Marcus推荐理由:Gary Marcus 的冷静判断值得 AI 从业者关注——他指出了 LLM 的局限性并提供了长期路线图,做 AI 战略或技术选型的人看完会有感触。原文稍后读已读值得跟进有用关注 LLM
01:03Gary Marcus@GaryMarcus精选Gary Marcus 在 X 上反驳 Google 联合创始人 Sergey Brin 的观点,Brin 认为 Transformer 架构本身足以实现 AGI。Marcus 指出,当前没有任何团队单独使用 Transformer,而是结合工具、约束和神经符号 AI 架构。他认为 Transformer 可能是 AGI 的必要条件,但绝非充分条件,这正是神经符号 AI 兴起的原因。行业AGITransformer神经符号 AI推荐理由:AGI 路线争论升级,做 AI 架构和研究的开发者值得关注——Transformer 的边界在哪、神经符号 AI 为何崛起,看完会有启发。原文稍后读已读值得跟进有用关注 AGI