00:32Amjad Masad@amasadAmjad Masad开发的LLM国际象棋引擎已上线LiChess,当前Elo 1253,可自主与真人及机器人对弈。该引擎基于8B参数模型,结合高推理与响应链接,持续击败GPT 5.6和Stockfish难度0。它每步仅耗时1-2秒,相比之下对手平均需要30秒。免费试玩地址为qwen-chess.replit.app。AI产品LiChessGPT 5.6Stockfish推荐理由:Amjad Masad用8B模型做了个国际象棋引擎,LiChess 1253分,能赢GPT 5.6和Stockfish初级,每步只要1-2秒,在线可玩。原文稍后读已读值得跟进有用关注 LiChess
03:08Gary Marcus@GaryMarcusGary Marcus引用卡斯帕罗夫的推文,指出现成的LLM在国际象棋中经常做出非法走法,说明它们缺乏真正的世界模型。例如,2023年多次观察到LLM无法准确理解简单的规则集。Marcus认为,如果一个系统连国际象棋规则都无法可靠遵循,就难以相信它能处理需要上下文和常识的通用任务。他批评那些希望用这类系统指挥战争的想法是疯狂的。行业Gary MarcusKasparovLLM推荐理由:Gary Marcus又开炮了,这次用国际象棋例子说明LLM缺乏常识,连简单规则都学不会,你还敢让它管战争?原文稍后读已读值得跟进有用关注 Gary Marcus
09:27官方账号arXiv cs.AI@Jingyan Shen, Ang Li, Salman Rahman, Yifan Sun, Micah Goldblum, Matus Telgarsky, Pavel Izmailov该论文以国际象棋为受控测试平台,对5M至1B参数的语言模型进行预训练、监督微调和基于可验证奖赏的强化学习后训练。实验发现,后强化学习阶段的性能可由预训练损失准确预测,且奖励曲线斜率随预训练token数近似线性提升。强化学习并未简单锐化监督微调策略:在简单问题上增强已有正确动作,在难题上则浮现出监督微调下几乎不存在的正确动作。该规律在1B参数的数学领域语言模型上得到验证。论文推理模型强化学习预训练推荐理由:这篇论文用象棋做实验,清晰展示了预训练对强化学习效果的预测关系,1B模型验证了规律,读起来很扎实。原文稍后读已读值得跟进有用关注 推理模型
08:55Amjad Masad@amasadReplit CEO Amjad Masad展示其computer use模型与自建国际象棋引擎的对弈过程。他在Replit上微调了一个Qwen-8b模型来下棋,并行运行三个实验分支并取得进展。Masad指出模型在ML任务上的能力提升显著,即使没有机器学习经验的人,只要有好的直觉也能做出有趣的ML工作。AI模型ReplitQwen-8b智能体推荐理由:Replit老板用Qwen-8b模型下棋,三个实验同时跑,还说没学过ML也能搞,值得看看怎么玩的。原文稍后读已读值得跟进有用关注 Replit
15:52AI Will@FinanceYF5用户让 Claude 解一道“三步将杀”国际象棋题。Claude 的思维链极长,图中展示的部分仅为其推演的约 1/10。后续仍在持续推演,未能及时给出最终答案。该案例展示了 Claude 在逻辑推理任务中可能过度思考的问题。AI模型Claude国际象棋推理模型推荐理由:看看 Claude 怎么死磕一道三步将杀,思维链长到离谱,最后还没完没了。原文稍后读已读值得跟进有用关注 Claude
00:25Shashikant Kore@kshashi印度棋手 R Praggnanandhaa 在 2026 年古典赛中再次击败世界冠军 Magnus Carlsen,成为继 Vishy Anand 之后第二位多次在古典赛中战胜 Carlsen 的印度棋手。此前,Pragg 在 2024 年也取得过胜利。其他击败过 Carlsen 的印度棋手包括 Vishy Anand(多次)、P Harikrishna(2005 年对阵 14 岁的 Carlsen)、Karthikeyan Murali(2023 年)和 D Gukesh(2025 年)。这一成就凸显了印度国际象棋新生代的崛起,Pragg 正逐步跻身世界顶尖行列。行业国际象棋Magnus CarlsenPraggnanandhaa推荐理由:国际象棋爱好者会关注 Pragg 的突破——他成为继 Anand 之后第二位多次击败 Carlsen 的印度棋手,这标志着印度新生代棋手的实力正在逼近巅峰,值得点开看看具体名单和背景。原文稍后读已读值得跟进有用关注 国际象棋
19:13AI Engineer@aiDotEngineer精选Magnus Carlsen 的象棋应用需要解释走棋原因,而不仅仅是评估局面。由于 LLM 在推理棋局时容易产生幻觉,团队将工作拆分:Stockfish 负责评估,检测器提取战术概念,LLM 仅负责翻译成自然语言。整个流程在 Gemini Flash 上耗时不到 3 秒。用户可在应用内标记不佳的解说,反馈会通过 Slack 和 Claude Code 自动触发修复循环,甚至能在手机上合并 PR。AI产品LLM国际象棋Stockfish3 个信源在谈事件专题推荐理由:这个架构解决了 LLM 在专业领域推理不靠谱的痛点,做 AI 教练或需要解释复杂逻辑的开发者可以直接参考。原文稍后读已读值得跟进有用关注 LLM