10:47官方一手arXiv: DeepSeek@Sagar Deb, Ashwanth Krishnan精选STOCKTAKE是一个26周供应链补货基准,基于部分可观测马尔可夫决策过程,含六个隐藏因子过程。它通过公平参考策略计算技能分数(0到1),并测量状态估计滞后和知道-做率。在50个种子压力情景下,Claude Sonnet 5、GPT-5.4、DeepSeek-V4-Pro和Grok 4.5检测84-88%隐藏失败,但技能分数从0.62到-0.23,两个模型低于症状盲基线。正确诊断的压力周中仍有34-43%缺货,且该比率与技能分数负相关。论文STOCKTAKEClaude Sonnet 5GPT-5.42 个信源在谈事件专题推荐理由:这篇论文用STOCKTAKE基准把LLM智能体的‘没看懂’和‘看懂了却没行动’分开了,四个主流模型的表现差距比想象中大。原文稍后读已读值得跟进有用关注 STOCKTAKE
23:00Sahil Lavingia@shl这是一条来自 shl 的推文,强调了人类与 AI 智能体之间的分工:人类负责制定目标和计划(议程),而智能体负责执行具体任务。这种分工模式反映了当前 AI 应用的核心趋势,即人类保持战略控制,AI 处理执行细节。推文获得了 38 个点赞和 3576 次浏览,表明该观点引起了广泛共鸣。行业智能体人机协作自动化推荐理由:这条推文点出了 AI 时代人机协作的本质——人类做决策,AI 做执行。做产品、带团队、搞自动化的读者看完会重新思考分工方式,建议直接收藏。原文稍后读已读值得跟进有用关注 智能体