12:09官方账号arXiv cs.AI@Sarvesh Baskar, Zikui Cai, Shayan Shabihi, Anirudh Satheesh, Muhammad R. Islam, Udari Madhushani Sehwag, Tom Goldstein, Furong Huang新论文提出trace-grounded参数化测试方法,在2,190个视频上审计事件计数能力。Gemini 3.6 Flash在80%可靠性阈值下最多可靠计数12个持续状态转换事件(0.5和1.0 Hz),对瞬时闪烁事件则无可靠计数区间。高计数高频率场景下仅0.2%的最终计数正确,模型只能恢复18.1%的真实事件。提高采样率将Bounce Ball准确率从19.6%提升至29.3%,但报告序列与真值一致率仅3.7%。论文Gemini 3.6 Flash视频语言模型事件计数1 个信源在谈事件专题推荐理由:用可执行真值逐帧审计视频模型计数,发现Gemini 3.6 Flash处理瞬时事件几乎失效,加帧只虚涨分数,值得看。原文稍后读已读值得跟进有用关注 Gemini 3.6 Flash
11:21官方账号arXiv cs.AI@Yakun Yu, Ashley Wiens, Adrián Barahona-Ríos, Benedict Wilkins, Saman Zadtootaghaj, Nabajeet Barman, Cor-Paul Bezemer精选现有视觉语言模型(VLM)在游戏故障检测评估中,大多将故障视为静态视觉异常,忽略了时间性故障——这类故障需通过帧间变化才能识别。研究者提出TempGlitch基准,包含五种时间性故障类型及配对的无故障视频,用于系统评估。对12个开源和闭源VLM的测试显示,当前模型在TempGlitch上表现接近随机,要么过于保守漏检,要么过于敏感误报。增加帧采样密度或模型规模并不能可靠解决这些问题。该基准为时间推理、游戏理解和自动化故障检测提供了聚焦测试平台。论文视觉语言模型游戏QA故障检测推荐理由:游戏QA团队和VLM研究者终于有了专门测试时间性故障的基准——当前模型表现接近随机,说明这是个硬骨头,做自动化测试的值得关注。原文稍后读已读值得跟进有用关注 视觉语言模型
16:04mem0@mem0aiMem0 发布了更新后的 token 高效记忆算法,默认开启时间推理(Temporal Reasoning),新项目无需迁移即可使用。记忆衰减(Memory Decay)功能可通过仪表盘或 SDK 启用。该更新旨在提升 AI 记忆系统的上下文相关性和时效性,对构建长期记忆的智能体开发者尤为重要。API 保持不变,无需迁移,开发者可免费获取 API 密钥立即体验。AI产品Mem0记忆系统时间推理推荐理由:做智能体或长期记忆系统的开发者,Mem0 这次更新直接解决了记忆时效性问题,默认开启时间推理意味着更精准的上下文召回,建议直接拿免费 API 试试。原文稍后读已读值得跟进有用关注 Mem0
15:18mem0@mem0ai精选Mem0 发布了四月算法更新,引入了单次提取和分层检索机制,显著提升了记忆提取效率并降低了全上下文 token 成本。新算法包含时间推理功能,为每条记忆赋予时间戳,记录事件发生时间、是否持续或已完成、时间精度及记忆类型。同时增加了记忆衰减机制,基于时效性进行排序,确保旧记忆不会主导当前查询结果。这些改进使检索更具时间感知能力,能准确反映信息的变化和当前有效性。AI产品记忆系统Mem0时间推理推荐理由:做 AI 记忆系统和长期上下文管理的开发者,这个算法更新直接解决了记忆时效性和检索效率的痛点,值得关注并尝试集成。原文稍后读已读值得跟进有用关注 记忆系统