11:54官方一手arXiv: DeepSeek@Zheling Tan, Jin Gao, Dequan Wang精选CABLE是一种插件式内存增强方法,专为解决LLM代理长期记忆中的证据可达性问题。该方法在LoCoMo和MA-LongMemEval基准测试中使用Qwen3.5-27B、DeepSeek-chat和GPT-4o-mini进行评估。CABLE通过构建稀疏的推理相关关联,而非重复主机检索器已覆盖的内容,显著提升了跨记忆和会话的证据检索能力。在开放域、多会话和偏好导向问题类别中,CABLE实现了最大的性能提升。AI模型CABLE记忆检索LLM代理推荐理由:清华团队提出CABLE方法,让AI记忆系统不再只靠相似度,而是通过互补链接找回被遗忘的关键信息。原文稍后读已读值得跟进有用关注 CABLE
13:50官方账号François Chollet@fchollet精选François Chollet 指出,如果基准测试依赖静态数据集或训练时已知的静态分布,那么它本质上衡量的是记忆/检索,而非智能。他以 ARC 挑战为例,说明现有基准容易因数据泄露而失效,并强调真正智能需要应对未知变化。Chollet 呼吁社区设计更能体现泛化能力的测试,如基于动态环境的评估。行业François Chollet基准测试智能测评推荐理由:Chollet 点破了基准测试的痛点:很多高分模型只是背答案,不是真聪明。做评测的值得看看。原文稍后读已读值得跟进有用关注 François Chollet