7月31日
12:02
11:55
11:55官方账号arXiv cs.AI@Rong Wu, Daocheng Fu, Licheng Wen, Xuemeng Yang, Shu Zou, Jianbiao Mei, Yuxin Wang, Hairong Zhang, Yu Yang, Tao Hu, Cong Zhang, Botian Shi, Pinlong Cai
MemHarness 框架在决策时用统一策略模型批判并重构检索到的经验,而不是像基线那样逐字回放。重构能力通过 GRPO 端到端训练自然涌现,无需额外监督。在 ALFWorld 和 WebShop 两个基准上,MemHarness 显著超过纯 RL 和静态记忆增强基线。分析表明,MemHarness 的重构目标可防止负迁移,并在 OOD 场景中保持鲁棒性。
推荐理由:MemHarness 让智能体把旧经验改写到当前场景再用,在 ALFWorld 和 WebShop 上比静态记忆基线强不少。
11:49
11:49官方账号arXiv cs.AI@Zexuan Yan, Yuzhou Wu, Yue Ma, Zonghang He, Kaibo Yin, Xiaobing Tu, Yinggui Wang, Jinkui Ren, Xiantao Zhang, Shijian Wang, Jinghong Liu, Linfeng Zhang
EgoGenesis是一个基于预训练视频生成先验的自我中心世界动作模拟器,用于合成可控的操作视频。它通过在线锚定投影记忆(OAPM)保留第一帧3D场景锚点,并用Action-3D RoPE编码末端执行器运动。将400条真实轨迹与400条EgoGenesis生成轨迹合并后,单臂任务真实机器人成功率从77%提升至84%。双臂任务成功率从53%提升至70%,说明合成数据能显著改善下游世界动作模型的泛化。
推荐理由:EgoGenesis是个能生成机器人操作视频的工具,用400条合成数据就把单臂成功率从77%提到84%,双臂从53%提到70%,挺厉害。
11:47
11:47官方账号arXiv cs.AI@Xiaofei Xu, Quan Z. Sheng, Zhongjie Wang, Boualem Benatallah, Xiao Wang, Ruipeng Han
arXiv 论文 2607.28242 提出 AMServ 概念,将智能体服务与元宇宙结合。Meta-AaaS 作为其实现范式,把感知、决策、执行、协作和内容生成能力封装为即服务。论文回顾了 GenAI 从聊天机器人到智能体 AI 的关键转变,并分析了 AMServ 的典型应用场景。
推荐理由:想知道智能体怎么变成可调用的服务?这篇论文用 AMServ 和 Meta-AaaS 把概念和应用场景都讲了,还给了例子。
11:34
11:34官方账号arXiv cs.LG@Jaume Ros, Alessio Arleo, Fernando Paulovich
作者提出Gap Index(GI)质量指标,通过将二维投影空间分解为空白三角形,并与高维对应部分比较来计算变形。该指标可以聚合为单一标量值,也可叠加在投影上可视化局部失真模式。实验表明,与常见质量指标不同,GI能捕捉具有高视觉影响的小型结构变形,且计算快速、可解释。
推荐理由:降维图里的空白区域也会失真,这个新指标能发现其他指标看不出的视觉变形,论文不长,想学方法可以看看。
11:30
11:30官方账号arXiv cs.LG@Erick Eduardo Ramirez-Torres, Javier Macias-Guarasa, Daniel Pizarro, Javier Tejedor, Sira Elena Palazuelos-Cagigas, Pedro J. Vidal-Moreno, María R. Fernández-Ruiz, Sonia Martin-Lopez, Miguel Gonzalez-Herraez, Roel Vanthillo
该论文发布Marlinks-NS DAS数据集,包含74,771个标注实例,来自北海28公里埋地光缆中2,554米段连续10天的记录。数据集定义了船只检测和船只到电缆距离估计两个机器学习任务。每个实例包含250个传感通道的光谱能量特征,以及AIS衍生的距离和元数据。该数据集旨在支持可复现的海底电缆保护研究。
推荐理由:这个论文发布了北海海底光缆的DAS数据集,带7.4万条标注,可做船只检测和距离估计,防电缆被破坏。
11:29
11:29官方账号arXiv cs.LG@Rasmus Tirsgaard, Laurits Fredsgaard, Marisa Wodrich, Mikkel Jordahn, Mikkel N. Schmidt
该论文(arXiv:2607.28304v1)提出用集成共识目标训练分子图模型,解决分子领域难以设计标签保持增强的问题。实验覆盖多种分子数据集、任务类型和图神经网络架构,显示半监督集成共识能提升预测准确率。单成员模型经此训练后,在几乎所有情况下都优于传统监督方式训练的全集成,并降低校准误差。
推荐理由:这篇 arXiv 论文用集成共识做分子图半监督学习,不用费力设计数据增强,单个模型就能超过传统全集成,还降校准误差。
11:27
11:27官方账号arXiv cs.LG@Edoardo Ragusa, Giovanni Paolo Canuti, Simone Lugani, Rodolfo Zunino, Paolo Gastaldo
论文提出两种方法,利用RGB-D数据在小型深度网络中整合深度信息,包括重构的硬件感知神经架构搜索和专用微调流程。两个真实世界数据集上的实验显示,多数生成的解决方案能识别Pareto最优前沿,平衡泛化性能和硬件要求。原型采用Jetson Nano和RealSense RGB-D相机,整体能耗与智能手机电池兼容,可实现实时性能。
推荐理由:论文给嵌入式设备上的可供性分割提供了新思路,用Jetson Nano和RealSense做出实时方案,能耗跟手机电池差不多,比同类tiny方法更能处理复杂场景。
11:07
11:07官方账号arXiv cs.LG@Luigi Sigillo, Matteo Silvestri, Francesco Tabaro, Rajat Bhatnagar, Syed Irtaza Mubashar, Matt Jeffryes, Daljit Nijjer, Vittorio Perera, Ola Spjuth, Julio Saez-Rodriguez, Melissa Harrison, Fabio Petroni
EMBL AI Librarian是一个面向AI智能体的生命科学知识层,将Europe PMC的40M条文献记录升级为自然语言问答接口。它用单个LLM编排互补子查询,并由同一模型阅读选中论文以定位证据。在ScholarQABench基准上,Librarian的Citation F1比近期强基线高出16分以上。在LitQA2基准上,接入Librarian的GPT-5.4智能体比使用网页搜索得分高约8分。代码已在GitHub公开。
推荐理由:生命科学智能体可以直接用自然语言查文献了,EMBL AI Librarian在LitQA2上比网页搜索高8分,代码已开源。
11:01
11:01官方账号arXiv cs.LG@Changjian Liu, Tianyu Wang, Xiaoxuan Deng, WenTao Zhu, Yuwei Xu, Jungqi Jin, Yong Gao, Chuan Yu, Jian Xu, Bo Zheng
论文提出ReAlloc,一个用于多通道预算分配的快速-慢速因果框架。它通过正交教师从短期日志提取无偏局部梯度,再由解释引导学生蒸馏为长期边际收益场。在淘宝平台的大规模在线A/B测试中,ReAlloc同时提升了支付订单数和收入。与标准预测-优化方法相比,该方法能处理跨渠道替代效应并避免外推。
推荐理由:这篇论文教电商平台怎么在多个营销渠道间分钱,用ReAlloc框架在淘宝实测同时涨订单和收入,比传统预测-优化方法更稳。
10:59
10:59官方一手arXiv: OpenAI@Daniel Silva, Renan Alves, Emanuel Dantas Filho, Ademar Sousa Neto, Mirko Perkusich, Danyllo Wagner Albuquerque, Kyller Gorgônio, Angelo Perkusich
该论文针对OpenAI o3生成的微服务分解提出基于静态依赖分析的自动验证流程,在PetClinic和Bookstore两个系统上比较零样本与少样本提示策略。使用依赖保持(TPD)和依赖违反(TVD)指标评估,并通过鲁棒性分析控制类到服务映射覆盖差异。标准化后两种策略的结构遵从性等价,TPD值分别为68.0%和83.3%。结果表明,结构评估需显式控制映射覆盖率,否则提示策略间的差异可能是方法偏差。
事件专题

推荐理由:这篇论文用源码依赖实测OpenAI o3拆微服务的靠谱度,零样本和少样本结果差不多,TPD达到68%和83%。
10:38
10:38官方一手arXiv: OpenAI@Danyllo Albuquerque, José Renan, Guillermo Rodríguez, Guillermo Rodríguez, Emanuel Dantas, Ademar França, Mirko Perkusich, Kyller Gorgônio, Angelo Perkusich
精选
一项研究评估了 OpenAI o3 仅凭文本需求生成微服务架构的能力,测试对象为 Bookstore 和 PetClinic 两个系统。少样本提示下服务识别 F1 达 0.97,显著高于零样本的 0.79;通信恢复 F1 从 0.61 提升至 0.82。盲审专家认为少样本输出在模块性、连贯性和合理性上优于零样本。研究者指出结论受限于两个小型系统,不能视为模型无关的普遍证明。
事件专题

推荐理由:OpenAI o3 能直接从需求文档拆出微服务,少样本示例让 F1 从 0.79 涨到 0.97。想用 LLM 做架构设计的可以看这篇。
09:53

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。