7月9日
7月8日
23:35
09:55
09:55官方账号arXiv cs.AI@Andrea Alfarano, Andrea Bacciu, Saab Mansour, Amin Mantrach, Marcello Federico
该研究首次在22种语言(涵盖高、中、低资源)上系统评估了9种不确定性估计方法。发现用英文推理(即使问题为低资源语言)能显著提升UE性能,并缩小与高资源语言的性能差距。研究还指出,小规模模型下基于概率的开放盒方法更优,大规模模型下封闭盒的自我表述不确定性更有效。论文提供了多语言选择性预测中阈值选择的指导。
推荐理由:这篇论文用22种语言、9种方法实测发现:让模型用英文思考能大幅改善低资源语言的不确定性估计,选方法还得看模型大小。
01:45
7月7日
11:07
11:07官方账号arXiv cs.AI@Zefeng Wang, Minxi Yan, Jinhe Bi, Sikuan Yan, Volker Tresp, Yunpu Ma
MetaSkill-Evolve提出双时间尺度框架,使智能体技能改进递归化:任务技能在快循环演化,元技能(分析、检索、分配、提议、进化五组件)在慢循环自我应用。在OfficeQA、SealQA和ALFWorld三个基准测试上,该方法相比无技能基线分别提升+23.54、+16.09和+1.92个点。所有组件共享单一冻结骨干模型,无需额外模型或目标。
推荐理由:这篇论文让AI智能体不仅能学技能,还能自动改进改进方法本身,在三个测试集上都有明显提升,挺有意思。
7月4日
01:02
01:02官方账号MIT CSAIL@MIT_CSAIL
MIT CSAIL提出Masked IRL方法,利用LLM解决机器人面对模糊指令的问题。该方法包含两个模型:一个用于澄清用户提示,另一个忽略无关信息。这使机器人能更准确执行含糊不清的任务如'把那个东西放好'。

推荐理由:机器人终于能听懂'把那个东西放好'这种模糊话了。MIT的Masked IRL用LLM先理清意图再干活,挺实用。
7月3日
12:01
12:01官方账号arXiv cs.LG@Zhuowei Chen, Liwei Chen, Christian Schunn, Raquel Coelho, Xiang Lorraine Li
NeuFS提出一种基于神经元激活模式的主动少样本学习框架,替代传统基于输出熵或语义相似性的样本选择方法。它在推理和文本分类两个任务共三个数据集上超越现有AFSL基线。消融实验证明内部神经元激活信号比外部嵌入在选择信号上更有效。该方法通过双标准策略兼顾样本多样性和模型易幻觉样本识别。
推荐理由:这篇论文把样本选择从看输出结果改成看神经元内部活动,比传统方法更精准,适合专门领域的少样本学习场景。
7月2日