6月23日
11:08
11:08官方账号arXiv cs.AI@Alexander V. Kozachok, Alexander M. Nazimov, Shamil G. Magomedov
论文将自然语言到DSL代码生成定义为Text2DSL新问题,并引入PolkitBench数据集,含4204对自然语言-Polkit规则对。实验在GigaChat-10B-A1.8B(18亿活跃参数)和Nemotron-3-Nano-30B-A3B(30亿活跃参数)两个MoE模型上测试。提供结构化上下文(BNF语法、API说明、允许标识符词汇)后,语法有效性达98.6-99.4%,结构有效性提升9.7-35.5个百分点,CodeBLEU分数提升60-95%。
推荐理由:这篇论文定义了Text2DSL任务,带了一个4204条规则的数据集PolkitBench,还发现喂给模型语法规则能让代码生成质量暴增,不用微调。
10:32
10:32官方账号arXiv cs.LG@Mathieu Delcluze, Léa Briand, Benjamin Chapus, Deniz Mekik, Guillaume Salha-Galvan
Deezer在2025年部署了基于大型语言模型(LLM)的自动播放列表标注系统。该系统为Daily Mix功能生成自然语言描述,覆盖数百万用户。部署后用户参与度显著提升,表明语义描述如何影响用户对个性化推荐的感知。论文发表于arXiv,编号2606.22460v1。
推荐理由:Deezer用LLM给每日推荐写标题,百万用户真用上了,参与度还涨了——不是PPT,是上线产品。
6月19日
11:04
11:04官方账号arXiv cs.LG@Haw-Shiuan Chang, Jeffrey Gomez, Mehul Patwari, Aryan Sajith, Hamed Zamani
这篇论文提出利用用户与LLM交互时的鼠标轨迹和眼动数据作为隐式反馈来替代昂贵的显式偏好标注。他们构建了IFLLM数据集,包含59名用户的1336个多轮问答,并记录了鼠标和眼动数据。基于这些隐式反馈训练的奖励模型将文本奖励模型的准确率从55%提升到64%。对8个LLM应用DPO后,响应质量相对提升近3倍,证明了隐式反馈在真实场景中的价值。数据集和代码已开源。
推荐理由:别光看用户点了什么赞,鼠标和眼睛动的方向才是真心话。这篇论文用59人的眼动和鼠标轨迹数据训练奖励模型,准确率从55%飙到64,还开源了数据集。
10:13
10:13官方账号arXiv cs.AI@Simon Aagaard Enni, Malthe Stavning Erslev, Karl-Emil Kjær Bilstrup, Kristoffer Laigaard Nielbo
该论文提出'编辑对齐'作为参与式AI的设计实践,旨在让编辑专家参与重新对齐LLM界面以符合编辑标准。通过和北欧公共知识机构合作,设计并实现了LLM驱动的百科全书界面案例研究。论文将编辑标准视为设计制品,把编辑实践和价值观转化为技术对齐目标。最后讨论编辑对齐如何为编辑提供持续参与和代理权。
推荐理由:这篇论文通过具体案例展示了如何让编辑参与对齐LLM,帮助公共知识机构保持编辑标准,实操性强且有启发性。
02:52
02:52官方一手Cloudflare Blog@Grant Bourzikas
精选
Cloudflare博客详解其多阶段漏洞发现工具的技术架构,包括状态控制机制、通过对抗性审查将误报率降低90%的方法,以及如何绕过LLM上下文长度限制(如4k token限制)。该工具实现自动化分类,每日可处理超过10万条告警。文章还公开了其基于GPT-4的分阶段提示词模板和缓存策略。
推荐理由:Cloudflare公开了他们内部用的漏洞检测工具怎么做,从状态管理到对抗审查都讲了,想自己搭自动化安全工具的可以抄作业。
6月18日
11:59
11:59AI Will@FinanceYF5
根据Olivia Moore分享的数据,LLM(大语言模型)目前为Walmart和Target等顶级零售商贡献了接近2%的推荐流量。这一比例在过去一年中增长了三倍多。其中,电子产品、家居与花园等研究密集型类别的AI推荐流量增幅最大。
推荐理由:AI现在真的能帮你买东西了!LLM给Walmart、Target带来的推荐流量一年涨了三倍,电子产品最明显,做决策前让AI推荐更靠谱。
11:58
10:58
10:58官方账号arXiv cs.AI@Linus Sander, Habtom Kahsay Gidey, Alexander Lenz, Alois Knoll
该论文提出一个包含对手方、负载、交互状态、发现机制和模式灵活性5个维度的分类法,对9个活跃维护的开源协议进行迭代分析。研究发现所有智能体间协议均结合混合负载与会话状态持久化,多数协议支持多个预定义模式,两个协议在运行时协商模式,显示模式灵活性趋势。去中心化发现仍属罕见。短期看协议将趋同统一智能体间与智能体-上下文通信,长期则可能发展为分层协议栈。
推荐理由:这篇论文把9个主流的智能体通信协议拆成5个维度做分类,告诉你哪种协议适合什么场景,以及未来会怎么演进。如果你在做多智能体系统,想选协议或者设计协议,这篇很有参考价值。
09:40
09:40官方账号arXiv cs.AI@Yafeng Wu, Huu Hiep Nguyen, Thin Nguyen, Hung Le
论文提出CADE框架,用于时间序列问答。该框架通过点式线性编码器和MLP投影器将每个时间步直接映射到LLM嵌入空间,避免分词瓶颈和固定窗格损失。引入单向监督对比损失对齐时间序列嵌入与冻结类名文本锚点。在Time-MQA基准上,CADE在六个TSQA任务中一致优于开源和闭源LLM基线。
推荐理由:这篇论文提出CADE,解决了LLM处理时间序列时丢了数值信息的痛点,用直接时间步嵌入和对比对齐,在Time-MQA上比GPT-4还强。
03:04
03:04Gary Marcus@GaryMarcus
Gary Marcus重申LLM不可靠的观点,称无法被驳斥。特朗普政府要求Anthropic确保Fable 5的护栏不能被绕过,但安全专家表示不可能完全阻止规避。Marcus认为这是生成式AI的普遍问题,而非Anthropic一家的问题。WIRED报道引述了相关官员和专家的意见。
事件专题

推荐理由:权威AI批评家Gary Marcus再次发声,直指LLM根本不可靠,加上特朗普政府与Anthropic的对峙,这场AI安全争议你必须了解。
6月17日
12:00
12:00官方账号arXiv cs.LG@Longlong Zhu, Jiashuo Yu, Zedi Chen, Yuhan Wu, Zhifan Jiang, Yuchen Xian, Yimeng Liu, Jiajie Su, Shaopeng Zhou, Xingyuan Li, Hongyan Liu, Xuan Liu, Dong Zhang, Chunming Wu, Xiang Chen
OmniPlan采用基于大语言模型的解释器将异构自然语言意图转化为统一偏好向量,并利用混合专家架构动态选择MIP求解器、启发式算法和DRL模型作为专家。在分布式机器学习推理卸载任务(包括决策树、SVM、XGBoost等)的真实测试中,OmniPlan实现了近最优卸载,延迟降低高达97.8%,网络设备资源消耗降低11.5%。
推荐理由:OmniPlan用LLM和混合专家做网络优化,在分布式ML卸载上延迟降97.8%,资源降11.5%,效果很直观。
10:43
10:43官方账号arXiv cs.AI@Henry Bodwell, Hong Yang, John C. Simeone, Kelvin Gorospe, Bella Sullivan, Lana Huang, Jessica Gephart, Sandy Aylesworth, Molly Masterton, Naren Ramakrishnan
论文提出IUU+DB系统,利用大语言模型(LLM)从异构文档中提取非法、未报告和未监管捕捞(IUU)及相关海鲜欺诈、劳工虐待事件信息。系统可分类是否相关,提取行为者、地点、物种、船舶、违规类型及执法结果等关键数据,并支持去重和趋势分析。案例验证表明,IUU+DB能帮助组织碎片化证据,识别地理和行为热点,为学术界、非政府组织、行业风险评估及政府政策执行提供支持。
推荐理由:这篇论文搞了个IUU+DB系统,用LLM自动从大量文档里挖出非法捕捞和海鲜欺诈的线索,能帮监管者和研究人员快速定位热点区域,挺实用的。
10:40
10:40官方账号arXiv cs.AI@Ziqi Zhou, Yubo Ye, Sumeet Atul Vadhavka, Linwei Wang, Zhiqiang Tao
论文提出LEADS框架,利用LLM智能体在结构化动作空间中迭代发现混合物理-神经模型,解决传统方法需要专家手动设计且无法跨患者迁移的问题。在三种合成反应数据和真实心脏电生理数据上,LEADS均优于人工设计的混合模型和其他基于LLM的方法。该方法保证了模型的物理合理性、可解释性和数值稳定性,同时允许开放性的架构探索。
推荐理由:这篇论文用LLM智能体自动设计心脏数字孪生的混合模型,比人工靠经验搭的更准,还跨病人管用。合成和真实数据上都赢了其他方法。
10:17
10:17官方账号arXiv cs.LG@SongEun Kim, Seungyoo Lee, Edwin Fong, Hyungi Lee, Juho Lee
论文发现LLM在多项选择问答中早期存在信念漂移,违背鞅性质。通过提出的提示预测重采样(PPR)方法,模型在多次重采样后信念自稳定并收敛。基于此,研究者进一步提出种子答案提示策略和自一致性损失微调方法。在多项选择QA基准测试中,这些方法显著减少信念漂移并提高预测一致性,且不牺牲准确性。
推荐理由:这篇论文发现了LLM回答重复问题时信念会自己稳定,还给了两种让模型更一致的方法,适合关注推理可靠性的读者。