7月10日
09:36
09:36官方账号arXiv cs.AI@Xinlong Zhao, Dongsheng Liu, Hengyu Zhao, Zixuan Fu, Zheng Wang, Jie Cai, Jie Zhou, Qiang Ma, Xuanhe Zhou, Xu Han, Yudong Wang, Zhiyuan Liu
UltraX 提出一种函数调用精炼框架,通过引入插入操作完成编辑函数空间,实现细粒度实例级编辑。该框架通过数据集自适应提示优化指导专家LLM生成高质量精炼文本,再通过行对齐映射和动态上下文替换转换为结构化程序监督。实验表明 UltraX 在所有语料库上取得最高平均性能,并使用更少训练 token 匹配或超越基线,展现更强数据效率和精炼可靠性。
推荐理由:UltraX 搞了个新框架,用程序化编辑替代传统规则和LLM方式,既能细粒度编辑又保证效率,精炼预训练数据效果不错。
09:31
09:31官方账号arXiv cs.AI@João Matos, Olivia Buege, Donny Cheung, Gary S. Collins, Paula Dhiman, Nan Li, Bingyu Mao, Benjamin W. Nelson, Michail Ouroutzoglou, Paul Varghese, Jonathan Amar
该论文分析了2053个真实患者与AI聊天机器人的对话,发现用户交流模式和情绪表达差异显著。研究开发了患者模拟器,分别建模临床内容、情感状态、对话策略和交流风格。在15位人类评分员的图灵测试中,模拟对话与真实对话几乎无法区分,准确率仅55%。使用5种患者角色和1164个临床医生评分案例,评估了4个LLM的紧急评估性能,发现交流风格显著改变分诊结果。
推荐理由:别只看用理想病人测AI的论文,这篇用2053个真实对话发现,交流风格直接改变分诊结果,准确率才55%!
7月9日
10:11
10:11官方账号arXiv cs.LG@Shreyasvi Natraj, Cyrus Achtari, Felice Gragnano, Andrea Milzi, Marco Valgimigli, Diego Paez-Granados
ECGLight是一个端到端轻量级框架,可在CPU上30秒内将手机拍摄的纸质心电图转化为数字化12导联信号。该框架在21,799份PTB-XL数据集上训练,并在医院ECG-Matrix数据集上验证。在PTB-XL上心梗检测准确率达95.51%(F1=0.9519),在ECG-Matrix上OMI检测准确率达88.89%(F1=0.8862)。框架还集成SHAP可解释性,支持临床诊断。
推荐理由:用手机拍张纸质心电图,ECGLight直接在本地CPU跑30秒就能筛查心梗,准确率95%以上,偏远地区也能用。
10:10
10:10官方账号arXiv cs.LG@Xiangming Huang, Guannan Zhang, Lu Lu, Raphaël Pestourie
论文提出NOTES方法,将DeepONet神经算子与CMA-ES进化策略结合,在紧凑潜空间中进行全局优化。该方法将纳米光子束偏转器的设计维度从256降至25,并实现超过95%的效率。在结构优化任务中,NOTES发现的合规性设计达到246。与CMA-ES、拓扑优化等基线相比,NOTES在性能和迁移性上均有提升。
推荐理由:这篇论文搞了个叫NOTES的框架,用神经算子压缩设计空间,再用进化策略找最优,在纳米光子偏转器上效率超95%,比传统方法好。
09:54
09:54官方账号arXiv cs.LG@Vladislav Beliaev
精选
AdaPrefix-GRPO针对GRPO在困难问题上梯度消失的问题,提出自适应调整正确前缀长度的机制。方法通过反馈控制器将问题的成功率维持在50%附近以最大化梯度信号,训练后完全移除前缀。在0.6B模型上,该方法在保留训练分布的难题上将准确率提升2.1倍;在Qwen3-1.7B上提升1.6倍,在AIME基准上提升1.7倍,同时将追踪长度减半。模型越小,增益越大。
推荐理由:这篇论文解决了GRPO训练时难问题学不到东西的痛点,用自适应前缀让模型在数学推理上准确率翻倍,而且模型越小效果越明显,值得做强化学习的人看看。
09:47
09:47官方账号arXiv cs.LG@C G Krishnanunni, Thomas Scott, Tan Bui-Thanh
本研究提出基于后验误差估计的神经网络深度自适应方法,将训练建模为连续时间最优控制问题,推导误差分布到各层的严格上界。通过双加权残差方法获得可计算误差指示器,在累计误差最大处插入新层。在Navier-Stokes方程的科学数据集上,该方法在泛化性能上优于现有架构自适应方法。
推荐理由:这篇论文搞了个新路子,用误差估计自动告诉你该在网络的哪一层加更多神经元,在流体力学数据上比现有方法都强。
09:16
09:16官方账号arXiv cs.AI@Ricardo Maia Avelino, Rita Sevastjanova, Tom Van Mele, Philippe Block, Mennatallah El-Assady
该论文指出,当前追求消除摩擦的生成式AI(如通用对话模型)与结构设计师通过迭代摩擦激发创意的需求存在错位。研究者提出一个基于视觉语言模型的协同设计系统,使结构探索变得对话式、多模态,并能响应用户的演化意图。通过一个原型界面和与领域专家的研究,发现该系统能减少重复性建模摩擦,同时保留有益于创意生成的反思维摩擦。
推荐理由:这篇研究说AI一味追求“省事”反而帮倒忙——结构设计需要“摩擦”来激发灵感。他们用视觉语言模型做了个交互系统,帮设计师边想边改,保留思考摩擦,去掉重复劳动。
09:14
09:14官方账号arXiv cs.AI@Zhenyu Hou, Yujiang Li, Jie Tang, Yuxiao Dong
提出Single-rollout Asynchronous Optimization (SAO)方法,解决异步RL中GRPO框架不适用于智能体任务的稳定性和离策略问题。用单轨迹采样替代组采样,配合价值模型训练和双面token级裁剪,在SWE-Bench Verified、BeyondAIME、IMOAnswerBench上持续优于GRPO及其变体。SAO已成功部署于GLM-5.2模型(750B-A40B)的智能体RL训练管线。
推荐理由:想高效训练智能体模型?SAO用单轨迹采样打补丁,稳定训练1000步,在编码和推理基准上全面超越GRPO,干货论文。

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。