7月31日
7月30日
11:29
11:29官方账号arXiv cs.LG@Yihao Chen, Shi Chang, Khaled Chawa, Feng Lin, Boyuan Chen, Shaowei Wang, Ahmed E. Hassan
论文提出 MindForge 自动流程,将开源命令行程序转为仅暴露编译后可执行文件和文档的源码无关环境。用 GLM-5.2 作为教师智能体生成高质量程序合成轨迹,微调 Qwen3.6-27B。微调后模型在 ProgramBench 上平均测试通过率从 37.98% 提升至 49.51%,并在 7 个未见基准上均获提升,如在 RepoZero-C2Rust 上绝对增益 31.00 分、SWE-bench Verified 上 5.04 分。
推荐理由:MindForge 教小模型从零写完整软件,不用源码只用可执行文件和文档就把 Qwen3.6-27B 在 ProgramBench 上提升了 11.53%,跟大模型差不多。
11:23
11:23官方账号arXiv cs.AI@Peter Kirgis, Sayash Kapoor, Andrew Schwartz, Stephan Rabanser, David Africa, Konstantinos Voudouris, Viet Nguyen, Toby Pilditch, Magda Dubois, Harry Coppock, Cozmin Ududec, Nitya Nadgir, Matilda Orona, Tilman Bayer, Derrick Chan-Sew, Yue Ling, Abhishek Shetty, Helen Toner, Gillian Hadfield, Seth Lazar, Steve Newman, Shoshannah Tekofsky, Rishi Bommasani, Arvind Narayanan
该研究提出“影子评估”方法,让AI agent尝试回答两篇未发表的NeurIPS 2026论文的核心研究问题。agent在6天内消耗数千美元算力完成了全部工程任务,但未取得实质性进展,两篇论文均被原作者明确拒绝。研究归纳了五个失败模式:对发表标准判断不佳、研究设计缺陷缺乏创造性应对、无效回溯、资源意识差、指令漂移。另一模型和脚手架的稳健性检验重现了相同失败。
推荐理由:想知道AI做研究到底行不行?这篇论文用两个真实案例告诉你:干活还行,但搞科研还差得远,五个硬伤很实在。
11:20
11:20官方账号arXiv cs.AI@Nia Nixon, Jaeyoon Choi, Pedro Martins De Bastos, Mohammad Amin Samadi, Luise Mehner, Seehee Park, Spencer JaQuay
研究通过16组两人+AI队友和17组全人类三人团队的随机对照实验,在道德困境决策任务中分析沟通动态。AI队友是组内最健谈的成员,但其信息密度和新鲜度最低。AI的存在导致人类队友间响应性和社会影响力下降,归属感和地位感降低。对话中AI主导程度越高,人类感觉越不被重视。这种社会成本在对话初期即出现,不随时间累积。
推荐理由:这篇论文用实验证明了跟AI组队会让人类队友之间沟通变少、归属感下降。别光看AI多能说,它抢了你的存在感。
11:18
11:18官方账号arXiv cs.AI@Ji Xin, Xiao Xiao, Ishan Bhatt, Vinesh Gudla, Trace Levinson, Raochuan Fan, Shishir Kumar Prasad, Prakash Putta, Tejaswi Tenneti
该论文提出一种发现增强的搜索系统,利用意图条件召回扩展。采用两阶段混合架构:先使用闭源大语言模型(LLM)优化头部查询,再通过LoRA适配器和师生蒸馏微调小语言模型(SLM)覆盖尾部查询。系统评估使用LLM-as-a-judge指标和端到端会话级购买分析。结果将发现覆盖率从约60%提升至80%,推理成本仅为教师模型的30%。
推荐理由:论文提出一种混合架构,用大模型和小模型结合,将电商搜索发现覆盖率从60%提升到80%,推理成本仅大模型的30%,适合大规模部署。
11:17
11:17官方账号arXiv cs.AI@Jingbo Zhou, Yusai Zhao, Qi Bao, Jingjia Cao, Zhenghai Chen, Chang Gao, Kaiqi Guo, Muxin Guo, Mingxuan Li, Xinjiang Lu, Yanru Ma, Yixiong Xiao, Zenghui Zhang, Le Zhang, Hua Wu
新基准 OmegaUse-OfficeVal 包含 100 个办公套件任务,平均需 2.32 小时人工完成。每个任务提供人工时间与任务价格代理两个经济信号,用于对比人类成本与 LLM 推理成本。评估了 GPT-4、Claude 3.5 等前沿 LLM,结果显示它们虽更便宜更快,但交付质量尚未达到人类水平。该基准代码与数据集已开源。
推荐理由:想做办公自动化?这个新基准用真实成本告诉你:现在LLM虽便宜但还没人类靠谱,值得看看差距在哪。
09:48
09:48官方账号arXiv cs.LG@Andrew Flynn, Cian McCafferty, Klaus Lehnertz, François David, Vincenzo Crunelli, Gordon Lightbody, Sebastian Wieczorek
该研究提出一种基于临界转换的癫痫发作检测算法,克服了传统方法需大量预处理和依赖黑箱机器学习的局限。通过对癫痫大鼠不同形态发作的电压记录进行受试者工作特征分析,量化算法与专家标注的发作起止时间的一致性。在多数记录会话中,算法达到接近专家水平的性能,并最终推导出一组适用于所有会话的通用参数,保持高性能。该算法对多变癫痫形态具有鲁棒性,可补充现有机器学习方法。
推荐理由:想绕过复杂预处理和黑箱模型检测癫痫发作?这篇论文的临界转换方法在多个大鼠记录中达到接近专家水平,通用参数依然高表现,值得研究。

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。