8月11日
12:35
12:35官方账号arXiv cs.LG@Mind Lab, :, Vin Bo, Asher Cai, Jingwei Cao, Song Cao, Vic Cao, Amelia Chen, Andrew Chen, Kaijie Chen, Cleon Cheng, Steven Chiang, Kaixuan Fan, Hera Feng, Huan Feng, Arthur Fu, Jun Gao, Pyke Han, Nolan Ho, Ori Hong, Hailee Hou, Piers Hua, Charles Huang, Miles Jiang, Nora Jiang, Yuyi Jiang, Qiuyu Jin, Fancy Kong, Kuss Koo, Jaron Lee, Andrew Lei, Alexy Li, Dawn Li, Lucian Li, Ray Li, Ricardo Li, Smith Li, Theo Li, Allen Lin, Elliot Lin, Fan Lin, Chen Ling, Kairus Liu, Kieran Liu, Logan Liu, Neo Liu, Xiang Liu, Yuxin Lu, Maeve Luo, Pony Ma, Verity Niu, Cole Qiao, Guian Qiu, Vince Qu, Sentry, Niko Song, Vincent Wang, Bo Wu, Rio Yang, Evelyn Ye, Fiona Ye, Ina Ye, Regis Ye, Josh Ying, Atlas Zeng, Danney Zeng, Salmon Zhan, Anya Zhang, Di Zhang, Mia Zhang, Sueky Zhang, Wei Zhao, Ada Zhou, Adrian Zhou, Yuhua Zhou, Juno Zhu, Murphy Zhuang
Macaron-V1是面向体验智能的开源智能体-模型家族,支持部署后持续学习。旗舰版Macaron-V1-Venti基于744B的GLM-5.2底座,搭配聊天、智能体、编程和GenUI四个LoRA适配器。Macaron-V1-Tall基于Qwen3.6(50B)设计,用于本地部署。系统采用模型-框架协同设计和递归自我改进循环,包含UI4A组件原生GenUI框架和智能体RL框架MindForge。在Personal Intelligence、GenUI和通用能力基准上进行了评估。
推荐理由:想了解怎么让模型部署后还能继续学?Macaron-V1用LoRA组合和递归改进做到了,744B大模型加四个专家LoRA,还开源。
11:57
11:57官方账号arXiv cs.AI@Oluwanifemi Bamgbose, Simon Rosen, Jash Shah, Lindsay Devon Brin, Hoang H Nguyen, Anke Koelzer, Rachel Hansen, Tara Bogavelli, Fanny Riols
arXiv论文提出首个维度级TTS元评估基准,将自然度拆解为10个语言学感知维度,包含860条由语言学家标注的语音样本。基准测试4个MOS预测器和4个Audio-LLM评判器后发现,MOS预测器仅反映声学信号质量,Audio-LLM评判器对特定提示有选择性检测且无法跨维度泛化。两类方法均不能可靠捕捉语言学结构化的语音错误。数据集、标注模式和评估代码已公开。
推荐理由:做TTS评测的可以看看,这篇把自然度拆成10个维度,实测发现MOS和Audio-LLM都测不全,还公开了数据集和代码。
11:54
11:54官方账号arXiv cs.AI@Alban Puech, Matteo Mazzonelli, Tamara R. Govindasamy, Mangaliso Mngomezulu, Héctor Maeso-García, Thomas Tolhurst, Javad Bayazi, Ali Moeini, Naomi Simumba, Celia Cintas, David Nelischer, Romeo Kienzler, Jonas Weiss, Anna Varbella, Florian Dörfler, Gabriela Hug, Martin Mevissen, Juan Bernabé-Moreno, François Mirallès, Hendrik F. Hamann, Etienne Vos, Thomas Brunschwiler
GENCO(几何神经校正优化器)是一个统一神经求解器,用于稳态输电网分析,涵盖潮流(PF)、最优潮流(OPF)和状态估计(SE)。在PFDelta和OPFData基准上,GENCO在大规模PF中比牛顿-拉夫逊法快30倍,同时匹配DC-PF的功率平衡残差。在OPF中,它比IPOPT快85倍,并提高了可行性和最优性。在SE中,GENCO对噪声和参数误差的鲁棒性优于加权最小二乘法。配套的开源GridFM开发框架和百万级数据集支持可复现的基准测试。
推荐理由:电力系统工程师看过来:GENCO一个模型搞定潮流、最优潮流和状态估计,比传统求解器快几十倍,还开源了框架和数据集,想上手试试的别错过。
11:51
11:51官方账号arXiv cs.AI@Björn Engdahl, Adrian Kosowski, Jan Chorowski, Zuzanna Stamirowska, Przemysław Uznański, Junlin Jiang, Rohan Phadke, Remigiusz Kinas, Richard Zhong
BDH-CQ 是一种结合上下文学习与循环潜在推理的推理模型,推理时输入持续更新模型记忆,并在高维潜在空间迭代计算,不输出中间推理过程。在 ARC-AGI-1 公开评测集上,150M 参数配置达到 29.5% pass@2,单任务推理成本仅 0.0007 美元。该结果突破了 ARC-AGI-1 此前报告的成本-准确率帕累托前沿,树立了新的基准成本效率标杆。研究还通过受控 ARC 干预实验,分析了模型从演示中学习的内容、应用推断变换的一致性及难点概念。
推荐理由:这个模型用循环潜在推理做上下文学习,150M 参数在 ARC-AGI-1 上花 0.0007 美元就拿到 29.5% 的 pass@2,性价比直接刷新纪录,值得看看它怎么做到的。
11:48
11:48官方账号arXiv cs.AI@Wanying Qu, Qinghua Mao, Yu Li, Jiyao Liu, Xin Zhang, Dadi Guo, Yanxu Zhu, Qingyu Liu, Leitao Yuan, Xi Lin, Shanfeng Zhu, Yanwei Fu, Jing Shao, Xia Hu, Dongrui Liu
SHE框架将智能体安全机制分解为系统提示、规则库、安全记忆和工具策略四个组件,每个组件有明确的安全职责。该框架通过归因引导的进化循环,将轨迹失败转化为结构化诊断,并学习组件特定的边界优化。在Agent-SafetyBench上,SHE相比静态SafeHarness将攻击成功率降低3.1倍,同时提升良性效用。进化后的安全机制在AgentHarm基准上泛化到未见风险,并无需额外进化即可跨智能体模型迁移。
推荐理由:SHE把智能体安全从模型权重扩展到运行框架,分解成四个可独立进化的组件,实测攻击成功率降3.1倍,还能跨模型迁移,搞AI安全的值得看看。
11:46
11:46官方账号arXiv cs.AI@Abraham Gonzalez, Raghav Gupta, Akanksha Jain, Hanna Alam, Alexander Novikov, Po-Sen Huang, Matej Balog, Marvin Eisenberger, Sergey Shirobokov, Ngân Vũ, Hank Levy, Borivoje Nikolić, Sagar Karandikar, Martin Dixon, Parthasarathy Ranganathan
ArchAgent v2 将自动化微架构搜索扩展到多级数据预取。它引入级联进化搜索,按缓存层级依次进化和冻结预取器,并加入硬件可实现性反馈回路,在进化过程中实时估算硬件规模。在 DPC4 规则下,ArchAgent v2 自动设计的三级预取器比人工设计的冠军方案表现更好,几何平均 IPC 较基线提升 3.8%,较前冠军 BertiGO 提升 0.3%。在低带宽单核配置下,其性能提升达 4.6%,而 BertiGO 仅为 2.6%。
推荐理由:AI 自动设计芯片预取器,居然跑赢了 DPC4 冠军方案,单核低带宽下提速 4.6%,搞硬件架构的值得看看。
11:44
11:44官方账号arXiv cs.AI@Alexander Panfilov, David Schmotz, Ilia Shumailov, Luca Beurer-Kellner, Joachim Schaeffer, Ameya Prabhu, Jonas Geiping, Maksym Andriushchenko
精选76°
Anthropic、OpenAI和Google等主流LLM提供商将推理轨迹加密后返回客户端,但研究发现这些加密块在会话、用户和模型间可互换。攻击者将加密轨迹注入同提供商的较弱模型,可强制其明文输出推理内容,无需直接越狱更强模型。通过解码315,320个推理块,研究者恢复了367个PII和182个凭证。该漏洞还支持隐形提示注入,可污染智能体部署。论文提出加密和系统级缓解措施。
事件专题

推荐理由:这篇论文揭露了Anthropic、OpenAI和Google推理加密的漏洞,能跨模型解密,还挖出大量隐私数据,搞AI安全的必看。
11:43
11:43官方账号arXiv cs.AI@Mahvish Nagda, Jihyeon Lee, Matthew Thompson, Chunjong Park, Tim Strother, Valentin Liévin, Roma Ruparel, Akshay Goel, Teya Bergamaschi, Suhana Bedi, Meet Shah, Pavel Dubov, Liviu Panait, Toshiyuki Fukuzawa, Sam Schmidgall, Craig Schiff, Joseph Xu, Aliya Rysbek, Yana Lunts, Jan Freyberg, Rebecca Hemengway, Sunny Virmani, David Racz, Carey Radebaugh, Joëlle Barral, Kavi Goel, Dale R. Webster, Katherine Chou, Avinatan Hassidim, Yossi Matias, James Manyika, Gregory Wayne, Tao Tu, Yun Liu, Ethan Goh, Christina Chen, Ryutaro Tanno, Po-Hsuan Cameron Chen, Mike Schaekermann, Anil Palepu
71°
谷歌研究团队推出AMIE(Video),一个基于Gemini的多智能体系统,支持低延迟对话、临床推理和实时视听感知。在包含30名初级保健医生、15名患者演员和100个临床场景的随机OSCE研究中,AMIE(Video)在病史采集、诊断、管理和体格检查方面与医生评分相当或更优。患者演员更偏好AMIE的病情评估和解释方式,但医生在建立融洽关系和伙伴关系上更受青睐。模态消融显示,患者更偏好视频界面而非纯文本聊天。研究指出在精细解剖精度、细微情感表达和高频动作方面仍有局限。
推荐理由:谷歌把医疗AI做到视频问诊了,AMIE视频版在100个临床场景里和真人医生打平甚至更好,患者还更喜欢它的解释方式,想看看AI看病到底行不行可以读这篇。
11:24
11:24官方账号arXiv cs.AI@Pinzhen Chen, Koel Dutta Chowdhury, Xiaoya Xu, David Tan, Doreen Osmelak, Ona de Gibert, Ariun-Erdene Tumurchuluun, Ashok Urlana, Fedor Sizov, Hale Sirin, Jesujoba Alabi, Karrar Talib Abed, Mateusz Klimaszewski, Nikolay Bogoychev, Niyati Bafna, Patricia Schmidtova, Preksha Manjunath Shanbhag, Sherrie Shen, Vilem Zouhar, Vivek Iyer, Yasser Hamidullah, Yusser Al Ghussin, Zheng Zhao
Cultivar 是一个基于 FLORES 的本地化翻译基准,用于评估模型在特定地区文化语境下的翻译能力。该基准通过源语言对比设计,将未本地化版本与本地化版本配对,以检测数据污染和本地化鲁棒性。研究对 32 个开源权重模型进行测试,发现机器翻译专用模型鲁棒性较差,部分模型可能过拟合 FLORES,且模型普遍更擅长翻译美国内容而非其他地区内容。
推荐理由:想测翻译模型有没有背答案?Cultivar 用本地化对照来抓数据污染,32 个开源模型跑下来,发现 MT 专用模型反而更脆,美国内容翻译得最好。
11:16
11:16官方账号arXiv cs.AI@Nathan Godey, Yoav Artzi
精选
Matryoshka训练框架将500M、1.5B和3B三个子模型堆叠进单一嵌套架构,端到端训练。相比独立训练基线,该套件在基准性能和困惑度上持平,但训练计算量减少36%。嵌套结构天然支持投机解码,吞吐量提升14-26%。论文还消融了关键架构选择,为构建强Matryoshka套件提供指导。
推荐理由:想省训练算力又不想掉性能?这个嵌套训练法把三个模型塞一个架构里,直接省36%算力,还顺带加速推理,值得一看。
11:06
11:06官方账号arXiv cs.LG@Jakub Kacper Szeląg, Aydin Abadi, Mohammad Naseri
该论文提出去中心化问题,指计算机通信系统中缺乏普遍接受的定义。作者引入基于图的本体论,将去中心化定义为关系性和主体特定属性,并区分于分布。提出两个新指标:Void Tolerance和Imperviousness,用于评估系统。提供浏览器实现,可自动分类和计算任意系统的指标。在联邦学习和区块链架构上的实例验证显示一致、可比较的评估结果。
推荐理由:这篇论文给去中心化下了个清晰定义,还搞了两个新指标,能自动算系统去中心化程度。搞联邦学习或区块链的可以看看,比之前那些模糊说法靠谱。

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。