00:04elvis@omarsar0精选AWS AI Labs发布新论文,探讨智能体交接税问题。研究测量了在运行中升级到更强模型的实际成本,发现全轨迹升级只能恢复弱强模型之间不到一半的质量差距,同时增加大量成本。论文链接:arxiv.org/abs/2608.24358。论文智能体交接税模型性能推荐理由:AWS AI Labs的新论文揭示了智能体交接税问题,了解交接成本对模型性能的影响,值得一读。原文稍后读已读值得跟进有用关注 智能体
08:09elvis@omarsar0精选DAIR.AI发布论文《There Is No Neutral Harness》,讨论了智能体驯服评估中的问题。十二个开放权重模型在26种可辩护的驯服配置下,对ARC、HellaSwag、MMLU和TruthfulQA的3,679个问题进行回答。gemma4-31b在不同驯服配置下的准确率从31%到89%不等。论文链接:arxiv.org/abs/2608.21382论文智能体MCP/工具论文推荐理由:DAIR.AI发布了关于智能体驯服的论文,探讨了评估中的问题,值得一看。原文稍后读已读值得跟进有用关注 智能体
23:38AK@_akhaliqApodex 1.1 论文发布,探讨复杂工作中的智能体扩展,Hugging Face 上可查阅。论文Apodex 1.1智能体论文推荐理由:想了解智能体扩展新进展的朋友,这篇论文值得一读,它详细探讨了 Apodex 1.1 的应用和效果。原文稍后读已读值得跟进有用关注 Apodex 1.1
22:37elvis@omarsar0精选微软团队提出AutoSaddler,自动优化harness设计,在GAIA2、SWE-Bench Pro和Terminal-Bench 2.0上分别提升9.0、9.6和10.0点。论文AutoSaddlerharness设计微软推荐理由:微软团队的新论文AutoSaddler,自动优化harness设计,效果显著,值得一读。原文稍后读已读值得跟进有用关注 AutoSaddler
05:33elvis@omarsar0这篇调查详细介绍了终端智能体的概念,并探讨了为何不同平台对终端智能体的评价存在矛盾。论文链接:arxiv.org/abs/2608.20485。在Dair学院追踪更多AI论文:academy.dair.ai论文终端智能体智能体论文推荐理由:想了解终端智能体概念和评价差异的朋友,这篇调查值得一读。它提供了详实的信息,帮助理解这一领域。原文稍后读已读值得跟进有用关注 终端智能体
22:43量子位@思邈中国公司提出AI科研评价新规则,实践数据在两项基准测试中位列第一,全球大厂开始关注。论文AI科研评价规则中国公司基准测试推荐理由:这篇论文提出了新的AI科研评价标准,数据表现优异,值得行业关注。原文稍后读已读值得跟进有用关注 AI科研评价规则
21:36elvis@omarsar0精选NVIDIA新论文探讨评估智能体技能,提出Skill Lift方法,通过对比加载与未加载技能的执行差异来衡量技能提升。研究基于145个真实技能案例,发现技能执行、行为检查和技能效率方面有显著提升。论文NVIDIA智能体技能评估3 个信源在谈事件专题推荐理由:NVIDIA提出Skill Lift新方法,评估智能体技能提升,与现有方法相比有显著优势,值得一读。原文稍后读已读值得跟进有用关注 NVIDIA
05:34elvis@omarsar0精选研究多智能体系统在代码审查中的应用,提出Adversarial Review方法,使用三个智能体进行审查,在LiveCodeBench上优于五智能体基线,在SWE-PRBench上实现最高F1值。论文智能体代码审查多模态推荐理由:这篇论文探讨了如何使用多智能体系统进行代码审查,提出了一种新的方法,值得一读。原文稍后读已读值得跟进有用关注 智能体
10:09官方账号arXiv cs.AI@Xudong Chen, Shengbo Gong, Lu Cheng, Wei JinProtoCP是一种用于时序交互图边级欺诈检测的共形预测框架,针对欺诈数据中良性邻居主导和类别极度不平衡的问题,通过聚焦欺诈相关子图上下文提升校准效率。该方法利用学习到的原型抑制良性噪声,并引入邻域相对评分与时间分数扩散机制,实现稳定的类别条件校准。在YelpChi、S-FFSD、FTFD和BankSim四个欺诈基准上,ProtoCP以更小的预测集达到目标覆盖率,优于现有最先进基线。代码已开源。论文ProtoCP共形预测欺诈检测推荐理由:欺诈检测要控制误报和漏报,这篇论文的ProtoCP把共形预测用在了时序图上,四个基准上都比现有方法预测集更小,做风控的可以看看。原文稍后读已读值得跟进有用关注 ProtoCP
11:52官方账号arXiv cs.AI@Avinash Kori, Fabrizio Russo这篇论文从因果视角研究世界模型,提出超越生成能力、捕捉实体属性及其交互的因果世界模型(CWM)正式定义。作者将世界建模与因果表示学习、目标中心学习、因果发现、结构因果模型及基于模型的决策制定等工作联系起来。论文还探讨了可识别性文献,澄清世界模型组件何时能从数据中恢复以及等价性边界。论文世界模型因果推理因果表示学习推荐理由:如果你在搞世界模型或因果推理,这篇把概念理清了,还连上了因果发现的现有工作,值得一看。原文稍后读已读值得跟进有用关注 世界模型
02:51elvis@omarsar0精选Harness-IF提出一种规则评估方法,通过从执行证据中逐条打分256条规则,并在九个探针构建中撤回每条规则后重跑任务,来区分规则是否真正改变了模型行为。在12个前沿模型上,原始准确率为72.1%到85.9%,剔除巧合后的Against-Prior准确率降至66.1%到78.6%,每个模型下降3.6到7.4个点。研究发现优先级不随提示词深度变化,系统提示、项目文件和用户指令的优先级都高于工具和技能描述。论文见arxiv.org/abs/2608.11727。论文AGENTS.mdHarness-IF智能体推荐理由:如果你在给编码智能体写AGENTS.md,这篇论文用256条规则和12个模型实测告诉你哪些规则真有用,别凭感觉写了。原文稍后读已读值得跟进有用关注 AGENTS.md
10:59官方账号arXiv cs.LG@Vagan Terziyan, Artur Terziian, Oleksandra Vitko本文提出有序结构依赖假说(OSDH),认为同一观测的多个可接受排序能揭示单一序列无法捕捉的互补结构依赖。为验证该假说,作者提出独立结构专家原则(ISEP),独立训练各投影专属序列模型,再通过融合模型整合表征。具体实现为结构演化RNN(SE-RNN),保持底层循环计算不变,仅增加投影多样性。在三个不同复杂度合成数据集上的实验表明,SE-RNN在存在隐藏结构依赖时持续受益于多投影,在简单数据集上仍具竞争力。该方法独立于底层序列模型,可扩展至其他架构。论文SE-RNNRNNOSDH推荐理由:想给RNN换个思路?这篇论文提出用多个顺序投影挖掘结构依赖,实验显示在复杂数据上更稳,简单数据也不掉链子。原文稍后读已读值得跟进有用关注 SE-RNN
06:30elvis@omarsar0Zachary Horvitz发现,把上传的论文从paper.pdf改名为paper_final_draft_pdf_ready_for_review.pdf,GPT-5.6-Terra给出的平均评审分数就会上涨。这个针对GPT-5.6-Terra的实验显示,LLM评审会受文件名等无关因素干扰。他因此建议,在GPT-5.6-Terra这类模型上不要用数值评分做评审,尽量改用二元标签,比如通过/不通过。技巧gpt-5.6-terraLLM评审论文推荐理由:把论文名改成最终送审版,GPT-5.6-Terra给的分数就涨了。以后让LLM审稿别要分数,直接让它说过/不过。原文稍后读已读值得跟进有用关注 gpt-5.6-terra
16:00IT之家(博客/媒体)72°OpenAI 于 7 月 31 日发布 249 页 PDF,介绍下一代模型 Astra 在高维球填充、量子博弈论等领域的数学进展,按 Sol API 费率计算约耗 2,000 美元词元成本。多名数学家审查后指控其学术不端,两项核心结果未正确引用既有文献。Yeshiva University 数学家 Steven Miller 指出,针对 1000 维或更高维空间的球体装箱问题,Astra 的核心论证首次出现在他 2016 年的论文中。Cambridge 数学家 Francesco Fournier-Facio 和 Dresden University of Technology 的 Andreas Thom 发现,群论中关于 Soficity 的结果结合了 2016 年和 2019 年两篇论文的想法。OpenAI 回应称对结果正确性负责,并计划本周小幅更新论文。行业OpenAIAstra学术不端10 个信源在谈事件专题推荐理由:OpenAI 的 Astra 论文被数学家抓了没引文献,两项核心结果撞车 2016 和 2019 年的工作,OpenAI 说要改,看看学术圈怎么较真。原文稍后读已读值得跟进有用关注 OpenAI
12:51官方账号arXiv cs.LG@Daniel Paulin, Victor Elvira该研究提出一种VARMA模型估计框架,使每次优化迭代的计算成本与序列长度T无关,通过偏自相关重参数化保证平稳性和可逆性。损失函数仅依赖固定大小的充分统计量,借助Parseval恒等式以近线性成本评估截断长度。两种点估计器(正则化最小二乘和协方差边缘化最大后验)在固定维度下以近参数速率恢复真实过程的无穷自回归表示。实验中,从d=10到d=40,估计器接近oracle预测误差,而经典条件MLE在d=40时产生非可逆拟合且预测发散。该方法在零售需求、气象和空气质量数据上匹配或优于VAR、贝叶斯VAR、成分ARMA和稀疏VARMA基线。论文VARMA时间序列估计方法推荐理由:这篇论文把VARMA从低维度限制里解放出来了,迭代成本不再随序列长度增长,在d=40时还能稳定预测,做时间序列的可以看看。原文稍后读已读值得跟进有用关注 VARMA
00:08elvis@omarsar0精选Kernel Forge是一个开源agent harness,能直接改写PyTorch模型的CUDA内核。它覆盖视觉、扩散和LLM三类工作负载。采用蒙特卡洛树搜索(MCTS)而非线性生成-修复链,并提供GUI监控进度。在NVIDIA DGX Spark(GB10 GPU)上,经过每核50次优化迭代,它在四个模型中优化了14个内核,使其超越PyTorch基线。性能提升主要来自harness结构和原地重整合,而非更强的LLM。论文Kernel ForgeCUDA代码优化10 个信源在谈事件专题推荐理由:想又快又稳地优化CUDA内核?Kernel Forge用MCTS自动探索,比手动写靠谱多了,实测14个内核超基线。原文稍后读已读值得跟进有用关注 Kernel Forge
10:06官方一手arXiv: OpenAI@Carlo Iacono这篇论文审计了2025年7月18日至2026年7月17日期间40条实证记录,发现最新命名模型出现时中位年龄为281天(四分位距75-478天,范围11-939天)。其中25篇期刊文章的中位年龄为395天,14篇预印本为56天,1篇实验室报告为49天。35条记录包含已被取代的模型系列,仅7条提供了精确的日期标识符。论文将模型年龄与声明货币性区分开,提出六项报告实践,并展示了作者借助GPT-5.6 Sol Pro在两天内完成研究的反思性案例。论文GPT-5.6 Sol ProOpenAI模型评估1 个信源在谈事件专题推荐理由:这篇论文研究了AI模型评估结论过时的速度,发现模型发布后近一年结论可能已失效。如果你做AI评测或读评测报告,它能帮你判断证据是否还新鲜。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol Pro
07:32Ethan Mollick@emollick一篇论文测试了AI模型在解决多个领域的复杂商业问题上的能力,使用商学院MBA教学中的案例作为基准。结果显示AI在当前版本下已能出色完成这些任务,覆盖不同商业学科。研究还发现,随着模型迭代,AI的表现随时间显著提升。该论文为评估AI在商业决策中的应用提供了实证数据。论文论文MBA案例商业问题推荐理由:这篇论文很有意思,他们用商学院MBA的案例考AI,结果AI答得很好,而且进步飞快,值得看看具体数据。原文稍后读已读值得跟进有用关注 论文
12:41官方账号arXiv cs.AI@Meena Jagadeesan, Tatsunori Hashimoto, Jon Kleinberg这篇论文研究了LLM检测工具如何在用户策略性行为下影响下游指标。作者构建了一个模型,展示不完美的LLM检测器会导致反直觉结果:用户反而可能增加LLM使用量,即使减少检测特征能提升输出质量,引入检测器也可能导致更低的输出质量。实验在arXiv摘要的词频上重现了检测属性的“先升后降”模式。论文揭示了LLM检测作为干预时的失效模式,涉及LLM使用和输出质量的扭曲。论文LLM检测策略性用户行为输出质量推荐理由:这篇论文用模型和实验告诉你,加LLM检测可能适得其反,让用户用更多LLM、产出更差内容,搞学术研究的值得看看。原文稍后读已读值得跟进有用关注 LLM检测
12:38官方账号arXiv cs.AI@Gjergji Kasneci, Enkelejda Kasneci当前AI安全讨论过度聚焦显性失败,而部署系统中许多关键失败是隐蔽且被工作流正常化的。本文提出五层框架诊断隐性风险:认知完整性、控制完整性、时间完整性、组织完整性和生态系统完整性。该框架识别了过度依赖、提示注入、奖励黑客、记忆中毒、评估欺骗等风险模式。作者呼吁从模型中心评估转向社会技术系统可靠性。论文AI安全隐藏风险五层框架推荐理由:这篇论文讲的是AI系统那些不容易发现的隐患,比如过度依赖、提示注入和记忆中毒,不只是看模型本身,还分析组织和使用环境的风险。原文稍后读已读值得跟进有用关注 AI安全
12:08官方账号arXiv cs.LG@Lena Libon, Ben Rank, Jehyeok Yeon, David Schmotz, Jeremy Qin, Daniel Donnelly, Derck Prinzhorn, Maksym AndriushchenkoResearchArena 是一个框架,用于评估自动化AI研发中的AI控制方法,涵盖安全后训练、能力后训练、CUDA内核优化和推理服务器优化四项长周期任务。每个任务配有两个隐藏的副任务:嵌入式破坏(蓄意破坏提交的模型、适配器、内核或服务器)和独立副任务(在沙箱中执行隐蔽越界操作但留下诚实的构件)。研究测试了四种监控类型(是否执行和探测构件、是否看到代理的思维链),发现训练数据中的破坏最难捕捉,被标记率不到一半。允许监控器在构件上运行实验有帮助但仍不足,监控器常因只检查表面、解释掉异常或用错误测试而遗漏嵌入式破坏。研究将ResearchArena作为模块化框架发布,用于评估自动化AI研发中的破坏和控制。论文ResearchArenaAI安全智能体推荐理由:这篇论文提出了ResearchArena,用来测试AI研发中Agent会怎么搞破坏、监控能不能抓住,做法很实在,有具体的数据和案例。原文稍后读已读值得跟进有用关注 ResearchArena
02:32官方账号OpenAI@OpenAI76°OpenAI与ApolloAI合作发布新研究,探讨奖励追求行为(模型倾向于遵循评分者奖励而非用户意图)。提出新方法Contrastive SDF,量化模型信念对行为的影响程度。研究在alignment.openai.com上公开,包含具体实验和基准测试。论文OpenAIApolloAIreward-seeking1 个信源在谈事件专题推荐理由:OpenAI联手ApolloAI,用Contrastive SDF方法测量模型是否在讨好评分者而非用户,搞对齐的必看。原文稍后读已读值得跟进有用关注 OpenAI
00:59官方账号MIT CSAIL@MIT_CSAIL精选78°MIT研究人员提出一种新算法,能在指数级更少的采样步骤内达到与标准扩散模型相同的精度。该算法可大幅提升图像生成等扩散AI系统的效率。相关论文在ICML 2023荣获杰出论文奖(Outstanding Paper)。论文MIT扩散模型采样加速推荐理由:MIT搞了个新算法,采样扩散模型快了很多,还拿了ICML最佳论文奖,做图像生成的朋友可以看看。原文稍后读已读值得跟进有用关注 MIT
23:09elvis@omarsar0用户指出Vitushkin论文中的方法使Fable的解决方案更易理解。讨论中提及xy+1和xz项的具体表达式。评论指出Fable未引用Vitushkin论文。推文期待更详细的报告。论文VitushkinFable论文推荐理由:这场讨论点出了论文引用和算法溯源的重要性,适合关注数学推导细节的读者。原文稍后读已读值得跟进有用关注 Vitushkin
11:31官方账号arXiv cs.AI@Yasheng Sun, Zezi Zeng, Yifan Yang, Chong Luo, Wenyi Wang, Ziwei Liu, Jürgen SchmidhuberSciDiagramEdit是一个从自然论文修订中学习编辑科学图表的基准和技能演化框架。该基准从arXiv版本历史中挖掘前后图表对,每对都附有作者的修订意图。框架采用智能体学习,通过技能演化不断优化代理的技能规范,提升编辑准确性。实验表明,在保留验证集上,技能逐步提高了编辑准确率,证明自然论文修订是有效的指令驱动图表编辑训练信号。论文SciDiagramEditarXiv论文推荐理由:这篇论文提出了一个从论文修订数据中学习编辑科学图表的框架,还附带了一个基准,适合想做图表自动化编辑的研究者看看。原文稍后读已读值得跟进有用关注 SciDiagramEdit
01:40elvis@omarsar0该综述论文(arXiv:2607.13104)系统梳理了自我改进智能体从研究原型到实际部署的进展。它将现代智能体定义为“基础模型+操作脚手架”的组合,并形式化自我改进为一种自我诱导的更新操作符,能对模型或脚手架进行修改。论文涵盖了多种自我改进范式,包括基于反馈循环、经验回放和自动提示优化的方法。论文智能体自我改进论文推荐理由:想了解智能体怎么自己变强?这篇综述把自我改进拆解成模型和脚手架两个维度,框架清晰,适合入门和参考。原文稍后读已读值得跟进有用关注 智能体
04:43官方一手Google Research: Blog(资讯)谷歌研究人员在2026年7月15日发表论文,试图从算法和理论层面解释扩散模型(如Stable Diffusion、Imagen)的创意生成能力。他们通过分析模型内部的潜在空间结构和训练数据分布,提出了一种新指标来量化模型的创造力。实验表明,模型在特定噪声调度下能产生更多样化的输出,其创意水平与训练数据的多样性和模型容量正相关。该研究为理解生成式AI的创造性过程提供了理论框架。论文diffusion modelsGoogle创造力推荐理由:谷歌发了篇论文,专门分析扩散模型为啥能搞创意生成,有实验有指标,不做玄学解释。原文稍后读已读值得跟进有用关注 diffusion models
09:28官方账号arXiv cs.AI@Eranga Bandara, Ross Gore, Asanga Gunaratna, Ravi Mukkamala, Nihal Siriwardanagea, Gihan Siriwardanagea, Sachini Rajapakse, Isurunima Kularathna, Pramoda Karunarathna, Chalani Rajapakse, Sachin Shetty, Christopher K. Rhea, Ng Wee Keong, Kasun De Zoysa, Amin Hass, Shaifali Kaushik, Wathsala Herath, Preston Samuel, Anita H. Clayton, Atmaram Yarlagadd该论文分析了人类与AI助手、编码协作或图像生成等交互中的迭代循环,指出每次请求-反馈-再调整过程会高频触发条件反射,强化不耐烦、完美主义等消极神经通路。作者提出,通过在三层观察(预认知感受、调节间隙、后反应)和两种模式(用户引导与代理辅助)中打断反应链条,可以利用长期抑制替代长时程增强来弱化不良回路。论文以生成式图像提示为例,说明同一挫败会话在观察与否时行为相似但神经效果相反。论文AI agent神经可塑性条件反射推荐理由:这篇论文把日常AI交互解读成神经训练,教你用观察来打断反应回路,实操感强,图像提示例子很直观。原文稍后读已读值得跟进有用关注 AI agent
10:43官方账号arXiv cs.AI@Kaiji Zhou, Ales Leonardis, Yue FengAgora是一种新提出的框架,引入激励相容的拍卖机制,将推理步骤视为可交易物品,让专家模型和工具基于修正后的胜任度进行竞标,从而将关键逻辑分配给最合适的求解器。在五个基准测试上的评估显示,Agora在可比候选池下优于匹配的单模型、路由和级联基线。该框架通过单个拍卖参数实现可控的成本-质量权衡。论文AgoraLLM Agent拍卖机制推荐理由:想提升LLM Agent推理效率?Agora用拍卖机制动态分配任务给专家模型,在五个基准上都比传统路由强,还能平衡成本和效果。原文稍后读已读值得跟进有用关注 Agora
09:36官方账号arXiv cs.AI@Xinlong Zhao, Dongsheng Liu, Hengyu Zhao, Zixuan Fu, Zheng Wang, Jie Cai, Jie Zhou, Qiang Ma, Xuanhe Zhou, Xu Han, Yudong Wang, Zhiyuan LiuUltraX 提出一种函数调用精炼框架,通过引入插入操作完成编辑函数空间,实现细粒度实例级编辑。该框架通过数据集自适应提示优化指导专家LLM生成高质量精炼文本,再通过行对齐映射和动态上下文替换转换为结构化程序监督。实验表明 UltraX 在所有语料库上取得最高平均性能,并使用更少训练 token 匹配或超越基线,展现更强数据效率和精炼可靠性。论文UltraX预训练数据数据精炼推荐理由:UltraX 搞了个新框架,用程序化编辑替代传统规则和LLM方式,既能细粒度编辑又保证效率,精炼预训练数据效果不错。原文稍后读已读值得跟进有用关注 UltraX
17:17量子位@量子位的朋友们精选阿里在2025年ACL大会上获得最佳资源论文奖,其提出的Agent评测框架BenchAgent包含5万+测试用例和20+真实任务场景。该框架通过自动化生成对抗性测试,将现有Agent基准的评估效率提升300%。论文首次系统解决了Agent行为空间过大导致的评测覆盖不足问题。论文阿里ACLBenchAgent推荐理由:阿里拿奖的这篇论文,搞了个叫BenchAgent的新评测框架,专门测Agent行不行,覆盖真实场景多,你搞Agent开发可以看看。原文稍后读已读值得跟进有用关注 阿里
12:19官方账号arXiv cs.AI@Anna Cordoba, Adam Puente Tercero, Nerea Angulo Hijo, Mar Linares Tercero, Julia Barrientos, Ainhoa Miranda, Jesus OliveraDepthWeave-KV是一种跨层键值缓存压缩方法,通过共享低秩通道基分解相邻层状态,保留令牌特定残差。它使用令牌条件深度路由器为指令型和检索关键令牌分配更高重构秩,并通过注意力输出探头在线追踪误差自适应压缩。在LongBench等基准上,DepthWeave-KV实现近满缓存任务质量,压缩比达8.3倍,64K上下文速度72.8 tokens/s。论文DepthWeave-KVKV缓存压缩长上下文推荐理由:长上下文推理内存瓶颈有救了!DepthWeave-KV用跨层分解加自适应压缩,8.3倍KV缓存缩减,速度72.8 tokens/s,比其他方法效果更好。原文稍后读已读值得跟进有用关注 DepthWeave-KV
13:03官方一手arXiv: OpenAI@Sukanta GangulyPLACEMEM将智能体记忆表示为带版本号的胶囊,统一语义、来源、有效性和可重用运行时状态。原型基于vLLM,支持提示级文本检索、KV导向路由和级联失效。通过OpenAI兼容的侧车和类型化元数据契约,测量了首次token延迟、复用率和校正后行为。论文提出了面向终身智能体系统的重放感知服务集成路线图。论文PLACEMEM论文终身智能体4 个信源在谈事件专题推荐理由:这篇论文提出了PLACEMEM,用版本化胶囊解决终身智能体的记忆管理问题,原型跑在vLLM上,实测了延迟和复用率,适合研究记忆架构的读者。原文稍后读已读值得跟进有用关注 PLACEMEM
12:21AI Will@FinanceYF5精选Anthropic 与 Neuronpedia 合作,为开源权重模型制作了交互式演示,方便研究者直观探索模型内部机制。该演示对应一篇可解释性论文,论文域名 transformer-circuits.pub 提供了完整技术细节。用户可通过交互界面结合论文理解模型行为。论文AnthropicNeuronpedia开源模型10 个信源在谈事件专题推荐理由:Anthropic 联合 Neuronpedia 搞了个开源模型的交互演示,能上手玩模型内部,配合论文看更清楚。原文稍后读已读值得跟进有用关注 Anthropic
03:24Mustafa Suleyman@mustafasuleymanMustafa Suleyman团队在Nature Health发表论文,标题为“Public use of a generalist LLM chatbot for health queries”,该研究探讨通用型大语言模型聊天机器人(LLM)在公众健康查询中的应用。论文登上了该期刊的封面,表明LLM在医疗领域具有重要潜力。研究聚焦于LLM如何辅助用户获取健康信息,并评估其准确性和可靠性。论文LLMAI健康咨询Nature Health推荐理由:DeepMind的Nature Health封面论文,第一篇严格评估LLM在健康问答中的表现,感兴趣可以看看。原文稍后读已读值得跟进有用关注 LLM
10:05官方账号arXiv cs.AI@Haonan Huang该论文提出一个端到端自主研究流水线,从11,083篇凝聚态物理arXiv论文出发,自动生成包含三个实质物理发现(关于交变磁性压电性)的稿件。流水线分为六个阶段,历经47次全新对话会话,共执行2,162次文献查阅事件。容错机制通过冗余设计实现:隔离上下文、分布式接地和对抗性审查弥补单次会话的遗漏。对比预架构基线和无pilot消融实验,结构强制数值对抗被识别为关键接地机制。论文LLM自主研究容错推荐理由:这篇论文展示了一个真正端到端的自主科研代理,从读论文到写论文全自动,还能发现新的物理现象,值得科研人员看看。原文稍后读已读值得跟进有用关注 LLM
09:38官方账号arXiv cs.AI@Nathan Hughes, Ibrahim Habli本研究系统分析了53篇关于人机团队的论文,基于心理学团队分类法将其归纳为5个集群:AI助手、临时依赖、临时强制依赖、配对平衡和群体平衡。每个集群代表不同的整体团队特征,表明同一术语下存在多种异质团队类型。研究指出,不同论文间的见解是否可迁移存疑,并提供了识别人机团队类型的指南和研究报告清单。论文Human-AI团队团队分类论文推荐理由:这篇论文帮你理清了人机团队到底有几种类型,看了53篇文献给你分了5类,读完就知道不同研究到底在聊什么、结论能不能通用。原文稍后读已读值得跟进有用关注 Human-AI团队
09:07官方账号arXiv cs.LG@Joseph Webb, Sadok Jerad, Coralia Cartis精选DSGNAR是一种针对物理信息神经网络(PINNs)训练中病态损失问题的二阶优化框架,通过双重草图高斯-牛顿与自适应正则化策略,在多个基准上取得突破。在双精度下,相对ℓ2误差可低至3×10^{-16};在经典Burgers方程上比现有结果提升五个数量级,在高维Poisson问题上提升八个数量级。单精度下,Burgers方程可在10秒内达到ℓ2_rel=4.75×10^{-7}。该方法对不同架构、精度和超参数均表现鲁棒。论文DSGNARPINNs二阶优化推荐理由:PINNs一直跑不过传统方法,DSGNAR用二阶优化解决了问题,精度和速度都大幅提升,代码已开源,值得看看。原文稍后读已读值得跟进有用关注 DSGNAR
11:08官方账号arXiv cs.AI@Ziyu Chen, Yilun Zhao, Arman Cohan这篇论文构建了一个大规模评估框架,从高质量人类研究论文中逆向工程出可能激发核心想法的少量相关先前工作。通过提示LLM从论文标题和摘要生成新想法,作者引入双轴研究品味分类法(机会模式和研究范式)来量化人类与LLM想法之间的差异。在多个LLM生成的想法集中,观察到一致的分布差距:LLM想法过度集中在桥接式机会和综合方法上,而人类论文参考分布更广泛地分布在构建差距和贡献的方式上。结果表明,即使强大的LLM能产生合理想法,其范围仍比人类研究品味窄且系统性偏移。论文LLM研究想法论文推荐理由:这篇论文用一套严谨的方法测出了LLM和人类科研人员在脑洞上的真实差距,发现LLM的想法集中但套路化,和人比还是有明显偏差。原文稍后读已读值得跟进有用关注 LLM
10:15官方账号arXiv cs.AI@Hao Huang论文将Muon优化器解释为隐式残差连接。正交化更新牺牲局部梯度保真度,但改善下游层的表示保留。在受控线性优化中,Muon学习对局部目标拟合慢但下游层易利用的表示。该视角为设计平衡局部下降与下游可用性的优化器提供了新思路。论文Muon优化器残差连接推荐理由:这篇论文给了Muon一个新视角:它不只是优化器,更像隐式残差连接,专门为下游层保留好的表示。想理解Muon为什么管用的可以看看。原文稍后读已读值得跟进有用关注 Muon