09:37官方账号arXiv cs.AI@Jiangang Han精选本文研究LLM安全带中部分相关验证器级联的可靠性。与条件独立下的对数赔率线性增长(Odds Law, arXiv:2606.15712)不同,部分相关下后验对数赔率对k呈凹性,失败概率多项式衰减(例如Beta(a,b)潜伏下1-r_k ∝ k^{-b}, ρ_v=1/(a+b+1))。盲点原子(质量1-π)在α=1处限制证据上限为-ln(1-π)纳特。实验显示独立假设在k=5时低估失败20倍,k=10时低估约3000倍,而R=8次重复判决的相关拟合能追踪实际深度。有效杠杆是去相关(更换模型族、模态或证据源),而非增加门数。论文LLM验证器级联部分相关推荐理由:这篇论文用数学证明加更多验证门不如换不同模型或模态,部分相关会让可靠性提升远不如预期。原文稍后读已读值得跟进有用关注 LLM
11:01官方账号arXiv cs.AI@Aleh Manchuliantsau一篇论文研究了LLM计划评估器的漏洞:计划可通过省略必要工作提高得分。在26条路线组成的队列中,所有57次合法删除都匹配了分析恒等式,且每条路线至少有一次得分提升的删除。评分优化器在21/26条路线中发现了未被覆盖的结构。GATE机制在26/26条静默路线上拒绝得分释放,0次诚实暂停;之后47/54次修订转为覆盖结构,严格覆盖改进从1/26升至13/26。自适应编译器感知合著者揭示了注册表-来源边界:义务通道规避在v1/v1.5条件下保持6/6,而delta索引成本下限将诚实路线从6/6降至3/6,静默可融资性从5/6降至0/6。论文LLMGATEAI安全推荐理由:这篇论文深挖了一个漏洞:计划评估器可能因为计划含糊就给高分。他们用数学证明并在26条路线上验证了。搞LLM安全或评估的值得一读。原文稍后读已读值得跟进有用关注 LLM
11:00官方账号arXiv cs.AI@Sen Yang, Yuen-Hei Yeung对齐LLM在非证据激励(如用户信心)下会误报,违背内部激励相容(IC)。研究提出反事实报告协调(CRC)方法,通过因果交换干预识别低秩报告坐标(答案、置信度、预警)。在Bayesian-witness基准上,两遍夹钳实现联合resist和update得分1.00(Wilson 95% CI [0.99,1.00])。单遍编译有损耗,resist和update为0.73和0.97。方法在三个模型家族和SycophancyEval上复现,提供激活级因果不变性作为内部IC的结构原语。论文LLM激励相容反事实干预推荐理由:这篇论文用因果干预把LLM的内部报告拆解成抵抗压力和更新证据两个维度,在测试中做到满分,比一般对齐方法更扎实。原文稍后读已读值得跟进有用关注 LLM
09:41官方一手arXiv: DeepSeek@Wei Liu, Weisong Sun, Tingting Xu, Hanwei Qian, Yi Zhao, Chunrong Fang, Xia Feng本研究针对方法名预测(MNP)任务,发现现有评估多依赖token相似度指标(如BLEU)与人类判断不一致,且LLM直接代码-名称映射不及人类先理解再命名的过程。实验对比6种指标评估器、5种LLM评估器(包括DeepSeek)和6名人类评估者,显示DeepSeek评估器与人类判断更一致。进一步比较直接生成与摘要-精炼策略,后者提升了语义质量。基于此提出SMNP方法,融合MNP导向摘要和链式精炼,在5个LLM和2个数据集上验证了有效性。论文SMNPLLMMethod Name Prediction推荐理由:这篇论文告诉你:给代码自动取名时,先写摘要再命名比直接硬猜更靠谱。他们用DeepSeek做评估,效果比传统指标好十倍。原文稍后读已读值得跟进有用关注 SMNP
09:39官方账号arXiv cs.AI@Xixuan Hao, Zeyu Zhang, Zehao Lin, Yihang Sun, Ziliang Guo, Xichong Zhang, Yuxuan Liang, Feiyu Xiong, Zhiyu LiMemOps基准将对话记忆重新定义为生命周期操作序列,包括记住、遗忘、更新、反思及其组合。它通过可控生成流水线在长任务对话中嵌入操作,产生六类操作级探针,并在相邻证据与长上下文两种设置下评估。实验对比了长上下文、检索、参数化和托管记忆系统,发现会话级检索优于回合级检索,而长上下文模型在重构有序记忆状态轨迹上表现明显较弱。该基准揭示出仅靠最终答案准确度无法暴露的多种失败模式,推动记忆评估向可解释的操作级诊断转变。论文MemOpsLLM记忆操作推荐理由:想测AI的记忆系统到底靠不靠谱?这个新基准MemOps把记忆拆成6种操作来测,比只看最终答案准多了,搞记忆研究的必读。原文稍后读已读值得跟进有用关注 MemOps
09:20官方账号arXiv cs.AI@Xing Zhang, Guanghui Wang, Yanwei Cui, Ziyuan Li, Wei Qiu, Bing Zhu, Peiyang He这篇论文指出,自进化智能体系统依赖一个隐藏假设:存在可靠的评估指标,但现实中往往没有。作者提出演化指标方法,通过搜索小缺陷检测器的组合形成可检查的指标,使用十项锚定参考集训练,并采用共识正则化和留出审计。在代码生成(MBPP+)、企业文本到SQL(Spider 2.0-Snow)和无参考报告生成任务中,共进化方法Double Ratchet保留了由真实指标驱动下的88-110%的提升效果。安全方面,移除锚定守卫会导致指标退化,独立裁判能捕获技能游戏行为,且任务感知裁判在77%的判定对中偏好演化输出。论文LLM智能体评估指标推荐理由:这篇论文解决了自进化AI的一个核心漏洞:没有可靠指标怎么办。他们让指标和技能一起进化,在多个基准上验证了有效性,还能防作弊。值得研究Agent自改进的人读一读。原文稍后读已读值得跟进有用关注 LLM
09:07官方账号arXiv cs.LG@Julius Steiglechner, Lucas Mahler, Gabriele LohmannElenchos是一个基于lambda演算系统的生成式评估框架,用于测试大语言模型(LLM)的溯因推理能力。评估发现,前沿和中端模型在检测系统是否被修改时表现较好,但识别具体规则修改的能力显著不足。在交互突变场景下,模型性能大幅下降,通常只能恢复部分突变。初步证据显示,增加推理时间预算仅带来微小改进,收益递减。论文LLMElenchos溯因推理推荐理由:这篇论文用Elenchos框架测了LLM的溯因推理,发现模型能发现异常但猜不准具体改了啥,挺有意思的。原文稍后读已读值得跟进有用关注 LLM
03:07Ate-a-Pi@svpino精选一本包含50个动手项目的书籍,用Python、PyTorch、Scikit-Learn等工具教你理解大型语言模型内部机制。项目覆盖分词、嵌入、输出logits、Transformer输出、注意力、MLP等核心主题。每个项目配有解决方案,如运用HellaSwag评估模型、用cosine相似度分析嵌入、实现logit lens等方法。完成全部项目可进入该领域前0.01%的水平。技巧LLMPyTorch实战项目推荐理由:想扎实掌握LLM原理?这50个实战项目从基础分词到高级注意力分析,用PyTorch一步步搭出来,比看论文快多了。原文稍后读已读值得跟进有用关注 LLM
01:11elvis@omarsar074°DeepMind 新论文提出 LLM 路由器的两个关键属性:行为分化(模型间输出不同)和表面形式重写稳定性(同一查询的不同表述应路由到同一专家)。实验表明,仅看准确率和成本可能掩盖无意义的路由(如冗余模型池或分配不一致)。论文编号 arxiv.org/abs/2607.09197,提供实用检查方法。论文DeepMind模型路由LLM推荐理由:DeepMind 这篇论文告诉你,别被路由器的漂亮数字骗了——模型都答一样或乱分配,路由就是摆设。原文稍后读已读值得跟进有用关注 DeepMind
23:39elvis@omarsar0精选该综述论文认为,LLM中常见的置信度校准、自我验证、知道何时停止及知道未知等行为实际上是元认知的不同方面。作者提出了一个全面的元认知地图,并分类了评估这些能力的方法与基准(如arxiv:2607.11881)。研究将这些能力与LLM的能力、可靠性和透明度联系起来,指出随着智能体任务周期变长,监控和调节自身推理成为衡量可靠性的重要方式。论文LLM元认知置信度校准推荐理由:这篇把LLM的自我认知行为串起来了,比如什么时候该停、知道自己不知道啥,对做可靠AI agent的人特别有用。原文稍后读已读值得跟进有用关注 LLM
22:48Martin Fowler@martinfowlerMartin Fowler 发布新文章,介绍 @unmeshjoshi 使用抽象和领域特定语言(DSL)来约束 LLM 代码生成的经验。通过为 LLM 设定明确边界,可减少生成代码中的错误。文章强调 DSL 能确保输出符合预期,提高代码质量。该方法适用于快速原型设计及生产级代码的生成。技巧Martin FowlerDSL领域特定语言推荐理由:Martin Fowler 分享了用 DSL 给 LLM 画好框框的技巧,能少踩不少坑,写代码更稳。原文稍后读已读值得跟进有用关注 Martin Fowler
12:33官方账号arXiv cs.AI@Gabrielle Kaili-May Liu, Areeb Gani, Jacqueline Lu, Jordan Thomas, Mark Steyvers, Arman Cohan这篇论文首次系统梳理了大型语言模型(LLM)的元认知研究现状。作者提出了一个分类框架,涵盖测量和评估元认知能力的方法与基准,如自一致性检测和校准评分。总结了提升LLM元认知的技术,包括提示策略和训练方法。讨论了元认知在提升LLM可靠性、透明度和安全性方面的应用与挑战。论文LLM元认知综述推荐理由:想了解LLM怎么学会自我反思?这篇综述盘点了最新进展,包括怎么测量和提升元认知,对研究AI透明度很有参考。原文稍后读已读值得跟进有用关注 LLM
12:16官方账号arXiv cs.LG@Esteban U. Vega Barajas该研究基于一个此前提出的教学评价反馈分类协议,该协议使用2019年的冻结嵌入在西班牙语语料上取得良好效果。研究者在三个表示世代(稀疏词特征、冻结Transformer嵌入、提示大语言模型)上重新测试,并将情感分类任务迁移到英语(使用45,000条评论的平衡语料与方面标注数据集对比)。结果显示,2026年的前沿模型在西班牙语最难任务上取得最高主题F1分数,但情感任务上没有对廉价模型表现出优势;模型选择成为部署决策而非方法属性。论文文本分类教学反馈跨语言迁移推荐理由:这篇论文验证了旧的教学反馈分类协议是否还能用,发现即使用最新的LLM也不一定有优势,选什么模型看预算就行。原文稍后读已读值得跟进有用关注 文本分类
11:54官方账号arXiv cs.LG@Yibo Hu, Ren Wang73°本文揭示多智能体系统中的分布式后门攻击,恶意负载被分割到多个智能体,使局部监控每个步骤都通过,但组合后形成攻击。作者形式化定义了“可观测边界”:若片段在监控视角下看似良性,则任何检测器都无法捕获。实验表明,局部监控在0.874 mean AUROC下无法检测到攻击,只有监控看到组合对象时才恢复信号。解码视图门控可阻断所有测试攻击,但需知道编码族。论文多智能体系统LLM后门攻击推荐理由:这篇论文用具体实验证明,多智能体系统里单独检查每个智能体的信息根本不够,分布式后门能让所有局部检查都正常,但组合起来就成攻击了。原文稍后读已读值得跟进有用关注 多智能体系统
11:03官方一手arXiv: DeepSeek@Tiancheng Ma, Nasir U. Eisty该研究基于Defects4J中10个真实bug(Lang 1、3-11),提出需求驱动流水线,比较5个LLM(DeepSeek-V3、Gemma-3n、Llama-3、Mistral-7B、Qwen-3)生成Java测试预言的正确性与泛化能力。实验表明LLM生成的预言与需求预言(REQ)的一致性高于与系统(SUT)的一致性,宏平均准确率、精确率、召回率和F1均报告,但不同bug和模型间方差显著。需求技术性/模糊性评分与预言准确率之间的相关性弱且置信区间宽,未发现可检测的线性关系。研究结论为初步可行性证明,旨在推动更大规模实证。论文Defects4JLLM测试预言推荐理由:这篇论文用10个真实bug和5个流行LLM测试了它们能否直接从业务需求写测试断言,发现效果还行但差异大。如果你想了解LLM在自动化测试中的实际能力,这篇值得看看。原文稍后读已读值得跟进有用关注 Defects4J
09:56官方账号arXiv cs.AI@Asher Sprigler, Yang-Yang Feng, Iftach Amir, Jonathan E. Bogard, Todd S Braver, Yi Ding, David Kinney, Yixue Zhao论文提出一个模块化、可扩展的评估框架,旨在系统评估和增强大语言模型在心理健康领域的对齐表现。该框架集成了正念、同情、非二元推理等沉思原则,可无缝接入新模型、评估指标和基准。实验重现了现有SOTA结果,并通过灵活组合模型、指标和基准实现公平交叉评估。框架设计领域无关,可扩展至决策、道德推理与人-AI协作等场景。论文LLM心理健康对齐推荐理由:一篇论文搞了个模块化框架,用沉思原则来评估和提升LLM在心理健康领域的对齐,还能套用到其他领域。原文稍后读已读值得跟进有用关注 LLM
09:29官方账号arXiv cs.LG@Sirine Ayadi, Sándor Daróczi, Stephan Günnemann, Bertrand Charpentier该论文系统评估了量化LLM在2、3、4、8比特位宽下的可靠性,涵盖不确定性、校准和鲁棒性三个维度,使用了六种不同量化方法。研究发现,模型性能随总比特数单调提升,但可靠性缩放呈非线性,4比特量化模型达到可靠性峰值。实验还表明,量化增强了LLM对字符级和词级自然扰动的鲁棒性。论文LLM量化可靠性推荐理由:论文用实验告诉你,4比特量化的LLM最靠谱,比8比特还稳,想省资源又想要可靠性可以照这个选。原文稍后读已读值得跟进有用关注 LLM
09:23官方账号arXiv cs.LG@Xiangxin Zhou, Jiarui Yao, Penghui Qi, Bowen Ping, Jiaqi Tang, Haonan Wang, Tianyu PangPPO通常使用采样标记重要性比率来稳定LLM强化学习的离策略更新,包括邻近准则和方向准则。DPPO改进了邻近准则但方向准则仍继承自PPO,其基于重要性比率的方向可能与散度变化不一致。本文提出预测性分歧掩码,通过闭式解预测策略梯度步骤对同一散度的影响,并针对生产环境中的Top-K词汇开发了两种轻量估计器。实验表明,该方法在多个模型尺度和精度设定下提升了RL训练效果。论文LLMPPODPPO推荐理由:这篇论文提出了一种更聪明的掩码方法,解决了PPO和DPPO在方向判断上的不一致,让LLM强化学习训练更稳定高效。原文稍后读已读值得跟进有用关注 LLM
09:21Jerry Liu@jerryjliu0LlamaIndex 创始人 Jerry Liu 在推文中赞同一种观点:企业利用数据的核心不在于训练模型,而在于将数据转化为模型可在推理时通过上下文使用的技能或工件。他指出训练模型耗时费力且需随基模型更新重复,且难以撤销。相比之下,通过提示词和编排利用模型推理时的易用性是 LLM 流行的部分原因。行业LlamaIndexLLM上下文学习推荐理由:LlamaIndex 创始人聊数据策略:别费劲训练模型,把数据做成上下文技能更划算。原文稍后读已读值得跟进有用关注 LlamaIndex
09:18官方账号arXiv cs.LG@Fabrizio Marozzo, Stefano Iannicelli该论文提出一种用大语言模型进行观点摘要的框架,结合多维分类(如情感、主题)和分层采样策略,先在Amazon产品评论、Tripadvisor酒店评论和X/Twitter帖子等数据集上筛选出紧凑且有代表性的意见子集,再通过定制提示生成平衡摘要。实验表明,该方法在保持语义的同时显著降低了Token使用量和计算成本,在内容覆盖、平衡性和语义保留上一致优于传统AI和标准LLM摘要基线。论文LLM观点摘要语义保留推荐理由:这篇论文找到了一个用LLM做观点摘要的新路子,能省下不少token,还能保留不同人的真实观点,比常规摘要方法更靠谱。原文稍后读已读值得跟进有用关注 LLM
09:12官方账号arXiv cs.LG@Shrestha Datta, Hongfu Liu, Anshuman Chhabra论文提出Weight-Adjusted Gradients方法,通过捕获权重与一阶梯度的交互来估计参数重要性。在GPT-2、Llama-2等模型上,WAG发现仅占0.3%的关键参数,修改它们会导致性能下降超过40%,而现有幅度剪枝准则遗漏了这一失效模式。该方法在混合专家模型分配、参数级遗忘、混合精度量化和知识编辑层选择等四类应用中展示了有效性。实验表明WAG统一了零阶与一阶信息,为分析、调试和控制LLM提供了新工具。论文WAGLLM参数重要性推荐理由:这篇论文提出了WAG方法,能精准定位LLM中那些一旦改动就会崩掉的关键参数,比传统重要性指标更灵敏,还顺手解决了专家分配、遗忘、量化等实际问题。原文稍后读已读值得跟进有用关注 WAG
02:15Jerry Liu@jerryjliu0精选Skyfall AI推出Morpheus,首个不重置的持久企业模拟平台,用于评估模型在真实动态环境中的持续学习能力。现有RL基准如Atari、OpenAI Gym、MuJoCo、Procgen均为游戏世界,每几分钟重置一次。团队测试了前沿LLM在Morpheus上的表现,结论是LLM不是持续学习者。AI产品MorpheusSkyfall AILLM10 个信源在谈事件专题推荐理由:Skyfall AI搞了个叫Morpheus的模拟环境,永不重置,专门测LLM能不能持续学习,结果发现它们根本不行。原文稍后读已读值得跟进有用关注 Morpheus
00:09shao__meng@shao__meng精选语音AI demo由STT→LLM→TTS组成,但生产系统需解决低延迟音频流、轮次检测、打断处理等编排问题。文章要求亚秒级往返延迟(STT+LLM+TTS+电话层≤1秒)、知识库有依据回答、实时上下文注入、转人工干净、不拨号可测试。方案用Telnyx AI Assistant Builder吸收管线,开发者仅写约15行FastAPI webhook。通过静态Instructions和Dynamic Variables拼接prompt,支持门户浏览器、真实PSTN号码、WebRTC三种测试方式。技巧TelnyxSTTLLM推荐理由:想搞生产级语音Agent?这篇拆了Telnyx的实战方案,15行webhook搞定上下文注入,还讲清了低延迟和测试细节。原文稍后读已读值得跟进有用关注 Telnyx
13:03Geek@geekbb一个Python玩具项目通过模拟神经化学浓度来生成机器人情绪。用户输入文字后,LLM将其转化为化学脉冲,进而驱动一块8x8 LED点阵脸做出对应表情。项目代码已开源在GitHub。技巧PythonLLMLED点阵推荐理由:用LLM把文字变化学脉冲,再让LED脸演情绪,创意满分,开源可玩。原文稍后读已读值得跟进有用关注 Python
11:38官方账号arXiv cs.LG@Kangwei Xu, Bing Li, Ulf Schlichtmann这篇论文讨论了LLM在电子设计自动化(EDA)前端设计中的应用,指出其可在HDL生成、测试台构建和设计空间探索等任务中作为统一接口。文章回顾了从局部辅助到自主代理执行的演变,并介绍了OpenClaw等先驱系统。还分析了LLM在电路生成和高级综合中提升设计质量的现有进展。最后,论文总结了集成LLM的关键挑战和未来机遇。论文LLMEDA芯片设计3 个信源在谈事件专题推荐理由:这篇论文系统梳理了LLM在芯片前端设计中的应用,从HDL生成到设计空间探索,还介绍了OpenClaw等代理AI方案,适合关注EDA与AI结合的读者。原文稍后读已读值得跟进有用关注 LLM
10:49官方账号arXiv cs.AI@Katherine Swinea, Kshitiz Aryal, Lopamudra Praharaj, Maanak Gupta论文提出VEXAIoT,一个基于LLM的多智能体框架,包含漏洞检测代理和攻击执行代理,用于自主发现和利用IoT环境中的漏洞。在IoTGoat和Metasploitable2的10个OWASP IoT攻击场景中测试,单次攻击成功率高达100%,平均执行时间低于2分钟。在总共260次攻击执行中,整体成功率为95.0%,其中IoTGoat环境94.5%,Metasploitable2环境96.7%。结果表明LLM驱动的代理可自动化IoT漏洞评估和渗透测试。论文VEXAIoTLLMIoTGoat推荐理由:用LLM代理自动挖IoT漏洞,成功率95%,两分钟一个攻击,省时省力。原文稍后读已读值得跟进有用关注 VEXAIoT
10:28官方账号arXiv cs.AI@Kiran Pala, Punam Silu, Lixun Yu该论文提出一个基于特征图的可解释框架,用于表示八种语言共160个习语的传统意义。每个习语通过二进制概念特征(如包含、隐藏、情感、社会等)进行标注,并使用Jaccard相似度构建加权图。社区检测显示习语按概念模式聚类而非按语言聚类,其结构符合认知语言学预测。该概念网络捕获了分布式嵌入中不存在的独特语义信息,可通过LLM自动标注扩展,并提升下游习语检测性能。跨语言迁移实验表明,仅凭概念相似性即可识别五种语系中的可接受翻译等价物,相比基于嵌入的基线有显著提升。论文习语表达跨语言概念网络推荐理由:这篇论文用图网络和概念特征来分析八种语言里的习语,发现它们按语义模式聚类而不是语言,还能用LLM自动标注,对做跨语言NLP和理解习语很有用。原文稍后读已读值得跟进有用关注 习语表达
09:56官方账号arXiv cs.AI@Chongyu Qu, Can Cui, Zhengyi Lu, Junchao Zhu, Tianyuan Yao, Junlin Guo, Juming Xiong, Yanfan Zhu, Yuechen Yang, Bennett A. Landman, Yuankai HuoSAGEAgent是一种基于LLM的临床智能体,能自主决定为每位癌症患者获取哪些诊断模态,平衡预测准确性与临床侵入性。它通过临床工具、情景记忆和语义记忆推理患者的诊断状态。在包含TCGA-LGG、TCGA-GBM和BraTS的胶质瘤队列中,使用四种诊断模态,SAGEAgent在保持竞争性生存预测准确率的同时,将平均获取负担降低了55%。论文SAGEAgent多模态生存预测推荐理由:这篇论文提出了SAGEAgent,它能像医生一样判断该给病人做哪些检查,在几乎不掉准确率的前提下把检查负担砍掉一半多,挺实用的。原文稍后读已读值得跟进有用关注 SAGEAgent
09:26官方账号arXiv cs.LG@Pan Li论文提出Rashomon解释范式,构建一组忠实预测的解释而非单个。提出RashomonLLM框架,使用解释-预测-反思代理工作流,在客户流失分类、临床生存回归和工业点击预测三个任务上验证。RashomonLLM在准确率和解释质量上均显著优于SOTA基线,增益由解释忠实性驱动。该方法对分布偏移、时间分割和随机种子鲁棒。论文RashomonLLMRashomon解释集可解释AI推荐理由:这篇论文打破了‘解释会牺牲准确率’的旧观念,用RashomonLLM让大模型自动生成解释还能反过来提升预测,三个真实场景实测都更强,研究很扎实。原文稍后读已读值得跟进有用关注 RashomonLLM
04:40Harrison Chase@hwchase17LLM Wiki网络研讨会视频已在YouTube上线。主要内容包括两个洞察:Wiki作为缓存(常用信息优先组织)和Wiki作为超链接页面集合。讨论从字符串到文件、目录再到超链接的记忆演变路径。作者认为超链接页面方式可规模扩展,类似互联网结构。行业LLMWiki知识管理推荐理由:hwchase17总结了两个关于Wiki的巧妙观点,帮你重新思考知识库的组织方式。原文稍后读已读值得跟进有用关注 LLM
18:08AI Will@FinanceYF5该视频教程通过5个阶段(LLM入门、Transformer架构、训练过程、模型现代化改造、扩展)完整演示如何从零构建大语言模型。作者全程边讲边敲代码,覆盖ChatGPT、Claude等模型的核心原理。视频时长3小时,代码全程可见,适合想深入理解LLM工作原理的开发者。技巧LLMTransformer训练过程推荐理由:想搞懂ChatGPT和Claude怎么造出来的?这个3小时教程从零敲代码,全程干货,比看书快多了。原文稍后读已读值得跟进有用关注 LLM
12:18官方账号arXiv cs.AI@Yifan Zhou, Qihao Yang, Yan Li, Donggang Li, Xiru Hu, Hokin Deng, Ziyang Gong, Xuanyi Zhou, Huacan Wang, Xiangchao Yan, Wanghan Xu, Wenlong Zhang, Shaofeng Zhang, Yue Zhou, Yifan Yang, Zhihang Zhong, Xue Yang该论文提出IdeaGene-Bench (IG-Bench)基准,包含1,961条黄金谱系轨迹、1,085个Idea Genome对象和920个pairwise GenomeDiff记录,覆盖10个科学领域。IG-Exam含42个任务类型、1,029个实例,用于封闭式谱系推理;IG-Arena使用种群进化得分(PES)评估生成质量。在14个LLM科学家的测试中,最强系统仅达到27.3%的精确准确率,且结构化谱系上下文会打乱模型排名。该研究揭示了当前AI在科学思想继承与变异推理上的组合瓶颈。论文IdeaGene-Bench科学谱系推理想法生成推荐理由:这篇论文拿IdeaGene-Bench测了14个LLM,最强也只有27.3%准确率,而且加谱系信息反而搞乱排名。想看看AI离真正理解科学进化还有多远?读它。原文稍后读已读值得跟进有用关注 IdeaGene-Bench
12:13官方账号arXiv cs.AI@Emanuele Quinto, Carlo Andrea Rozzi, Francesco Zanitti论文提出一种Lisp启发的概念模型,使用符号形式、对象身份和live-image思想解释LLM中介工作流。核心区分derive(确定性计算)和infer(LLM判断),并将工作流定义、实例、推理记录等作为持久知识对象存储在共享知识基板中。该模型使工作流本身成为可检查、可恢复、可审查的知识对象。论文LLMLisp工作流推荐理由:这篇论文把工作流本身当成可持久化的知识对象,用Lisp概念讲LLM工作流语义,挺有启发。原文稍后读已读值得跟进有用关注 LLM
12:12官方账号arXiv cs.AI@Baha Rababah, Cuneyt Gurcan Akcora, Carson K. Leung该论文提出了正确性一致性(correctness agreement)指标,用于衡量基础模型与量化变体在正确预测上的重叠程度。在8-bit至2-bit的多种量化方案下,发现即使任务性能看似保持,中等量化也会导致行为分歧。分析表明查询和键投影的敏感性高于值和输出投影,揭示了低比特宽度的非线性断点。这些发现指出仅依赖准确率和困惑度会掩盖量化的真实影响。论文LLM量化模型评估推荐理由:这篇论文用新指标发现,量化后的模型即使分数不变,行为也可能跑偏,搞模型部署的同学建议看看。原文稍后读已读值得跟进有用关注 LLM
11:48官方账号arXiv cs.LG@David González-Martínez, Shiwei LiuSLORR是一种无需修改架构、无需SVD的低秩正则化框架,基于Hoyer稀疏度量和核范数两种变体。在ImageNet-1K上对ResNet-50、ViT-B/16和ViT-L/16进行短时继续训练,对ResNet-18进行预训练,SLORR在引入不到8%训练开销的同时提升了可压缩性。在135M和560M参数的LLM预训练中,SLORR-Hoyer使压缩模型性能显著优于未正则化模型,平均训练开销低于1%。论文SLORR低秩正则化模型压缩推荐理由:想压缩模型又不想掉太多精度?SLORR在训练时加低秩正则化,开销很小,效果很好,值得一试。原文稍后读已读值得跟进有用关注 SLORR
09:38官方账号arXiv cs.AI@Eugene Ng Yi Sheng, Bingquan Shen本研究通过多智能体市场模拟,实验了18个使用DeepSeek-V3模型的LLM代理在约束社交网络中交易的情景。在200轮实验中比较了8种机制,发现Mediation机制表现最佳。通过迭代优化提示的LLM驱动攻击进行对抗性测试,最强攻击(v6)仅使诚实代理效用降低13.3%,无法导致市场崩溃。研究证实Mediation机制在持续对抗压力下仍能维持市场稳定。论文DeepSeek-V3Mediation智能体推荐理由:这篇论文用DeepSeek-V3模拟了18个AI代理的市场,发现加入调解机制能抗住攻击,效用只降13%但市场不会崩盘。原文稍后读已读值得跟进有用关注 DeepSeek-V3
09:31官方账号arXiv cs.AI@João Matos, Olivia Buege, Donny Cheung, Gary S. Collins, Paula Dhiman, Nan Li, Bingyu Mao, Benjamin W. Nelson, Michail Ouroutzoglou, Paul Varghese, Jonathan Amar该论文分析了2053个真实患者与AI聊天机器人的对话,发现用户交流模式和情绪表达差异显著。研究开发了患者模拟器,分别建模临床内容、情感状态、对话策略和交流风格。在15位人类评分员的图灵测试中,模拟对话与真实对话几乎无法区分,准确率仅55%。使用5种患者角色和1164个临床医生评分案例,评估了4个LLM的紧急评估性能,发现交流风格显著改变分诊结果。论文LLM健康聊天机器人患者模拟器推荐理由:别只看用理想病人测AI的论文,这篇用2053个真实对话发现,交流风格直接改变分诊结果,准确率才55%!原文稍后读已读值得跟进有用关注 LLM
20:49Aadit Sheth@aaditshAI时代,核心技能从回答问题转向提出正确问题。Groq创始人Jonathan Ross通过让用户在X上提问测试其推理硬件,实现爆火。一条展示LLM在Groq上快速运行的视频引发病毒传播,用户生成个性化答案产生魔力。AI产品Groq推理模型提问技巧推荐理由:Groq用‘让用户自己提问’这招,一条推特就火了,教你如何抓住AI时代的本质技能。原文稍后读已读值得跟进有用关注 Groq
11:21官方账号arXiv cs.AI@Victor Giannakouris, Immanuel TrummerJailbreak 是一种新方法,通过直接读取 PostgreSQL 和 MySQL 存储文件实现数据库绕过,避免 JDBC/ODBC 驱动的性能瓶颈。它利用 LLM 辅助代码合成,从数据库文件格式的源代码和文档中再生出表读取组件。在 TPC-H 基准测试中,Jailbreak 生成的读取器将数据输出为 Apache Arrow 格式,可直接被 DuckDB、Apache Spark、cuDF 等引擎消费,端到端分析吞吐量提升最高达 27 倍。论文验证了该方法在 PostgreSQL 和 MySQL 之外对其他文件格式已知的数据库系统具有通用性。论文JailbreakLLMPostgreSQL推荐理由:这篇论文提出了 Jailbreak,用 LLM 直接读数据库存储文件,不用 JDBC,TPC-H 测试下最高快 27 倍。搞大数据分析的人可以看看。原文稍后读已读值得跟进有用关注 Jailbreak
09:18官方账号arXiv cs.AI@Kaicong Huang, Meng Ma, Ruimin KeCARLA-GS是一个模块化角落情况合成框架,将视觉表示、语义推理和物理执行解耦但保持耦合。它利用多智能体LLM进行场景推理,生成意图级路径点轨迹,并由PID控制器在CARLA中实现运动控制,最终将车辆状态重投影到高斯场景中渲染。在Waymo Open数据集上,CARLA-GS能生成与语义意图一致且物理可行的真实感视频。定量和定性实验证明了其可控性及时空一致性。论文CARLA-GSWaymo Open DatasetLLM推荐理由:这篇论文提出CARLA-GS,用多智能体LLM做推理、PID控制确保物理可行,在Waymo数据上生成逼真角落场景,解决了端到端方法时空不一致的痛点。原文稍后读已读值得跟进有用关注 CARLA-GS