13:10官方账号arXiv cs.AI@Campbell Lund, Thomas Euyang, Zanele Munyikwa, Marzieh Fadaee2023年Eloundou等人计算的GPTs暴露评分成为工作未来辩论的核心输入,该评分定义暴露为LLM能辅助的职业任务占比。论文指出其存在时间、地理和本体论局限,并调查了五类应对研究:动态和基准度量、集成方法、任务框架扩展、以工人为中心的指标、采纳和使用数据。研究-政策协调不足,政策分析仍引用静态评分而未采纳方法论更新。建议政策制定者拓宽证据基础,研究者采用参与式方法并构建数据基础设施。论文GPTExposure ScoresLLM推荐理由:这篇论文拆解了被广泛引用的GPT暴露评分到底靠谱不,指出静态评分的坑,还给出了五类改进方向,搞AI政策或研究的人值得一看。原文稍后读已读值得跟进有用关注 GPT
12:50官方账号arXiv cs.LG@Yujia Zheng, Vishal Verma, Mantej Gill, Haoyue Dai, Peter Spirtes, Kun Zhang该论文指出将大语言模型(LLMs)与因果发现结合时,若让模型直接推断因果关系,可能引入文本关联、提示伪影和幻觉机制等不可靠因素。作者主张代理(agents)的角色应局限于检查数据、检索上下文、解释方法假设和澄清图输出,而非提供边、方向、先验或因果结论。他们提出了causal-learn+在线平台,该平台围绕causal-learn算法生态系统协调数据分析、预处理、方法推荐、专家知识融入和形式化发现。在Big Five人格数据案例研究中,展示了代理辅助的因果发现流程,避免将语言模型的不可靠性转化为因果证据。论文causal-learn+LLM因果发现推荐理由:这篇论文给了一个清晰的边界:AI代理该帮什么、不该帮什么。causal-learn+平台演示了如何让LLM辅助分析数据,但不越界做因果推断。原文稍后读已读值得跟进有用关注 causal-learn+
12:03官方一手arXiv: DeepSeek@Xiang-Jun Ou, Shuang Liang, Xin-Yu Hu, Rong-Hao Huang, Jing Wang, Shao-Qun Zhang该研究提出一种粒度不确定性分类法,将LLM不确定性归因于输入级、参数级、词元级和解码过程四个源头。研究者将现有21种不确定性量化方法分为贝叶斯、集成、共识和单次推理四类,并在Qwen3、Llama 3.2和DeepSeek-V3三个模型家族上,使用TriviaQA、GSM8K和HumanEval基准进行实验。结果显示,共识方法(Deg和EigV)一致优于其他方法,且更大模型规模与更低不确定性估计相关。该工作为量化LLM不确定性提供了系统诊断工具。论文LLM不确定性量化Qwen31 个信源在谈事件专题推荐理由:这篇论文把LLM不确定性拆成四个层面,测了21种方法在多个基准上的效果,结论是共识方法最稳,模型越大越不模糊。原文稍后读已读值得跟进有用关注 LLM
11:10官方账号arXiv cs.AI@Weiwei Ye, Hangchen Liu, Dongyuan Li, Renhe Jiang论文提出PAPERCLAW,一个多智能体系统,可从研究领域自主生成完整论文。该系统通过实时文献、数据集和代码孵化想法,并利用假设地图的迭代“提出-测试-反思”循环推进,在证据支持结论时自动撰写符合会议格式的论文。PAPERCLAW支持全生命周期记忆,允许暂停、检查与恢复,并内置人机协作接口,使研究者可在任意阶段介入优化。评估使用LLM评判表明,PAPERCLAW在完全自主和人在回路两种模式下均能产出高质量论文。论文PAPERCLAW多智能体自主研究推荐理由:想用AI帮你从头到尾写论文?PAPERCLAW能自动搜文献、定假设、跑实验、写全文,你还能中途插手改方向。原文稍后读已读值得跟进有用关注 PAPERCLAW
11:08官方账号arXiv cs.AI@Alexander V. Kozachok, Alexander M. Nazimov, Shamil G. Magomedov论文将自然语言到DSL代码生成定义为Text2DSL新问题,并引入PolkitBench数据集,含4204对自然语言-Polkit规则对。实验在GigaChat-10B-A1.8B(18亿活跃参数)和Nemotron-3-Nano-30B-A3B(30亿活跃参数)两个MoE模型上测试。提供结构化上下文(BNF语法、API说明、允许标识符词汇)后,语法有效性达98.6-99.4%,结构有效性提升9.7-35.5个百分点,CodeBLEU分数提升60-95%。论文Text2DSLPolkitBenchDSL推荐理由:这篇论文定义了Text2DSL任务,带了一个4204条规则的数据集PolkitBench,还发现喂给模型语法规则能让代码生成质量暴增,不用微调。原文稍后读已读值得跟进有用关注 Text2DSL
10:55官方账号arXiv cs.AI@Saumya Biswas, Amrit De, Md Tauhidul Islam论文提出一个由大语言模型(LLM)编排的设计代理,用于硅绝缘体(SOI)2×2定向耦合器。LLM提出候选间隙值并判断收敛,频率域本征模求解器估算耦合系数κ,独立时域有限差分(FDTD)进行验证。两个求解器均基于相同的2D有效折射率模型,设计κ与FDTD响应之间残差对应一个固定额外耦合长度2.837 μm。该代理实现50/50分束器,FDTD测得的交叉分数为0.498(目标0.500),残差0.0017。结果在2D有效折射率模型内自洽,LLM经过多次尝试成功交付设计。论文LLMFDTD定向耦合器推荐理由:这篇论文让LLM指挥本征模和FDTD模拟自动设计定向耦合器,误差仅0.0017,省去手动调参的麻烦。原文稍后读已读值得跟进有用关注 LLM
10:38官方账号arXiv cs.LG@Aygün Varol, Katarzyna Kołodziej, Łukasz Sobczak, Michał Romaszewski, Przemysław Głomb, Naser Hossein Motlagh, Mirka Leino, Johanna Virkki这篇论文提出结构化提示构建框架,将原始空气质量和热舒适传感器数据转化为三种渐进的文本表示(原始值、阈值描述、环境摘要)。研究使用室内Raspberry Pi/BME680数据集和户外华沙等城市数据集,评估5个本地和5个云端LLM。在无思维链推理模式下,本地模型准确率从50.9%提升至81.7%(室内),从63.7%提升至89.3%(户外),平均延迟仅0.22秒。结果表明轻量级预处理可显著缩小边缘与云端的准确率差异。论文LLMIoT数据预处理边缘AI推荐理由:把传感器数据预处理成文字提示,小模型准确率能从50%涨到89%,延迟才0.22秒,不比云端差。原文稍后读已读值得跟进有用关注 LLM
10:36官方账号arXiv cs.LG@Muhammad Bilal, Ali Hassaan Mughal该论文分析了一个生产级租赁搜索助手,其自动化测试套件在六周内增长到1,553个测试用例。尽管套件持续通过,用户可见缺陷仍不断进入生产环境。研究检查了项目中所有252个bug修复提交,发现约44%的修复属于四个无法被组件级单元测试观察的接缝:实时浏览器运行时、非默认市场、端到端流程和全系统级别。一个缺陷因缺少接缝防护而两次发布。论文提出了四接缝框架和实测缺陷分布。论文LLM多市场Web应用推荐理由:这篇论文用252个真实bug数据,告诉你怎么测试全绿依然出bug,给所有做LLM应用的人敲响警钟。原文稍后读已读值得跟进有用关注 LLM
10:32官方账号arXiv cs.LG@Mathieu Delcluze, Léa Briand, Benjamin Chapus, Deniz Mekik, Guillaume Salha-GalvanDeezer在2025年部署了基于大型语言模型(LLM)的自动播放列表标注系统。该系统为Daily Mix功能生成自然语言描述,覆盖数百万用户。部署后用户参与度显著提升,表明语义描述如何影响用户对个性化推荐的感知。论文发表于arXiv,编号2606.22460v1。论文DeezerLLM播放列表生成推荐理由:Deezer用LLM给每日推荐写标题,百万用户真用上了,参与度还涨了——不是PPT,是上线产品。原文稍后读已读值得跟进有用关注 Deezer
10:24官方一手arXiv: OpenAI@Moran Koren该论文提出一种以验证为先的LLM辅助经济理论协议,并实例化为三种方法:单次严谨通道、对抗性验证器对(Claude Opus 4.8提议,OpenAI Codex反驳,作者仲裁)以及带评审门控的结构化多智能体项目。作者在一个开放示例——为Gans-Kominers等级膨胀模型设计Groves/Pigouvian激励相容机制——上评估该协议,三个运行均未产生严格直接揭示VCG/Clarke机制,对抗性通道自身证实了该点。结果揭示三个反复出现的现象:收敛发现、对抗验证的有效性、以及抛光不等于严谨。论文LLM经济理论验证协议10 个信源在谈事件专题推荐理由:这篇论文为你演示了如何用LLM做经济理论研究,重点不是让模型生成答案,而是设计验证流程来确保结果可靠,三种方法对比很清楚。原文稍后读已读值得跟进有用关注 LLM
03:45GitHub@githubGitHub与合作伙伴通过协作研究发现,基于LLM的上下文验证能显著提升秘密扫描告警质量。该方法将误报率降低75.76%,减少了安全团队处理大量无效告警的负担。研究结果表明,单纯增加告警数量并不能提高安全性,而智能验证才是关键。AI产品GitHubLLMsecret scanning推荐理由:GitHub发现用LLM做上下文校验能让密钥扫描告警更准,误报少了四分之三,安全团队不用天天看假警报了。原文稍后读已读值得跟进有用关注 GitHub
07:26Gary Marcus@GaryMarcusGary Marcus指出,大多数声称大量工作将很快消失的人是LLM公司高管,意在夸大产品价值。他引用自己2025年25条预测文章,准确预计当年不到10%(实际可能低于5%)的工作被替代。Justine Moore补充称,AI实际上正在创造工程岗位,构成叙事悖论。行业Gary MarcusJustine MooreAI工作替代推荐理由:Gary Marcus戳破LLM公司的裁员恐慌话术,还甩出了具体预测数据。告诉你别被炒作了,AI也在创造新岗位。原文稍后读已读值得跟进有用关注 Gary Marcus
11:06官方账号arXiv cs.LG@Sihui Dai, Mann Patel该论文通过混合良性合规示范(无害请求、有用回复)与有害合规示范(有害请求、有用回复),测试了三种关于示范组合如何导致有害合规的假设。在四个模型中,良性示范与有害示范不可互换:良性示范可能减少或增加有害合规,取决于模型。研究发现偏好优化是关键训练阶段,可防止良性示范增加有害合规;示范排序存在强烈的近因偏差;模型在拒绝与上下文学习交互时表现不同。论文LLMjailbreakdemonstration推荐理由:这篇论文解释了为什么不同的合规示范会以不同方式影响模型,帮你理解LLM的jailbreak机制,不只是实证而是分析原理。原文稍后读已读值得跟进有用关注 LLM
11:04官方账号arXiv cs.LG@Haw-Shiuan Chang, Jeffrey Gomez, Mehul Patwari, Aryan Sajith, Hamed Zamani这篇论文提出利用用户与LLM交互时的鼠标轨迹和眼动数据作为隐式反馈来替代昂贵的显式偏好标注。他们构建了IFLLM数据集,包含59名用户的1336个多轮问答,并记录了鼠标和眼动数据。基于这些隐式反馈训练的奖励模型将文本奖励模型的准确率从55%提升到64%。对8个LLM应用DPO后,响应质量相对提升近3倍,证明了隐式反馈在真实场景中的价值。数据集和代码已开源。论文IFLLMLLM隐式反馈推荐理由:别光看用户点了什么赞,鼠标和眼睛动的方向才是真心话。这篇论文用59人的眼动和鼠标轨迹数据训练奖励模型,准确率从55%飙到64,还开源了数据集。原文稍后读已读值得跟进有用关注 IFLLM
10:13官方账号arXiv cs.AI@Simon Aagaard Enni, Malthe Stavning Erslev, Karl-Emil Kjær Bilstrup, Kristoffer Laigaard Nielbo该论文提出'编辑对齐'作为参与式AI的设计实践,旨在让编辑专家参与重新对齐LLM界面以符合编辑标准。通过和北欧公共知识机构合作,设计并实现了LLM驱动的百科全书界面案例研究。论文将编辑标准视为设计制品,把编辑实践和价值观转化为技术对齐目标。最后讨论编辑对齐如何为编辑提供持续参与和代理权。论文编辑对齐参与式AILLM推荐理由:这篇论文通过具体案例展示了如何让编辑参与对齐LLM,帮助公共知识机构保持编辑标准,实操性强且有启发性。原文稍后读已读值得跟进有用关注 编辑对齐
10:11官方账号arXiv cs.AI@Huang Peng, Jiuyang Tang, Weixin Zeng, Hao Xu, Xiang ZhaoMACR针对LLM推理中参数知识与外部上下文之间的冲突,提出了一种显式消解机制。该方法首先用修改的语义熵衡量模型对答案的置信度,据此内部知识不足时再检索外部信息。然后引入三个专用智能体,分别归纳规则、分析潜在冲突并消解所有不一致。实验在多个基准上显著超过现有方法,并提供可解释的冲突消解过程。论文LLMMACR知识冲突推荐理由:这篇论文提出了MACR,能帮LLM自己判断知识是否可靠并解决矛盾,比过去的方法强不少,还能解释冲突。原文稍后读已读值得跟进有用关注 LLM
10:08官方账号arXiv cs.AI@Tingyue Pan, Mingyue Cheng, Daoyu Wang, Yitong Zhou, Jie Ouyang, Qi Liu, Enhong ChenScholarQuest 是一个基于超过1,000个计算机科学主题和四种研究意图(方法导向、场景锚定、比较型、范围控制)的学术论文搜索基准。该基准通过可扩展的答案构建和共享检索后端 ScholarBase 支持可重复评测。评测中最佳智能体方法在 Recall@100 上仅达0.314,在 Recall@All 上为0.355,表明搜索性能仍有巨大提升空间。研究还分析了搜索效率、意图级鲁棒性和失败案例。论文ScholarQuestLLM智能体推荐理由:想测你的LLM论文搜索智能体?ScholarQuest 给了1000多个主题和4种意图的标准测试,最强方法才0.314召回,你的能提多少?原文稍后读已读值得跟进有用关注 ScholarQuest
10:07官方账号arXiv cs.AI@Xinyi Zheng, Ling Shi, Tianlong Yu, Yongxin Zhao, Lorenz Goette, Kailong WangQMFOL是一个自动生成一元一阶逻辑推理任务的框架,可精确控制推理深度、宽度、标签类型和干扰项。基于该框架构建的QMFOLBench包含2880个实例、960种配置。在6个大型推理模型(LRMs)和2个LLM上的评估表明,逻辑复杂度增加时性能下降、计算开销上升。模型在True标签任务上表现优于False或Unknown任务,且对语义变化敏感。论文QMFOLLLM推理推荐理由:这篇论文提出了一个更好的推理测试方法QMFOL,能精细控制逻辑难度,用来测LLM推理能力更准。原文稍后读已读值得跟进有用关注 QMFOL
02:52官方一手Cloudflare Blog@Grant Bourzikas精选Cloudflare博客详解其多阶段漏洞发现工具的技术架构,包括状态控制机制、通过对抗性审查将误报率降低90%的方法,以及如何绕过LLM上下文长度限制(如4k token限制)。该工具实现自动化分类,每日可处理超过10万条告警。文章还公开了其基于GPT-4的分阶段提示词模板和缓存策略。技巧Cloudflare漏洞检测自动化推荐理由:Cloudflare公开了他们内部用的漏洞检测工具怎么做,从状态管理到对抗审查都讲了,想自己搭自动化安全工具的可以抄作业。原文稍后读已读值得跟进有用关注 Cloudflare
11:59AI Will@FinanceYF5根据Olivia Moore分享的数据,LLM(大语言模型)目前为Walmart和Target等顶级零售商贡献了接近2%的推荐流量。这一比例在过去一年中增长了三倍多。其中,电子产品、家居与花园等研究密集型类别的AI推荐流量增幅最大。行业LLMWalmartTarget推荐理由:AI现在真的能帮你买东西了!LLM给Walmart、Target带来的推荐流量一年涨了三倍,电子产品最明显,做决策前让AI推荐更靠谱。原文稍后读已读值得跟进有用关注 LLM
11:58AI Will@FinanceYF5据最新数据,LLM(大语言模型)已为Walmart、Target等顶级零售商贡献近2%的推荐流量。这一比例在过去一年增长了3倍多。流量增长最明显的品类是电子产品和家居园艺,均为研究决策较重的品类。行业LLMWalmartTarget推荐理由:想知道LLM怎么帮沃尔玛、塔吉特带货的吗?推荐流量占比快2%,一年翻三倍,电子产品最吃香。原文稍后读已读值得跟进有用关注 LLM
10:58官方账号arXiv cs.AI@Linus Sander, Habtom Kahsay Gidey, Alexander Lenz, Alois Knoll该论文提出一个包含对手方、负载、交互状态、发现机制和模式灵活性5个维度的分类法,对9个活跃维护的开源协议进行迭代分析。研究发现所有智能体间协议均结合混合负载与会话状态持久化,多数协议支持多个预定义模式,两个协议在运行时协商模式,显示模式灵活性趋势。去中心化发现仍属罕见。短期看协议将趋同统一智能体间与智能体-上下文通信,长期则可能发展为分层协议栈。论文LLM通信协议智能体推荐理由:这篇论文把9个主流的智能体通信协议拆成5个维度做分类,告诉你哪种协议适合什么场景,以及未来会怎么演进。如果你在做多智能体系统,想选协议或者设计协议,这篇很有参考价值。原文稍后读已读值得跟进有用关注 LLM
10:57官方账号arXiv cs.AI@Ikram Belmadani, Oumaima El Khettari, Carlos Ramisch, Frederic Bechet, Richard Dufour, Benoit Favre该研究以法语医疗问答为案例,比较了持续预训练(CPT)、监督微调(SFT)及其组合在Llama 2、Mistral、Bloom三个模型家族、7B-70B多种规模和三种初始化类型上的效果。对于多项选择问答(MCQA),CPT+SFT通常得分最高,但相对于单独SFT的提升很小且常不显著,SFT成为强且成本效益高的默认选择。对于开放问答(OEQA),CPT一致提升基于重叠的指标(如BLEU、ROUGE),而SFT常降低生成质量;指令微调和CPT+SFT在LLM评估中更受偏好。跨语言实验显示,法语适应可有效迁移到英语基准(如MedQA)。论文LLM医疗领域领域适应推荐理由:这篇论文用扎实的数据告诉你,在医疗领域微调模型时SFT性价比最高,CPT对开放问答有帮助但别盲目上全套,省钱又省力。原文稍后读已读值得跟进有用关注 LLM
10:57官方账号arXiv cs.AI@Haodong Chen, Xuanhe Zhou, Wei Zhou, Xinyue Shao, Yanbing Zhu, Bo Wang, Jiawei Hong, Anya Jia, Fan WuX+Slides 是一个评估大语言模型根据受众条件自动生成幻灯片的新基准。它覆盖 113 个主题和 7 种演示场景,使用 8133 个去重、基于源文本的探针,并引入四个互补指标:Audience Coverage、Domain-wise Coverage、Efficiency 和 Correctness。在 DeepPresenter、SlideTailor 和 NotebookLM 上的实验表明,在 τ_A=0.7 阈值下,NotebookLM 消融版达到最高 Audience Coverage 0.853,而 DeepPresenter 为 0.714,SlideTailor 为 0.594。结果显示当前系统仍无法完整恢复受众关键信息,且视觉质量不能替代源文本验证。论文X+SlidesLLM幻灯片生成推荐理由:想了解如何科学评估AI做PPT的水平?这篇论文用113个主题和8133个探针,测出NotebookLM能覆盖85%的受众关键信息,比DeepPresenter和SlideTailor强不少。原文稍后读已读值得跟进有用关注 X+Slides
10:56官方账号arXiv cs.LG@Sanghyeok Choi, Henry Gouk, Esmeralda S. WhitammerLarge Language Gibbs 是一种利用大型语言模型条件分布进行结构化概率推理的MCMC方案。该方法通过迭代重采样单个变量避免单次自回归生成的顺序偏差,产生的平稳分布反映所有局部条件之间的折中。在合成分布采样、一致性推理和贝叶斯结构学习任务上验证了有效性。结果表明LLM条件作为MCMC转移算子可替代单次生成进行结构化推理。AI模型Large Language GibbsLLMMCMC推荐理由:这篇论文提出用LLM做MCMC采样,比直接生成更鲁棒,适合复杂推理场景,值得做概率建模的人看看。原文稍后读已读值得跟进有用关注 Large Language Gibbs
10:43官方账号arXiv cs.AI@Soheyl Bateni, Maryam AbdolaliClaMPAPP系统将LLM用作特征提取接口,而非直接诊断引擎,对自由文本病历进行模式约束提取后经确定性检查,再输入XGBoost分类器。该系统在两个德国医院独立儿科阑尾炎队列上评估,性能优于端到端LLM基线(包括开源和专有模型)。在内部和外部验证中,ClaMPAPP实现了最强整体诊断性能,并最小化漏诊阑尾炎病例。端到端LLM在敏感度-特异度权衡和叙事重排下表现更不稳定。论文ClaMPAPPLLMXGBoost推荐理由:这篇论文提出了一个实用设计:用LLM理解病历文本,但把最终判断交给更可靠的机器学习模型,值得做临床AI的看看。原文稍后读已读值得跟进有用关注 ClaMPAPP
10:42官方账号arXiv cs.LG@Nahum Korda, Gadi EvronOpenAnt是一个开源漏洞发现系统,将静态程序分析与大语言模型推理结合,采用多阶段流水线。它通过代码分解将分析面减少97%,仅保留从外部入口可达的攻击相关代码。系统通过对抗验证模拟攻击者能力评估可利用性,并自动生成动态验证环境在沙箱容器中执行。在OpenSSL、WordPress和Flowise等开源项目评估中,OpenAnt识别了之前未知的漏洞,同时大幅降低误报率。论文OpenAntLLM漏洞发现推荐理由:OpenAnt把LLM和静态分析结合起来做漏洞挖掘,在三个知名开源项目里发现了新漏洞,误报还少,值得做安全的看看。原文稍后读已读值得跟进有用关注 OpenAnt
10:02官方账号arXiv cs.LG@Zilong Zhang, Yi-Ting Hung, Lei Ding, Chi-Kuang Yeh该研究将LLM作为评判者时的语速偏见等系统性偏差定义为问题核心。作者将有限人类监督下的LLM评估建模为正-无标记学习问题。提出基于部分最优传输(Partial Optimal Transport)的几何审计框架,无需重新训练即可识别人类一致偏好并纠正有偏评判者。实验表明该方法在提升与人类偏好一致性、增强对呈现偏差鲁棒性上优于现有流水线,并提供可解释的置信度估计。论文LLMLLM-as-a-Judge正-无标记学习推荐理由:想治治AI裁判的偏袒病?这论文用数学几何直接纠偏,不用重训模型,比调prompt靠谱多了。原文稍后读已读值得跟进有用关注 LLM
09:46官方账号arXiv cs.AI@Xhevahire Tërnava论文对10个vibe coded C/C++项目进行分析,发现制品内变体性近乎为零,所有变体决策集中在生成时。提出VbR(Variability by Regeneration)方法,让LLM作为推导引擎,为每个变体生成无死代码的二进制。用一个wc产品家族演示了完整流程。该工作首次将产品线思想引入AI生成代码的变体性管理。论文Vibe CodingVbR产品线推荐理由:这篇论文用10个C++项目分析了vibe coding的变体性问题,还提出了VbR方法让LLM直接生成无死代码的二进制,挺有启发的。原文稍后读已读值得跟进有用关注 Vibe Coding
09:42官方账号arXiv cs.AI@Fengying Ye, Yanming Sun, Runzhe Zhan, Zheqi Zhang, Lidia S. Chao, Derek F. WongG-IdiomAlign是一个新的基准测试,以Wiktionary的英语注释为锚点,专门评估跨语言习语对齐能力。它包含两个协议:带类型干扰项的多项选择习语等价测试,以及通过有无注释对比生成来隔离语义锚点效果。实验发现,多种LLM在低资源语言上普遍倾向于直译,这是主要失败模式。添加注释后,在基于嵌入的语义度量下生成质量有所提升,但绝对性能仍然有限,说明开放输出空间仍有较大改进余地。对Qwen3-8B的分析表明,差异更多集中在注意力头而非层上,且优质生成与更强的注释锚定相关。论文G-IdiomAlignQwen3-8BLLM推荐理由:这篇论文搞了个G-IdiomAlign基准,专门测AI能不能理解不同语言的习语。结果模型爱直译,加了注释能好点但还差得远,值得一看。原文稍后读已读值得跟进有用关注 G-IdiomAlign
09:40官方账号arXiv cs.AI@Yafeng Wu, Huu Hiep Nguyen, Thin Nguyen, Hung Le论文提出CADE框架,用于时间序列问答。该框架通过点式线性编码器和MLP投影器将每个时间步直接映射到LLM嵌入空间,避免分词瓶颈和固定窗格损失。引入单向监督对比损失对齐时间序列嵌入与冻结类名文本锚点。在Time-MQA基准上,CADE在六个TSQA任务中一致优于开源和闭源LLM基线。论文CADE时间序列问答LLM推荐理由:这篇论文提出CADE,解决了LLM处理时间序列时丢了数值信息的痛点,用直接时间步嵌入和对比对齐,在Time-MQA上比GPT-4还强。原文稍后读已读值得跟进有用关注 CADE
03:12官方账号LangChain@LangChainAIBenchling AI负责人@nlarusstone在LangChain发布的视频中提出,理解LLMs应借鉴生物学思维而非传统软件工程。他认为LLM的错误模式和调试过程与实验生物学类似,需要迭代测试和大规模观察。该观点引发业界对LLM可解释性本质的重新讨论。行业BenchlingLangChainnlarusstone推荐理由:Benchling的AI负责人用生物视角解释LLM的奇怪行为,比技术文档好懂,推荐看看他的原话。原文稍后读已读值得跟进有用关注 Benchling
03:04Gary Marcus@GaryMarcusGary Marcus重申LLM不可靠的观点,称无法被驳斥。特朗普政府要求Anthropic确保Fable 5的护栏不能被绕过,但安全专家表示不可能完全阻止规避。Marcus认为这是生成式AI的普遍问题,而非Anthropic一家的问题。WIRED报道引述了相关官员和专家的意见。行业GaryMarcusLLMAnthropic10 个信源在谈事件专题推荐理由:权威AI批评家Gary Marcus再次发声,直指LLM根本不可靠,加上特朗普政府与Anthropic的对峙,这场AI安全争议你必须了解。原文稍后读已读值得跟进有用关注 GaryMarcus
12:00官方账号arXiv cs.LG@Longlong Zhu, Jiashuo Yu, Zedi Chen, Yuhan Wu, Zhifan Jiang, Yuchen Xian, Yimeng Liu, Jiajie Su, Shaopeng Zhou, Xingyuan Li, Hongyan Liu, Xuan Liu, Dong Zhang, Chunming Wu, Xiang ChenOmniPlan采用基于大语言模型的解释器将异构自然语言意图转化为统一偏好向量,并利用混合专家架构动态选择MIP求解器、启发式算法和DRL模型作为专家。在分布式机器学习推理卸载任务(包括决策树、SVM、XGBoost等)的真实测试中,OmniPlan实现了近最优卸载,延迟降低高达97.8%,网络设备资源消耗降低11.5%。论文OmniPlanLLM混合专家架构推荐理由:OmniPlan用LLM和混合专家做网络优化,在分布式ML卸载上延迟降97.8%,资源降11.5%,效果很直观。原文稍后读已读值得跟进有用关注 OmniPlan
10:43官方账号arXiv cs.AI@Henry Bodwell, Hong Yang, John C. Simeone, Kelvin Gorospe, Bella Sullivan, Lana Huang, Jessica Gephart, Sandy Aylesworth, Molly Masterton, Naren Ramakrishnan论文提出IUU+DB系统,利用大语言模型(LLM)从异构文档中提取非法、未报告和未监管捕捞(IUU)及相关海鲜欺诈、劳工虐待事件信息。系统可分类是否相关,提取行为者、地点、物种、船舶、违规类型及执法结果等关键数据,并支持去重和趋势分析。案例验证表明,IUU+DB能帮助组织碎片化证据,识别地理和行为热点,为学术界、非政府组织、行业风险评估及政府政策执行提供支持。论文IUU+DBLLM非法捕捞推荐理由:这篇论文搞了个IUU+DB系统,用LLM自动从大量文档里挖出非法捕捞和海鲜欺诈的线索,能帮监管者和研究人员快速定位热点区域,挺实用的。原文稍后读已读值得跟进有用关注 IUU+DB
10:42官方账号arXiv cs.AI@Michèle Finck大型语言模型已能生成至少中位质量的法律文本,但现有法律AI评估仅测量辅助性任务,无法评价其是否执行教义性法律推理。欧盟AI法案对高风险司法AI要求“适当准确性”,却因缺乏教义性推理基准而无操作内容。这篇论文首次系统定义该测量空白,并呼吁建立对应的标准化评估。论文LLMEU AI Act法律推理推荐理由:这篇论文直击法律AI评测的核心缺陷——现有基准只测写文书,不测真正懂法理。做法律AI或合规的朋友值得看看。原文稍后读已读值得跟进有用关注 LLM
10:41官方账号arXiv cs.AI@Yuwei Zhang, Tong Xia, Bianca Emmerich, Yu Yvonne Wu, Dimitris Spathis, Xin Liu, Daniel McDuff, Cecilia Mascolo论文提出WEQA,一个查询自适应智能体框架,统一LLM推理与可穿戴分析及建模工具。它采用LLM控制器合成执行计划,动态路由查询至传感器分析与预训练模型组合,并借助外部知识进行响应审计。研究团队构建了涵盖四个公开可穿戴数据集、三个健康领域的基准。实验显示,WEQA比LLM和智能体基线准确率高出24%。一项由12名医学专家和8名用户参与的盲测表明,其在有用性和临床合理性上有显著提升。论文WEQA可穿戴健康数据医学问答推荐理由:这篇论文解决了大模型看不懂可穿戴数据的问题。WEQA框架比基线的准确率高出24%,还通过了医学专家盲测,做医疗AI的同学值得看看。原文稍后读已读值得跟进有用关注 WEQA
10:40官方账号arXiv cs.AI@Ziqi Zhou, Yubo Ye, Sumeet Atul Vadhavka, Linwei Wang, Zhiqiang Tao论文提出LEADS框架,利用LLM智能体在结构化动作空间中迭代发现混合物理-神经模型,解决传统方法需要专家手动设计且无法跨患者迁移的问题。在三种合成反应数据和真实心脏电生理数据上,LEADS均优于人工设计的混合模型和其他基于LLM的方法。该方法保证了模型的物理合理性、可解释性和数值稳定性,同时允许开放性的架构探索。论文LEADS心脏电生理数字孪生推荐理由:这篇论文用LLM智能体自动设计心脏数字孪生的混合模型,比人工靠经验搭的更准,还跨病人管用。合成和真实数据上都赢了其他方法。原文稍后读已读值得跟进有用关注 LEADS
10:17官方账号arXiv cs.LG@SongEun Kim, Seungyoo Lee, Edwin Fong, Hyungi Lee, Juho Lee论文发现LLM在多项选择问答中早期存在信念漂移,违背鞅性质。通过提出的提示预测重采样(PPR)方法,模型在多次重采样后信念自稳定并收敛。基于此,研究者进一步提出种子答案提示策略和自一致性损失微调方法。在多项选择QA基准测试中,这些方法显著减少信念漂移并提高预测一致性,且不牺牲准确性。论文LLM信念稳定性PPR推荐理由:这篇论文发现了LLM回答重复问题时信念会自己稳定,还给了两种让模型更一致的方法,适合关注推理可靠性的读者。原文稍后读已读值得跟进有用关注 LLM
09:45官方账号arXiv cs.AI@Manon Reusens, Sofie Goethals, David Martens该论文正式提出LLM消费者行为理论,作为分析LLM代理自主消费决策的新领域。作者结合经典与行为经济学及NLP进展,形式化人类偏好如何通过LLM代理反映并聚合为市场需求。论文梳理了关于LLM决策、人类行为模拟和偏好提取的碎片化文献,指出在代理市场中理性与异质性等传统假设可能失效。文章未提供实证验证,而是勾勒研究范围并识别对齐、偏好表示和市场动态等开放问题。论文LLM消费者行为经济学推荐理由:这篇论文把LLM当作消费决策的代理人来研究,从经济学角度提出了一个全新的理论框架,适合想了解人机交互市场动态的读者。原文稍后读已读值得跟进有用关注 LLM