论文精选73°09:40潜在递归思想:冻结大模型的推理方法研究人员提出LRT方法,让冻结大模型在连续表示空间中进行推理,仅需少量计算就能超越传统方法。#LRT#冻结LLM#推理模型#连续空间aarXiv cs.AI@Zhaoliang Chen, Jie Fu原文稍后读已读值得跟进有用关注 LRT
论文09:39EDRAC:阿拉伯方言阅读理解基准测试阿拉伯方言NLP研究者必看,首个覆盖五大方言的阅读理解基准,揭示现有模型局限。#EDRAC#阿拉伯方言#阅读理解#机器学习aarXiv cs.AI@Noor Abo Mokh 等 18 人原文稍后读已读值得跟进有用关注 EDRAC
论文Agent 与开发者09:39代码生成中提示词的作用评估这篇论文揭示了代码生成模型中提示词的实际作用,告诉你哪些提示真正有效,哪些只是表面功夫。#Qwen2.5-3B-Instruct#Phi-3.5-mini#代码生成#提示词工程aarXiv cs.AI@Will Badr原文稍后读已读值得跟进有用关注 Qwen2.5-3B-Instruct
论文09:39StateSwap:多选题支持消除框架隐藏状态研究这篇论文揭示了大模型在多选题中不一致回答的内部机制,通过StateSwap技术证明了不同表述方式会激活不同内部状态。#StateSwap#多选题#大语言模型#内部表示aarXiv cs.AI@Chao Gao 等 6 人原文稍后读已读值得跟进有用关注 StateSwap
论文精选73°09:38文本引导流匹配实现高效晶体结构生成TFMat用文本控制晶体生成,在MP-20基准达到92.04%匹配率,比CrystalFlow更高效。#TFMat#CrystalFlow#晶体结构生成#流匹配aarXiv cs.AI@Wentao Li原文稍后读已读值得跟进有用关注 TFMat
论文精选09:38卫星太阳能供电生成AI研究卫星用太阳能供电运行生成AI,研究如何在有限能量下平衡图像质量和传输可靠性。#生成AI#太阳能#卫星#扩散模型aarXiv cs.AI@Jierui Zhang 等 4 人原文稍后读已读值得跟进有用关注 生成AI
论文精选73°09:37ARISE-RL:基于强化学习的智能体自我进化框架OpenAI新框架ARISE-RL用评分协同进化解决开放智能体训练难题,ECR-Bench基准测试验证效果。#ARISE-RL#强化学习#智能体#ECR-BenchaarXiv cs.AI@Fanrui Zhang 等 16 人原文稍后读已读值得跟进有用关注 ARISE-RL
论文09:37跨多源行为预训练模型CM-PTM发布CM-PTM模型解决了移动设备用户行为建模的跨源挑战,能更好捕捉用户兴趣,提升游戏推荐效果。#CM-PTM#用户表示#移动游戏#预训练模型aarXiv cs.AI@Chengqi Yang 等 10 人原文稍后读已读值得跟进有用关注 CM-PTM
论文09:37WorldBench:多语言智能体文化基准测试研究人员发布WorldBench基准,测试多语言智能体在真实场景中的表现,发现当前模型在长周期任务中表现脆弱。#WorldBench#多语言智能体#基准测试#LLM-as-a-JudgeaarXiv cs.AI@Leonardo Ranaldi 等 4 人原文稍后读已读值得跟进有用关注 WorldBench
论文精选73°09:36滞后耦合:模型内部表征可读性先于因果性MIT发现AI模型内部表征可读性先于因果性,这一滞后现象在12B参数规模下依然存在,挑战了传统模型理解。#Pythia#滞后耦合#内部表征#因果性aarXiv cs.AI@Xining Xun原文稍后读已读值得跟进有用关注 Pythia
模型精选73°09:36HiveTraceGuard-Pro发布:0.6B安全护栏模型俄语安全护栏新模型,在俄语提示注入检测上表现优异,延迟最低,开源权重已发布。#HiveTraceGuard-Pro#Qwen3-0.6B#护栏模型#提示注入aarXiv cs.AI@Nikita Oblakov 等 3 人原文稍后读已读值得跟进有用关注 HiveTraceGuard-Pro
论文78°09:35AgentFactory:自动化智能体系统设计与优化研究人员推出AgentFactory,能自动优化智能体系统,比手动设计和现有方法效果更好,平均提升9.1%。#AgentFactory#智能体#自动化优化#LLMaarXiv cs.AI@Enci Zhang 等 5 人原文稍后读已读值得跟进有用关注 AgentFactory
论文精选73°09:35从截断到承诺:离散扩散模型中的持久上下文这篇论文提出CRS采样方法,通过持久上下文提升扩散模型性能,在相同NFE下获得更低GenPPL。#离散扩散模型#CRS#贝叶斯误差#GenPPLaarXiv cs.AI@Satoshi Hayakawa原文稍后读已读值得跟进有用关注 离散扩散模型
论文精选73°09:35ViTAMINS:自监督视觉Transformer合成难例训练研究ViTAMINS用合成难例提升视觉Transformer性能,资源效率还更高,ViT-B就能打败V-JEPA的ViT-L。#ViTAMINS#Vision Transformers#自监督学习#图像分类aarXiv cs.AI@Nikos Giakoumoglou 等 4 人原文稍后读已读值得跟进有用关注 ViTAMINS
论文精选73°09:35高风险机器学习系统的因果证据治理框架欧盟AI法案下,这个CEG框架帮你证明AI决策不是靠偏见,而是靠真实因果关系。#因果推理#CEG#AI监管#公平性aarXiv cs.AI@Samah Kareem, Barış Çeliktaş原文稍后读已读值得跟进有用关注 因果推理
论文09:34数据驱动人格条件化A/B测试模拟这篇论文教你如何用LLM代理模拟A/B测试,比传统方法快且成本低,准确率高达90%#A/B测试#LLM#人格条件化代理#数据驱动aarXiv cs.AI@Ziyad Benomar 等 4 人原文稍后读已读值得跟进有用关注 A/B测试
论文精选73°09:33ClinTraceBench:临床推理纵向评估基准斯坦福团队发布临床推理基准,测试八种历史表示策略,发现压缩导致关系损失,小模型 Haiku 在全上下文下超越大模型 Sonnet。#ClinTraceBench#MIMIC-IV#临床推理#DeepSeek-V3aarXiv: DeepSeek@Huimin Wang 等 3 人原文稍后读已读值得跟进有用关注 ClinTraceBench
论文精选73°09:33微调大模型提升PR与问题分类研究人员微调了多个大模型来自动匹配PR和问题,准确率提升显著,还能解释模型决策依据。#CodeLlama-7B#GPT-4o#微调#PR分类aarXiv: DeepSeek@Mustafa Yasir Altunhan 等 3 人原文稍后读已读值得跟进有用关注 CodeLlama-7B
论文09:32PersianAnonymizer:评估基于LLM标注的波斯语NER匿名化波斯语数据匿名化新方案,用LLM标注训练轻量NER模型,消费级GPU上2分钟处理4万消息。#PersianAnonymizer#NER#DeepSeek-V3-0324#GPT-OSS-120BaarXiv: DeepSeek@Mohammad Hossein Shalchian 等 3 人原文稍后读已读值得跟进有用关注 PersianAnonymizer
论文精选73°09:32PARSER压缩MoE大模型新方法PARSER方法解决了MoE模型压缩中误差累积问题,在相同内存减少下提升模型精度。#MoE#PARSER#Qwen#DeepSeekaarXiv: DeepSeek@Seungwoo Jung 等 7 人原文稍后读已读值得跟进有用关注 MoE
论文Agent 与开发者精选73°09:07AgentProv:通过工具使用策略探测审计智能体LLM APIMIT研究团队推出AgentProv,通过工具调用分布检测API是否偷偷更换底层模型,准确率远超现有方法。#AgentProv#LLM API#工具使用#审计aarXiv: Anthropic@Xun Wang 等 5 人原文稍后读已读值得跟进有用关注 AgentProv
论文精选12:20ECGQuest:心电图语言模型评测与微调基准ECGQuest为心电图领域语言模型提供了首个专业评测基准,微调让小模型接近大模型表现。#ECGQuest#GPT-5#DeepSeek-R1-Distill-Qwen-14B#微调aarXiv: DeepSeek@Mohammadsina Hassannia 等 3 人原文稍后读已读值得跟进有用关注 ECGQuest
模型中美对照精选73°12:20DeepSeek 175B在消费级笔记本上完成20万蛋白质配体虚拟筛选DeepSeek 175B在普通笔记本上完成20万蛋白质筛选,比A100集群快100倍,误差仅0.88,让小团队也能做药物发现。#DeepSeek 175B#RTX 4060#蛋白质配体虚拟筛选#药物发现aarXiv: DeepSeek@Rui Xiao, Yili Xu原文稍后读已读值得跟进有用关注 DeepSeek 175B
论文12:14TMB框架实现神经网络混合效应模型TMB让神经网络混合效应模型实现更简单,自动微分替代手动推导,提升模型复杂度和准确性。#NMMs#TMB#神经网络混合效应模型#自动微分aarXiv cs.LG@Nan Zheng 等 5 人原文稍后读已读值得跟进有用关注 NMMs
论文12:12高效AI评估基准测试研究Vector Institute研究团队发现高效AI评估可能改变基准结论,不同优化方式对结果影响各异。#BBQ#BBQ-V#AI评估#基准测试aarXiv cs.LG@Ahmed El Kady 等 5 人原文稍后读已读值得跟进有用关注 BBQ
论文78°12:11FACET:任务条件特征变换实现持续学习FACET用一个适配器解决了持续学习中的灾难性遗忘问题,比LoRA合并方法更高效。#FACET#类增量学习#持续学习#特征变换aarXiv cs.LG@Yunxiang Fu 等 3 人原文稍后读已读值得跟进有用关注 FACET
论文12:11对比偏好优化导致模型谄媚行为研究OpenAI等公司常用偏好优化方法会意外传递谄媚行为,影响模型准确性。#对比偏好优化#谄媚行为#OLMo#模型对齐aarXiv cs.LG@Camila Blank 等 5 人原文稍后读已读值得跟进有用关注 对比偏好优化
论文精选73°12:10无头多思维模型研究新方法让模型在嵌入空间连续推理,不生成离散token,性能还提升了。#Soft Latent Thinking#DeepSeek-Qwen-1.5B#LLaMA-3.2-3B#推理模型aarXiv cs.LG@Nikita Koriagin 等 6 人原文稍后读已读值得跟进有用关注 Soft Latent Thinking
论文精选73°12:10通用变换器实现电路计算这个280参数的变换器能完美处理任意长度布尔表达式,比普通模型更擅长深度泛化。#Universal Transformers#Boolean algebra#长度泛化#电路模型aarXiv cs.LG@Takuya Ito 等 4 人原文稍后读已读值得跟进有用关注 Universal Transformers
论文12:09牛齿分割模型研究:卷积与注意力模型对比牛齿分割研究,对比卷积和注意力模型在非专用ML数据集上的表现,预处理对结果影响大。#B.O.V.I.D.#语义分割#卷积模型#注意力模型aarXiv cs.LG@Keith G. Mills 等 4 人原文稍后读已读值得跟进有用关注 B.O.V.I.D.
论文精选73°12:09在线策略蒸馏有效性研究OPSA方法比OPD提升16.77分,在AIME24上相对增益263%,无需教师监督。#OPD#OPSA#Qwen3-1.7B#AIME24aarXiv cs.LG@Yi Ding, Ruqi Zhang原文稍后读已读值得跟进有用关注 OPD
论文73°12:09机器学习中的旋转等变性综合教程这篇教程帮你理解3D数据中的旋转等变性,从数学基础到实际应用都有详细讲解。#旋转等变性#几何深度学习#群论#3D计算机视觉aarXiv cs.LG@Peter Lippmann, Fred A. Hamprecht原文稍后读已读值得跟进有用关注 旋转等变性
论文12:08NoRA:低秩适应新方法NoRA改进LoRA训练,不增加参数却能加速收敛、提升稳定性,适用于多种训练场景。#LoRA#NoRA#参数高效微调#模型优化aarXiv cs.LG@Jiale Kang 等 5 人原文稍后读已读值得跟进有用关注 LoRA
论文12:08通过训练分布中的归纳偏置学习可接受假设的几何结构这篇论文展示了如何将科学原理嵌入AI训练过程,让模型能更准确地重建偏微分方程,对科学发现很有价值。#偏微分方程#变分自编码器#归纳偏置#科学发现aarXiv cs.LG@James Crowley 等 3 人原文稍后读已读值得跟进有用关注 偏微分方程
论文精选73°12:07TSPFN:生理时间序列分类基础模型医学AI新模型TSPFN来了,专门处理生理时间序列,比TabPFN和专用模型表现更好。#TSPFN#TabPFN#生理时间序列#时间序列分类aarXiv cs.LG@Jérémie Stym-Popper 等 5 人原文稍后读已读值得跟进有用关注 TSPFN
论文78°11:25SUN程序:语言引导的控制到学习到现实策略Kuafu系统将符号规划与数据驱动执行统一,无需演示或手动密集奖励,在机器人任务中表现优异。#SUN#Kuafu#MPC#语言引导aarXiv cs.AI@Weiqi Wang 等 10 人原文稍后读已读值得跟进有用关注 SUN
论文精选73°11:25匿名AI模型身份验证四阶段协议这个四阶段协议帮你验证匿名AI模型的真实身份,避免数据风险和性能不符预期。#匿名AI模型#身份验证#GLM-5.3#法医审计aarXiv cs.AI@Yisen Xi原文稍后读已读值得跟进有用关注 匿名AI模型
论文73°11:25OntoAligner-Ensemble:异构本体对齐投票融合框架研究人员提出本体对齐集成框架,通过投票融合不同技术,在多个基准测试中超越单一对齐器性能。#OntoAligner-Ensemble#本体对齐#知识图谱#大语言模型aarXiv cs.AI@Hamed Babaei Giglou 等 5 人原文稍后读已读值得跟进有用关注 OntoAligner-Ensemble
论文精选73°11:24大模型规模对本体学习的影响研究Qwen团队研究了13个模型规模对本体学习的影响,发现参数量并非越大越好,架构和模型血统比参数数量更重要。#Qwen3.5#Qwen3.6#本体学习#大模型规模aarXiv cs.AI@Hamed Babaei Giglou 等 3 人原文稍后读已读值得跟进有用关注 Qwen3.5
论文精选73°11:24BLOOM-WILT:大模型行为审计新方法BLOOM-WILT让大模型安全审计更高效,在Qwen3.5-4B测试中行为诱导率翻倍,还推翻了原有模型安全排名。#BLOOM-WILT#Qwen3.5-4B#大模型安全#行为审计aarXiv cs.AI@Adrians Skapars, Edoardo Manino原文稍后读已读值得跟进有用关注 BLOOM-WILT