19:34techcrunch@Jagmeet SinghBlacksmith是一家专注于AI代码测试的初创公司,其估值在不到一年内从约5500万美元跃升至5.5亿美元,增长近10倍。公司表示过去一年营收增长超过10倍。此轮融资由多家风投机构参与,资金将用于扩大团队和产品研发。Blacksmith利用AI自动生成测试用例,帮助开发者提高代码质量,减少手动测试时间。行业BlacksmithAI代码测试融资推荐理由:Blacksmith用AI自动写测试用例,一年营收翻十倍,估值冲到5.5亿美元,做开发的朋友可以看看这个方向。原文稍后读已读值得跟进有用关注 Blacksmith
19:32The Rundown AI@therundownaiAnthropic近日发布了一项新研究,聚焦于提升Claude模型在复杂任务中的表现。该研究引入了新的训练方法,使Claude在推理和代码生成任务上取得了显著进步。在多个基准测试中,Claude的得分超越了前代版本,接近GPT-4的水平。研究团队还公开了部分技术细节,为后续模型优化提供了方向。论文AnthropicClaude推理模型10 个信源在谈事件专题推荐理由:Anthropic发了新研究,Claude在推理和代码上又强了,接近GPT-4,想了解细节的可以看看。原文稍后读已读值得跟进有用关注 Anthropic
19:31The Rundown AI@therundownaiAnthropic宣布为Claude的输出添加AI水印,以增强内容可追溯性。Grok Bot成为最新的AI智能体队友构建工具。有教程展示如何用ChatGPT构建自定义Mac快捷方式系统。xAI联合创始人的River公司融资11亿美元,用于开发个人AI。行业AnthropicClaudeGrok Bot10 个信源在谈事件专题推荐理由:Anthropic给Claude加AI水印了,还有Grok Bot当队友,ChatGPT做Mac快捷方式,xAI创始人融资11亿搞个人AI,每条都挺有料。原文稍后读已读值得跟进有用关注 Anthropic
19:30IT之家(博客/媒体)吉利银河宣布AI全地形硬核SUV战舰700将于第四季度上市,展车本月中旬陆续到店。该车搭载吉利自研GVMC动态控制系统,官方称80公里/小时通过麋鹿测试,AI智能四驱支持前驱、后驱、四驱自动切换,集成蟹行、原地掉头、爆胎行驶等功能。车身长宽5085/1999mm,轴距2900mm,涉水深度800毫米。动力采用2.0T或1.5T插混系统,三电机四驱综合功率830千瓦,配47.14kWh宁德时代磷酸铁锂电池,CLTC纯电续航305km。底盘采用双腔空簧加CDC连续阻尼可调减振器。AI产品吉利银河战舰700AI四驱推荐理由:吉利银河战舰700要来了,四季度上市,展车本月到店。AI四驱能原地掉头、爆胎还能开,综合功率830千瓦,纯电续航305公里,硬核越野迷可以关注下。原文稍后读已读值得跟进有用关注 吉利银河
19:29Lovable@lovable_dev73°Lovable 宣布完成4亿美元融资,公司估值达到133亿美元。这笔资金将用于帮助用户实现更多目标。Lovable 是一家AI应用开发平台,允许用户通过自然语言构建应用。此次融资反映了市场对AI开发工具的高需求。行业Lovable融资AI应用开发推荐理由:Lovable 刚融了4亿美元,估值133亿美元,做AI应用开发的可以关注下。原文稍后读已读值得跟进有用关注 Lovable
18:58LovartAI@lovart_aiSeedance 2.5在Lovart平台正式上线,专为数字营销人员设计。该模型能在30秒内为单个AI模特生成50套不同服装。这一功能大幅提升了电商和广告素材的制作效率。Lovart平台现已支持该模型,用户可直接使用。AI产品Seedance 2.5Lovart视频生成推荐理由:做电商或广告的可以试试,Seedance 2.5在Lovart上30秒出50套服装,比传统拍摄快多了。原文稍后读已读值得跟进有用关注 Seedance 2.5
18:54Guillermo Rauch@rauchgAI SDK(@aisdk)每30天下载量约8050万次,增速超过所有AI实验室的SDK。该SDK已实现每周下载量突破2000万次。其核心优势在于开放且不绑定特定提供商。团队对帮助达成这一里程碑的开发者表示感谢。AI产品AI SDK下载量开发者工具推荐理由:AI SDK下载量涨得飞快,每周2000万次,比所有AI实验室的SDK都快,而且开放不锁供应商,做AI开发可以看看。原文稍后读已读值得跟进有用关注 AI SDK
18:53SuperTechFans(博客/媒体)法国将从8月11日起禁止未经消费者事先同意的电话营销,消费者可随时撤回同意。违规个人每次最高罚款7.5万欧元,企业最高罚款37.5万欧元,消费者可通过政府网站举报骚扰电话。该法律回应了约四分之三法国人每周至少接到一次推销电话的长期投诉,此前依赖的"不接听名单"系统被部分呼叫中心无视。德国已有类似禁令,而美国、加拿大、英国采用"选择退出"机制。新法引发摩洛哥担忧,其呼叫中心4万至5万个岗位面临风险,因法国市场占该行业收入80%以上。行业法国电话营销监管推荐理由:法国这次动真格了,8月11日起电话营销必须事先同意,违规企业最高罚37.5万欧元,摩洛哥4-5万呼叫中心岗位直接受冲击。原文稍后读已读值得跟进有用关注 法国
18:51Fireworks AI@FireworksAI_HQ精选Meta Superintelligence Labs 推出开源权重模型 Muse Glimmer,已上线 Fireworks 平台。该模型为 30B 稠密模型,专为持续运行的智能体设计,支持跨多次顺序工具调用进行推理并可从失败中恢复。Muse Glimmer 支持 128K+ 上下文,原生支持图像和文本输入。开发者可通过 Fireworks 平台开始构建应用。AI模型Muse GlimmerMetaFireworks推荐理由:Meta 新开源了个 30B 模型,专为智能体连续调用工具设计的,还能从报错里恢复,128K 上下文,想玩智能体的可以试试。原文稍后读已读值得跟进有用关注 Muse Glimmer
18:42官方一手arXiv: DeepSeek@Linhao Wu, Yizhou Chen, Zhen Yang, Pengyu Xue, Dan HaoCausalRepair是一个基于对话的自动程序修复框架,通过双切片策略构建最小因果上下文。静态切片净化测试语义,动态切片基于执行轨迹捕获精确运行时依赖。在Defects4J V1.2、V2.0和Defects4J-Trans上使用DeepSeek-V3评估,正确修复313个缺陷,优于ReinFix和TSAPR,平均修复成本降至0.029美元。论文CausalRepairDeepSeek-V3Defects4J推荐理由:想搞LLM自动修bug的可以看看,CausalRepair用双切片把上下文搞干净了,修复数比ReinFix多,成本还低。原文稍后读已读值得跟进有用关注 CausalRepair
18:41官方一手arXiv: DeepSeek@Chuqiao Lin, Shivaji Sondhi, Xiao-Liang Qi稀疏自编码器(SAE)常用于解释大语言模型行为,但区分表面词汇特征与真正高层特征一直困难。研究者提出特征非局域性(FNL),定义为SAE特征激活的逐位置影响熵,可在73%-84%的随机配对中正确区分上下文相关推理特征与词元驱动特征。在越狱缓解审计中,FNL发现多数有效特征实为低FNL的位置特征而非真正识别有害意图。在DeepSeek-R1-Distill-Llama-8B上,引导高FNL特征使MATH-500准确率提升4.6个百分点,优于低FNL特征,但效果因模型而异。论文SAEFNL稀疏自编码器推荐理由:想搞懂SAE特征到底抽没抽到抽象概念?这篇提出FNL指标,不用LLM打分就能测抽象度,还能帮你挑干预特征,实测提分4.6。原文稍后读已读值得跟进有用关注 SAE
18:40官方一手arXiv: DeepSeek@Beichen Huang, Zhenyu Liang, Bowen Zheng, Ran Cheng精选EvoX Genesis 框架将软件项目设为持久递归世界,本地智能体保持有限寿命,通过递归委派推进版本历史。基于 DeepSeek V4 Flash,Genesis 在 120 小时内构建了约 25 万行 Rust 的 C 编译器,花费仅 44 美元,通过完整 c-testsuite 及多数 LLVM 和 Csmith 测试。在 GLM 5.2 生成的编译器世界中,多次替换智能体后开发仍保持全部测试性能。Genesis 还将 13 个 MESA 模块(超 10 万行 Fortran)重写为约 9 万行 Rust,六个数值工作负载中位数加速 1.55 至 6.87 倍。结果表明,长期软件开发可围绕持久项目而非持久智能体组织。论文EvoX GenesisDeepSeek V4 FlashGLM 5.26 个信源在谈事件专题推荐理由:想低成本搞大型软件项目?EvoX Genesis 用 44 美元让 AI 写了 25 万行编译器,换人也不掉链子,值得看看。原文稍后读已读值得跟进有用关注 EvoX Genesis
18:39官方一手arXiv: DeepSeek@Liang Zhang, Stephen Hwang, Yue Ma, Jinfa Cai一项研究测试了LoRA监督微调能否提升LLM在数学隐喻编码任务上的表现。研究者使用2,265条6-8年级学生回答,让模型完成效价强度编码和主题编码。对比了GPT-4o mini、GPT-5 mini与DeepSeek-R1 1.5B、Mistral 7B,微调后开源模型性能大幅提升,且与专有模型竞争甚至超越。结果表明紧凑开源模型可支持可扩展、隐私友好的教育测量。论文LoRA微调DeepSeek-R1推荐理由:想知道小模型微调后能不能干过大厂API?这篇用2千多条真实学生数据实测,DeepSeek-R1 1.5B微调后比GPT-5 mini还稳。原文稍后读已读值得跟进有用关注 LoRA
18:38官方一手arXiv: DeepSeek@Francisco León Zúñiga Bolívar一项研究比较了DeepSeek V4 Pro、Qwen3-Max、Kimi K2.5和GLM-5.1四个中国前沿模型在进化囚徒困境中的合作倾向。通过固定代码转换器为GPT-5.4 Mini,排除了编码能力干扰,发现各模型攻击性均衡比例从Qwen3-Max的1%到DeepSeek V4 Pro的9%不等。四个实验室间的差异(8个百分点)大于中国与西方生态系统的均值差异(5.0%对5.0%)。研究支持H6假设,即中国模型并非单一整体,实验室层面而非生态系统层面决定合作倾向。论文DeepSeek V4 ProQwen3-MaxKimi K2.54 个信源在谈事件专题推荐理由:想知道中国大模型是不是都一个样?这篇论文用囚徒困境测了DeepSeek、Qwen、Kimi和GLM,发现它们合作倾向差别挺大,别再把它们当铁板一块了。原文稍后读已读值得跟进有用关注 DeepSeek V4 Pro
18:37shao__meng@shao__meng精选SpaceXAI 发布新型 AI 同事 Grok Bot,目前处于早期测试阶段。与传统 AI 助手不同,Grok Bot 拥有自己的计算机环境,能实际登录 Zendesk、CRM 等工具并像真人一样操作界面,直接交付已完成的工作。它支持异步 7×24 小时运行,用户下达任务后可离开,Bot 在需要审批时才会联系用户。用户可创建多个 Bot 并行处理不同职能,它们之间能共享上下文和相互协作。Grok Bot 还提供销售外联、人才招聘等预置岗位模板,并支持通过示范一次工作流程来创建可复用的例行程序。AI产品Grok BotSpaceXAI智能体推荐理由:想找个能替你干活的 AI 同事?Grok Bot 能登录你的工具、7×24 小时干活,还能学你的工作习惯,值得试试。原文稍后读已读值得跟进有用关注 Grok Bot
18:36shao__meng@shao__meng72°前千问负责人林俊旸宣布在上海成立新公司 Pragmatik Labs(语用科技),简称 p7k,聚焦横跨数字与物理世界的下一代智能体研究。公司同时覆盖软件层面的数字 Agent 和面向真实环境的具身智能。本轮融资由高榕创投与红杉中国联合领投,腾讯与上海未来产业基金跟投。据 The Information 报道,融资规模达数亿美元,投后估值约 20 亿美元。行业Pragmatik Labs林俊旸智能体推荐理由:林俊旸从阿里千问出来单干,搞数字和物理世界通吃的智能体,红杉高榕腾讯都投了,估值 20 亿美元,想了解他下一步动作的可以看看。原文稍后读已读值得跟进有用关注 Pragmatik Labs
18:35官方一手arXiv: Anthropic@Giuseppe Destefanis, Daniel Graziotin, Matteo Vaccargiu, Marco OrtuGitSkills 数据集收录了 2026 年 7 月从 282,200 个公共仓库中采集的 3,797,117 个 SKILL.md 文件。这些文件按内容哈希去重后得到 1,877,981 个不同版本,每个版本附带完整文本、front matter、文件夹内容及仓库元数据。数据集以单个 SQLite 文件发布,支持研究 Agent 技能的采用、复用、结构、维护与安全问题。该研究指出技能文件缺乏中央注册表,主要通过复制文件夹传播。论文GitSkillsAgentGitHub推荐理由:想研究 Agent 技能生态的,这个数据集直接给你 380 万份真实 SKILL.md,比你自己爬 GitHub 省事多了。原文稍后读已读值得跟进有用关注 GitSkills
18:33官方账号arXiv cs.LG@Nikolai Bolik, Lennart Stöpler, Artur AndrzejakShani等人2026年的研究显示LLM表征能大致还原人类类别边界,但无法捕捉细粒度典型性结构。本文用稀疏自编码器(SAE)活跃潜变量集的重叠度作为更可解释的相似度度量,重新审视该分析。在受控玩具模型中SAE潜变量集能恢复并集式组合结构,在自然文本中也能诱导语义连贯的邻域。但扩展到人类概念分析时,SAE激活集并未比稠密嵌入或残差流状态更忠实还原类别边界或典型性,而是追踪模型内部相似性结构。在受控语义修改下,人类概念变化判断与SAE活跃集变化存在显著不匹配,说明在理想化设置之外SAE特征不按简单词袋语义组合。论文稀疏自编码器SAE可解释性推荐理由:这篇论文用SAE潜变量集做相似度度量,发现它并不比稠密嵌入更贴近人类概念判断,搞可解释性的人值得看看这个反直觉结论。原文稍后读已读值得跟进有用关注 稀疏自编码器
18:31techcrunch@Tim De ChantReservoir公司获得800万美元融资,用于开发高效热水器。该热水器能预测热水需求、储存能量并检测全屋管道泄漏。产品旨在提升家庭能效,同时帮助电网平衡负荷。融资将用于扩大生产和市场推广。AI产品Reservoir智能热水器能源管理推荐理由:Reservoir拿了800万美元做智能热水器,能预测用水、储能还能查漏水,比传统热水器聪明多了。原文稍后读已读值得跟进有用关注 Reservoir
18:29IT之家(博客/媒体)字节跳动豆包面向全国在校大学生推出专属优惠活动。完成学生认证后,用户可获得2.5倍免费使用额度,并以38元/月的连续包月价订阅原价68元/月的专业版标准套餐。豆包专业版于今年6月24日上线,采用三级阶梯定价,标准、加强、高级套餐分别为68元、200元、500元每月。高阶套餐搭载豆包2.1 Pro旗舰大模型,提供更高使用额度。学生用户可通过豆包电脑端更新至最新版本,在"工作任务"模式发送"我要领取学生优惠"完成认证。AI产品豆包字节跳动学生优惠推荐理由:豆包给大学生发福利了,认证后免费额度翻2.5倍,专业版月费砍到38块,比原价便宜近一半,写论文写代码都够用。原文稍后读已读值得跟进有用关注 豆包
18:28官方账号Decoder@Matthias Bastian精选微软发布MAI Code 1.1 Flash,用于GitHub Copilot,声称比前代节省25%的token,成本降低75%。但在基准测试中,其性能被更便宜的DeepSeek V4 Flash超越。此举符合微软一贯模式:宣传开源AI,却在应用中内置更差的专有模型以保护利润。AI模型MAI CodeDeepSeekGitHub Copilot推荐理由:微软新代码模型被DeepSeek碾压,价格性能都输,想了解Copilot背后模型真实水平的朋友可以看看。原文稍后读已读值得跟进有用关注 MAI Code
18:27官方账号arXiv cs.LG@Eric A. F. Reinhardt, Adam J. Hauser该论文提出软注意力机制在概率单纯形上的精确量子实现方案。注意力分数通过Hadamard测试统计获得,指数softmax与Born规则测量存在精确双射。温度参数对应重复测量次数,值聚合通过确定性列加载通道实现。所有可学习参数均为旋转门角度,组合层在无限射击极限下精确。代数核心已用Lean 4形式化验证。论文量子计算softmax注意力机制推荐理由:量子计算和注意力机制结合的新思路,把softmax映射到量子测量,数学上还挺严谨,搞量子ML的可以看看。原文稍后读已读值得跟进有用关注 量子计算
18:26官方账号arXiv cs.LG@Changhao Xiang, Shangyu Xing, Zhen Wu, Jianbing Zhang, Xinyu DaiMMCS是一种新的多模态预训练方法,通过将文本实体替换为对应视觉对象,提供显式的对象级监督。该方法仅用50K样本就能匹配或超越在600K图像-文本对上训练的模型,数据效率提升12倍。MMCS在773K样本的预训练数据集上验证了有效性,并持续提升不同规模模型的视觉定位和感知能力。该研究针对现有MLLMs中图像级对齐的指称歧义问题,提出了更精确的局部视觉-语言对齐方案。论文MMCS多模态预训练推荐理由:这篇论文提出MMCS,用50K样本就干翻别人600K的效果,做多模态预训练的可以看看这个新思路。原文稍后读已读值得跟进有用关注 MMCS
18:25官方账号Decoder@Maximilian SchreinerMistral 新增了将 AI 请求路由至欧洲或美国服务器的选项,并出售高峰时段的优先队列访问权。这两项服务均需额外付费,且区域路由不覆盖所有功能或数据。该功能旨在满足欧盟数据合规需求,但用户需注意其局限性。AI产品Mistral欧盟数据数据处理推荐理由:Mistral 现在能选欧洲服务器了,但要多花钱,而且不是所有功能都支持。想用欧盟数据处理的可以看看具体限制再决定。原文稍后读已读值得跟进有用关注 Mistral
18:24官方账号arXiv cs.LG@Nguyen Thai Anh, Truong Viet Vu, Tran Thien Thanh, Vo Nguyen Quoc Bao, Ngo Hoang TuHEB-NB通过Type-II最大似然学习Dirichlet先验浓度,实现数据自适应的平滑,解决了Laplace等固定平滑在高基数数据上的偏差问题。理论证明其非渐近误差界匹配经验分布极小极大率,并给出有限样本风险级严格优于Laplace的证明。在31个UCI和OpenML基准上,HEB-NB取得最佳平均Friedman排名,高基数数据集对数损失降低达22.1%。HEB-AODE扩展也一致优于原始AODE。结合互信息加权,top-1 ECE降低41%-70%。论文HEB-NBNaive Bayes经验贝叶斯推荐理由:如果你用朴素贝叶斯处理高基数分类数据,HEB-NB能自动调平滑参数,比固定Laplace更准,论文还给了理论保证和实测数据。原文稍后读已读值得跟进有用关注 HEB-NB
18:23官方账号arXiv cs.LG@Pavel Averin, Theodoros Moysiadis, Ioannis Katakis该综述系统梳理了约束因果发现中的条件独立性检验方法,涵盖PC和FCI算法中骨架剪枝与方向判定的核心环节。文章将CI测试分为偏相关、列联表、回归、最近邻、核和机器学习六大家族,并重点分析各族的鲁棒性局限。综述指出CI检验的统计功效随条件集规模增大而衰减,且I型/II型错误不对称会影响图级骨架恢复和v结构定向。文章还比较了主要R和Python库的采用情况,并总结了混合类型数据、小样本误差控制等开放挑战。论文条件独立性检验因果发现PC算法推荐理由:做因果发现的朋友可以看看,这篇把PC和FCI背后的CI检验方法按六个家族梳理清楚了,还讲了每种方法什么时候会失效,省得自己踩坑。原文稍后读已读值得跟进有用关注 条件独立性检验
18:22官方账号arXiv cs.LG@Shiqi Huang, Jiani He, Dingyan Shang, Yihua Xu, Jize Li, Yan Lyu, Lashimi Muraleedharan NairDACRI 研究提出 CriticalSCM-Bench v1,一个带因果真值的合成基准,用于评估供应链干预策略。相比全信息静态基准,LambdaMART 在中位归一化净值上提升 5.7% 至 16.2%,在半导体和关键材料场景有统计支持,但在数字基础设施上不如领域常量缓冲策略。部分和延迟信息下,LambdaMART 保留全信息价值的 33% 至 75%。压力测试显示干预保真度、时机、成本和未见过中断会改变策略排序,关键材料的外推保留最弱。540 次生成中的受保护解释研究在确定性验证和模板回退后保留了所有固定干预决策,但措辞不稳定。论文DACRI供应链因果推断推荐理由:这篇论文用合成基准测了不同干预策略在供应链里的实际效果,LambdaMART 在某些场景确实更优,但数字基础设施上简单策略反而更强,值得做决策的人看看。原文稍后读已读值得跟进有用关注 DACRI
18:21官方账号arXiv cs.LG@Zetao Hong, Song Yuan, Yuanhao Ding, Yibo Zhu, Daxin Jiang, Zhibin Wang, Chen TianMISA-T是一种针对混合强化学习rollout服务的路由层准入策略,解决RLVR、RLHF和智能体rollout共享推理服务时的KV缓存竞争问题。在Step3.7和Qwen3.6-35B-A3B上的消融实验中,MISA-T相比调优的vLLM Router将rollout吞吐分别提升53.3%和43.6%,同时保持高前缀缓存命中率。在50次迭代的Step3.7实验中,吞吐提升35.6%,平均迭代时间减少22.8%,且任务分数相当。论文MISA-TRLHFKV缓存推荐理由:做LLM后训练的朋友可以看看,MISA-T把混合rollout调度做得更精细,吞吐提升明显,而且不牺牲任务效果。原文稍后读已读值得跟进有用关注 MISA-T
18:20官方账号arXiv cs.LG@Kaan Buyukkalayci, Kyle Pak, Merve Karakas, Christina Fragouli该论文提出一种基于推荐系统的传感器子集选择方法,用于目标跟踪。此前研究利用低成本声学RSSI测量推荐传感器节点子集,使昂贵传感模式(如摄像头)实现高跟踪精度,但RSSI易受声学干扰。新方法采用频带声学特征和双塔多层感知机(MLP)架构,高效评分候选传感器子集。在户外车辆跟踪部署实验中,该方法相比RSSI基线将跟踪精度提升约20%,同时保持实时选择性传感所需的低计算开销。论文传感器选择目标跟踪推荐系统推荐理由:这篇论文用推荐系统思路解决传感器选择,抗干扰还提精度20%,做跟踪或边缘计算的朋友可以看看。原文稍后读已读值得跟进有用关注 传感器选择
18:19官方账号arXiv cs.LG@Vladimir IglovikovAlbumentationsX 是一个新的数据增强库,确保图像及其相关标注(如掩码、边界框、关键点)在增强时使用相同的随机变换。它通过将变换列表、概率、标注设置和随机种子封装在一个 Compose 对象中,每次调用只生成一次随机值并应用于所有部分。该库支持自定义变换,并能保存管线定义、展示单次调用过程及重放。示例显示其位于文件解码后、PyTorch 批处理前,由实践者决定变换是否保持标签正确。论文AlbumentationsX数据增强图像标注推荐理由:做目标检测或分割的可以看看,AlbumentationsX 把图像和标注的增强统一了,避免随机变换错位,还能重放调试。原文稍后读已读值得跟进有用关注 AlbumentationsX
18:16官方账号arXiv cs.LG@Songlin Du, Xiaoyong Lu, Zeyu Wu, Xiaobo Lu, Guobao Xiao, Bin Fan, Jiayi Ma, Takeshi Ikenaga该综述系统梳理了跨视角特征匹配领域,提出涵盖特征提取、单类型匹配器、多类型匹配器、视觉基础模型方法、训练策略和鲁棒估计的分类体系。文章对代表性方法在统一协议下进行基准测试,比较性能差异。综述指出领域正从任务特定模型转向统一可泛化的对应模型,并讨论了效率、极端条件鲁棒性和跨域泛化等开放挑战。论文跨视角特征匹配视觉基础模型综述推荐理由:想了解跨视角匹配的现状和未来?这篇综述把方法分类、基准测试和基础模型趋势都讲清楚了,适合快速入门。原文稍后读已读值得跟进有用关注 跨视角特征匹配
18:15官方账号arXiv cs.LG@Robert Bitterling, Christian Nettersheim, Jörn Hees, Michael Rademacher针对LoRa智能城市部署,研究者用真实城市数据系统分析机器学习路径损耗预测精度随训练集规模的变化。随机森林结合LiDAR地形特征,k近邻使用坐标数据,两者在随机池化分割下均优于经验模型和专用LPWAN模型。最大训练规模时,ML模型RMSE低于6.5 dB,最佳基线为9.7 dB。留一网关验证显示,随机森林对未见网关有位置依赖的迁移,坐标k近邻在网关位置未见时大幅退化。论文LoRa路径损耗预测随机森林推荐理由:想搞LoRa网络规划?这篇用真实数据告诉你ML模型比传统模型准多少,还分析了换网关会翻车的情况,挺实在的。原文稍后读已读值得跟进有用关注 LoRa
18:14官方账号arXiv cs.LG@Artyom Sabitov, Daniil Volkov, Alexey Zaytsev该论文研究内存受限下推荐系统训练中批大小与负样本数量的分配问题。理论分析表明,在固定内存预算下,增大批大小比增加负样本数量带来更快的收敛速度。作者提出将内存优先分配给更多样本的实用规则,并在MovieLens-20M等四个真实推荐基准上验证。实验显示该配置在相同内存下获得更优的收敛速度和最终推荐质量。论文推荐系统采样softmax内存优化推荐理由:推荐系统训练时内存不够用?这篇论文告诉你该加批大小还是加负样本,结论很实用。原文稍后读已读值得跟进有用关注 推荐系统
18:13官方账号arXiv cs.LG@Sepideh Saran, Mahsa Ghanbari, Uwe Ohler该研究对基因组学中深度学习模型的不确定性量化方法进行了系统比较,涵盖Deep Ensembles、贝叶斯神经网络和MC-dropout。实验基于序列到活性模型和单细胞表达分析两类任务,评估了不同方法在类别不平衡和分布外数据下的表现。结果显示贝叶斯神经网络在捕获不确定性方面更优,尽管计算成本较高。研究还展示了不确定性分数在蛋白质-RNA相互作用预测中的应用。论文不确定性量化基因组学贝叶斯神经网络推荐理由:想知道基因组学里哪个不确定性方法靠谱?这篇实证对比了三种主流方法,贝叶斯网络在类别不平衡时表现最好,还教你怎么用不确定性挑高质量预测。原文稍后读已读值得跟进有用关注 不确定性量化
18:12官方账号arXiv cs.LG@Nikita Sevriukov, Anna Barabanova, Uliana Gagarina, Karina Ivanova, Sofiia Kasaeva, Ilya Levin, Marina Sheshukova逆强化学习(IRL)旨在从专家演示中恢复奖励函数,通常被建模为双层优化问题,内层为策略优化,外层衡量策略与专家数据的差异。然而,外层更新需要计算涉及内层目标逆Hessian向量积的超梯度,计算成本高昂。本文证明在内层最优处,内层目标的Hessian与策略的Fisher信息矩阵成正比,从而提出基于Fisher的超梯度,与自然超梯度下降紧密相关。为应对大规模Fisher矩阵的瓶颈,作者使用流式谱草图近似逆Fisher向量积,避免显式构造Fisher矩阵。在离散和连续控制环境中,该方法相比一阶随机双层基线,实现了有竞争力的策略性能和奖励排序质量,同时降低了曲率存储复杂度并提升了计算效率。论文逆强化学习超梯度Fisher信息矩阵推荐理由:这篇论文给IRL的超梯度计算找了个巧妙的捷径,用Fisher矩阵和谱草图省下大量算力,做强化学习的朋友可以看看。原文稍后读已读值得跟进有用关注 逆强化学习
18:10官方账号arXiv cs.LG@He-Yen Hsieh, H. T. KungReRound是一种后训练量化方法,针对标准RTN在量化接近区间中点的权重时固有的中点模糊性问题。它训练一个条件扩散模型生成低比特权重的连续重建,作为确定舍入方向的引导信号。ReRound引入容差度量,对中点附近权重用扩散重建,对边界附近权重用RTN,并通过扫描容差参数选择与原始全精度权重奇异值最匹配的候选。在3比特和4比特量化下,ReRound在小型LLM上持续优于RTN,且精度超过多种无校准方法,与依赖校准的方法相当,推理时无额外开销。该方法适用于LLM之外的AI模型,论文聚焦于小型LLM。论文ReRound量化扩散模型推荐理由:如果你在做低比特量化,ReRound用扩散模型解决RTN的中点模糊,3/4比特下比RTN更准,还不用校准数据,值得看看。原文稍后读已读值得跟进有用关注 ReRound
18:09官方账号arXiv cs.AI@Wenrui Bao, Tianyun Jiang, Zhiben Chen, Ser-Nam Lim, Peter D. Peng, Yuzhang ShangSurgical WAM 是一个基于 Cosmos Policy 构建的统一生成模型,能同时预测内窥镜观察和可执行的手术机器人动作块。它先从无动作视频中学习手术视觉动态,再在固定数量的动作标注数据上微调。在四项模拟手术任务中,视频预训练将平均成功率从 63.5% 提升至 77.8%,其中 PegTransfer 任务绝对提升 20 个百分点。接触密集和双臂协调任务受益最大,表明无动作视频可提供可迁移的视觉动态先验。论文Surgical WAMCosmos Policy手术机器人推荐理由:手术机器人数据难搞,这个模型用便宜的视频预训练把成功率拉高了 14 个点,PegTransfer 直接涨 20%,搞机器人学习的可以看看。原文稍后读已读值得跟进有用关注 Surgical WAM
18:08官方账号arXiv cs.AI@Chen Lyu, Xingwei Tan, Simon Cullen, Shelley Wilson, Lois Arthurs, Arshad Jhumka, Gabriele PergolaConVAWG 是一个用于生成暴力侵害女性(VAWG)场景多轮对话的检索增强框架。它利用英国国家统计局的人口统计数据、官方犯罪定义和家庭凶杀案审查案例构建场景,并生成超过 6,000 个多轮对话事件,覆盖 200 个场景。框架采用分层事件时间线生成多场景角色扮演对话,并通过激活导向的毒性控制调整不当表述。人工评估和 LLM-as-Judge 评估显示其对话质量和领域保真度较高。该研究旨在解决敏感领域真实对话数据难以获取的问题。论文ConVAWG合成对话生成检索增强推荐理由:想研究敏感场景对话生成?ConVAWG 用检索增强和毒性控制,造出 6000 多轮高质量对话,还带详细元数据,值得一看。原文稍后读已读值得跟进有用关注 ConVAWG
18:07官方账号arXiv cs.AI@Alan Li, Rahul Saha, Anton Xue, Swarat Chaudhuri, Adam Klivans, Pravesh K Kothari, Raghu Meka精选arXiv论文展示了AI在数学研究中改进Grothendieck常数K_G界限的案例。研究者将K_G的已知界限收紧至6π/11 ≤ K_G ≤ π/(2log(1+√2)) - 10^-4。AI系统提出了领域专家认为新颖的见解。论文详细讨论了AI在数学研究中的优缺点,以及创造理想条件让AI产生突破性见解的经验。论文Grothendieck常数AI数学研究arXiv推荐理由:想知道AI怎么帮数学家干活?这篇论文用Grothendieck常数当例子,讲AI怎么把已知界限又收紧了一截,还聊了AI的强项和翻车点,挺实在的。原文稍后读已读值得跟进有用关注 Grothendieck常数
18:06官方账号arXiv cs.AI@Ke Ma, Yamin Mao, Weiming Li, Shuai Tan, Yijie Zhong, Hao Chen, Haofen Wang, Meng WangR4DSG提出一种相对4D场景图记忆方法,用于长时程第一人称视频中的对象中心问答。该方法将视频转换为按时间、地点、持久对象和锚点相对变化索引的紧凑可查询记忆,而非存储原始图序列。它利用可提示视频分割和相对3D提升等RGB-only技术,在EgoLifeQA的255个对象相关问题子集上,相比EgoRAG-Text在仅问题检索下整体提升6.7分,在“何时”类问题上提升12.5分。论文R4DSGEgoLifeQA4D场景图推荐理由:做长视频问答的可以看看,R4DSG用相对锚点记录物体变化,比纯文本记忆强不少,在EgoLifeQA上比EgoRAG-Text高了6.7分。原文稍后读已读值得跟进有用关注 R4DSG