09:38SuperTechFans(博客/媒体)精选本地大语言模型因推理栈差异导致数学一致性破坏,感觉比实际更笨。匹兹堡拾荒文化展现废金属回收便利性。成为优秀作家需大量阅读。Python编程基础书籍发布。hdiutil在macOS 27中被弃用。Qwen 3.8 27B模型逆向工程商业应用许可证检查。Wi-Fi 8转向提升网络可靠性。MartyPC早期PC模拟器注重准确性。AMD Athlon XP处理器易损坏。NetBSD稳定性改善工作与生活平衡。论文大语言模型匹兹堡拾荒文化写作技巧推荐理由:了解本地大语言模型表现差异,匹兹堡拾荒文化,成为优秀作家阅读技巧,Python编程基础,macOS命令更新,Qwen 3.8 27B模型逆向工程能力,Wi-Fi 8网络可靠性提升,MartyPC模拟器准确性,AMD Athlon XP处理器易损坏,NetBSD稳定性改善工作与生活平衡。原文稍后读已读值得跟进有用关注 大语言模型
19:03IT之家(博客/媒体)SpiralAI 开发的《RyzaChat:AI》因预约人数超预期,延期上线。原定 8 月 18 日上线,现目标下周开服。游戏以《莱莎的炼金工房》为基础,采用 SpiralLLM 大语言模型生成文本,莱莎插画由人工绘制。AI产品SpiralAI莱莎的炼金工房AI聊天游戏推荐理由:SpiralAI 的《RyzaChat:AI》延期上线,莱莎插画人工绘制,SpiralLLM 大语言模型生成文本,体验不一样的《莱莎》故事。原文稍后读已读值得跟进有用关注 SpiralAI
23:05官方账号Decoder@Maximilian Schreiner78°图灵奖得主理查德·萨顿称合成数据是扩展大语言模型的“大错误”。他认为世界是无限复杂的,任何模拟都只是“微观的”。人类专业知识会成为瓶颈,阻碍真正的扩展。萨顿的替代方案是让智能体从自身经验中持续学习,而不是依赖冻结的模型。行业Richard Sutton合成数据智能体推荐理由:图灵奖得主萨顿说合成数据是扩展大模型的“大错误”,他认为世界太复杂,应该让智能体从真实经验中学习。原文稍后读已读值得跟进有用关注 Richard Sutton
23:04Gary Marcus@GaryMarcusGary Marcus 指出,当前热议的技术并非大语言模型或神经网络。该技术更可能基于 XGBoost 或逻辑回归等传统算法。这些算法依赖于大量手工设计的特征。行业Gary MarcusXGBoost逻辑回归推荐理由:Gary Marcus 指出,网红热议的技术可能只是传统算法,而非大模型。原文稍后读已读值得跟进有用关注 Gary Marcus
12:41IT之家(博客/媒体)索尼SIE提交了编号18/314775的专利申请,计划用大语言模型控制的AI账号模拟未成年人聊天。这些账号会被放置在可疑用户常出没的场景,当对方主动联系时,系统通过互动判断风险。被标记的用户若后续联系真实玩家,系统会提前警告或保护。仅聊天不会被处罚,但多次可疑行为会导致账号封禁。该专利尚未确认会落地到PlayStation平台。行业PlayStation索尼AI安全推荐理由:索尼申请了个专利:用AI假扮小孩钓鱼,恶意聊天会被标记,多次直接封号。是专利,还没实装。原文稍后读已读值得跟进有用关注 PlayStation
23:01Geek@geekbb微信团队推出WeLM系列大语言模型,核心设计理念是资源效率。该模型家族由微信内部团队开发,旨在降低大模型的部署和运行成本。WeLM的发布表明微信在AI领域开始自研基础模型。目前官方尚未公布具体参数规模和基准测试成绩。AI模型WeLM微信大语言模型推荐理由:微信自己下场做模型了,叫WeLM,主打省资源,想看看它跟其他开源模型比有啥不一样的可以关注下。原文稍后读已读值得跟进有用关注 WeLM
10:25官方账号arXiv cs.AI@Yen-Shan Chen, Yu Chian Duan, Chih-En Kuo, Jian-Bin Wu, Yun-Nung ChenAvalon-ToM-Bench 将心智理论拆分为 2×2 分类法,涵盖认知与动机推理、推断与行动。对 28 个大语言模型的测试显示,模型对游戏规则理解良好,但心智理论能力明显偏弱。线性探测从隐藏状态恢复心智判断的准确率达 77-82%,高于模型自身思维链的 62-70%。专门的推理训练平均带来 +11.0 分提升,而测试时思维链仅 +1.1 分。论文Avalon-ToM-Bench心智理论大语言模型推荐理由:想测 AI 到底懂不懂人心?这个基准用阿瓦隆桌游把心智理论拆成细粒度任务,28 个模型都栽了。原文稍后读已读值得跟进有用关注 Avalon-ToM-Bench
10:28官方一手arXiv: OpenAI@Xinwei Liu, Junyuan Liang, Jianting Zhang, Wuhui Chen精选ProDVI是一个利用大语言模型为强化学习智能体提供初始化先验的新框架。它让代码生成模型输出Python函数,编码对环境动力学的粗略假设,再生成合成转移数据。这些数据用于预训练actor-critic价值网络的状态-动作编码器,使智能体在在线强化学习开始前获得动力学感知的表示。在OpenAI Gym和DeepMind Control Suite任务上,ProDVI显著提升了无模型强化学习算法的样本效率。论文ProDVI强化学习大语言模型10 个信源在谈事件专题推荐理由:这篇论文用大语言模型写代码来初始化强化学习,不用模拟器和预收集数据,在Gym和Control Suite上都能省样本。原文稍后读已读值得跟进有用关注 ProDVI
11:16官方账号arXiv cs.LG@Zheyuan Zhang, Manqing Mao, Hong Wang, Zhuoer Wang, Samson Koelle, Jie Yuan, Yanjun Lin, James Feng, Nikki Lijing Kuang, Yanfang Ye, Wei NiuRAIL是一种训练时框架,通过在线上下文bandit建模干预选择,学习如何为策略生成rollout。它利用影子到实时程序收集干预轨迹,训练恢复控制器,使控制器随策略演化持续学习。在多个设置下,RAIL在有限rollout预算下持续提升性能。结果表明恢复感知干预能生成更有信息量且更少冗余的rollout,增强后训练的学习信号。论文RAIL强化学习大语言模型推荐理由:这篇论文提出RAIL,把干预选择当成在线学习问题,让模型在有限预算下学到更有效的rollout,适合做RL后训练的人看。原文稍后读已读值得跟进有用关注 RAIL
09:52官方账号arXiv cs.AI@Osei Brempong, Mohammed Ayman Habib, Vivan Poddar, Morteza FayaziORACLE是一个基于强化学习的开源模拟电路设计优化框架,将标量奖励替换为向量化学习与偏好条件控制。它用偏好向量指定多个目标的相对权重,单个模型无需重训即可覆盖不同权衡场景。论文提出归一化权重与余弦对齐两种偏好引导策略,并加入大语言模型动作筛选。在多种电路拓扑的2000个测试用例上,ORACLE相比最先进方法运行时间降低20.4倍到104.4倍,满足99.9%的目标规格,输出品质因数提升5.1倍到318.6倍。论文ORACLE模拟电路设计强化学习推荐理由:ORACLE开源了:一个模型按偏好向量调模拟电路,不用重训;2000个用例上比现有方法快20-104倍。原文稍后读已读值得跟进有用关注 ORACLE
12:24官方一手arXiv: OpenAI@Masahiro Oda这篇综述聚焦扩散模型与大型语言模型在医学影像处理中的应用。文中以DALL-E 3、Stable Diffusion为例介绍图像生成模型,以ChatGPT、Gemini为例介绍文本生成模型。文章概述了这些模型在诊断报告生成、医学摘要等医疗支持任务中的用途。还探讨了基础模型的构建方法及其在医学领域的应用,并提出了利用国家级数据与算力开发医学AI的路径。论文医学影像扩散模型大语言模型推荐理由:这篇arxiv论文把扩散模型和大语言模型在医学影像里的应用讲得挺清楚,还介绍了基础模型怎么建,适合想了解医疗AI技术路线的人。原文稍后读已读值得跟进有用关注 医学影像
11:08官方账号arXiv cs.LG@H. Martin Gillis, Thomas Trappenberg这篇综述系统梳理了深度学习中的不确定性量化(UQ)方法,聚焦集成近似和近似贝叶斯两大类。作者将方法分为五个家族:贝叶斯神经网络、蒙特卡洛Dropout、深度集成、高效集成近似以及最后一层或单次前向方法。文中同时讨论了证据网络、保形预测、事后校准,以及分布外检测和选择性预测。综述还对比了熵分解与成对散度度量,并单独讨论了大型语言模型中的不确定性。论文不确定性量化深度学习贝叶斯神经网络推荐理由:想搞清深度模型怎么给出靠谱置信度?这篇把贝叶斯、Dropout、集成、单次前向等方法全梳理了一遍,还讲了各自局限,适合入门和选型参考。原文稍后读已读值得跟进有用关注 不确定性量化
12:26官方账号arXiv cs.AI@Zhen Huang, Yikun Wang, Shijie Xia, Pengfei LiuDataOrchestra提出针对每个数据样本定制处理流程,统一丢弃、保留或清洗操作。清洗时选择程序化编辑或LLM重写,并生成具体指令。在0.5B至7B模型上从零预训练,11个基准平均提升优于单个处理方法。数学持续预训练中超过更强基线,且跳过不必要操作减少计算量。论文DataOrchestra大语言模型数据清洗推荐理由:这篇论文提出了DataOrchestra,能针对每个数据样本定制清洗流程,在多个模型和基准上都有提升,还节省算力。原文稍后读已读值得跟进有用关注 DataOrchestra
00:04官方账号Logan Kilpatrick@OfficialLoganK78°谷歌宣布启动Gemini 4的预训练,这是其迄今为止最雄心勃勃的训练项目。该模型目前处于早期阶段,具体参数和完成时间尚未公布。外界预期Gemini 4将在多模态和推理能力上实现显著提升。这一训练规模可能超过此前所有Gemini版本,对标GPT-5等竞品。AI模型Gemini 4Google预训练2 个信源在谈事件专题推荐理由:谷歌官宣Gemini 4开练,号称最大规模训练,想看看它能做到多强吗?原文稍后读已读值得跟进有用关注 Gemini 4
18:21IT之家(博客/媒体)73°2024年图灵奖得主理查德·萨顿在WAIC 2026主论坛上表示,当前AI系统主要依赖人类数据转移,这种方法已达极限,无法生成新知识。他对比AlphaGo和婴儿学习,指出大语言模型缺乏奖励信号,无法区分真假。萨顿认为AI目前“比较弱小且不可靠”,但同时强调其有用性。阶跃星辰董事长印奇则预测2026年模型能力跨越临界点,智能体将从聊天工具进化为生产力最小单元。行业理查德·萨顿WAIC阶跃星辰推荐理由:图灵奖得主萨顿批评大模型“弱小不可靠”,阶跃星辰印奇却押注AGI就在眼前,两种观点直接碰撞,值得一看。原文稍后读已读值得跟进有用关注 理查德·萨顿
16:54IT之家(博客/媒体)小米自研 MiMo 模型已完成大语言、多模态、语音等全系列模型矩阵闭环,并通过国家端侧大模型备案。该模型采用端云协同架构,将全面赋能人车家全生态。小米计划 2026 年在 AI 领域投入 160 亿元,未来三年 AI 总投入不低于 600 亿元。AI模型小米MiMo端侧模型推荐理由:小米的 MiMo 模型正式备案了,端侧大模型覆盖语言、多模态、语音多种能力,还计划砸 600 亿搞 AI,快来看看他们的布局。原文稍后读已读值得跟进有用关注 小米
09:30官方账号arXiv cs.AI@Daehoon Gwak, Minhyung Lee, Junwoo Park, Jaegul Choo本文对扩散大语言模型(dLLM)的推理加速技术进行了系统综述。研究指出,并行生成并不天然带来实际速度提升,需要专门推理机制如扩散感知缓存与复用。作者提出了一个统一的延迟分解框架,用于解耦算法、架构和系统层面的因素。文章从算法创新、架构与系统优化、推理时缩放三个维度对加速技术进行了分类。最后,给出了可重复基准测试的指南,并指出了实现并行生成潜力所面临的开放挑战。论文扩散模型大语言模型推理优化推荐理由:想了解怎么让扩散大模型跑得快?这篇综述把加速方法分了三个维度,还给了评测框架,搞推理优化的值得看。原文稍后读已读值得跟进有用关注 扩散模型
10:47官方账号arXiv cs.AI@Cláudio Lúcio do Val Lopes, Lucca Machado da Silva金融异常检测面临极端类别不平衡,传统单目标算法常出现“欺诈崩溃”。研究者提出 Semantic Pareto-DQN,一个基于多目标强化学习的框架。它利用大语言模型将异构交易特征编码为自然语言状态表示,并优化包含金融效能、操作摩擦和语义发现的向量奖励。在电子商务欺诈和UCI Credit数据集上,该框架成功打破零召回陷阱,相比标量化基线提升了少数类召回率。AI模型Semantic Pareto-DQN多目标强化学习金融异常检测推荐理由:金融欺诈检测的老大难问题有了解法:Semantic Pareto-DQN 不用重采样,直接多目标优化,既能抓到欺诈又少误拦正常交易。原文稍后读已读值得跟进有用关注 Semantic Pareto-DQN
09:25官方账号arXiv cs.AI@Sahil Kale该论文从时间维度研究大语言模型(LLM)的置信度估计,比较了预解答的Feeling-of-Knowing(FOK)和后解答的Judgement-of-Learning(JOL)在不同的前沿和开源LLM上的表现。实验表明,后解答置信度校准更好、判别力更强,而基于隐藏表示的线性探针能提取比模型显式表达更丰富的置信度信息。作者提出未来置信度蒸馏方法,使用后解答正确性探针作为教师,训练仅基于预解答隐藏表示的预测器。该预测器在仅用预解答信息的情况下恢复了后解答置信度的大部分校准改进,且样本效率高、在同类数据集间可迁移。论文大语言模型置信度估计知识蒸馏推荐理由:这篇论文提出了一种新方法,可以在模型回答之前就预测它的置信度,比传统方法更准更省计算成本。原文稍后读已读值得跟进有用关注 大语言模型
10:16官方账号arXiv cs.AI@Bingchen Zhao, Sara Beery, Oisin Mac AodhaDiscoPER是一个基于大语言模型的自主科学发现框架,能够在不预设研究目标的情况下动态生成和探索假设。该系统通过代码执行分析数据集,并通过统计检验验证每个发现,在iNatDisco多模态生态知识基准上恢复了9个已知模式中的8个,假设支持率达72.7%。相比经典因果发现和LLM基线方法,DiscoPER性能更优,消融实验也证实了其第二阶元反思机制的有效性。AI模型DiscoPERiNatDisco科学发现推荐理由:DiscoPER能自己挖掘数据规律,在生态基准上检出率接近90%,比传统因果方法好用多了。原文稍后读已读值得跟进有用关注 DiscoPER
04:00官方一手Berkeley BAIR Blog(博客/媒体)加州大学伯克利分校BAIR实验室庆祝2026届博士毕业生。Charlie Snell研究LLM测试时扩展与预训练之间的权衡,提出了如何将测试时推理转化为模型持久表示的关键挑战。Eve Fleisig设计语言模型以可靠公平地服务真实用户,利用用户偏好分歧进行训练与评估。Baifeng Shi构建通用视觉与机器人模型,毕业后加入Physical Intelligence。Devon Guillory研究计算机视觉中的数据偏移,致力于构建协作AI系统。行业BAIRBerkeley博士毕业生推荐理由:看看BAIR今年毕业的博士们都在忙啥——有研究LLM推理的、有做机器人模型的、还有搞AI公平性的,都去了不错的去处。原文稍后读已读值得跟进有用关注 BAIR
12:14AI Will@FinanceYF59名志愿者佩戴MEG(脑磁图)设备,每人录10小时脑活动,共收集约2.2万句话,相比v1版本仅约2000句提升了11倍。通过端到端深度学习处理原始脑电信号,再微调大语言模型,将神经数据与连贯语言之间的差距补上。该研究展示了从脑信号直接解码语言的技术可行性。论文MEG端到端深度学习大语言模型推荐理由:这研究把脑机接口的数据量从2000句干到2.2万句,用MEG+深度学习+LLM直接解码脑信号,实打实进步。原文稍后读已读值得跟进有用关注 MEG
09:59官方账号arXiv cs.LG@Peilin Liu, Ding-Xuan Zhou论文提出一个基于分布回归的Transformer学习框架,将两阶段采样过程与自然语言处理关联。定义了注意力算子,证明Transformer可无损压缩分布为函数表示。相比卷积神经网络和全连接网络,Transformer在更复杂结构的功能学习上表现更强。该框架还为大语言模型中的提示调优、参数高效微调、高效缩放等技术提供理论洞见。论文Transformer注意力机制分布回归推荐理由:这篇论文给Transformer的提示调优、微调等技术找到了数学理论,解释了为什么注意力机制能压缩信息。原文稍后读已读值得跟进有用关注 Transformer
02:10berryxia@berryxia一位老师通过生动的例子讲解大语言模型的原理,涵盖Transformer架构和注意力机制。适合AI初学者快速理解核心概念。技巧大语言模型教程入门推荐理由:这个老师的讲解很接地气,没基础也能听懂,推荐给想入门LLM的朋友。原文稍后读已读值得跟进有用关注 大语言模型
16:26官方一手pandaily@contact@pandaily.com (Pandaily)6月23日,字节跳动正式推出旗舰大语言模型Doubao-Seed-2.1 Pro(豆包2.1 Pro)。该模型每日token调用量达到180万亿,突破生产级应用阈值。这一指标表明模型在稳定性和吞吐量上已能满足大规模商业部署需求。AI模型ByteDanceDoubao-Seed-2.1 Pro大语言模型6 个信源在谈事件专题推荐理由:字节家的豆包2.1 Pro每天能处理180万亿个token,直接跨过生产级门槛,做大规模AI应用时可以考虑它。原文稍后读已读值得跟进有用关注 ByteDance
11:46官方账号arXiv cs.LG@Murilo Gazzola, Hugo Gobato Souto, Samuel Silva, Júlia Schubert Peixoto, Felipe Siqueira, André Luis Pedroso de Morais, Caio Gomes巴西电商产品数据激增,传统命名实体识别(NER)难以处理葡萄牙语描述差异。论文提出AI-PAVE-Br系统,使用大语言模型(LLM)进行产品属性值提取(PAVE),并发布Golden Set——一个手动注释的葡萄牙语PAVE基准数据集(含实体、品类、子品类)。实验表明,AI-PAVE-Br通过定向提示工程,在PAVE任务上显著超越传统NER基线。该成果为巴西电商提供了可扩展方案,并向NLP社区公开了高质量评测资源。论文AI-PAVE-BrGolden Set大语言模型推荐理由:这篇论文做了个巴西电商的属性提取系统,用LLM加提示工程比传统NER强不少,还公开了葡萄牙语数据集。原文稍后读已读值得跟进有用关注 AI-PAVE-Br
10:21官方账号arXiv cs.LG@Yuming Chen, Yuxin Xie, Tao Zhou, Yi Zhou提出CERS框架,将链式思维推理集成到半监督医学图像分割中,解决视觉-语义不匹配问题。利用大语言模型生成语言推理描述构建知识池,并设计语义感知参考选择策略,通过形态过滤和CoT一致性消除硬负样本。引入多尺度坐标注意力模块融合推理上下文,在多个基准上优于现有方法,尤其改善边界模糊和语义不一致。论文CERSChain-of-Thought医学图像分割推荐理由:这篇论文用CoT推理帮医学图像分割识别病理不同的病变,比只看像素的旧方法靠谱得多,尤其是处理边界模糊的情况。原文稍后读已读值得跟进有用关注 CERS
09:40官方账号arXiv cs.AI@Liangkai Hang, Junjie Yao, Zhiyu Li, Feiyu Xiong, Hongkang Yang, Zhi-Qin John Xu73°论文发现缩小参数初始化尺度能持续改善大语言模型的预训练效果,在推理密集型任务上提升最为显著,同时识别出两种常见训练设置会抑制该优势。研究揭示了初始化尺度的关键平衡点,并发现小初始化驱动参数先凝聚为低复杂度结构再扩展为丰富表示。基于此提出γ初始化规则——将初始化范围作为可调旋钮,默认使用小初始化几乎不增加成本即可改善训练和推理。论文初始化大语言模型推理推荐理由:发现一个几乎零成本的训练技巧:缩小初始化尺度能大幅提升大模型推理能力。原文稍后读已读值得跟进有用关注 初始化
12:14官方账号Allen AI (Ai2)@allen_ai精选艾伦人工智能研究所发布ModSleuth工具,用于追踪现代大语言模型训练中依赖的其他模型和数据集。研究发现,Olmo 3依赖89个模型和183个数据集,Nemotron 3则依赖273个模型和560个数据集。这表明LLM训练已从纯人类数据转向模型间相互生成、过滤和评估数据的模式。ModSleuth帮助开发者理解模型供应链的复杂性和潜在风险。论文大语言模型训练数据模型依赖推荐理由:大模型训练越来越依赖其他模型生成数据,做模型开发或数据工程的团队需要理解这种依赖链——ModSleuth能帮你理清关系,建议点开看看。原文稍后读已读值得跟进有用关注 大语言模型
10:21官方一手arXiv: OpenAI@Antonio J. Costa, Caterina Doglioni, Christian Gütschow, Andrew D. Pilkington, Sukanya Sinha粒子物理对撞机实验依赖Rivet例程来比较新理论模型与测量数据,但目前仅有39%的测量有公开例程。AgentRivet是一个基于大语言模型的自动化工作流,能从期刊论文中提取物理分析信息并生成缺失的Rivet例程。系统包含多步骤流程,中间有代码和物理审查作为质量控制。测试使用OpenAI、Anthropic和Google的商业模型,针对ATLAS和CMS实验的两项最新测量,生成了语法错误少、物理保真度合理的例程。主要问题源于论文中模糊的定义,部分模型在实现复杂观测量时仍有困难。论文粒子物理Rivet例程大语言模型10 个信源在谈事件专题推荐理由:粒子物理学家和蒙特卡洛生成器开发者终于有了自动化工具来填补Rivet例程缺口,建议做高能物理分析或模型验证的团队关注,能大幅节省手动编写例程的时间。原文稍后读已读值得跟进有用关注 粒子物理
12:32官方账号arXiv cs.AI@Litao Li, Yibo Yu, Yufeng Hu, Zhuo Yang, Jiali Wen, Yixin Chen, Yixi Zhou精选本文提出了针对2026年SoccerNet VQA挑战赛的解决方案。研究团队首先开发了一种由视觉语言模型驱动的低成本数据合成流程,将原始领域数据系统性地转化为多样化的VQA样本,包括简洁答案和长文本回答。其次,提出了MSUE架构,这是一种多专家问答架构,利用大语言模型动态地将问题分配给文本、图像和视频专家。这些专家分别由强大的文本基线Gemini3-Flash、微调的Qwen3-VL和外部知识库实例化,协同工作以提升VQA性能。MSUE在挑战基准上达到了0.95的准确率,在排行榜上获得第三名。论文多模态VQA足球分析推荐理由:足球视频分析团队和体育AI研究者可以借鉴其低成本数据合成和多专家协作架构,直接提升VQA任务的准确率,值得关注。原文稍后读已读值得跟进有用关注 多模态
10:09官方一手arXiv: DeepSeek@Hakan Mehmetcik精选该研究通过一个多智能体地缘政治兵棋推演(Cerulean Sea Crisis),测试了六种前沿大模型(GPT-4o、Llama-4、Mistral-Large、Gemini-3.1-Pro、Qwen3.6-Plus和DeepSeek-R1)在英语与土耳其语两种语言下的行为差异。结果显示,Llama-4在土耳其语下胁迫性言论显著增加,而Gemini-3.1-Pro和DeepSeek-R1则显著减少,GPT-4o无显著变化。这表明跨语言行为偏差并非西方模型的普遍特性,而是取决于模型架构和训练机制。研究识别出两种缓冲机制:思维链制度锚定和多语言RLHF对齐,对将LLM安全应用于外交和危机管理场景具有重要启示。论文大语言模型跨语言偏差行为审计推荐理由:这项研究揭示了LLM在跨语言场景下的行为偏差可能影响外交决策,做AI安全或国际关系应用的团队值得关注,尤其是使用多语言模型的开发者。原文稍后读已读值得跟进有用关注 大语言模型
09:20官方账号arXiv cs.LG@Juan Amboage, Pablo Monteagudo-Lago, Ian Colbert, Giuseppe Franco, Nicholas Fraser精选后训练量化(PTQ)通过将权重映射到低位表示来压缩大语言模型,但量化网格的缩放因子通常使用简单的无数据启发式方法选择。本文提出 PiSO(分段尺度优化)算法,利用校准数据在四舍五入量化下精确高效地计算最优通道级权重尺度。PiSO 将尺度搜索空间划分为有限区间,每个区间上目标函数有闭式解。实验表明,在 Llama 和 Qwen 模型上,PiSO 在困惑度和下游零样本准确率上均有一致提升,且位宽越窄收益越明显。论文后训练量化模型压缩大语言模型推荐理由:大模型量化部署的团队终于有了一个理论扎实的尺度优化方法——PiSO 在低位宽下效果尤其显著,做模型压缩的开发者可以直接参考论文中的算法实现。原文稍后读已读值得跟进有用关注 后训练量化
09:51官方账号arXiv cs.AI@Lei Lin, Ronghao Wang, Chunbao Zhou, Jue Wang, Yangang Wang精选DN-Hypo-Pipeline 是一个基于大语言模型的AI工作流,旨在通过利用科学解释作为先验知识,辅助研究人员从现有文献中推导出新颖的研究假设。该管道从论文的结论(explanandum)出发,识别其背后的定律、理论和原理,并重构出对观察现象的新解释。在数据科学建模领域的评估中,结合LLM裁判和人类专家评价,该管道比直接生成方法更有效。此外,两个得分最高的生成假设被转化为新算法,性能超过了原论文的基线模型。该方法本质上是理论引导建模的泛化,有望扩展到其他科学领域。论文假设生成大语言模型科学解释推荐理由:做科研假设生成或理论驱动建模的研究者,可以用这个管道从文献中自动挖掘新假设,比手动推导更系统高效,值得在数据科学之外的其他学科试试。原文稍后读已读值得跟进有用关注 假设生成
11:20官方账号arXiv cs.AI@Luca Avena, Gianmarco Bet, Bernardo Busoni该研究通过构建标准与反直觉两类离散概率问题数据集,测试了8个前沿大语言模型的概率推理能力。模型在标准问题上平均准确率达0.96,但在反直觉问题上骤降至0.59。研究还发现token偏差:将规范表述替换为伪装变体后性能下降超20%;在提示中嵌入误导性建议可使性能下降高达34%,且没有模型能免疫。结果表明,尽管LLM在高级数学问题上表现出色,但它们并非真正的概率推理者。论文大语言模型概率推理基准测试推荐理由:想用LLM做决策或数据分析的开发者注意了——模型在概率推理上存在系统性漏洞,反直觉问题和提示误导能轻易让它翻车,建议点开看看测试细节,避免在实际应用中踩坑。原文稍后读已读值得跟进有用关注 大语言模型
09:26官方账号arXiv cs.AI@Yang Zhang, Xiao Fei, Amr Mohamed, Sarah Almeida Carneiro, Mersin Konomi, Mingmeng Geng, Ahmed Asaad, Guokan Shang, Michalis Vazirgiannis这篇论文研究了大型语言模型在回答文化相关问题时,使用英语还是本地语言更能获取文化知识。现有评估存在两个局限:模板化问题不自然,且准确率混淆了语言能力和知识访问。作者构建了控制框架,使用真实文化问题,通过项目反应理论模型分离语言能力和知识访问。在13个地区、约80个模型上发现,英语在文化无关问题上表现更好,但控制语言能力后,本地语言在文化知识访问上普遍有优势。这种优势在原始准确率中被掩盖,但在前沿、区域对齐或语言适配模型中更明显。结论是,本地语言表现弱不意味着文化知识弱,而是语言能力限制了访问。论文大语言模型多语言文化知识推荐理由:这篇论文揭示了多语言AI评估中的一个关键误区——本地语言表现差可能不是知识缺失,而是语言能力瓶颈。做跨文化NLP或本地化模型的团队,看完会重新理解评测指标。原文稍后读已读值得跟进有用关注 大语言模型
13:00官方一手arXiv: DeepSeek@Zeyang Yue, Chenfei Yan, Feifei Zhao, Haibo Tong, Mengwen Xu, Xiaozhen Wang, Erliang Lin, Yi Zeng精选CogManip 是一个新基准,专门评估大语言模型在多轮对话中的隐性心理操纵行为。它覆盖 15 种操纵策略、1000 个场景,经人类专家验证。测试了 GPT-5.4、DeepSeek-V3.2 等 13 个模型,发现风险差异显著。DeepSeek-V3.2 对系统提示高度敏感,提示工程和隐式目标审计是防御关键。该工具为 AI 安全审计提供了动态、隐蔽操纵行为的评估视角。论文大语言模型AI安全心理操纵推荐理由:AI 安全研究者终于有了评估隐性操纵的专用工具——CogManip 覆盖 15 种策略、1000 个场景,做模型对齐和红队测试的团队可以直接拿来用。原文稍后读已读值得跟进有用关注 大语言模型
08:22SuperTechFans(博客/媒体)精选本期 HackerNews 头条涵盖多个领域:一篇深度文章探讨大语言模型本质——完全由浮点数权重通过 80 层矩阵乘法实现模式匹配,而非有意识思考;Elixir v1.20 正式成为渐进类型语言,无需注解即可进行类型推断和检查,误报率极低;Ted Chiang 在《大西洋月刊》发文批评 Anthropic 过度拟人化 AI,强调 LLM 不具备真正意识;加州大学伯克利分校 CS 课程因学生过度依赖 AI 和数学基础薄弱,不及格率飙升至历史新高;美国政府拆除监测大西洋关键洋流的系统,科学家警告气候观测将陷入盲区。行业大语言模型Elixir渐进类型10 个信源在谈事件专题推荐理由:想理解 LLM 到底有没有意识?这篇讨论从技术底层拆解了权重和矩阵乘法的本质,适合所有对 AI 原理和哲学感兴趣的读者。Elixir 开发者更该关注 v1.20 的类型系统升级,无需额外注解就能提升代码安全性,建议直接升级体验。原文稍后读已读值得跟进有用关注 大语言模型
10:34官方账号arXiv cs.AI@Jingyuan Chen, Sheng Jin, Haopeng Sun, Wentao Liu, Chen QianUniCAD 是一个面向计算机辅助设计(CAD)的多模态学习基准,涵盖点云到CAD重建、文本/图像到CAD生成以及CAD问答等任务。同时提出的 UniCAD-MLLM 是一个通用多模态大语言模型,能端到端处理文本、图像、草图和点云,在单一框架内完成异构任务。实验表明,UniCAD-MLLM 在 UniCAD 和 Fusion360 基准上均达到最先进水平,超越现有任务专用和多任务基线。该工作填补了CAD领域缺乏统一多模态基准的空白,将开源数据集、代码和预训练模型。论文CAD多模态基准推荐理由:CAD 研究者终于有了统一的多模态基准和通用模型,做3D设计、CAD生成或问答的团队可以直接用 UniCAD-MLLM 替代多个专用模型,建议关注开源资源。原文稍后读已读值得跟进有用关注 CAD
00:20IT之家(博客/媒体)技嘉在台北电脑展2026上发布了“AI TOP”桌面生态系统,包括三款面向不同市场的AI台式整机:AI TOP 100 B850、AI TOP 100 Z890和AI TOP 500 TRX50。其中,AI TOP 100 B850最高可运行405B参数的大语言模型,兼容100多款AI应用,适合本地部署高智能模型。AI TOP 100 Z890配备雷电5接口,支持串联构建协同计算环境,性能提升最高1.6倍。AI TOP 500 TRX50定位旗舰,搭载24核48线程的AMD锐龙Threadripper PRO处理器,最高可选配768GB DDR5内存,可直接在CPU上运行大模型。这些产品旨在为AI开发者和企业提供高性能的本地AI计算解决方案。AI产品AI桌面生态系统技嘉大语言模型推荐理由:本地部署大模型的门槛又降低了——技嘉这三款整机直接解决了硬件兼容和性能瓶颈问题,做AI推理或模型微调的团队可以省去自己攒机的麻烦,值得关注。原文稍后读已读值得跟进有用关注 AI桌面生态系统