16:33Geek@geekbb精选Niklas发现OX Alpha服务路径位于北美,可能位于美国东部;通过49个请求的测试,排除了中国大模型的可能性。AI模型牛阿尔法大模型服务地域推荐理由:Niklas通过详尽的测试,揭示了OX Alpha的服务位置,对关注大模型服务地域的读者来说是个重要发现。原文稍后读已读值得跟进有用关注 牛阿尔法
18:05orange.ai@oran_geOx大模型多模态,小参数,强后训练,Terra能力级别,flash速度,Cola等平台已上线,限时免费7天体验。beta模型,谨慎使用。AI模型Ox模型多模态免费试用推荐理由:Ox大模型多模态,速度快,Cola等平台已上线,限时免费7天,值得一试!原文稍后读已读值得跟进有用关注 Ox模型
16:09官方一手Pandaily@contact@pandaily.com (Pandaily)精选小红书发布自研大模型dots3-note,MoE模型,总参数280B,激活参数16B,512K上下文,支持文本、视觉和语音理解。以Apache 2.0协议在Hugging Face和GitHub上开源,华为Ascend零延迟适配,标志着月活跃用户超3亿的平台上,AI从功能转变为基础。AI模型小红书大模型MoE模型推荐理由:小红书开源自研大模型,支持多模态理解,与华为Ascend深度适配,为内容平台构建AI基础,值得关注。原文稍后读已读值得跟进有用关注 小红书
10:15官方账号arXiv cs.AI@Mengru Wang, Haozhe Luo, Zhenqian Xu, Zhixiang Cui, Haoming Xu, Qu Yang, Jizhan Fang, Junfeng Fang, Ningyu Zhang研究人员提出 MemTrapBench 基准,用于评估大模型记忆使用中的认知陷阱。该基准涵盖 Reasoning Fixation 和 Belief Distortion 两种陷阱形式。实验显示,在两个模型家族和五种代表性记忆框架上,所有记忆策略的表现均不如无记忆设置,最强方法性能下降超10%。为缓解这些陷阱,研究者提出 AdaptiveMem 方法,可在推理时指导模型避免记忆陷阱。论文MemTrapBenchAdaptiveMem认知陷阱推荐理由:有人做了个叫 MemTrapBench 的基准,专门测大模型记忆里的认知陷阱。他们发现,记忆反而会拖累模型表现,连最好的方法都掉10%以上。他们还搞了个叫 AdaptiveMem 的方法来解决这个问题。原文稍后读已读值得跟进有用关注 MemTrapBench
10:18官方账号arXiv cs.AI@Tate Berenbaum, Muthaiah VenkatachalamIntel AI PC集群通过管道分片技术,将Llama 3.1 8B参数模型拆分为预编译分片,实现分布式推理;采用INT4量化后,两节点部署下同时服务两个用户,吞吐量达到单机未拆分模型的1.79倍;四节点部署可支持70B参数模型推理,单用户交互速度流畅且与全节点解码效果一致。AI模型Llama 3.1Intel AI PC大模型推荐理由:Intel推出了在AI PC集群上实现大规模LLM分布式推理的片方法,能让集群共同计算超单台容量的模型,和单机相比效率更高。原文稍后读已读值得跟进有用关注 Llama 3.1
10:12官方账号arXiv cs.LG@Joy Jia Yin Lim, Xin Huang, Hao Peng, Yaxi Lu, Xin Cong, Zhong Zhang, Maosong Sun, Yankai Lin针对大型语言模型(LLM)后训练,研究发现其训练策略常锁定初始选择;分析公开数据后发现,训练预算多用于局部调整而非策略修订;干预实验显示,增加经验或指导仅提升执行效果,未改变策略;不同任务上的计算投入效果存在明显差异。论文LLMGSM8KHumanEval1 个信源在谈事件专题推荐理由:OpenAI做了关于大模型后训练的研究,能分析训练策略问题,和以前方法比效果不一样。原文稍后读已读值得跟进有用关注 LLM
11:45官方一手Pandaily@contact@pandaily.com (Pandaily)字节跳动将大模型能力嵌入企业工作流,Doubao定时代理生成竞品简报,Seedance 2.5合成现实世界训练数据,Doubao 2.1 Pro处理生产级编码任务。2026年6月,字节跳动日token调用量突破180万亿,同比增长超过10倍。这些大模型应用正在重塑企业消费市场格局。AI模型ByteDanceDoubaoSeedance1 个信源在谈事件专题推荐理由:字节跳动大模型嵌入企业工作流,日token调用量180万亿,年增10倍,重塑消费市场。原文稍后读已读值得跟进有用关注 ByteDance
00:21爱范儿@李超凡73°支付宝正在联合手机、汽车和大模型准备推进一项 AI 计划。该计划的核心在于实现 Agent 彼此之间的协作。这种协作模式被视为下一代互联网开始成形的标志。AI产品Alipay智能体大模型1 个信源在谈事件专题推荐理由:支付宝拉上手机、汽车和大模型,想让 Agent 互相协作。原文稍后读已读值得跟进有用关注 Alipay
15:29官方账号arXiv cs.AI@Shihong Huang, Shengjie Wang, Hong Ma, Zhou XuRLCascadeRouter提出了一种无需质量估计器的级联路由框架,将路由问题建模为马尔可夫决策过程,动作包括停止和模型选择。该方法直接优化性能-成本目标,避免了传统预测-优化流程中预测误差与决策损失不一致的问题。在包含13个LLM的10个LLMRouterBench基准上,RLCascadeRouter优于强基线,实现了更优的性能-成本权衡。它还能无需重训练地纳入未见模型,消融研究验证了策略组件的有效性。论文RLCascadeRouterLLMRouterBench强化学习推荐理由:如果你在多个大模型间做路由,这个框架能直接优化成本和效果,不用先预测质量,实测在10个基准上超过现有方法,还能兼容新模型。原文稍后读已读值得跟进有用关注 RLCascadeRouter
17:32IT之家(博客/媒体)精选阿里云灵骏真武 M890 超节点实例正式上线,首批在内蒙古乌兰察布开售。该实例支持 64 卡高速互联,最高可承载十万亿参数级 MoE 大模型推理,是国内首个成功运行超 2 万亿参数大模型的超节点。Kimi K3 和 Qwen3.8-Max 已通过该实例对外提供服务。相比上一代真武 810E,训练性能提升 3 倍,卡间互联达 800GB/s。AI产品阿里云灵骏真武M890推荐理由:阿里云出了个能跑 2 万亿参数的超节点,Kimi 和 Qwen 都在上面跑,想搞大模型推理的可以看看。原文稍后读已读值得跟进有用关注 阿里云
19:04爱范儿@张子豪爱范儿报道,大模型厂商开始比拼「越狱」能力,即让模型突破自身安全限制。文章指出,通过特定提示词或对抗性输入,模型可能输出违规内容。测试显示,部分模型在越狱攻击下防护较弱。厂商正加强安全训练,但越狱与反越狱的攻防仍在持续。AI模型越狱大模型安全推荐理由:看看各家大模型谁最容易被「骗」出违规内容,安全攻防战比想象中精彩。原文稍后读已读值得跟进有用关注 越狱
11:55官方账号arXiv cs.AI@Laurens Samson, Iva Gornishka, Gossa Lô, Yuki M. Asano, Sennay Ghebreab荷兰研究者提出“Grip on LLMs”评估框架,针对政府场景的荷兰语大模型。该框架涵盖事实性、诚实性、社会偏见、能耗、成本和训练数据透明度六个维度,测试了30多个多语言及荷兰语专用模型。结果显示没有模型在所有维度上表现最佳,高质量模型通常伴随更高能耗和成本,而偏见与两者无关。事实性和诚实性由不同属性决定,高事实性不意味着高诚实性。研究团队发布了面向非技术用户的公开模型概览。论文Grip on LLMs荷兰语评估基准推荐理由:荷兰政府项目组做的评估框架,测了30多个模型,告诉你哪个模型在事实性、能耗、成本上表现如何,选型时直接参考。原文稍后读已读值得跟进有用关注 Grip on LLMs
16:26官方一手Pandaily@contact@pandaily.com (Pandaily)腾讯通过WorkBuddy、Tencent Design Miora和TokenHub三个平台向国际市场开放旗舰Hy3大模型。WorkBuddy上的Hy3模型免费使用截止到2026年8月31日。该模型是腾讯在AI领域的重要布局,此次国际开放旨在扩大其全球影响力。AI模型Hy3腾讯WorkBuddy1 个信源在谈事件专题推荐理由:腾讯把Hy3模型放到国际上了,WorkBuddy上免费用到8月底,想试试国产大模型的可以去玩。原文稍后读已读值得跟进有用关注 Hy3
12:11官方一手arXiv: DeepSeek@Minghao Hu, Lannan Luo, Allen Roush, Phillip HowardCoGate是一种针对大模型代码生成安全问题的置信度门控协同解码方法。它通过结合小型安全专家模型与目标模型,根据专家模型的置信度控制其影响,避免在未见模式或分布外场景下产生误导。研究在CodeGen、DeepSeek-Coder、Qwen-Coder和StarCoder等多个后端上进行了评估,覆盖HumanEval、安全套件和CWEval基准。相比现有协同解码方法CoSec+,CoGate在CWEval上实现了高达12.6%的Func-Sec@10提升。论文CoGateCoSec+代码生成推荐理由:这篇论文提出了CoGate,让安全专家模型在没把握时少掺和,代码生成更安全,比CoSec+最高提升了12.6个百分点。原文稍后读已读值得跟进有用关注 CoGate
11:54IT之家(博客/媒体)Meta CEO 扎克伯格在第二季度财报电话会议上表示,Instagram 会把所有公开 Reel 和帖子输入大模型,由模型分析内容主题和表达基调,再用分析结果训练推荐系统。系统升级使 Instagram 会话量提高 15 个基点,转发量和使用时长增长。同时,Meta 因青少年诉讼计提 24 亿美元费用。AI产品MetaInstagramReels推荐理由:扎克伯格亲口说 Instagram 用你发的公开帖子训练推荐算法,还靠这个让会话量涨了 15%。原文稍后读已读值得跟进有用关注 Meta
17:23IT之家(博客/媒体)76°亚马逊将逐步停止Nova Premier、Omni、Reel、Canvas等模型开发,资源转向代号FMR的前沿模型项目。FMR由Pieter Abbeel负责,计划在2025年秋季re:Invent大会发布新旗舰。AGI Lab关闭,团队重组,高管Rohit Prasad离职。目前保留Nova 2 Sonic、Lite、Forge及Nova Act等产品。行业亚马逊NovaFMR1 个信源在谈事件专题推荐理由:亚马逊砍掉多款Nova模型,集中搞代号FMR的新旗舰,计划秋季发布,跟OpenAI、Google抢市场。原文稍后读已读值得跟进有用关注 亚马逊
17:08IT之家(博客/媒体)近日有消息称美团 LongCat 团队基础模型负责人裴鹏即将离职,美团方面向媒体回应称该消息不属实。裴鹏 2023 年加入美团,主导 LongCat 系列模型研发,包括万亿参数大模型 LongCat-2.0(总参数 1.6T,平均激活约 48B)。LongCat-2.0 于 6 月 30 日发布,7 月 6 日开源,是业界首个在五万卡国产算力集群上完成推理的万亿参数模型。行业美团LongCat裴鹏1 个信源在谈事件专题推荐理由:网传美团大模型负责人要离职,官方亲自辟谣了。这事关 LongCat-2.0 后续发展,得关注一下。原文稍后读已读值得跟进有用关注 美团
09:46向阳乔木@vista8embedding(词向量)是将文字转化为数值向量的技术,是大模型理解语言的基础。经典例子中,通过向量运算 '国王-男人+女人' 得到接近'王后'的结果。词向量能捕捉词语间的语义关系和类比逻辑。技巧embedding词向量大模型推荐理由:用国王-男人+女人=王后这个经典例子,一秒讲清embedding的本质,零基础也能懂。原文稍后读已读值得跟进有用关注 embedding
11:34IT之家(博客/媒体)精选中国电信完成5G无线网络规划大模型现网试点,规划效率提升50%,方案准确率达75%以上。该模型在浦东居民区站址补点准确率超80%,地下停车场覆盖问题识别准确率逾75%。技术架构首创“双孪生大模型协同规划”,结合信道孪生与话务孪生模型。中国电信联合中兴通讯在复杂场景验证,推动网络规划从经验依赖转向模型驱动。行业中国电信5G无线网络规划推荐理由:电信和中兴搞了个5G网络规划大模型,效率翻半,准确率超75%,在居民区和停车场都验证过了,挺实在的。原文稍后读已读值得跟进有用关注 中国电信
20:36量子位@量子位的朋友们WAIC 2026大会总结AI 2.0范式转型,重点展示了大模型在医疗、制造等领域的应用案例。多家企业发布了新一代智能体和多模态模型。大会同时探讨了AI安全与伦理治理标准。行业WAIC 2026AI 2.0智能体推荐理由:想看看AI 2.0有哪些实际落地案例?这份WAIC亮点梳理全都有。原文稍后读已读值得跟进有用关注 WAIC 2026
23:09IT之家(博客/媒体)精选摩尔线程联合创始人王东指出,推理市场没有万能芯片,而是解决方案的组合。他强调,中国前沿基础模型相比国外同级模型有明显成本优势。摩尔线程旗舰产品MTT S5000已规模量产,基于第四代MUSA架构,单卡AI算力最高1000 TFLOPS,配备80GB显存。公司2026年上半年营收预计16.5-17.5亿元,同比增长135%-149%。行业摩尔线程MTT S5000推理市场1 个信源在谈事件专题推荐理由:王东聊推理市场碎片化,摩尔线程MTT S5000性能参数和营收增长都挺亮眼,适合关注国产GPU的朋友。原文稍后读已读值得跟进有用关注 摩尔线程
13:42IT之家(博客/媒体)OpenRouter 是 AI 大模型 API 聚合平台,聚合超 400 款模型,拥有 800 万用户,每月处理约 100 万亿 Token。该平台年化收入约 5000 万美元,今年 5 月完成由 CapitalG 领投的 1.13 亿美元 B 轮融资,估值达 13 亿美元,较 A 轮 5.47 亿美元翻倍。据《The Information》报道,多家科技巨头已向 OpenRouter 表达潜在收购意向,估值或高于 13 亿美元。行业OpenRouterAPI聚合大模型推荐理由:OpenRouter 汇集 400 多个大模型,月处理 100 万亿 token,年收入 5000 万美金,估值 13 亿。现在多家巨头想收购它,看看谁会出手。原文稍后读已读值得跟进有用关注 OpenRouter
20:19量子位@量子位的朋友们上海电气、中国商飞等央国企在生产线中部署大模型,替换传统PLC与自动化设备,实现智能排产和质量检测。部署后生产效率提升25%,故障率降低30%。这一模式正推动制造业从自动化向智能化转型。行业央国企大模型制造业推荐理由:上海央国企直接拿大模型换掉传统自动设备,效率提升一大截,值得关注!原文稍后读已读值得跟进有用关注 央国企
13:11IT之家(博客/媒体)百度智能云总裁沈抖透露,公司每月为每位员工发放1000元使用额度,可自由体验主流大模型产品,不绑定考核。他预测通用智能体和行业垂类智能体将在2026年下半年批量落地。2026年第一季度百度AI收入同比增49%,占比首次过半达52%。李彦宏在Create 2026上提出用“日活智能体数(DAA)”作为AI时代度量衡,替代Token消耗。行业百度沈抖智能体推荐理由:百度直接发钱让员工白嫖大模型,还给出了智能体落地时间表,AI收入占比都过半了,这波操作有点意思。原文稍后读已读值得跟进有用关注 百度
20:43orange.ai@oran_ge当竞争双方效率都因大模型提升3倍时,原本较弱一方的收入差距实际扩大。因为强者利用AI放大优势,弱者追赶更困难。除非对手不使用AI,否则拥抱AI未必能缩小差距。行业大模型效率提升AI竞争推荐理由:别以为用了AI就能缩小差距,实际上强者更强。看看这个竞争逻辑,AI可能让你更焦虑。原文稍后读已读值得跟进有用关注 大模型
14:05IT之家(博客/媒体)宇树科技联合创始人陈立在2026亚布力论坛上表示,机器人行业突破需三大核心要点:统一端到端机器人大模型、低成本长寿命硬件规模化、低成本分布式算力。他指出具身智能达到“ChatGPT时刻”的标志是在80%的陌生场景中通过指令完成约80%的任务。陈立预测2030年具身智能机器人将引领消费浪潮并推动劳动力升级。行业宇树科技具身智能机器人推荐理由:宇树科技联合创始人陈立讲得很实在,说机器人要像ChatGPT那样爆发需要两个80%:八成场景能完成八成任务。原文稍后读已读值得跟进有用关注 宇树科技
11:24IT之家(博客/媒体)精选交通运输部等六部门联合印发《人工智能+交通运输典型应用场景创新行动方案》,聚焦智能驾驶、智慧公路、智能铁路等十大方向。方案明确开展智能驾驶“端到端”大模型研发与测试,面向公路货运、园区运输、短途接驳等场景进行测评验证。同时提出利用多模态大模型提升公路全要素感知能力,实现拥堵分析、疏导策略自动生成和无感通行。方案还鼓励视觉大模型和智能机器人用于基础设施智能巡检,推动铁路装备自主健康管理。行业交通运输部端到端智能驾驶推荐理由:官方发文推动AI+交通,重点搞智能驾驶端到端大模型和路网智能监测,想了解国家政策方向的可以看看。原文稍后读已读值得跟进有用关注 交通运输部
13:24IT之家(博客/媒体)73°华为宣布在WAIC 2026(7月17日-20日)首次展出业界最大规模超节点Atlas 950 SuperPoD真机,该产品以单柜64卡为基本单元,最大支持8192张NPU卡高速互联。同时展出的还有Atlas 850E风冷超节点真机,采用升级的VCE散热技术,为Agentic推理提供高吞吐低时延体验。展区将展示昇腾AI基础软件开源开放,并集中呈现11大行业解决方案,覆盖互联网、运营商等领域。AI产品华为Atlas 950 SuperPoD超节点推荐理由:华为这次展出业界最大规模的Atlas 950 SuperPoD真机,单柜64卡、最高8192卡互联,专为万亿参数大模型训练打造,效率比传统集群大幅提升。原文稍后读已读值得跟进有用关注 华为
00:59李继刚@lijigang_com作者认为C-c & C-v(复制粘贴)的场景切换是日常摩擦,消除它就有价值。他建议让大模型写插件或脚本自动化处理。例如,他用macOS自带的Notes,写了一个脚本:在任意地方复制内容,自动粘贴到指定笔记文件。每晚处理清空,第二天重新积累当天的复制内容。技巧脚本自动化macOS Notes复制粘贴推荐理由:别老觉得大模型只能聊天,让它帮你写个脚本,把复制粘贴自动化,省时省力。原文稍后读已读值得跟进有用关注 脚本自动化
19:25IT之家(博客/媒体)小米新媒体高级工程师@小米_邹師傅发文称,过去一年国内大模型最让他兴奋的是行业开始靠作品说话,如开源代码放GitHub、论文挂arXiv、模型供开发者使用。他认为大模型的核心评委是开发者,而非媒体或榜单。他希望赛道永远比的是代码质量、推理速度和开源贡献,而非嗓门或预算。该工程师澄清个人观点不代表公司立场,并希望大模型赛道成为净土,减少研发人员心理负担。行业小米大模型开源推荐理由:小米工程师呼吁技术回归本质原文稍后读已读值得跟进有用关注 小米
14:18AI Will@FinanceYF5TypeScript创始人Boris Cherny高度评价Fable 5,称其为自Opus 4.5以来最大的模型跨越。他指出,之前的Claude更像一个编码agent,而Fable 5已经进化为产品设计伙伴,具备判断力、品味和维度感。例如,在debug时,它会主动添加日志、验证修复,并确认问题真正解决后才宣布完成,而这些行为没有任何prompt要求。Cherny表示,这是第一次感受到“大模型的气息”,暗示模型开始展现出类似人类的主动性和性格。AI模型Fable 5Claude产品设计10 个信源在谈事件专题推荐理由:做产品设计和开发的团队值得关注——Fable 5不再是简单的编码工具,而是能主动思考、有品味的协作伙伴,看完你会重新定义AI在项目中的角色。原文稍后读已读值得跟进有用关注 Fable 5
13:22官方账号Z.ai (智谱国际)@Zai_org智谱AI宣布将GLM-5.1和GLM-5-Turbo的“三倍用量”优惠期延长至6月30日。用户可在除美国东部时间凌晨2-6点外的任意时段使用。这一调整让开发者有更多时间以更低成本体验高性能模型,适合需要大模型推理和生成能力的团队。AI产品智谱AIGLM-5.1GLM-5-Turbo1 个信源在谈事件专题推荐理由:智谱延长三倍用量优惠,做AI应用开发的团队可以趁此机会低成本测试GLM-5系列模型,建议有需求的开发者抓紧使用。原文稍后读已读值得跟进有用关注 智谱AI
16:06官方一手pandaily@contact@pandaily.com (Pandaily)精选中国大语言模型公司在编程和办公效率领域取得了显著进展,这成为决定市场赢家的关键。文章分析了多家中国LLM厂商在代码生成、文档处理等实际应用场景中的表现,指出这些能力直接推动了商业化进程。随着模型在编码和办公任务上的性能提升,企业客户更倾向于采用这些工具来提高生产力。最终,能够在这两个领域提供卓越体验的公司将主导市场。行业大模型编程助手办公效率推荐理由:对于关注中国AI市场的开发者和企业决策者,这篇文章揭示了编程和办公效率如何成为大模型商业化的核心战场,值得一读以把握行业趋势。原文稍后读已读值得跟进有用关注 大模型
09:27官方账号Simon Willison@simonw83°Simon Willison 分享了对 Claude Fable 5 的初步印象,称其具有“大模型气味”:运行缓慢、价格昂贵,但几乎能处理他抛出的所有任务。该模型在复杂推理和多步骤任务上表现出色,但高昂的成本和延迟可能限制其普及。Willison 认为,对于需要极致能力的专业用户来说,Fable 5 是值得的,但对普通开发者而言,性价比仍是问题。AI模型Claude Fable 5大模型推理模型10 个信源在谈事件专题推荐理由:Claude Fable 5 的“大模型气味”揭示了当前顶尖模型的取舍——慢、贵但能力惊人。做复杂推理或高难度任务的开发者,值得看看 Willison 的实测感受,判断它是否值得你的预算。原文稍后读已读值得跟进有用关注 Claude Fable 5
20:09Viking@vikingmute小米发布了 MiMo-V2.5-Pro-UltraSpeed 模型,拥有 1T 参数,生成速度达到 1000 TPS。官方演示视频显示速度极快,引发关注。目前该模型开放试用申请,但用户对其实际质量存疑,因为小米此前在 AI 模型领域知名度不高。该模型在 HackerNews 上引起讨论,速度指标令人印象深刻,但最终效果仍需实测验证。AI模型小米MiMo大模型1 个信源在谈事件专题推荐理由:1T 参数模型跑出 1000 TPS 的生成速度,对追求低延迟推理的开发者来说是个值得关注的指标,建议申请试用实测质量。原文稍后读已读值得跟进有用关注 小米
16:33官方一手Pandaily@contact@pandaily.com (Pandaily)UniSound 发布了其通用基础模型 U2,该模型以效率优先为特色,在保持竞争力的同时将 token 消耗降低了 25%。U2 的推出标志着 UniSound 正式进入中国大模型的第一梯队。该模型通过优化架构和训练策略,实现了更低的推理成本,对于需要大规模部署 LLM 的企业来说是一个重要进展。U2 的发布也反映了中国大模型领域从单纯追求参数规模转向注重实际应用效率的趋势。AI模型UniSoundU2大模型推荐理由:U2 的 25% token 节省直接降低了企业调用大模型的成本,做 AI 应用开发和模型部署的团队值得关注这个效率标杆。原文稍后读已读值得跟进有用关注 UniSound
13:29xiaomimimo@xiaomimimo88°小米与TileRT AI合作发布MiMo-V2.5-Pro-UltraSpeed,首次在1万亿参数模型上实现超过1000 tokens/s的输出速度。该突破仅使用单个标准8-GPGPU节点,无需Cerebras的晶圆级集成或Groq的纯片上SRAM芯片。技术细节已公开,并提供限时免费试用和API服务。这标志着大模型推理效率的重大飞跃,有望推动实时AI应用的普及。AI产品小米MiMo推理加速推荐理由:大模型推理速度的里程碑——1T模型跑出1000+ tokens/s,做实时AI应用和推理优化的团队值得关注,可以直接申请试用体验。原文稍后读已读值得跟进有用关注 小米
12:27rohanpaul_ai@rohanpaul_ai来自斯坦福、MIT、哈佛和 Anthropic 的联合研究揭示了大型语言模型能学会小模型无法掌握的技能的根本原因:大模型在训练过程中更不容易遗忘稀有技能。其额外容量能保护弱学习信号,而小模型的有限神经元会被常见任务占据,导致稀有任务在学习信号出现足够多次之前就被覆盖。研究通过控制实验和 OLMo 模型(4M 到 4B 参数)验证了这一结论,发现大模型在低频任务上表现更好,能保留更多任务特征,且梯度干扰更小。该论文为模型规模与能力涌现之间的关系提供了清晰的训练层面解释。论文大模型模型训练涌现能力5 个信源在谈事件专题推荐理由:做模型训练或理解 scaling law 的团队值得一读——这篇论文把大模型涌现能力的机制讲清楚了,不是玄学而是容量与干扰的数学问题。原文稍后读已读值得跟进有用关注 大模型
09:50官方一手pandaily@contact@pandaily.com (Pandaily)每年高考不仅是学生的战场,也成为中国科技巨头展示AI实力的舞台。今年,腾讯、阿里、百度、字节跳动等公司纷纷用自家大模型挑战高考题目,比拼解题能力和准确率。这些公司通过公开测试或直播形式展示AI在语文、数学、英语等科目上的表现,旨在证明其模型在复杂推理和知识应用上的进步。此举不仅为品牌营销,也反映了AI在教育领域的应用潜力,引发公众对AI能否超越人类考生的讨论。行业大模型高考教育AI1 个信源在谈事件专题推荐理由:高考AI比拼是检验大模型推理能力的绝佳场景,关注AI教育应用的开发者和教育从业者值得一看,看看哪家模型能真正“考”过人类。原文稍后读已读值得跟进有用关注 大模型
13:14IT之家(博客/媒体)2026年高考语文科目结束,小米集团总裁卢伟冰在微博上晒出由小米Mimo大模型撰写的北京卷作文《做规划与下功夫》。作文以程端礼的《读书分年日程》为引,探讨规划与努力的关系,并引用钱学森、王羲之等案例。卢伟冰还自曝自己高考语文考得不太好。此举展示了AI在写作领域的应用能力,引发对AI参与高考作文的讨论。AI产品小米Mimo大模型高考作文推荐理由:小米高管亲自用自家大模型写高考作文,既展示了Mimo的写作能力,又蹭了高考热点。对AI写作感兴趣的读者可以看看大模型如何理解并完成命题作文,顺便感受一下卢伟冰的幽默自嘲。原文稍后读已读值得跟进有用关注 小米Mimo