8月22日
16:33
8月21日
18:05
16:09
16:09官方一手Pandaily@contact@pandaily.com (Pandaily)
精选
小红书发布自研大模型dots3-note,MoE模型,总参数280B,激活参数16B,512K上下文,支持文本、视觉和语音理解。以Apache 2.0协议在Hugging Face和GitHub上开源,华为Ascend零延迟适配,标志着月活跃用户超3亿的平台上,AI从功能转变为基础。

推荐理由:小红书开源自研大模型,支持多模态理解,与华为Ascend深度适配,为内容平台构建AI基础,值得关注。
10:15
10:15官方账号arXiv cs.AI@Mengru Wang, Haozhe Luo, Zhenqian Xu, Zhixiang Cui, Haoming Xu, Qu Yang, Jizhan Fang, Junfeng Fang, Ningyu Zhang
研究人员提出 MemTrapBench 基准,用于评估大模型记忆使用中的认知陷阱。该基准涵盖 Reasoning Fixation 和 Belief Distortion 两种陷阱形式。实验显示,在两个模型家族和五种代表性记忆框架上,所有记忆策略的表现均不如无记忆设置,最强方法性能下降超10%。为缓解这些陷阱,研究者提出 AdaptiveMem 方法,可在推理时指导模型避免记忆陷阱。
推荐理由:有人做了个叫 MemTrapBench 的基准,专门测大模型记忆里的认知陷阱。他们发现,记忆反而会拖累模型表现,连最好的方法都掉10%以上。他们还搞了个叫 AdaptiveMem 的方法来解决这个问题。
8月20日
10:18
10:18官方账号arXiv cs.AI@Tate Berenbaum, Muthaiah Venkatachalam
Intel AI PC集群通过管道分片技术,将Llama 3.1 8B参数模型拆分为预编译分片,实现分布式推理;采用INT4量化后,两节点部署下同时服务两个用户,吞吐量达到单机未拆分模型的1.79倍;四节点部署可支持70B参数模型推理,单用户交互速度流畅且与全节点解码效果一致。
推荐理由:Intel推出了在AI PC集群上实现大规模LLM分布式推理的片方法,能让集群共同计算超单台容量的模型,和单机相比效率更高。
10:12
10:12官方账号arXiv cs.LG@Joy Jia Yin Lim, Xin Huang, Hao Peng, Yaxi Lu, Xin Cong, Zhong Zhang, Maosong Sun, Yankai Lin
针对大型语言模型(LLM)后训练,研究发现其训练策略常锁定初始选择;分析公开数据后发现,训练预算多用于局部调整而非策略修订;干预实验显示,增加经验或指导仅提升执行效果,未改变策略;不同任务上的计算投入效果存在明显差异。
事件专题

推荐理由:OpenAI做了关于大模型后训练的研究,能分析训练策略问题,和以前方法比效果不一样。
8月19日
11:45
00:21
8月5日
16:26
16:26官方一手Pandaily@contact@pandaily.com (Pandaily)
腾讯通过WorkBuddy、Tencent Design Miora和TokenHub三个平台向国际市场开放旗舰Hy3大模型。WorkBuddy上的Hy3模型免费使用截止到2026年8月31日。该模型是腾讯在AI领域的重要布局,此次国际开放旨在扩大其全球影响力。
事件专题

推荐理由:腾讯把Hy3模型放到国际上了,WorkBuddy上免费用到8月底,想试试国产大模型的可以去玩。
7月28日
7月23日
09:46
7月20日
20:36
7月13日
20:43
6月12日
13:22
13:22官方账号Z.ai (智谱国际)@Zai_org
智谱AI宣布将GLM-5.1和GLM-5-Turbo的“三倍用量”优惠期延长至6月30日。用户可在除美国东部时间凌晨2-6点外的任意时段使用。这一调整让开发者有更多时间以更低成本体验高性能模型,适合需要大模型推理和生成能力的团队。
事件专题

推荐理由:智谱延长三倍用量优惠,做AI应用开发的团队可以趁此机会低成本测试GLM-5系列模型,建议有需求的开发者抓紧使用。
6月10日
09:27
09:27官方账号Simon Willison@simonw
83°
Simon Willison 分享了对 Claude Fable 5 的初步印象,称其具有“大模型气味”:运行缓慢、价格昂贵,但几乎能处理他抛出的所有任务。该模型在复杂推理和多步骤任务上表现出色,但高昂的成本和延迟可能限制其普及。Willison 认为,对于需要极致能力的专业用户来说,Fable 5 是值得的,但对普通开发者而言,性价比仍是问题。
事件专题

推荐理由:Claude Fable 5 的“大模型气味”揭示了当前顶尖模型的取舍——慢、贵但能力惊人。做复杂推理或高难度任务的开发者,值得看看 Willison 的实测感受,判断它是否值得你的预算。
6月9日
6月8日
6月7日
13:14
13:14IT之家博客/媒体
2026年高考语文科目结束,小米集团总裁卢伟冰在微博上晒出由小米Mimo大模型撰写的北京卷作文《做规划与下功夫》。作文以程端礼的《读书分年日程》为引,探讨规划与努力的关系,并引用钱学森、王羲之等案例。卢伟冰还自曝自己高考语文考得不太好。此举展示了AI在写作领域的应用能力,引发对AI参与高考作文的讨论。

推荐理由:小米高管亲自用自家大模型写高考作文,既展示了Mimo的写作能力,又蹭了高考热点。对AI写作感兴趣的读者可以看看大模型如何理解并完成命题作文,顺便感受一下卢伟冰的幽默自嘲。