8月22日
07:23
05:34
05:03
8月21日
21:38
19:58
18:03
18:03官方账号深度求索 DeepSeek@deepseek_ai
78°
DeepSeek-V4-Flash-Vision-Exp模型在DeepSeek API平台上线,文本能力与DeepSeek-V4-Flash相当,多模态性能提升显著,接近Opus-4.8。DeepSeek Harness 0.1.1版本支持新模型。
事件专题

推荐理由:DeepSeek新模型上线,文本和推理能力提升,多模态性能接近Opus-4.8,值得一试!
16:07
16:07官方一手pandaily@contact@pandaily.com (Pandaily)
78°
开源开发者新基准Qwen3.8-27B发布,两天内下载量破百万,跻身Hugging Face全球趋势榜,在Artificial Analysis的智能指数上与GPT-5.6 Luna和DeepSeek V4 Flash并列,昵称'本地Opus 4.6',将前沿能力压缩至27亿参数模型,4位量化后适配24GB GPU。新发布模型均以超越Qwen3.8-27B为标准。
事件专题

推荐理由:开源开发者有了新基准,Qwen3.8-27B横扫消费级硬件,比肩GPT-5.6 Luna和DeepSeek V4 Flash,参数量27亿,4位量化后适配24GB GPU,超越它才是新标准!
06:43
06:40
03:04
03:04官方一手marktechpost@Asif Razzaq
精选
Liquid AI发布了LFM2.5-DSpark模型。该模型通过推测性解码技术,在保持输出结果不变的情况下,将解码速度提升了最高3.18倍。新模型包含三个约3亿参数的drafters。
推荐理由:Liquid AI给LFM2.5模型加了三个drafters,解码速度能快3.18倍,但输出结果和原来一模一样,不用改现有应用就能用。
01:41
01:41lmarena.ai@lmarena_ai
精选
Meta 发布了 Muse Spark 1.2 (xHigh) 模型。该模型在 Agent Arena 基准测试中实现了 +2.1% 的净提升。相比前代 Muse Spark 1.1,其净提升分数从 0.9% 提升至 2.1%。在 Bash Recovery 任务上,性能从 +5.9% 提升到 +11.4%。

推荐理由:Meta 刚刚发布了 Muse Spark 1.2 (xHigh),在 Agent Arena 上的净提升分数从 0.9% 提升到了 2.1%,Bash Recovery 任务直接翻倍,比前代强了不少。
01:39
01:39lmarena.ai@lmarena_ai
Muse Spark 1.2 (xHigh) 模型在 Bash Recovery 基准上提升了 11.4%。该模型在 Confirmed Success 指标上提升了 6%。Praise vs. Complaint 指标下降了 5.7%。Steerability 指标下降了 2.5%。Tool Hallucination 指标提升了 1.1%。

推荐理由:Muse Spark 1.2 (xHigh) 模型发布了,在处理命令行错误上提升明显,用户反馈也更好,但纠错和引导能力略有下降。
8月20日
23:04
15:57
14:45
14:45官方账号Latent Space (swyx)博客/媒体
Z.ai首席执行官Jie Tang针对GLM 5.3模型版本发表看法;他介绍了新的Post-training Scaling Law及其应用场景;该定律对比传统方法,在模型训练效率上表现更优。
事件专题

推荐理由:Z.ai的老总讲了GLM 5.3和那个新定律,讲清楚和以前不一样的地方,你去听听了解下。
13:41
13:41官方账号阿里通义 Qwen@Alibaba_Qwen
阿里推出的Qwen3.8 - 27B新模型,借助Unsloth技术后,在Div - 300基准测试中表现更优;该模型采用1 - bit量化方式,能在8GB内存下运行,保持77%准确率;相比其他模型,它在KLD等更多基准上领先超10%
事件专题

推荐理由:阿里和Unsloth一起发布了Qwen3.8 - 27B模型,用新方法让它运行更好,比其他模型好超10%。
13:26
10:25
10:25官方账号arXiv cs.LG@Changshun Wu, Weicheng He, Xiaowei Huang, Saddek Bensalem
SPK是一个专门用于目标检测离分布(OoD)检测的研究框架;该框架通过挖掘预训练目标检测器的隐含先验知识来实现检测;在多个OoD基准测试中达到了领先水平(state-of-art);其设计还能构建可解释的知识空间来分析预测可靠性。
推荐理由:SPK是新提出的框架,能让目标检测器在检测时更准确识别异常情况,和之前的方法相比效果更好。
10:20
10:20官方账号arXiv cs.LG@Sotirios P. Chatzis, Loukas Papadoulas
精选
Lévy Attention是一种新型注意力机制,可对连续时间序列查询提供信任度评估;该机制通过泊松随机测度实现,单次计算就能输出不确定性相关指标;在t-PatchGNN基准测试中,与同类方法相比仅损失5.6%精度;其输出的不确定性信号能有效提升预测可靠性,优于多轮采样方式。
推荐理由:Lévy Attention这个模型,能一次计算就给连续时间预测评信任度,和之前的方法比,在小数据场景下还保持较好表现。
10:19
10:19官方账号arXiv cs.LG@Jielong Lu, Zhihao Wu, Jiajun Yu, Zhaoliang Chen, Haishuai Wang
SIMPLE模型利用合成任务先验开展多视图可复用推理预训练,在多组学基准测试中无需额外调整即可取得较好结果。该模型针对多视图和多组学场景设计,验证了可复用推理的可行性。与传统方法对比,其减少了知识重复学习的浪费,提升了应用效率。
推荐理由:SIMPLE这个模型做了个用合成任务先验做多视图可复用推理的事,在多组学数据上直接用冻结方式就好,比以前方法省事儿。
10:18
10:18官方账号arXiv cs.AI@Jayjun Lee, Jessica Yin, Asif Rana, Nicholas Blauch, Sam Mady, Mohak Bhardwaj, Nima Fazeli, Nathan Ratliff, Karl Van Wyk, Ankur Handa
精选
ADEPT是一种强化学习框架,通过预训练和后训练方式提升多指机器人的灵巧性。该模型在23自由度的Kuka-Allegro和29自由度的Flexiv-Sharpa上测试,可从原始感知直接完成长时任务。它先针对通用物体摆放任务进行预训练,再将预训练行为作为先验用于下游任务的后训练。通过稳定后训练流程,实现模拟到现实的转移并达到人速级别的灵巧操作。
推荐理由:我了解ADEPT这个模型,它是用强化学习让机器人更灵活,学新动作时能直接用之前的经验,和没这么训练的方法比,效果更好。
10:18
10:18官方账号arXiv cs.AI@Anran Wang, Wen Shi, Yong Luo, Jianbin Huang, Lijuan Chen, Junhu Zhao, Weixin Jin, Huihui Yuan
采用的可解释式AI模型将大气环流预测转化为降水估计,预测2026年夏季中国中部会出现干旱异常。预测从3月到5月初始化后,一致表明该地区2026年夏季存在干旱情况。回顾性评估显示该模型的预测能力更强,且这类年份常伴随中太平洋升温现象。
推荐理由:这是科研团队用可解释AI做气候预测研究,用模型分析大气环流与降水联系,预测干旱效果比常规方法更好。
10:18
10:18官方账号arXiv cs.AI@Ramneet Kaur, Pradyumna Chari, Ramesh Raskar, Jugad Singh, Sumit Kumar Jha, Anirban Roy
Qwen3-0.6B模型在多代理拍卖场景中,通过新框架监测潜在隐蔽协作;该框架对同质化代理的检测准确率达0.993,异质化组合达0.854;测试显示对小范围竞拍者监测负载小,全白盒干预能恢复出价分布并降低合谋行为47.3个百分点。
推荐理由:Qwen3推出了VLA框架,用来监测多代理潜在通信,在小范围拍卖里表现好,你可以去了解下。
10:16
10:16官方账号arXiv cs.AI@Boqiao Zhang, Godbless James, Sai Krishna Gottipati, Andrew Fitzgibbon
PGFS++是一种用于分子性质优化的强化学习框架,在合成和多样性约束下实现改进。该框架基于PGFS升级,采用可训练反应模板表示,显著提升性能。相比前代方法,它在改善目标性质的同时保持了输出多样性。
推荐理由:PGFS++是新分子优化方法,能解决合成和多样性难题,比之前版本效果更好还保分子多样性。
10:15
10:15官方一手arXiv: OpenAI@Bo Liu, Simon Yu, Yiding Jiang, Ao Qu, Andrew Zhao, Zichen Liu, Junsu Kim, Zijian Zhou, Seungone Kim, Tongzheng Ren, Mickel Liu, Hanfei Yu, Zhaorun Chen, Weiyan Shi, Paul Pu Liang, Luke Zettlemoyer, Yejin Choi, Natasha Jaques
72°
SPADE利用30B参数模型实现自学习,构建自适应合成执行环境作为训练场景;让单一大语言模型同时承担环境设计与推理任务,提升数学、科学等领域表现;在八项推理与工具使用基准测试中,SPADE使模型平均提升5.3个百分点。
推荐理由:你可以试试SPADE,它是让大语言模型自己学建环境,在数学题这些领域比固定环境方法强5.3%呢。
07:36
05:26
05:26Replicate@replicate
72°
Replicate平台上正式上线了OpenAI推出的GPT - 5.6版本,该版本为开发者提供了新的接口支持;与之前版本对比,GPT - 5.6在复杂问题处理上的效率提升了15%。用户可通过Replicate直接调用该版本进行项目开发。体验更便捷高效。
事件专题

推荐理由:Replicate和OpenAI一起推出了GPT - 5.6版本,用户可以直接用它来做项目,和之前版本比起来使用体验更好了。
05:25
04:00
02:55
02:25
02:25Guillermo Rauch@rauchg
@blackboxai推出为期两周免费GLM - 5.2,该模型使用量远超预期;同时提供ChatGPT Sol一个月内五折优惠,与常规价格相比更具性价比;两款产品对比,GLM - 5.2作为劳力型模型表现突出。
推荐理由:黑盒AI现在提供免费GLM - 5.2两周体验,还能拿到ChatGPT Sol半价优惠,比普通购买便宜不少,你值得试试。
01:25
01:25官方账号NVIDIA AI@NVIDIAAI
74°
英伟达对超300项验证技能开展基准测试,以相同任务、模型和设置对比有无技能的代理表现。在多项真实任务基准中,带技能的代理正确率提升41个百分点。与无技能代理相比,带技能代理效率提升35个百分点。
事件专题

推荐理由:英伟达测试超300项技能,对比后可知技能对代理帮助大小, 和无技能代理比效果不同, 值得去了解。
8月19日
22:42
22:39
22:39官方账号Decoder@Maximilian Schreiner
Anthropic的Claude模型在蛋白设计中实现35%成功率,远高于行业平均10 - 15%;该模型仅辅助已有专业工具,独立评估仍在进行中;此技术让任意实验室能完成蛋白质设计的完整流程。
事件专题

推荐理由:Anthropic放出Claude模型新功能,能让任意实验室完成全蛋白设计流程,比行业平均效率高很多。