8月18日
15:30
15:30官方账号阿里通义 Qwen@Alibaba_Qwen
精选73°
Qwen3.8-27B在Artificial Analysis Intelligence Index上达到DeepSeek V4-Pro和GPT 5.6 Luna的性能水平,成为首个获得前沿模型能力的本地模型。该模型仅27B参数,却实现了与大型前沿模型相当的表现。Qwen团队表示,这一进展速度超出预期,未来将应用于更多领域。
事件专题

推荐理由:Qwen的27B本地模型跑出了DeepSeek V4-Pro和GPT 5.6 Luna的水平,本地模型也能打前沿了,值得看看。
7月24日
12:01
12:01官方一手arXiv: DeepSeek@Lei Zhang, Yusheng Zhao, Yimeng Cao, Ranyiliu Chen, Mingrui Jing, Jizhe Lai, Ziao Tang, Jingu Xie, Hongshun Yao, Xuanqiang Zhao, Guocheng Zhen, Chengkai Zhu, Xin Wang
精选
研究者发布两个 Lean 4 基准:Lean-QuantumAlg-Bench(36 个任务)和 Lean-QIT-Bench(40 个任务),用于评估 AI 在量子算法和量子信息理论上的定理证明能力。在四个模型(GPT-5.5、Kimi K3、DeepSeek V4-Pro、MiniMax M3)中,最高难度加权得分分别为 60.4/100 和 59.6/100。库增强推理(LAD)在所有八个模型-基准对比中均提升得分和完成率,最高提升 15.9 分。模型在量子模拟、量子学习、量子信息度量等领域的证明能力存在薄弱环节。
事件专题

推荐理由:想知道 AI 定理证明在量子计算领域到底多强?这篇论文给了两个新基准和四个模型实测分数,LAD 方法能提升最高 15.9 分,很实在。
7月18日