7月1日
05:45
05:45官方账号Simon Willison’s Weblog博客/媒体
Anthropic 发布了 Claude Sonnet 5,其性能接近 Opus 4.8 但价格更低。模型支持 1M 上下文窗口和 128K 输出 token,自适应思考默认开启。新 tokenizer 使英文文本 token 数增加约 30%,实际成本上升约 30%。定价保持 Sonnet 4.6 水平:$3/百万输入、$15/百万输出,8月31日前有折扣。
事件专题

推荐理由:Anthropic 刚发了 Sonnet 5,性能接近 Opus 4.8 但更便宜,不过新 tokenizer 会让你的账单多掏 30%,用之前先算好账。
03:08
03:00
03:00官方账号Decoder@Matthias Bastian
76°
Anthropic推出Claude Sonnet 5,在GDPval-AA v2知识工作测试中得分1,618,超越前代Sonnet 4.6和更贵的Opus 4.8。该模型在网络安全任务上得分远低于美国政府当前封锁的模型。Sonnet 5进一步缩小了与Opus系列的价格-性能差距。
事件专题

推荐理由:Anthropic的新模型Sonnet 5,基准测试上超过自家大哥Opus 4.8,价格还更低,挺能打的。
02:04
01:34
01:34官方账号Decoder@Matthias Bastian
Google发布两个新生成式AI模型:Nano Banana 2 Lite可在4秒内生成图像,每张成本0.034美元。Gemini Omni Flash首次通过API支持文本提示生成和编辑视频。Google建议将两个模型串联,从静态图像转换为动画视频。
事件专题

推荐理由:Google新出两个模型:一个4秒出图只要3分钱,另一个能文字生成视频,还能链着玩。
01:07
01:07官方一手OpenAI Blog博客/媒体
GeneBench-Pro是一个新发布的基准测试,用于评估AI在基因组学、生物学和科学研究中的性能。该基准使用复杂真实世界数据集,涵盖多种科学任务。它旨在衡量模型在基因分析和生物信息学方面的能力。
事件专题

推荐理由:GeneBench-Pro用真实数据测AI在基因组学上的表现,搞科研的可以看看到底谁更强。
6月30日
23:40
23:40官方账号Decoder@Maximilian Schreiner
76°
美团发布LongCat-2.0模型,参数量达1.6万亿,完全在国产芯片上训练完成,未使用Nvidia硬件。该模型在多个中文基准上表现优异,证明中国芯片可支撑超大规模AI训练。训练过程中采用分布式优化算法,效率接近国际主流方案。
事件专题

推荐理由:美团搞了个1.6万亿参数的大模型LongCat-2.0,全程用国产芯片,没碰Nvidia,性能还很强。想看看中国芯片能不能撑起大模型?这篇聊得清楚。
16:51
16:51官方账号Decoder@Matthias Bastian
DeepSeek发布新框架DSpark,将每位用户的响应速度提升60%至85%。该框架使用小型模型生成候选token,再由大型模型批量验证。通过优化计算流程,DSpark能在更少芯片上榨取更多性能。这有助于减少中国对高端美国芯片的依赖。

推荐理由:DeepSeek的DSpark用小型模型提候选token、大模型批量验证,让速度提升85%,还减少了芯片需求,挺实用的。
16:05
16:05官方一手pandaily@contact@pandaily.com (Pandaily)
精选
华为开源了92B参数的openPangu-2.0-Flash模型,上下文窗口达512K tokens。该模型原生适配昇腾AI开发生态,可在Ascend硬件上高效运行。这是华为在开源大模型领域的重要动作,为开发者提供了新的选择。
事件专题

推荐理由:华为开源了92B参数的openPangu-2.0-Flash,512K上下文挺大,而且专为昇腾优化,做国产AI开发的同学可以试试。
16:04
10:29
10:29官方一手pandaily@contact@pandaily.com (Pandaily)
72°
DeepSeek计划于7月中旬发布V4官方版本。高峰时段(9am-12pm和2pm-6pm)API定价将为标准费率的2倍,类似电力分时计价模式。此举旨在引导开发者在非高峰时段调用API。

推荐理由:DeepSeek V4马上要来了,7月中旬发布。高峰时段API价格翻倍,想省成本就避开那段时间,适合用API的开发者留意。
01:17
01:17官方账号Simon Willison’s Weblog博客/媒体
精选
DeepReinforce 发布 Ornith-1.0,一款 MIT 许可的开源模型,基于 Gemma 4 和 Qwen 3.5 预训练。提供 9B Dense、31B Dense、35B MoE 和 397B MoE 四种规格。在编码基准上达到同尺寸开源模型 SOTA。作者在 LM Studio 上测试 35B Q4_K_M GGUF 版本,能流畅运行代理工具调用并处理代码定位任务。
事件专题

推荐理由:DeepReinforce 新出的开源编码模型,基于 Gemma 4 和 Qwen 3.5,在代理编码任务上表现不错,LM Studio 就能跑,值得试试。
6月29日
6月28日
16:36
16:36官方一手Pandaily@contact@pandaily.com (Pandaily)
76°
北京大学与DeepSeek联合开源了投机解码框架DSpark,该框架无需修改模型即可将LLM推理速度提升60-85%。在严格延迟约束下,吞吐量增益最高达661%。DSpark通过高效的投机解码策略显著降低推理延迟。这一成果已在GitHub上开源。

推荐理由:北大和DeepSeek搞的DSpark,不用改模型就能让推理快80%,吞吐量翻好几倍,适合做部署的试试。
16:03
16:03官方账号Decoder@Jonathan Kemper
精选
新浪微博发布开源模型VibeThinker-3B,仅30亿参数。在数学和编程基准上,它匹配了DeepSeek V3.2和Kimi K2.5,后两者参数规模大333倍。模型通过多阶段后训练实现高性能。研究人员假设:逻辑推理可压缩进小模型,但广泛世界知识不行。

推荐理由:30亿参数的小模型推理能力居然能打千亿级大模型,新浪VibeThinker-3B在数学和编程上很强,而且开源了。
13:11
13:11官方一手pandaily@contact@pandaily.com (Pandaily)
DeepSeek 发布 DSpark 推测解码框架,可将文本生成速度提升 80%。该框架优化推理效率,标志着 AI 竞争焦点从训练规模转向实际部署。DSpark 采用推测解码技术,通过小模型草稿加速大模型生成。

推荐理由:DeepSeek 的 DSpark 框架让模型生成快八成,推理部署更省算力,搞推理优化的可以看看。
13:01