09:24IT之家(博客/媒体)AI芯片初创企业Etched宣布其推理加速器芯片完成A0步进流片,并已获得超10亿美元订单和8亿美元B轮融资,首批机架预计2026年夏天出货。该芯片基于台积电N4P制程,数学模块电压比大多数竞品低50%以上,能以超80%算力效率运行1T规模的稀疏MoE模型。缓存侧采用片内SRAM+片外HBM组合,兼顾低延迟和大容量,实现高吞吐与交互性。AI模型EtchedSRAMHBM5 个信源在谈事件专题推荐理由:Etched发了款新推理芯片,电压比竞品低一半,跑1T模型还能保持80%效率,还用了SRAM加HBM缓存,挺有意思。原文稍后读已读值得跟进有用关注 Etched
08:00IT之家(博客/媒体)谷歌发布Nano Banana 2 Lite图像生成模型,4秒内可生成一张图像。每生成1000张图像收费0.034美元(约合0.23元人民币),成本低于标准版Nano Banana 2。该模型强调速度和批量处理能力,已登陆谷歌AI Studio、Gemini API等平台,并取代初代Nano Banana。谷歌还扩大了Gemini Omni Flash的开放范围,其视频生成收费标准为每秒0.10美元。AI模型Nano Banana 2 Lite谷歌图像生成10 个信源在谈事件专题推荐理由:谷歌新出的Nano Banana 2 Lite,4秒出一张图,一千张才两毛三,做批量生图效率高又省钱。原文稍后读已读值得跟进有用关注 Nano Banana 2 Lite
07:47IT之家(博客/媒体)Anthropic发布Claude Sonnet 5,定位Sonnet系列智能体能力最强模型,可自主制定计划、调用浏览器和终端等工具。在智能体搜索评测BrowseComp和计算机使用评测OSWorld中,Sonnet 5相比Sonnet 4.6有显著改进,部分任务接近Opus 4.8。API优惠期(至2026年8月31日)每百万tokens输入2美元、输出10美元,之后恢复3美元、15美元。安全方面不良行为发生率低于Sonnet 4.6,在恶意请求拒绝、提示注入攻击抵抗等方面均有改善。AI模型Claude Sonnet 5Anthropic智能体10 个信源在谈事件专题推荐理由:Anthropic新出Claude Sonnet 5,智能体能力最强,能自己用浏览器和终端干杂活,价格比Opus便宜,做自动化任务很划算。原文稍后读已读值得跟进有用关注 Claude Sonnet 5
07:19官方账号Simon Willison’s Weblog(博客/媒体)Google 发布了 Nano Banana 2 Lite,即 Gemini 3.1 Flash Lite Image 图像模型,声称是“最快最便宜的 Gemini 图像模型”。作者在 AI Studio 用提示词生成了“寻找拿着火腿收音机的浣熊”风格的图片,效果优于4月时其他 Nano Banana 模型的尝试。模型在生图时出现了两处拼写错误(如“Forest Festival”拼错)。该模型专为高速度和大规模部署设计,API 名称为 gemini-3.1-flash-lite-image。AI模型Nano Banana 2 LiteGemini 3.1 Flash Lite ImageGoogle10 个信源在谈事件专题推荐理由:Google 出了个 Nano Banana 2 Lite 图像模型,最快最便宜,能生成沃尔多风格找图,比上一版好但拼写会错。原文稍后读已读值得跟进有用关注 Nano Banana 2 Lite
05:46官方一手marktechpost@Asif Razzaq74°Anthropic 发布 Claude Sonnet 5,在智能体编码基准上缩小了与 Opus 4.8 的差距。Sonnet 5 沿用 Sonnet 系列的定价,成本低于 Opus 系列。与上一代 Sonnet 4.6 相比,Sonnet 5 在多项智能体任务上表现提升。API 定价方面,Sonnet 5 每百万 tokens 输入约 3 美元、输出约 15 美元,Opus 4.8 则分别约 15 美元、75 美元。AI模型Claude Sonnet 5Sonnet 4.6Opus 4.810 个信源在谈事件专题推荐理由:做智能体编程选 Sonnet 5 吧,性能接近 Opus 4.8,价格却便宜好几倍。原文稍后读已读值得跟进有用关注 Claude Sonnet 5
05:45官方账号Simon Willison’s Weblog(博客/媒体)Anthropic 发布了 Claude Sonnet 5,其性能接近 Opus 4.8 但价格更低。模型支持 1M 上下文窗口和 128K 输出 token,自适应思考默认开启。新 tokenizer 使英文文本 token 数增加约 30%,实际成本上升约 30%。定价保持 Sonnet 4.6 水平:$3/百万输入、$15/百万输出,8月31日前有折扣。AI模型Claude Sonnet 5Anthropic推理模型10 个信源在谈事件专题推荐理由:Anthropic 刚发了 Sonnet 5,性能接近 Opus 4.8 但更便宜,不过新 tokenizer 会让你的账单多掏 30%,用之前先算好账。原文稍后读已读值得跟进有用关注 Claude Sonnet 5
03:08techcrunch@Lucas RopekGoogle发布了Nano Banana 2 Lite图像生成模型。该模型在生成速度上进行了优化,比前代更快。同时降低了计算成本,更适合大规模使用。面向创作者,可用于快速生成AI图像内容。AI模型GoogleNano Banana 2 Lite文生图10 个信源在谈事件专题推荐理由:Google出了个新图生模型Nano Banana 2 Lite,更快更便宜,做AI内容的朋友可以关注。原文稍后读已读值得跟进有用关注 Google
03:00官方账号Decoder@Matthias Bastian76°Anthropic推出Claude Sonnet 5,在GDPval-AA v2知识工作测试中得分1,618,超越前代Sonnet 4.6和更贵的Opus 4.8。该模型在网络安全任务上得分远低于美国政府当前封锁的模型。Sonnet 5进一步缩小了与Opus系列的价格-性能差距。AI模型Claude Sonnet 5AnthropicOpus10 个信源在谈事件专题推荐理由:Anthropic的新模型Sonnet 5,基准测试上超过自家大哥Opus 4.8,价格还更低,挺能打的。原文稍后读已读值得跟进有用关注 Claude Sonnet 5
02:58官方一手AWS Machine Learning Blog@Aamna Najmi76°Anthropic 发布 Claude Sonnet 5,这是其最新一代的首个 Sonnet 模型,已在 Amazon Bedrock 和 AWS Claude Platform 上可用。该模型在编码、智能体任务和日常专业工作中提供顶级智能,定价保持 Sonnet 系列标准。基于此前 Sonnet 4 的架构升级,Sonnet 5 在多个基准测试中表现领先。AI模型Claude Sonnet 5AnthropicAWS10 个信源在谈事件专题推荐理由:Anthropic 把最强 Sonnet 模型放到 AWS 上,编码和智能体任务更强,价格还不变。原文稍后读已读值得跟进有用关注 Claude Sonnet 5
02:04techcrunch@Rebecca Bellan76°Anthropic推出Claude Sonnet 5,具备更强的智能体能力。其定价低于Opus、GPT-5.5和Gemini Pro。模型在安全性上也有所改进。该定位旨在提供更经济的AI代理运行方案。AI模型Claude Sonnet 5AnthropicGPT-5.510 个信源在谈事件专题推荐理由:Anthropic出了Claude Sonnet 5,便宜又能跑智能体,比GPT-5.5和Opus都划算。原文稍后读已读值得跟进有用关注 Claude Sonnet 5
01:34官方账号Decoder@Matthias BastianGoogle发布两个新生成式AI模型:Nano Banana 2 Lite可在4秒内生成图像,每张成本0.034美元。Gemini Omni Flash首次通过API支持文本提示生成和编辑视频。Google建议将两个模型串联,从静态图像转换为动画视频。AI模型Nano Banana 2 LiteGemini Omni FlashGoogle10 个信源在谈事件专题推荐理由:Google新出两个模型:一个4秒出图只要3分钱,另一个能文字生成视频,还能链着玩。原文稍后读已读值得跟进有用关注 Nano Banana 2 Lite
01:07官方一手OpenAI Blog(博客/媒体)GeneBench-Pro是一个新发布的基准测试,用于评估AI在基因组学、生物学和科学研究中的性能。该基准使用复杂真实世界数据集,涵盖多种科学任务。它旨在衡量模型在基因分析和生物信息学方面的能力。AI模型GeneBench-Pro基因组学基准测试2 个信源在谈事件专题推荐理由:GeneBench-Pro用真实数据测AI在基因组学上的表现,搞科研的可以看看到底谁更强。原文稍后读已读值得跟进有用关注 GeneBench-Pro
23:40官方账号Decoder@Maximilian Schreiner76°美团发布LongCat-2.0模型,参数量达1.6万亿,完全在国产芯片上训练完成,未使用Nvidia硬件。该模型在多个中文基准上表现优异,证明中国芯片可支撑超大规模AI训练。训练过程中采用分布式优化算法,效率接近国际主流方案。AI模型LongCat-2.0美团Nvidia7 个信源在谈事件专题推荐理由:美团搞了个1.6万亿参数的大模型LongCat-2.0,全程用国产芯片,没碰Nvidia,性能还很强。想看看中国芯片能不能撑起大模型?这篇聊得清楚。原文稍后读已读值得跟进有用关注 LongCat-2.0
23:29IT之家(博客/媒体)2026年6月29日,华为与陕文投联合开发的“博观文旅大模型”在西安实现规模化应用,这是全球首个商用的多模态文旅大模型。该模型依托1.2PB文旅数据集,包含3100万张图片、440万分钟文博影像等。其支撑开发的AI伴游智能体已覆盖超400万用户,非遗数字IP衍生产品销售额超200万元。此外,“博观”还基于昇腾算力底座,成为首个以文化保护和传承为核心的行业大模型。AI模型博观文旅大模型华为陕文投1 个信源在谈事件专题推荐理由:华为和陕文投把多模态大模型用在了文旅行业,能生成博物馆级文物内容,还能做非遗IP,已服务400万用户,值得看看。原文稍后读已读值得跟进有用关注 博观文旅大模型
16:51官方账号Decoder@Matthias BastianDeepSeek发布新框架DSpark,将每位用户的响应速度提升60%至85%。该框架使用小型模型生成候选token,再由大型模型批量验证。通过优化计算流程,DSpark能在更少芯片上榨取更多性能。这有助于减少中国对高端美国芯片的依赖。AI模型DeepSeekDSpark推理模型推荐理由:DeepSeek的DSpark用小型模型提候选token、大模型批量验证,让速度提升85%,还减少了芯片需求,挺实用的。原文稍后读已读值得跟进有用关注 DeepSeek
16:21官方一手marktechpost@Asif Razzaq精选Meta AI 发布了 Brain2Qwerty v2,这是一个基于非侵入式脑磁图(MEG)的脑机接口管道,用于将打字思维转化为文本。在基准测试中,该模型实现了 61% 的单词准确率,并开源了训练代码供研究社区复现。与前一版本相比,v2 提升了解码速度与鲁棒性,支持实时句子级解码。AI模型Brain2Qwerty v2Meta AIMEG推荐理由:Meta 开源了 Brain2Qwerty v2,用脑磁图直接解码打字想法,单词准确率 61%,比上一代更准更快。原文稍后读已读值得跟进有用关注 Brain2Qwerty v2
16:05官方一手pandaily@contact@pandaily.com (Pandaily)精选华为开源了92B参数的openPangu-2.0-Flash模型,上下文窗口达512K tokens。该模型原生适配昇腾AI开发生态,可在Ascend硬件上高效运行。这是华为在开源大模型领域的重要动作,为开发者提供了新的选择。AI模型openPangu-2.0-FlashHuaweiAscend1 个信源在谈事件专题推荐理由:华为开源了92B参数的openPangu-2.0-Flash,512K上下文挺大,而且专为昇腾优化,做国产AI开发的同学可以试试。原文稍后读已读值得跟进有用关注 openPangu-2.0-Flash
16:04官方一手pandaily@contact@pandaily.com (Pandaily)中国神秘AI团队MopMonk在CyberGym安全基准测试中取得73.1%的得分,位列全球第7名,距离OpenAI仅一步之遥。该基准主要评估模型抵御对抗性攻击的能力,MopMonk的成绩超过了多个知名模型。团队背景尚未公开,但这一排名显示出中国在AI安全领域的快速追赶。AI模型MopMonkCyberGymAI安全9 个信源在谈事件专题推荐理由:中国团队MopMonk用73.1%的成绩在安全基准上杀进全球前七,距离OpenAI不远了,值得关注。原文稍后读已读值得跟进有用关注 MopMonk
14:08IT之家(博客/媒体)普林斯顿大学发布CEO-Bench基准测试,模拟创业公司500天经营,初始资金100万美元。多数模型在500天内破产,Claude Fable 5期末现金达4715万美元,是唯一多次运行均高于初始余额的模型。Claude Opus 4.8和GPT-5.5分别以2777万美元和2129万美元位列其后。Grok 4.20表现最差,平均仅维持28天。基于规则的基准模型期末现金为1580万美元。AI模型CEO-BenchClaude Fable 5Claude Opus 4.810 个信源在谈事件专题推荐理由:普林斯顿搞了个AI当老板的模拟考试,Claude Fable 5赚了4700万,其他大多破产,这测试挺能看出谁更适合做长期决策。原文稍后读已读值得跟进有用关注 CEO-Bench
12:31IT之家(博客/媒体)73°华为于6月30日正式开源 openPangu-2.0-Flash 模型,总参数量92B,激活参数量6B,支持512K上下文长度。该模型基于昇腾原生训练与推理技术开发,旨在为业界提供最佳实践参考。同时,计划于7月开源 openPangu-2.0-Pro 模型,总参数量505B,激活参数量18B。开源内容包括模型权重、基础推理代码、训推算子以及预训练和后训练代码。AI模型openPangu华为盘古1 个信源在谈事件专题推荐理由:华为把92B参数的Flash模型开源了,512K上下文,还有505B的Pro版下月来,搞Agent底座的别错过。原文稍后读已读值得跟进有用关注 openPangu
11:00IT之家(博客/媒体)73°美团今日发布LongCat-2.0,总参数1.6T,平均激活约48B,动态范围33B-56B,原生支持1M超长上下文。该模型在五万卡国产算力集群上完成全流程训练,预训练数据规模超30T tokens。其在SWE-bench Pro中得分59.5,领先Gemini 3.1 Pro(54.2)、GPT-5.5(58.6)和Claude Opus 4.6(57.3);在SWE-bench Multilingual中取得77.3,接近Claude Opus 4.6。推理阶段采用LongCat Sparse Attention和零计算专家机制,实现token级动态激活,降低解码延迟。AI模型LongCat-2.0美团MoE2 个信源在谈事件专题推荐理由:美团开源了LongCat-2.0,国产芯片跑万亿参数,编程和Agent能力很强,还支持百万上下文,值得上手试试。原文稍后读已读值得跟进有用关注 LongCat-2.0
10:33techcrunch@Anna HeimBase44是Wix旗下的vibe coding平台,近日开始推出自己的AI模型。此举旨在让平台在AI初创公司中建立防御性,减少对外部前沿模型的依赖。Base44表示希望该模型最终能超越当前最先进模型的表现。目前该模型已在部分用户中测试。AI模型Base44Wixvibe coding推荐理由:Base44搞了个自己的AI模型,想不靠别人,自己干翻前沿模型。vibe coding玩家可以期待一下。原文稍后读已读值得跟进有用关注 Base44
10:29官方一手pandaily@contact@pandaily.com (Pandaily)72°DeepSeek计划于7月中旬发布V4官方版本。高峰时段(9am-12pm和2pm-6pm)API定价将为标准费率的2倍,类似电力分时计价模式。此举旨在引导开发者在非高峰时段调用API。AI模型DeepSeekV4API定价推荐理由:DeepSeek V4马上要来了,7月中旬发布。高峰时段API价格翻倍,想省成本就避开那段时间,适合用API的开发者留意。原文稍后读已读值得跟进有用关注 DeepSeek
09:19掘金本周最热@猫猫头啊精选文章对比了Step 3.7 Flash、DeepSeek V4 Flash、Gemini 3.5 Flash在Agent场景下的代码生成效率、响应速度和工具调用稳定性。测试采用Claude Code工具,第一个案例从零搭建开发者日志站,Step 3.7 Flash一次生成,输出25.7k tokens,成本¥1.22,耗时2m30s;DeepSeek V4 Flash成本¥0.72,输出14k tokens。第二个案例搭建GitHub项目雷达,Step 3.7 Flash无错误完成,Gemini 3.5 Flash有2次自动修复报错。在视觉效果和稳定性上Step 3.7 Flash表现更优,但DeepSeek V4 Flash成本更低。AI模型Step 3.7 FlashDeepSeek V4 FlashGemini 3.5 Flash2 个信源在谈事件专题推荐理由:最近这几个Flash模型我帮你试了,Step 3.7 Flash写博客页和抓GitHub项目都很稳,页面好看,一次跑通,成本也就一两块钱,值得试试。原文稍后读已读值得跟进有用关注 Step 3.7 Flash
08:44SuperTechFans(博客/媒体)78°Semgrep 安全团队对比多模型在 IDOR 漏洞检测上的表现,GLM 5.2 在仅给定提示下取得 39% F1,高于 Claude Code 的 32% 和 Claude Opus 4.8。该模型是智谱 AI 开源的 750B 总参数 MoE 模型,每个 token 仅激活 40B,支持 128K 上下文,采用 MIT 许可证。专业静态分析管道 Semgrep 多模态仍领先,F1 达 53%–61%,显示模型与框架的差距。AI模型GLM 5.2ClaudeSemgrep1 个信源在谈事件专题推荐理由:智谱的 GLM 5.2 开源模型在安全漏洞检测上居然超过了 Claude,而且推理成本低,适合做代码审计。原文稍后读已读值得跟进有用关注 GLM 5.2
02:49官方一手Hugging Face: Blog(博客/媒体)精选Allen AI 发布 DiScoFormer,一种基于 Transformer 的架构,同时学习任意数据分布的密度函数和得分函数。传统方法如 NICE、MAF、ResFlow 需分别建模或使用归一化流,DiScoFormer 通过单一模型完成且无需显式归一化。在 2D 环形、高维高斯混合等多个基准分布上,DiScoFormer 的密度估计和得分误差均低于这些基线。该论文已被 NeurIPS 2024 接收,代码和预训练模型已在 GitHub 开源。AI模型DiScoFormerAllen AITransformer推荐理由:Allen AI 搞了个新模型 DiScoFormer,一个 Transformer 既能算密度又能算得分,比 NICE 这些老方法误差更低。想省事搞密度估计的可以看看。原文稍后读已读值得跟进有用关注 DiScoFormer
01:17官方账号Simon Willison’s Weblog(博客/媒体)精选DeepReinforce 发布 Ornith-1.0,一款 MIT 许可的开源模型,基于 Gemma 4 和 Qwen 3.5 预训练。提供 9B Dense、31B Dense、35B MoE 和 397B MoE 四种规格。在编码基准上达到同尺寸开源模型 SOTA。作者在 LM Studio 上测试 35B Q4_K_M GGUF 版本,能流畅运行代理工具调用并处理代码定位任务。AI模型Ornith-1.0DeepReinforceGemma 42 个信源在谈事件专题推荐理由:DeepReinforce 新出的开源编码模型,基于 Gemma 4 和 Qwen 3.5,在代理编码任务上表现不错,LM Studio 就能跑,值得试试。原文稍后读已读值得跟进有用关注 Ornith-1.0
17:03IT之家(博客/媒体)小鹏集团正式发布X-Mind技术框架,通过内嵌预测性世界模型,将12帧未来世界推演压缩至仅96个Token。相比传统VLA模型,X-Mind在复杂长尾场景下轨迹预测误差(ADE)显著降低。该框架通过深度压缩自编码器(DC-AE)和循环块扩散机制,在车规级芯片上实现低推理延迟。小鹏宣称X-Mind赋予自动驾驶“预见未来”的能力,可实现防御性驾驶。AI模型X-Mind小鹏自动驾驶推荐理由:小鹏在自动驾驶上搞了一个新招:X-Mind能用96个Token推演未来12帧,比传统模型更准更快,还能跑在车规芯片上。原文稍后读已读值得跟进有用关注 X-Mind
16:27官方一手Pandaily@contact@pandaily.com (Pandaily)精选73°DeepSeek 与北京大学联合开发的 DSpark 推理系统获得 PyTorch 核心维护者 Dmytro Dzhulgakov 的详细技术分析。他重点称赞 DSpark 的半并行草稿(semi-parallel drafting)机制,能提升推理吞吐量。分析指出该系统达到生产级工程水平(production-grade engineering),在特定负载下相比基线有显著加速。这一评测为开源推理系统提供了高含金量的第三方验证。AI模型DeepSeekDSparkPyTorch推荐理由:PyTorch 核心大佬亲自下场拆解 DeepSeek 的 DSpark,说它半并行草稿很牛、工程落地扎实,搞推理优化的必看。原文稍后读已读值得跟进有用关注 DeepSeek
00:16量子位@听雨Yuxinlu1在Hugging Face模型排行榜上击败多家大厂模型,登顶多个细分榜单。该账号发布的模型综合得分领先于Meta、Google等公司的开源项目。排行榜显示其推理效率与准确率均达到SOTA水平。AI模型yuxinlu1Hugging Face模型排行榜推荐理由:一个个人开发者干翻大厂,看看yuxinlu1到底做了什么模型这么强原文稍后读已读值得跟进有用关注 yuxinlu1
19:09IT之家(博客/媒体)71°马斯克称 Grok 4.5 基于 1.5 万亿参数的 V9 基础大模型,并引入 Cursor 数据训练。该模型已在 SpaceX 和特斯拉内部测试,早期评测显示其性能接近甚至有望超越 Opus 模型。马斯克还透露 SpaceX 今年每月推出一批完全从零训练的新模型。Grok 4.5 的强化学习及调度框架仍在持续迭代。AI模型Grok 4.5SpaceX特斯拉8 个信源在谈事件专题推荐理由:Grok 4.5 用了 1.5 万亿参数和 Cursor 数据,内部测试已接近 Opus,想了解马斯克最新大模型进展可以看这篇。原文稍后读已读值得跟进有用关注 Grok 4.5
18:27官方账号Decoder@Maximilian Schreiner精选普林斯顿大学研究团队创建了CEO-Bench基准测试,要求AI代理在模拟环境中经营一家软件公司500天。测试结果显示,大多数参与模型最终破产,仅三个AI模型的资本高于初始资金。令人意外的是,一个简单的、不依赖AI的规则启发式方法几乎击败了所有AI模型。该测试揭示了当前AI在长期决策与资源管理方面的局限性。AI模型CEO-BenchPrinceton智能体推荐理由:普林斯顿大学用500天模拟测试AI经营公司,结果大部分亏钱,一个非AI规则反而更稳。看看哪三个模型赚钱了。原文稍后读已读值得跟进有用关注 CEO-Bench
16:36官方一手Pandaily@contact@pandaily.com (Pandaily)76°北京大学与DeepSeek联合开源了投机解码框架DSpark,该框架无需修改模型即可将LLM推理速度提升60-85%。在严格延迟约束下,吞吐量增益最高达661%。DSpark通过高效的投机解码策略显著降低推理延迟。这一成果已在GitHub上开源。AI模型Peking UniversityDeepSeekDSpark推荐理由:北大和DeepSeek搞的DSpark,不用改模型就能让推理快80%,吞吐量翻好几倍,适合做部署的试试。原文稍后读已读值得跟进有用关注 Peking University
16:03官方账号Decoder@Jonathan Kemper精选新浪微博发布开源模型VibeThinker-3B,仅30亿参数。在数学和编程基准上,它匹配了DeepSeek V3.2和Kimi K2.5,后两者参数规模大333倍。模型通过多阶段后训练实现高性能。研究人员假设:逻辑推理可压缩进小模型,但广泛世界知识不行。AI模型VibeThinker-3B新浪推理模型推荐理由:30亿参数的小模型推理能力居然能打千亿级大模型,新浪VibeThinker-3B在数学和编程上很强,而且开源了。原文稍后读已读值得跟进有用关注 VibeThinker-3B
14:34量子位@林樾百度在GitHub开源了全新OCR模型,模型名称暂未公开,但根据展示能一次性识别整本图书内容。该模型作者被社区推测为前DeepSeek研究员。项目已在GitHub托管,提供预训练权重和API文档。AI模型百度OCR开源模型推荐理由:百度搞了个能扫整本书的OCR,还开源了,做文档处理的可以试试。原文稍后读已读值得跟进有用关注 百度
13:11官方一手pandaily@contact@pandaily.com (Pandaily)DeepSeek 发布 DSpark 推测解码框架,可将文本生成速度提升 80%。该框架优化推理效率,标志着 AI 竞争焦点从训练规模转向实际部署。DSpark 采用推测解码技术,通过小模型草稿加速大模型生成。AI模型DeepSeekDSpark推理加速推荐理由:DeepSeek 的 DSpark 框架让模型生成快八成,推理部署更省算力,搞推理优化的可以看看。原文稍后读已读值得跟进有用关注 DeepSeek
13:09官方一手pandaily@contact@pandaily.com (Pandaily)精选73°DeepSeek 在获 70 亿美元融资后发布首篇论文,提出 DSpark 推测解码框架,在无需额外训练的情况下将大模型生成速度提升 85%。该框架通过轻量级草稿模型配合验证机制加速推理,在多个基准测试中达到与原始模型相当的质量。DSpark 支持即插即用,可适配现有 DeepSeek 系列模型,显著降低延迟。AI模型DeepSeekDSpark推理模型推荐理由:DeepSeek 刚发了 DSpark,跑大模型生成能快 85%,还是即插即用的。搞推理加速的朋友可以关注。原文稍后读已读值得跟进有用关注 DeepSeek
13:01官方一手marktechpost@Asif Razzaq精选Liquid AI 发布了 LFM2.5-230M,这是其最小的 230M 参数开源权重模型。该模型在 Galaxy S25 Ultra 上达到 213 tok/s,在 Raspberry Pi 5 上为 42 tok/s。基于 LFM2 架构,它专注于工具使用和数据提取,在指令遵循上击败了 Qwen3.5-0.8B 和 Gemma 3 1B 等更大模型。模型支持 llama.cpp、MLX、vLLM、SGLang 和 ONNX 框架。AI模型LFM2.5-230MLiquid AI开源模型1 个信源在谈事件专题推荐理由:Liquid AI 出了个超小模型 LFM2.5-230M,手机跑 213 tokens 每秒,树莓派也能跑 42,指令遵循还比 Qwen3.5-0.8B 和 Gemma 3 1B 强。原文稍后读已读值得跟进有用关注 LFM2.5-230M
10:49IT之家(博客/媒体)前英国政府数据科学家Liam Wilkinson用76个MCP工具将Claude、GPT-5、Gemini等四个AI模型投入《文明VI》进行23局测试。Claude在游戏中研发核弹摧毁法国城市图卢兹,但法国以20外交分获胜。AI主动检查全局状态的行为仅占1-2%,且48%-66%的计划在10回合内未执行。GPT-5在GovBench选择题中获99.26分,但在游戏中表现不佳。实验暴露了scaling law无法解决的感知盲区和知行差距问题。AI模型ClaudeGPT-5Gemini推荐理由:有人让Claude、GPT-5、Gemini玩《文明VI》,结果Claude造核弹炸了法国却还是输了,暴露了AI在复杂决策中根本的感知和执行缺陷,比单纯比分数有意思多了。原文稍后读已读值得跟进有用关注 Claude
01:07官方一手marktechpost@Asif Razzaq79°DeepSeek开源了DSpark框架,通过将草稿模块附加到现有DeepSeek-V4权重上实现推测解码。它结合并行草稿骨干和轻量级马尔可夫头来减少后缀衰减,并加入基于置信度的调度验证,根据实时GPU负载调整检查token数量。离线测试中,接受长度相比DFlash和Eagle3提升16-31%;生产环境中每个用户生成速度比MTP-1基线提升57-85%,且无损。训练代码DeepSpec以MIT许可证开源。AI模型DSparkDeepSeek-V4DeepSeek1 个信源在谈事件专题推荐理由:DeepSeek搞了个DSpark,让V4推理速度翻倍,开源还无损,适合高并发场景。原文稍后读已读值得跟进有用关注 DSpark