15:16官方一手pandaily@contact@pandaily.com (Pandaily)精选83°MiniMax 发布了其旗舰模型 M3,声称这是国内首个将前沿编码、智能体能力、100 万 token 上下文窗口和原生多模态处理整合在单一架构中的 AI 模型。M3 模型在多项基准测试中表现出色,尤其在长文本理解和复杂任务执行方面。该模型支持同时处理文本、图像、音频等多种输入,并具备强大的代码生成和工具调用能力。MiniMax 表示 M3 旨在为开发者和企业提供更高效、更全面的 AI 解决方案。AI模型MiniMaxM3多模态推荐理由:MiniMax M3 将 1M 上下文、多模态和智能体能力打包进一个模型,做长文本处理或多模态应用的开发者可以直接用它替代多个模型组合,省心又高效。原文稍后读已读值得跟进有用关注 MiniMax
14:50官方一手歸藏(guizang.ai)@op7418精选76°MiniMax 正式发布大版本模型升级 MiniMax M3,核心亮点包括标配 1M 超长上下文、采用新的 MSA(MoE with Segment-wise Attention)稀疏注意力架构,以及从训练起就融合了文本、图片、视频和桌面操作的原生多模态能力。MSA 架构在 100 万上下文下每 token 计算量仅为上一代的约 1/20,大幅提升可落地性。API 价格同步更新,小于 512k 的 API 限时五折(7 天)。模型权重和技术报告将在约 10 天后开源。AI模型MiniMax M3长上下文稀疏注意力6 个信源在谈事件专题推荐理由:MiniMax M3 把长上下文、稀疏注意力和多模态融合做到了一个模型里,而且计算效率大幅提升,做 Agent 开发、多模态应用或长文档处理的团队可以直接用 API 试试,价格也很友好。原文稍后读已读值得跟进有用关注 MiniMax M3
11:11OpenRouter@OpenRouterAI精选76°MiniMax-M3 是一款前沿开源权重模型,已在 OpenRouter 平台上线。它集成了 100 万 token 的超长上下文窗口、顶尖的编程与智能体能力,以及原生支持图像和视频的多模态处理。该模型在编码和智能体任务上表现卓越,同时保持了开源特性,为开发者和研究者提供了强大的工具。其 1M token 上下文窗口尤其适合处理长文档、复杂代码库和多模态数据融合场景。AI模型MiniMax-M3开源模型长上下文6 个信源在谈事件专题推荐理由:MiniMax-M3 把长上下文、强编码和多模态塞进一个开源模型里,做复杂智能体或长文档处理的团队可以直接在 OpenRouter 上试,省去自己部署的麻烦。原文稍后读已读值得跟进有用关注 MiniMax-M3
11:17官方一手pandaily@contact@pandaily.com (Pandaily)卡内基梅隆大学和马里兰大学的研究人员发现,大型语言模型(LLM)在模拟“睡眠”机制后,能够更好地整合长上下文信息,从而提升复杂推理任务的性能。该研究通过让模型在训练或推理过程中插入类似睡眠的“巩固”阶段,有效减少了信息遗忘,并增强了模型对长文本的理解能力。这一发现为优化LLM的长期记忆和推理能力提供了新思路,可能对需要处理大量上下文的应用场景产生重要影响。论文LLM推理模型长上下文推荐理由:做LLM推理优化或长上下文应用的团队值得关注——这项研究用“睡眠”机制解决了模型信息遗忘的痛点,直接提升复杂推理表现,建议点开看看具体实现。原文稍后读已读值得跟进有用关注 LLM
09:06官方账号NVIDIA AI@NVIDIAAI精选76°NVIDIA 宣布推出 Step 3.7 Flash 模型,这是一个 198B 参数的混合专家(MoE)模型,但仅需 11B 活跃参数即可运行,大幅降低推理成本。该模型支持 256K 上下文长度,并原生支持图像和视频输入。即日起可在 build.nvidia.com 上通过 GPU 加速端点使用,也可通过 NVIDIA NIM 微服务部署,并支持使用 NeMo 框架进行微调。这一发布标志着 NVIDIA 在高效大模型领域的重要进展,尤其适合需要多模态理解和长上下文处理的应用场景。AI模型Step 3.7 FlashNVIDIAMoE5 个信源在谈事件专题推荐理由:198B 参数但仅 11B 活跃,推理效率极高,做多模态应用或长文档处理的团队可以直接在 NVIDIA 平台试用,省成本又省心。原文稍后读已读值得跟进有用关注 Step 3.7 Flash
11:59官方账号arXiv cs.LG@Kevin Y. Li, Asher Trockman, Ananda Theertha Suresh, Ziteng Sun精选72°Oryx 是一种新型混合架构,能在序列处理中灵活切换注意力(用于长上下文检索)和线性循环(用于高效生成),解决了传统模型在效率和长上下文能力之间的权衡。该模型在 1.4B 参数规模下,平均语言建模任务性能比单一混合器基线提升至少 0.7 个百分点。在检索任务中,即使仅用不到 10% 的 token 运行注意力模式,Oryx 也能达到与 Transformer 基线相当的性能。Oryx 的关键创新是让不同混合器共享至少 90% 的参数,从而在共享内部表示上高效切换。这项工作表明注意力与线性循环模型可以共享表示,为序列轴上的混合设计提供了新方向。论文混合架构注意力机制线性循环模型推荐理由:Oryx 解决了长上下文检索与高效生成的矛盾,做序列建模或大模型架构的开发者可以直接参考其共享参数设计思路,值得关注。原文稍后读已读值得跟进有用关注 混合架构
10:40rohanpaul_ai@rohanpaul_ai精选研究发现,长时间运行的语言智能体如果定期暂停并整合记忆,性能会更好。当前Transformer模型随着上下文增长,注意力机制需要检查更多历史token,导致推理变慢且成本增加。论文提出在模型中引入“睡眠阶段”:暂停推理,多次重读近期上下文,将有用信息写入固定大小的记忆层,然后清空短期注意力缓存。这样,模型在睡眠时进行额外计算,而正常推理仍保持单次前向传播的高效。实验表明,睡眠时间越长,模型在需要深度推理的复杂任务上表现越好,尤其当旧信息已不在注意力缓存中时。论文智能体长上下文记忆整合推荐理由:长时运行智能体终于有了解决上下文膨胀问题的思路——做Agent或长链推理的开发者值得关注,它可能改变你处理长期记忆的方式。原文稍后读已读值得跟进有用关注 智能体
06:13rohanpaul_ai@rohanpaul_ai本期新闻简报涵盖多项AI与芯片领域重要进展:华为公布芯片设计新突破,有望缩小与台积电、英特尔的差距;阿里巴巴与南京大学联合论文提出通过选择性稀疏注意力机制,使标准LLM高效处理超长上下文;深度分析DeepSeek的真正优势不在于廉价聊天机器人,而在于将硬件稀缺转化为策略的架构创新;Meta、斯坦福与伊利诺伊大学联合调研论文主张AI智能体在代码作为主要工作层时表现更佳;Anthropic联合创始人警告AI导致的失业将引发历史性道德危机;xAI向SuperGrok和X Premium+用户推出终端原生智能体“Grok Build”。行业华为芯片设计长上下文10 个信源在谈事件专题推荐理由:芯片开发者、长上下文研究者、智能体实践者都能从中找到硬核洞察——华为的突破可能重塑竞争格局,阿里论文直接解决长文本推理痛点,DeepSeek的架构思路值得借鉴。建议花5分钟扫读,挑与自身领域相关的深度内容细看。原文稍后读已读值得跟进有用关注 华为
04:56宝玉@doteyRepoPrompt 是一款将整个代码仓库拼接成 XML 文本的工具,方便发送给支持长上下文的 AI 模型(如 Gemini 2、Claude 3.5、o1 pro)。其作者已被 OpenAI 招安,软件现已免费,并计划开源。此前付费用户将获得 Codex Credits 作为补偿。该工具目前仅支持 Mac 平台,可选择性包含部分文件。这一变化意味着开发者可以免费使用该工具,并期待其开源后的社区贡献。AI产品RepoPrompt开源/仓库AI编程助手10 个信源在谈事件专题推荐理由:RepoPrompt 解决了将整个代码仓库高效喂给大模型的痛点,做 AI 编程或代码审查的开发者现在可以免费使用,而且即将开源,值得关注后续社区版本。原文稍后读已读值得跟进有用关注 RepoPrompt
08:36berryxia@berryxia83°MiniMax AI工程负责人Skyler Miao预告了下一代模型M3的发布,并透露其核心架构:基于GQA的动态块稀疏注意力。该技术通过轻量索引分支快速筛选相关token块,仅对关键块执行稀疏注意力计算,大幅降低算力需求。在1M token上下文下,M3的预填充速度比M2快9.7倍,解码速度快15.6倍。这使得百万token级别的Agent任务从理论走向实用,长上下文处理变得又快又省。M3的发布将为长上下文模型赛道增添有力竞争者。AI模型MiniMaxM3长上下文推荐理由:MiniMax M3用动态稀疏注意力把1M上下文的算力成本打下来了,做长上下文Agent的开发者可以直接关注,这可能是让百万token任务真正落地的关键突破。原文稍后读已读值得跟进有用关注 MiniMax
04:08elvis@omarsar0精选该论文提出一种睡眠压缩机制,让模型每N步进行离线递归处理将上下文写入持久快速权重,然后清除KV缓存。在细胞自动机、多跳图检索和数学推理任务上,该方法比纯Transformer和SSM-Attention混合模型效果更好,睡眠时间越长性能提升越大。这为长时智能体提供了替代方案,通过压缩和遗忘原始token来避免注意力二次计算开销。论文DAIR.AI智能体长上下文推荐理由:智能体睡一觉,推理更强原文稍后读已读值得跟进有用关注 DAIR.AI
01:37rohanpaul_ai@rohanpaul_ai研究发现,长上下文AI模型并非被大量错误信息逐渐削弱,而是仅需10%的误导性段落就能造成近58%的性能损失,这种现象被称为“第一滴墨水效应”。误导信息之所以危险,是因为它们与问题高度相关但错误,在注意力机制中会挤占正确答案的空间。在128K token的Qwen2.5实验中,前10%的硬干扰项解释了97%的干扰压力。这意味着过滤文档时,移除坏内容不如缩短整个上下文有效。该研究对构建长上下文AI系统的开发者具有重要警示意义。论文长上下文注意力机制误导信息推荐理由:做长上下文AI应用或RAG系统的团队,这个发现会颠覆你对上下文管理的认知——不是堆更多文档就能提升效果,少而精才是关键,建议点开看看具体实验数据。原文稍后读已读值得跟进有用关注 长上下文
23:22berryxia@berryxia83°CMU和UMD的研究团队发现,Transformer大模型在处理超长任务时注意力机制会因上下文长度二次方爆炸而性能下降。他们提出“sleep-like consolidation”机制,让模型在“睡眠”期间将最近上下文转化为持久fast weights并清空KV cache,从而将短期记忆转为长期记忆。实验表明,增加睡眠深度或时长能显著提升睡眠后的推理能力。该方案完全开源,颠覆了传统靠堆显存扩展上下文的做法。论文Transformer长上下文记忆固化推荐理由:这个研究用“睡觉”这种生物启发机制解决了长上下文推理的显存和速度瓶颈,做长序列AI应用的开发者可以直接参考开源方案,比堆显存更聪明。原文稍后读已读值得跟进有用关注 Transformer
11:44官方账号arXiv cs.AI@Sangyun Lee, Sean McLeish, Tom Goldstein, Giulia Fanti精选论文提出一种类似睡眠的记忆巩固机制,让 Transformer 模型在长上下文任务中表现更好。模型在推理过程中定期将近期上下文转换为持久化的快速权重,并清除键值缓存,类似生物体的睡眠过程。在睡眠阶段,模型对积累的上下文进行多次离线循环处理,通过局部学习规则更新状态空间模型(SSM)块中的快速权重。在合成任务(如元胞自动机、多跳图检索)和数学推理任务上,该方法显著优于普通 Transformer 和 SSM-注意力混合模型。增加睡眠时长 N 能持续提升性能,尤其在需要深层推理的样本上效果最明显。论文Transformer长上下文记忆巩固1 个信源在谈事件专题推荐理由:这项研究给长上下文推理带来了新思路——用类似睡眠的离线巩固机制解决注意力瓶颈,做长链推理或复杂数学问题的开发者值得关注,尤其适合处理超长上下文的场景。原文稍后读已读值得跟进有用关注 Transformer
05:31官方一手marktechpost@Asif Razzaq72°Together AI 开源了 OSCAR,一种面向长上下文 LLM 推理的 INT2 KV 缓存量化方法。与依赖数据无关的 Hadamard 变换不同,OSCAR 通过离线估计注意力感知的协方差结构,为键和值分别推导旋转矩阵。在 Qwen3-4B-Thinking-2507 和 Qwen3-8B 上,OSCAR 以每 KV 元素 2.28 比特的精度,将 BF16 精度差距分别缩小至 3.78 和 1.42 分。该方法可实现约 8 倍的 KV 内存缩减,并在 100K 上下文长度下带来最高 3 倍的解码加速。AI模型量化KV 缓存长上下文推荐理由:长上下文 LLM 推理的内存瓶颈终于有了实用解法——OSCAR 在 2-bit 量化下几乎不损失精度,做长文档/多轮对话推理的团队可以直接集成,显著降低硬件成本。原文稍后读已读值得跟进有用关注 量化
04:37rohanpaul_ai@rohanpaul_ai精选72°阿里巴巴与南京大学联合发表论文,提出RTPurbo方法,通过轻量级适配将百万token预填充速度提升9.36倍(对比FlashAttention-2)。该方法发现训练好的全注意力模型已存在隐藏稀疏结构,无需重新训练。RTPurbo识别出少数需要远距离token的注意力头,其余头聚焦邻近文本,并使用16维索引器快速定位关键token。在长上下文基准和推理任务中,RTPurbo保持接近全注意力的精度,同时实现高达9.36倍加速。这证明长上下文推理中的浪费比表面看起来更有结构性。论文长上下文注意力稀疏化推理加速推荐理由:长上下文推理的算力瓶颈是AI应用落地的关键障碍,做LLM推理优化或长文档处理的团队可以直接参考RTPurbo的稀疏化思路,无需从头训练模型。原文稍后读已读值得跟进有用关注 长上下文
11:02官方账号arXiv cs.AI@Ali Hatamizadeh, Yejin Choi, Jan Kautz精选72°线性注意力模型通过固定大小的循环状态替代软注意力的无限缓存,但如何高效编辑压缩记忆而不打乱已有关联是难点。现有Delta规则模型使用单一标量门控同时控制擦除旧内容和写入新内容,存在耦合限制。Gated DeltaNet-2提出通道级擦除门控b_t和写入门控w_t,将两者解耦,可退化为KDA和Gated DeltaNet。在1.3B参数、100B FineWeb-Edu tokens训练下,该模型在语言建模、常识推理和检索任务上全面超越Mamba-2、Gated DeltaNet、KDA和Mamba-3。尤其在长上下文RULER基准的多键检索设置中优势显著,代码已开源。论文线性注意力门控机制长上下文推荐理由:线性注意力研究者终于有了更精细的门控机制——Gated DeltaNet-2把擦除和写入分开控制,做高效长序列建模的团队可以直接复现并对比效果。原文稍后读已读值得跟进有用关注 线性注意力
09:37官方账号Together AI@togethercompute83°阿里巴巴推出Qwen3.7-Max旗舰模型,专为智能体时代设计,支持100万token上下文窗口。该模型在智能体编程、推理和长周期自主任务上表现领先。现在可通过Together Serverless Inference平台用于生产级智能体工作流。这标志着大模型从对话助手向自主智能体核心引擎的转变。AI模型Qwen3.7-Max智能体长上下文推荐理由:做智能体应用的开发者终于有了一个原生支持长上下文和自主决策的旗舰模型,1M上下文窗口直接解决复杂任务中的记忆瓶颈,建议在Together上试试生产级部署。原文稍后读已读值得跟进有用关注 Qwen3.7-Max
11:42官方一手arXiv: OpenAI@Zhuohan Gu, Qizheng Zhang, Omar Khattab, Samuel Madden精选PEEK 是一种为长上下文 LLM 智能体设计的系统,通过缓存和维护“上下文地图”来提升其在重复外部上下文(如文档库、代码仓库)中的表现。现有方法要么保留智能体的轨迹、被动访问原始材料,要么保留任务级策略,但都忽略了可复用的方向知识(如上下文内容、组织方式、历史有用的实体和模式)。PEEK 通过三个模块(Distiller、Cartographer、Evictor)将推理信号转化为结构化、固定大小的上下文地图,并嵌入智能体提示中。实验显示,PEEK 在长上下文推理和信息聚合任务上比强基线提升 6.3-34.0%,同时减少 93-145 次迭代,成本比最先进的 ACE 框架低 1.7-5.8 倍。在上下文学习任务上,PEEK 的解决率和评分准确率分别提升 6.0-14.0% 和 7.8-12.1%,成本仅为 ACE 的 1.4 倍,且泛化到不同语言模型和智能体架构。论文长上下文智能体缓存策略推荐理由:PEEK 解决了长上下文智能体在重复场景中反复“从头探索”的痛点,做文档分析或代码库维护的开发者可以直接用,能显著降低推理成本并提升准确率。原文稍后读已读值得跟进有用关注 长上下文
10:44官方一手arXiv: DeepSeek@Minxuan Lv, Tiehua Mei, Tanlong Du, Junmin Chen, Zhenpeng Su, Ziyang Chen, Ziqi Wang, Zhennan Wu, Ruotong Pan, jian Liang, Ruiming Tang, Han Li精选GoLongRL 是一个完全开源的长上下文强化学习训练方案,包含 23K 样本的数据集、完整构建流程和训练代码。该方案基于长上下文能力分类法,覆盖 9 种任务类型,每个任务配有自然评估指标,数据来源包括书籍、学术论文和多轮对话等真实文档。在相同 GRPO 设置下,GoLongRL 数据集优于闭源的 QwenLong-L1.5 数据集,且 Qwen3-30B-A3B 模型在长上下文任务上表现接近 DeepSeek-R1-0528 和 Qwen3-235B-A22B。此外,论文提出 TMN-Reweight 方法,通过任务级均值归一化和难度自适应加权,解决异构奖励优化问题,进一步提升平均性能并保持通用能力。论文长上下文强化学习开源/仓库推荐理由:长上下文 RL 训练的数据构建和奖励设计一直是个难题,GoLongRL 提供了开源数据集和优化方法,做长上下文模型训练的团队可以直接复用,省去大量数据构造工作。原文稍后读已读值得跟进有用关注 长上下文
02:45官方账号Jeff Dean@JeffDean72°Jeff Dean 展示了 Gemini 3.5 Flash 的新能力:它能瞬间消化密集的学术论文,并自主编码出一个完全交互式的可视化网站,解释研究的细节。该过程融合了超长上下文、深度推理、复杂编码和超低延迟,是对模型综合能力的极限测试。这一功能帮助用户快速提炼论文精髓,加深理解。AI产品Gemini 3.5 Flash论文理解自动编码推荐理由:研究人员和开发者终于有了一个能边读论文边自动生成交互式演示的工具,省去手动编码和理解的繁琐,建议直接体验。原文稍后读已读值得跟进有用关注 Gemini 3.5 Flash
14:22官方账号arXiv cs.AI@Yuxiang Huang, Nuno M. T. Gonçalves, Federico Alvetreti, Lei Li, Xu Han, Edoardo M. Ponti, André F. T. Martins, Marcos V. Treviso精选72°DashAttention 提出了一种新的分层注意力机制,通过可微分的 α-entmax 变换替代传统 top-k 操作,自适应地为每个查询选择可变数量的关键值块,从而解决了现有方法(如 NSA 和 InfLLMv2)中固定块数和梯度阻断的问题。该方法保持整个层次结构完全可微分,且具有非分散性,提升了长上下文建模能力。实验表明,在 75% 稀疏度下,DashAttention 的准确率与全注意力相当,在高稀疏场景下优于 NSA 和 InfLLMv2。其基于 Triton 的 GPU 实现推理速度甚至超过 FlashAttention-3。DashAttention 为长上下文模型提供了一种高效且经济的方案。论文注意力机制长上下文稀疏注意力推荐理由:长上下文 LLM 的推理成本一直是痛点,DashAttention 用可微分稀疏注意力在保持精度的同时大幅提速,做长文本推理和模型优化的研究者值得关注。原文稍后读已读值得跟进有用关注 注意力机制
11:24官方账号arXiv cs.AI@Yasuyuki Okoshi, Hao Mark Chen, Guanxi Lu, Hongxiang Fan, Masato Motomura, Daichi Fujiki精选现代大语言模型依赖长前缀来控制推理行为,但前缀影响会随生成衰减,且注意力计算成本随前缀长度线性增长。现有方法要么压缩前缀但仍需注意力计算,要么通过梯度训练内化前缀但更新困难。本文提出 attention-state memory,一种无训练方法,将前缀与查询 token 的预计算注意力状态外化到轻量级查找表中。在 ManyICLBench 上,LLaMA-3.1-8B 在 1K-8K 内存预算下准确率超过上下文学习,注意力延迟降低 1.36 倍;在 NBA 基准上仅用 20% 内存就超越全注意力 RAG 性能。论文长上下文注意力机制LLM推理推荐理由:长上下文推理的注意力瓶颈终于有了轻量级解法——无训练、可更新、内存高效,做 LLM 推理优化或长文档应用的团队值得关注。原文稍后读已读值得跟进有用关注 长上下文
01:25berryxia@berryxia精选73°Sebastian Raschka发布《Recent Developments in LLM Architectures》,用可视化方式拆解Gemma 4到DeepSeek V4的硬核优化。文章指出长上下文瓶颈已从“能否支持更多token”转向“如何聪明分配计算”,这些优化已在生产环境落地。正在做长上下文模型、Agent或RAG的团队,这篇文章的视觉图和效率对比特别值得细读。论文长上下文架构优化Gemma 41 个信源在谈事件专题推荐理由:长上下文竞争已从堆token转向架构优化,做Agent或RAG的团队可以从Gemma 4到DeepSeek V4的真实方案中直接借鉴效率提升思路。原文稍后读已读值得跟进有用关注 长上下文
23:51Viking@vikingmute精选开发者 vikingmute 分享了一个解决 Codex 长上下文响应变慢的技巧:使用 handoff 技能将当前对话压缩成一份 handoff 文件,然后新开 session 继续任务。他发现 Codex 在上下文变长时返回速度明显下降,而 handoff 能避免自动压缩带来的性能损失,在任务进行到 70%-80% 时使用效果最佳。该技巧与 Codex 最新的 /goal 模式原理相似,适合处理长任务。AI产品Codexhandoff长上下文推荐理由:Codex 重度用户终于有了应对长上下文卡顿的实战技巧——handoff 压缩对话再开新 session,比硬扛自动压缩快很多,做复杂自动化任务的开发者可以直接抄作业。原文稍后读已读值得跟进有用关注 Codex
10:08官方一手arXiv: DeepSeek@Bin Lei, Caiwen Ding, Jiachen Yang, Ang Li, Xin Eric Wang精选研究发现,思维链推理长度增加时,模型对早期关键洞察的注意力会逐渐减弱,导致准确率在达到峰值后下降。为此,研究者提出InsightReplay方法,让模型在推理过程中定期提取关键洞察并回放到当前生成位置附近,保持其可访问性。在8B和30B规模的Qwen3.5、DeepSeek-R1-Distill-Qwen、Gemma-4模型上,覆盖AIME、HMMT、GPQA Diamond、LiveCodeBench v5等基准测试,3轮InsightReplay在所有24个设置中均带来准确率提升,平均提升1.65个百分点,最高单设置提升达9.2个百分点。结果表明,测试时扩展的有效性不仅取决于推理量,还取决于关键中间洞察在长推理轨迹中的可访问性。论文推理模型思维链注意力机制推荐理由:长链推理的注意力衰减问题终于有了针对性解法,做推理模型优化或长上下文应用的团队值得关注——InsightReplay简单有效,可以直接在现有CoT框架上尝试。原文稍后读已读值得跟进有用关注 推理模型
13:37官方账号深度求索 DeepSeek@deepseek_ai78°DeepSeek 发布了 V4 Preview 版本,包含 Pro 和 Flash 两个模型,均支持 1M 上下文长度。Pro 版本总参数量 1.6T,激活参数 49B,性能对标全球顶级闭源模型;Flash 版本总参数量 284B,激活参数 13B,主打高效经济。模型权重和技术报告已开源,API 同步更新。这标志着开源大模型在长上下文和性价比上迈出重要一步。AI模型DeepSeek-V4开源/仓库长上下文推荐理由:长上下文和低成本是当前 AI 应用的两大痛点,DeepSeek-V4 同时解决这两个问题,做 RAG、文档分析或长对话的开发者可以直接上手试试。原文稍后读已读值得跟进有用关注 DeepSeek-V4
21:55官方账号Together AI@togethercompute75°DeepSeek V4 Pro在Together AI无服务器平台上发布,具备长上下文推理能力和领先的编程性能。该模型通过KV缓存、前缀重用、混合注意力、批处理、内核优化和端点配置等技术实现高效服务。来自@zhyncs42、@realDanFu等人的深入分析揭示了其技术细节。AI模型推理模型开源/仓库Together AI推荐理由:DeepSeek V4 Pro在长上下文推理和编程任务上的表现达到SOTA,同时其高效服务技术栈的公开分析对AI部署实践有重要参考价值。原文稍后读已读值得跟进有用关注 推理模型