04:32coderabbitai@coderabbitaiCodeRabbit AI 对 Claude Sonnet 5 进行了代码审查基准测试。结果发现,该模型在生成更干净的评论方面表现突出,评论精度相比前代提升约9%。模型展现出更深层的思考能力,并在编码技能上有所增强。完整评测细节已在下方链接中公布。AI模型Claude Sonnet 5代码审查推理模型推荐理由:CodeRabbit AI 跑了 Claude Sonnet 5 的代码审查评测,评论精度提了9%,编码更聪明,值得看看细节。原文稍后读已读值得跟进有用关注 Claude Sonnet 5
03:21elvis@omarsar088°Anthropic 发布 Claude Sonnet 5,专为长期运行的代理任务优化。相较于前代 Sonnet,Sonnet 5 在代理任务可靠性上有显著提升,同时大幅强化了计算机使用(Computer Use)能力。该模型能够自主制定计划、使用浏览器和终端等工具,且运行自主性接近几个月前需要更大更贵模型才达到的水平。AI模型ClaudeSonnet 5Anthropic10 个信源在谈事件专题推荐理由:Claude Sonnet 5 来了,做长期代理任务比以前稳多了,还能自己用浏览器和终端,值得试试。原文稍后读已读值得跟进有用关注 Claude
03:18The Rundown AI@therundownai83°Anthropic发布了新模型Claude Sonnet 5。相比Claude 4.6,该模型在编码和智能体能力上有大幅提升。其知识工作分数超过了Opus 4.8。AI模型Claude Sonnet 5Anthropic编码10 个信源在谈事件专题推荐理由:Anthropic出了Claude Sonnet 5,编码和智能体能力比4.6强很多,知识工作分数甚至超过了Opus 4.8,值得试试。原文稍后读已读值得跟进有用关注 Claude Sonnet 5
02:58官方一手AWS Machine Learning Blog@Aamna Najmi76°Anthropic 发布 Claude Sonnet 5,这是其最新一代的首个 Sonnet 模型,已在 Amazon Bedrock 和 AWS Claude Platform 上可用。该模型在编码、智能体任务和日常专业工作中提供顶级智能,定价保持 Sonnet 系列标准。基于此前 Sonnet 4 的架构升级,Sonnet 5 在多个基准测试中表现领先。AI模型Claude Sonnet 5AnthropicAWS10 个信源在谈事件专题推荐理由:Anthropic 把最强 Sonnet 模型放到 AWS 上,编码和智能体任务更强,价格还不变。原文稍后读已读值得跟进有用关注 Claude Sonnet 5
02:17官方账号NVIDIA AI@NVIDIAAINemotron Labs发布了一项基于5000名Kaggle竞赛参与者数据的研究。他们分析了参与者的解题行为与推理策略。研究揭示了团队协作和多样化方法对提升AI推理效果的关键作用。这些经验可直接应用于现有模型的优化。论文Nemotron LabsKaggleNVIDIA4 个信源在谈事件专题推荐理由:Nemotron Labs用5000个Kaggle实战案例总结了AI推理的改进方法,比看论文更接地气。原文稍后读已读值得跟进有用关注 Nemotron Labs
22:50官方账号阶跃星辰 Stepfun@Stepfun_AIStep 3.7 Flash 本月在 OpenRouter 平台上处理了4.29万亿 tokens,进入该平台流量前十。开发者将其用于真实 agent 运行、编程任务和长上下文工作流。模型在处理复杂任务时表现稳定,获得社区积极反馈。AI模型Step 3.7 FlashOpenRouter推理模型推荐理由:Step 3.7 Flash 在 OpenRouter 上月流量超4万亿 tokens,开发者拿它跑智能体、写代码,又稳又快。原文稍后读已读值得跟进有用关注 Step 3.7 Flash
16:51官方账号Decoder@Matthias BastianDeepSeek发布新框架DSpark,将每位用户的响应速度提升60%至85%。该框架使用小型模型生成候选token,再由大型模型批量验证。通过优化计算流程,DSpark能在更少芯片上榨取更多性能。这有助于减少中国对高端美国芯片的依赖。AI模型DeepSeekDSpark推理模型推荐理由:DeepSeek的DSpark用小型模型提候选token、大模型批量验证,让速度提升85%,还减少了芯片需求,挺实用的。原文稍后读已读值得跟进有用关注 DeepSeek
14:34Suhail@Suhail一条推文揭示了闭源推理模型(如Claude、GPT系列)的原始推理轨迹,这些轨迹通常对用户隐藏。数据表明模型会像人类一样过度思考。Dustin Tran指出,通过更好的长度惩罚(length penalty)可以减少这种过度思考,而无需新的奖励函数。讨论涉及并行与顺序工具调用、工具与基座模型能力边界、单智能体与子智能体等策略。AI模型推理模型长度惩罚闭源模型推荐理由:看看闭源模型暗地里怎么想问题的——它们也会纠结和自我怀疑,而长度惩罚可能就是解药。原文稍后读已读值得跟进有用关注 推理模型
13:53官方账号arXiv cs.AI@Subramanyam Sahoo, Aman Chadha, Vinija Jain, Divya Chaudhary论文在Qwen3-14B策略上采用DPO,设置三个保守度β(低、中、高),并在在线适应中使用3×Qwen3-1.7B奖励集成。在GSM8K基准上测量准确率,发现更高保守度单调增加奖励黑客损伤,Goodhart gap及其曲线下面积AUGC的Spearman ρ=1.0。机制分析表明,高β DPO压缩策略熵,导致响应多样性降低,但集成分歧增加且被更快利用。论文进一步拟合幂律曲线,确定了平衡对齐保真度和漏洞的最优保守度β*。论文Qwen3-14BDPOGSM8K推荐理由:这篇论文用Qwen3-14B和DPO实验证明,离线训练越保守,在线适应越容易翻车,还在GSM8K上给出了最优保守度公式。做RLHF的值得一读。原文稍后读已读值得跟进有用关注 Qwen3-14B
13:17Geek@geekbb精选Qwythos 9B 基于 Qwen3.5-9B,在 5 亿 token 的 Claude 思维链轨迹上全参数微调,可处理 1M 上下文。支持原生 Function Calling 和多模态视觉(图像+文本)。GGUF 量化后仅 5.2 GiB,可在低配设备上运行。该模型为开源且未经审查。AI模型Qwythos 9BQwen3.5-9BClaude推荐理由:Empero AI 开源的 Qwythos 9B 把 Qwen3.5 和 Claude 思维链结合,1M 上下文加 Function Calling,量化后 5.2GB 的推理模型,低配机器也能跑。原文稍后读已读值得跟进有用关注 Qwythos 9B
12:49官方账号阶跃星辰 Stepfun@Stepfun_AIStep 3.7 Flash 在 Nous Portal 上获得实际应用,用户正在用它测试、构建和运行各种智能体工作流。该项目由 Nous Research 合作推进,并保持免费访问。官方邀请用户试用并分享成果。AI模型Step 3.7 FlashNous PortalNous Research推荐理由:快去 Nous Portal 上免费试用 Step 3.7 Flash,用它搭建各种智能体工作流,体验它的实际效果。原文稍后读已读值得跟进有用关注 Step 3.7 Flash
12:39官方一手arXiv: DeepSeek@Lei Bai, Zongsheng Cao, Yang Chen, Zhiyao Cui, Shangheng Du, Yue Fan, Shiyang Feng, Zijie Guo, Haonan He, Liang He, Xiaohan He, Shuyue Hu, Yusong Hu, Songtao Huang, Yichen Jiang, Hao Li, Xin Li, Dahua Lin, Weihao Lin, Fenghua Ling, Dongrui Liu, Zhuo Liu, Runmin Ma, Chunjiang Mu, Haoyang Peng, Tianshuo Peng, Jinxin Shi, Luohe Shi, Boyuan Sun, Zelin Tan, Shengji Tang, Qianyi Wang, Yiming Wu, Yi Xie, Xiangchao Yan, Jingqi Ye, Peng Ye, Fangchen Yu, Jiakang Yuan, Bihao Zhan, Bo Zhang, Chen Zhang, Shufei Zhang, Shuaiyu Zhang, Wenlong Zhang, Yiqun Zhang, Junpeng Zhao, Zhijie Zhong, Bowen Zhou, Yuhao Zhou精选Agents-A1是一个35B参数的Mixture-of-Experts智能体模型,通过扩展智能体视野(平均轨迹长度45K tokens)达到万亿参数级别性能。它在SEAL-0(56.4)、IFBench(80.6)、HiPhO(46.4)、FrontierScience-Olympiad(79.0)和MolBench-Bind(56.8)上超越了1T参数的Kimi-K2.6和DeepSeek-V4-pro,在SciCode(44.3)、HLE(47.6)和BrowseComp(75.5)上也具有竞争力。训练采用三阶段流程:全领域SFT、领域级教师模型、多教师领域路由在线蒸馏。AI模型Agents-A135B智能体推荐理由:35B的模型干翻万亿参数?Agents-A1用长视野扩展和智能体框架做到,基准全面领先,值得看看怎么训练的。原文稍后读已读值得跟进有用关注 Agents-A1
12:27官方账号NVIDIA AI@NVIDIAAINVIDIA 宣布其 Nemotron 模型与 LangChain 集成,覆盖从推理到编排的智能体工作流。开发者可在开放栈上自定义、调优和部署模型。该集成面向生产环境,基于 LangChain 框架实现灵活编排。Nemotron 是 NVIDIA 的前沿智能体性能模型,支持多种部署方式。AI产品NVIDIANemotronLangChain7 个信源在谈事件专题推荐理由:NVIDIA的Nemotron现在接入了LangChain,你可以按需调优和部署智能体,不受厂商锁定,适合做定制化AI代理。原文稍后读已读值得跟进有用关注 NVIDIA
11:14官方账号arXiv cs.LG@Aaryam Sharma推测解码利用快速起草器生成候选 token,再由大模型验证以加速推理。现有理论主要针对随机采样,而实用系统多用贪婪解码和松弛接受规则。本文提出一类具有拒绝区域的接受准则,并给出其精确 KL 散度下界,覆盖严格贪婪、加性和乘性松弛、top-(m) 以及熵阈值等情形。对于树形解码,推导出目标贪婪 token 仍被起草器 top-(m) 覆盖的充分条件。在 Qwen3 模型上的实验表明,松弛和树形准则显著扩大了可保证接受的区域。论文Qwen3speculative decoding推理模型推荐理由:这篇论文搞明白了推测解码里那些花式接受规则到底行不行,给出了数学保证,还在Qwen3上验证了,搞推理加速的值得一看。原文稍后读已读值得跟进有用关注 Qwen3
11:00IT之家(博客/媒体)73°美团今日发布LongCat-2.0,总参数1.6T,平均激活约48B,动态范围33B-56B,原生支持1M超长上下文。该模型在五万卡国产算力集群上完成全流程训练,预训练数据规模超30T tokens。其在SWE-bench Pro中得分59.5,领先Gemini 3.1 Pro(54.2)、GPT-5.5(58.6)和Claude Opus 4.6(57.3);在SWE-bench Multilingual中取得77.3,接近Claude Opus 4.6。推理阶段采用LongCat Sparse Attention和零计算专家机制,实现token级动态激活,降低解码延迟。AI模型LongCat-2.0美团MoE2 个信源在谈事件专题推荐理由:美团开源了LongCat-2.0,国产芯片跑万亿参数,编程和Agent能力很强,还支持百万上下文,值得上手试试。原文稍后读已读值得跟进有用关注 LongCat-2.0
10:06官方账号arXiv cs.LG@Abhranil Chandra, Sankaran Vaidyanathan, Utsav Dhanuka, Varun Gandhi, Scott NiekumHExA是一个无需训练的上下文学习框架,让LLM通过主动实验设计、迭代优化和技能库复用来解决新颖领域的长时任务。在Interphyre基准(基于PHYRE 2D物理环境)上,Claude Sonnet 4.6原本只有2%的成功率,而HExA将其提升至77%。HExA还优于ReAct和Reflexion等基线,并支持开源模型。仅使用从简单关卡学到的技能转移,HExA在新关卡上也能达到44%成功率,证明技能可复用。论文HExAClaude Sonnet 4.6Interphyre1 个信源在谈事件专题推荐理由:Claude 4.6在困难物理任务上从2%蹿到77%,全靠HExA这个主动实验框架。不用复杂训练,自己试错学技能,还能跨任务迁移。原文稍后读已读值得跟进有用关注 HExA
03:06@koltregaskes@koltregaskes79°DeepSeek v4 将于 7 月中旬进入通用可用(GA)阶段,部分用户已收到相关邮件通知。该版本带来更多功能优化和性能改进。具体改进细节尚未完全公开,但用户可期待更优的模型能力。AI模型DeepSeek v4DeepSeek开源模型推荐理由:DeepSeek v4 马上 GA 了,7 月中旬上线,性能有优化,想尝鲜的可以关注。原文稍后读已读值得跟进有用关注 DeepSeek v4
23:49官方账号阶跃星辰 Stepfun@Stepfun_AI精选StepFun 的 Step 3.7 Flash 模型在 Claw-Eval General 基准测试中取得第二名的成绩,该基准用于评估自主智能体。模型在多步执行和长程任务鲁棒性上表现强劲,排名仅次于 Claude Opus 4.6。这一结果显示其在真实世界智能体工作负载中的潜力。AI模型Step 3.7 FlashClaw-Eval General智能体推荐理由:StepFun 的 Step 3.7 Flash 在智能体基准 Claw-Eval General 排第二,仅次于 Claude Opus 4.6,多步执行和长程任务都强,感兴趣可以看看。原文稍后读已读值得跟进有用关注 Step 3.7 Flash
16:27官方一手Pandaily@contact@pandaily.com (Pandaily)精选73°DeepSeek 与北京大学联合开发的 DSpark 推理系统获得 PyTorch 核心维护者 Dmytro Dzhulgakov 的详细技术分析。他重点称赞 DSpark 的半并行草稿(semi-parallel drafting)机制,能提升推理吞吐量。分析指出该系统达到生产级工程水平(production-grade engineering),在特定负载下相比基线有显著加速。这一评测为开源推理系统提供了高含金量的第三方验证。AI模型DeepSeekDSparkPyTorch推荐理由:PyTorch 核心大佬亲自下场拆解 DeepSeek 的 DSpark,说它半并行草稿很牛、工程落地扎实,搞推理优化的必看。原文稍后读已读值得跟进有用关注 DeepSeek
15:41@koltregaskes@koltregaskes商汤推出了U1 Pro图像思考模型,该模型在图像生成能力上与GPT Image 2持平甚至更优。U1 Pro支持高达8K分辨率输出,专为设计场景优化。内部测试将于7月启动,之后计划公开发布。AI模型U1 ProSenseTimeGPT Image 2推荐理由:商汤新模型U1 Pro据说能和GPT Image 2比一比,还支持8K图,设计师7月就能内测了。原文稍后读已读值得跟进有用关注 U1 Pro
15:38@koltregaskes@koltregaskes91°OpenAI 开放了 GPT-5.6 模型家族的有限预览,包括旗舰版 Sol、性价比版 Terra 和快速版 Luna。Sol 引入最大推理努力和超模式,使用子代理加速复杂任务,在 Terminal-Bench 2.1 上领先,并在网络安全基准上匹配 Mythos Preview 性能,仅用三分之一输出令牌。系统卡将网络和生物能力评为高,但低于自主全链利用的关键阈值。更广泛可用性计划在未来几周内推出。AI模型OpenAIGPT-5.6Sol10 个信源在谈事件专题推荐理由:OpenAI 终于放出 GPT-5.6 预览,Sol 在编程和网络安全测试上效率高,Terra 半价达 GPT-5.5 水平,想尝鲜可以关注。原文稍后读已读值得跟进有用关注 OpenAI
14:55宝玉@dotey有用户发现,在 Codex 应用中将模型选为 GPT-5.5 并设置推理为 xhigh 后,运行 Juice 测试 Prompt 若返回 128 则实际使用的是 GPT 5.6 Sol,否则返回 768 就是 GPT 5.5。该 Prompt 要求模型输出 Juice 数除以2乘10再除以5的结果。目前测试仍返回 768,说明多数用户尚未灰度到 GPT 5.6 Sol。技巧GPT 5.6 SolGPT 5.5提示词工程推荐理由:想提前知道自己的 GPT 5.5 是不是偷偷升级了?用这个 Juice 测试 Prompt 一试便知,很简单。原文稍后读已读值得跟进有用关注 GPT 5.6 Sol
13:51官方账号Together AI@togethercompute精选智谱AI的GLM-5.2模型在Together AI平台展示了端到端代码修复能力,可读取issue、推理场景并自动生成补丁。一年前这类任务还被认为是闭源模型(如GPT-4)的专属领域,如今开源模型已能胜任。该模型未公布具体基准分数,但实际演示表明其编程推理能力接近闭源水平。AI模型GLM-5.2Together AI推理模型推荐理由:开源模型GLM-5.2能自己读代码问题、推理并修复,以前只有闭源模型才能做到,现在用Together AI就能跑。原文稍后读已读值得跟进有用关注 GLM-5.2
13:49官方账号阶跃星辰 Stepfun@Stepfun_AI精选Step 3.7 Flash 是开源多模态推理模型,现已在 DeepInfra API 上线。该模型支持私有端点部署,适用于专用负载场景。它专为智能体编码、工具使用、搜索和视觉工作流设计。开发者可通过 DeepInfra 的 API 直接调用。AI模型Step 3.7 FlashDeepInfra多模态推荐理由:Step 3.7 Flash 开源多模态推理模型刚上线 DeepInfra,支持私有部署,适合智能体编程和视觉任务,开发者可以试试。原文稍后读已读值得跟进有用关注 Step 3.7 Flash
13:49官方账号Microsoft AI@MicrosoftAI微软AI在X上发布视频,展示团队成员如何解决机器学习中的难题。视频中研究人员探讨了改进LLM训练效率的新思路。团队还分享了在推理模型优化上的实践。行业Microsoft AI推理模型训练优化推荐理由:看看微软AI团队怎么解决实际技术难题,了解模型背后的人原文稍后读已读值得跟进有用关注 Microsoft AI
13:49官方账号Together AI@togethercomputeGLM-5.2模型已在Together AI平台上架,并通过OpenRouter快速提供服务。Together AI优化推理路径,使模型在长上下文编码和智能体工作负载中每GPU能处理更多token,同时保持低延迟。该模型展现出强劲性能,适合需要高吞吐的复杂任务。AI模型GLM-5.2Together AIOpenRouter1 个信源在谈事件专题推荐理由:GLM-5.2跑得快,长上下文和智能体场景下Together的优化让token更多更流畅,试试看。原文稍后读已读值得跟进有用关注 GLM-5.2
13:49Ethan Mollick@emollickEthan Mollick 指出,所有模型路由器(model routers)在处理非数学/编程任务时,普遍低估任务难度并分配过少的智能资源。他建议,对于不可验证的任务(如创新、营销、定性分析),使用更智能的模型往往能带来更大收益。这一观点源于他对多种路由器实际表现的经验观察。技巧model routers任务分配推理模型推荐理由:Ethan Mollick 分享了一个容易被忽视的问题:模型路由器的任务分配不够智能,尤其对创意和分析类任务。如果你也发现一些任务结果不好,可能不是模型不行,是路由器给它派了太弱的模型。原文稍后读已读值得跟进有用关注 model routers
13:48Ethan Mollick@emollick这个提示词让AI模型推荐两首适合当前GenAI状态的诗,并要求认真思考而非后验合理化。作者建议在GLM-5.2或Opus 4.8上尝试,观察模型如何选题和论证。它提供了窥探模型内部推理过程的视角,适合想了解模型思考方式的人。该技巧无需额外工具,直接复制提示词即可使用。技巧GLM-5.2Opus 4.8提示词工程6 个信源在谈事件专题推荐理由:想看看AI怎么思考?让GLM-5.2或Opus 4.8帮你选诗,能看到它的推理过程,挺有意思的。原文稍后读已读值得跟进有用关注 GLM-5.2
10:12官方账号arXiv cs.LG@David Steinmann, Antonia Wüst, Kristian Kersting, Wolfgang StammerCOCOLogic-V2 是一个面向现实图像的对象中心数据集,覆盖一阶逻辑的广泛子集,用于视觉归纳推理评估。它将样本分为正变体、近边界和远边界负例三类,实现对模型可解释性的细粒度诊断。实验表明,模型能很好区分正样本和远边界负例,但在近边界负例上表现失败。此外,感知噪声和大规则搜索空间在少样本场景下构成额外挑战。该数据集为推进视觉归纳推理提供了具体基础。论文COCOLogic-V2推理模型视觉理解推荐理由:COCOLogic-V2 这个新数据集专测视觉推理,正反例分类特别细,模型在近边界上直接翻车,做可解释 AI 的可以看看。原文稍后读已读值得跟进有用关注 COCOLogic-V2
10:11官方账号arXiv cs.AI@Rajesh Jayaram, Drew Tyler, David Woodruff, Corinna Cortes, Yossi Matias, Vahab Mirrokni, Vincent Cohen-AddadPaper Assistant Tool(PAT)是谷歌开发的智能体框架,用于深度科学评审,能检查理论结果、验证实验并提出改进建议。PAT利用推理缩放技术,在SPOT基准上对数学错误的零样本召回率提升了34%。该工具已在STOC和ICML两大计算机科学会议作为预提交工具试点,有效识别关键错误并减轻审稿人认知负担。AI产品Paper Assistant ToolGoogle自动化评审推荐理由:谷歌做了个叫PAT的工具,能帮你审论文抓数学错误,召回率比普通模型高34%,已在两大顶会试过了,实用。原文稍后读已读值得跟进有用关注 Paper Assistant Tool
10:09官方账号arXiv cs.AI@Chenguang Wang, Ming Li, Xinyue Zeng, Zhuochun Li, Hong Jiao, Tianyi Zhou, Dawei Zhou论文提出Epi2Diff(Episode to Difficulty)框架,将大型推理模型(LRM)的推理轨迹映射为认知片段序列,通过推理规模、努力分配和状态转换建模难度。在四个真实人类难度数据集上,Epi2Diff优于微调小语言模型、LLM上下文学习和监督LLM适应等基线。在SAT分类基准上,Epi2Diff相比监督LLM微调获得8.1%平均相对增益。分析发现更难的题目导致更费力、迭代、以实施为中心的片段动态,而非仅更长的回答。论文Epi2DiffLRM推理模型推荐理由:想用AI推理过程预测题目难度?这篇论文提出了Epi2Diff,从LRM的思考轨迹中提取片段特征,比直接微调模型效果好8%以上,而且可解释。原文稍后读已读值得跟进有用关注 Epi2Diff
10:08官方账号arXiv cs.AI@Difan Jiao, Raghav Singhal, Robert West, Ashton AndersonTandem Reinforcement Learning (TRL) 将 tandem 训练范式引入带可验证奖励的强化学习(RLVR)。TRL 让一个较强的 senior 模型与一个冻结的 junior 模型随机交替协作生成推理过程,对最终结果给予奖励,并对 senior 应用标准 GRPO 损失。在 Qwen3-4B-Instruct 上使用竞赛数学训练,TRL 的 solo 推理能力与 vanilla GRPO 持平,但同时提升了 senior 与 junior 的交接鲁棒性、减少了 junior 侧分布漂移,并产出了对 junior 更易理解的思维链。该工作为多模型通信与人类兼容性提供了实际收益的路径。AI模型TRLQwen3-4BGRPO推荐理由:他们提出了 TRL,让强模型和弱模型组队推理,强模型学会写弱模型能看懂的推理过程。训练 Qwen3-4B 后,单打能力不降,协作能力更强。原文稍后读已读值得跟进有用关注 TRL
10:06官方一手arXiv: DeepSeek@Lei Yu, Peng Wang, Jia Xu, Jingyuan Zhang, Xin Wang, Jiajia Ma, Li Yang, Changzhi Deng, Zenghua Wang, Fengjun ZhangBashCoder-R1提出三阶段框架:连续预训练(CPT)专业化Bash范式、长思维链监督微调(L-CoT SFT)模拟风险意识推理、鲁棒性感知分组相对策略优化(R-GRPO)优化语法与鲁棒性。在包含952个真实任务(773单行,179多行)的BashBench基准上,单行/多行任务SyntaxPass达100.00%/94.97%,RobustPass达95.99%/79.33%,FullRate达90.04%/73.18%。相比最强基线DeepSeek-V3.2(推理)在FullRate上分别提升37.82%和20.18%。AI模型BashCoder-R1BashBenchDeepSeek推荐理由:BashCoder-R1用三阶段训练让AI写bash脚本更稳更可解释,在BashBench上比DeepSeek-V3.2完整率高出一大截。原文稍后读已读值得跟进有用关注 BashCoder-R1
00:36Yangyi@YangyixxxxNous Research 的 Hermes Agent 发布 MoA(Mixture-of-Agents)预置虚拟模型,允许在不同时刻为同一 Agent 路由不同模型,类似快慢脑逻辑。在新基准测试中,该方案比 Opus 4.8 高出 8%,比 GPT 5.5 高出 11%。多 Agent 场景下效果更显著,延续了 Hermes 的工程化优势。AI模型HermesNous Research智能体推荐理由:Nous Research 让 Agent 在不同时刻自动切换不同模型,比单一模型更强,新基准上比 Opus 4.8 高8%、比 GPT 5.5 高11%。原文稍后读已读值得跟进有用关注 Hermes
21:39小互@imxiaohu71°马斯克透露Grok 4.5基于1.5T参数的V9基础模型,并在补充训练中加入了Cursor数据。该模型已在SpaceX和Tesla进入早期测试阶段。初步评估显示其性能接近甚至可能超过Anthropic的Opus模型。马斯克还表示强化学习持续提升模型性能,今年将每月发布完全从头训练的新模型。AI模型Grok 4.5马斯克XAI10 个信源在谈事件专题推荐理由:马斯克刚发了Grok 4.5,基于1.5T参数的V9模型,还加了Cursor数据,测试阶段就快超过Opus了,值得关注。原文稍后读已读值得跟进有用关注 Grok 4.5
16:03官方账号Decoder@Jonathan Kemper精选新浪微博发布开源模型VibeThinker-3B,仅30亿参数。在数学和编程基准上,它匹配了DeepSeek V3.2和Kimi K2.5,后两者参数规模大333倍。模型通过多阶段后训练实现高性能。研究人员假设:逻辑推理可压缩进小模型,但广泛世界知识不行。AI模型VibeThinker-3B新浪推理模型推荐理由:30亿参数的小模型推理能力居然能打千亿级大模型,新浪VibeThinker-3B在数学和编程上很强,而且开源了。原文稍后读已读值得跟进有用关注 VibeThinker-3B
13:09官方一手pandaily@contact@pandaily.com (Pandaily)精选73°DeepSeek 在获 70 亿美元融资后发布首篇论文,提出 DSpark 推测解码框架,在无需额外训练的情况下将大模型生成速度提升 85%。该框架通过轻量级草稿模型配合验证机制加速推理,在多个基准测试中达到与原始模型相当的质量。DSpark 支持即插即用,可适配现有 DeepSeek 系列模型,显著降低延迟。AI模型DeepSeekDSpark推理模型推荐理由:DeepSeek 刚发了 DSpark,跑大模型生成能快 85%,还是即插即用的。搞推理加速的朋友可以关注。原文稍后读已读值得跟进有用关注 DeepSeek
05:49Marc Andreessen@pmarcaMarc Andreessen在X上援引多位AI内部人士观点,称GLM-5.2是首个匹配并经常超越美国大模型的中国AI模型。该推文获得3553次查看。另有5个点赞和1次转发。AI模型GLM-5.2智谱AI推理模型1 个信源在谈事件专题推荐理由:有AI圈内人说GLM-5.2性能已经不输美国主流模型了,而且是智谱AI做的,可以关注一下。原文稍后读已读值得跟进有用关注 GLM-5.2
21:12官方账号LMSYS Org (SGLang)@lmsysorg精选英伟达与智谱AI合作,发布了基于GLM-5.2的NVFP4量化检查点。该模型为744B参数混合专家架构(40B活跃参数),专注于推理和编码任务。NVFP4量化通过NVIDIA Model Optimizer实现,在降低内存占用的同时保持前沿推理性能。模型还支持稀疏注意力和IndexShare索引器,实现高效长上下文处理。目前已在Blackwell/Grace Blackwell上通过SGLang提供首日支持。AI模型GLM-5.2NVFP4NVIDIA5 个信源在谈事件专题推荐理由:英伟达把GLM-5.2压缩成NVFP4,内存省一大截,推理编码在Blackwell上直接跑,SGLang第一时间就能用。原文稍后读已读值得跟进有用关注 GLM-5.2
21:12官方账号LMSYS Org (SGLang)@lmsysorg精选Liquid AI 发布了 LFM2.5-230M 模型,参数规模仅 230M,是其最小模型。该模型基于 LFM2 架构,专为设备端部署设计,推理速度极快。它可在云端 GPU 和低成本 CPU 上运行,并支持工具调用和结构化数据提取。性能超过两倍参数量的模型,且已获 SGLang 的 Day 0 支持。AI模型LFM2.5-230MLiquid AISGLang推荐理由:Liquid AI 新出的 230M 小模型,跑得飞快,还能干工具调用的活,比两倍大的模型还强。原文稍后读已读值得跟进有用关注 LFM2.5-230M