17:48官方账号NVIDIA AI@NVIDIAAICodeRabbit与Baseten合作,用CodeRabbit自身的路由决策数据微调了NVIDIA Nemotron 3.5 Lightning。整个微调过程耗时不到3小时,花费低于100美元。微调后的模型相比此前的GPT级模型,准确率提升约4%,推理成本下降约50%。详细技术解析已发布在CodeRabbit官方博客。AI模型CodeRabbitNemotron 3.5 LightningBaseten10 个信源在谈事件专题推荐理由:CodeRabbit用不到100美元和三小时微调了NVIDIA新模型,比原来的GPT级模型准确率高4%,推理成本还省一半,想省钱的可以看看。原文稍后读已读值得跟进有用关注 CodeRabbit
17:47shao__meng@shao__meng76°马斯克在 X 上表示,Grok 4.7 将超过当前所有模型。他称 SpaceX 的训练语料独特,若存在真实工程能力更强的模型会感到惊讶。马斯克预计 Grok 4.7 将在一个月内发布。他还提到 Anthropic 是家很棒的公司,可能会很快发布更好的模型。AI模型GrokElon MuskSpaceX10 个信源在谈事件专题推荐理由:马斯克给 Grok 4.7 背书,说工程能力无敌,还夸了 Anthropic,一个月内就发布,到时候看有没有被打脸。原文稍后读已读值得跟进有用关注 Grok
17:47向阳乔木@vista8一条推文将Grok 4.6、DeepSeek V4 Pro 0813、WeLM-617B和Qwen3.8-2.4T-A95B四个模型放在一起,问网友最想先测哪个。该推文目前已获得4980次浏览、19个赞和10条评论。除型号列表外,原文并未给出基准测试分数、发布时间等更多信息。AI模型Grok 4.6DeepSeek V4 ProWeLM-617B10 个信源在谈事件专题推荐理由:四个新模型突然一起出现,Grok、DeepSeek、WeLM、Qwen,你想先试哪个?原文稍后读已读值得跟进有用关注 Grok 4.6
17:47Cognition@cognition_labsCognition 宣布在 Devin 中集成 Grok 4.6。该模型在改动任何代码之前会进行全面的代码探索与根因分析。Devin 用户可借助这一能力更准确地定位 bug。完整评估见 Devin 官方博客。AI模型GrokDevinCognition推荐理由:Cognition 把 Grok 4.6 放进 Devin,改代码前先做深度探索和根因分析,挺实用。原文稍后读已读值得跟进有用关注 Grok
17:46LlamaIndex@llama_index精选ExtractBench 基准包含 370 份企业文档和 14 个提取系统。最难的测试是长列表完整性,例如 26,725 行的未认领财产清单。前沿视觉语言模型在长文档上 F1 仅为 8.9%–35.8%,精度高但召回率大幅下降。LlamaIndex 的新方案 Agentic Plus 将长文档迭代处理,在长列表任务上达到 96.1% F1。AI模型ExtractBenchLlamaIndexAgentic Plus1 个信源在谈事件专题推荐理由:LlamaIndex 搞了个 ExtractBench,测了 14 个系统,发现长文档提取召回率很低。它家 Agentic Plus 能到 96.1%,比别的都稳。原文稍后读已读值得跟进有用关注 ExtractBench
17:46向阳乔木@vista8博主@vista8 用与DeepSeek V4 Pro相同的提示词测试Grok 4.6。在一个打砖块游戏中,Grok 4.6设计出带熔炉故事场景的情节,音效表现也可圈可点。该模型还一次生成了60种Bento样式风格,其中部分样式的视觉效果优于DeepSeek V4 Pro。AI模型Grok 4.6DeepSeek V4 ProBento样式10 个信源在谈事件专题推荐理由:有人用同一组提示词跑Grok 4.6和DeepSeek V4 Pro,Grok在打砖块场景和Bento样式上都很惊艳,部分比DS 4 Pro还好看。原文稍后读已读值得跟进有用关注 Grok 4.6
17:45lmarena.ai@lmarena_ai精选Arena AutoEval 使用数千万条历史人类对战数据训练奖励模型,以大规模估算人类偏好并快速输出评估结果。与 LLM-as-judge 方法不同,AutoEval 是实时基准,来源于真实对战数据,由奖励模型对用户提示和模型回复打分。该方法由 Arena 机器学习工程师 Haoran Guo 和 Wayne Zhang 介绍。AI模型Arena AutoEval奖励模型基准测试推荐理由:Arena 用数千万人类真实对战数据训了个奖励模型,评估速度飞快,还比 LLM-as-judge 更贴近真实偏好。原文稍后读已读值得跟进有用关注 Arena AutoEval
17:43orange.ai@oran_geDeepSeek V4 Pro 0813正式版发布。从评测指标看,该模型有两项指标超越Fable,多项指标超越Opus 4.8。Fable仍被认为是难以逾越的高山,但V4 Pro的推理成本比Fable便宜约100倍。官方强调这是涨价前的价格,后续可能调整。AI模型DeepSeekV4 ProFable推荐理由:DeepSeek出了V4 Pro 0813,多项跑分超过Opus 4.8,比Fable便宜100倍,想省钱又想要性能的可以看看。原文稍后读已读值得跟进有用关注 DeepSeek
17:43向阳乔木@vista8用户对比Grok 4.6与DeepSeek v4 Pro 0813,称前者一次成功率略高。价格上DeepSeek v4 Pro 0813更有优势。作者指出测试主观且生成随机,实际还需生产环境长期验证。AI模型GrokDeepSeek模型对比推荐理由:有人拿Grok 4.6和DeepSeek v4 Pro 0813比了比,说成功率Grok稍好,但DeepSeek便宜不少,预算有限选它更香。原文稍后读已读值得跟进有用关注 Grok
17:42Geek@geekbbX 用户 @geekbb 发帖称,在日常使用环境中已体验不出 DeepSeek-V4-Pro-0813 与 DeepSeek-V4-Flash-0731 的区别。他认为 Pro 版相比 Flash-0731 没有明显优势,并缺少 Flash-0731 发布时的惊艳感。该帖已获得 1519 次浏览、4 条评论和 2 个点赞。AI模型DeepSeek-V4-Pro-0813DeepSeek-V4-Flash-0731DeepSeek推荐理由:有人拿 Pro 和 Flash 日常对比,说没啥区别,想升级的可以看看再决定。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Pro-0813
17:42官方账号NVIDIA AI@NVIDIAAI72°CrowdStrike 定制 NVIDIA Nemotron 3.5 Lightning,用于网络安全 agent 工作流。该模型达到分析师级准确率,训练速度更快、计算需求更低。它能自动关闭最高 88% 的良性检测,让安全团队专注真实威胁。AI模型Nemotron 3.5 LightningCrowdStrikeNVIDIA10 个信源在谈事件专题推荐理由:CrowdStrike 用 Nemotron 3.5 Lightning 做了安全智能体,自动关掉 88% 误报,训练快又省算力。原文稍后读已读值得跟进有用关注 Nemotron 3.5 Lightning
17:42lmarena.ai@lmarena_ai精选DeepSeek-V4-Pro (Max) 在 Code Arena: WebDev 的 AutoEval 中获得 1607 分,总分第 8,开放权重模型中排第 2。该成绩仅次于 GPT-5.6 Sol 的 1622 分和 Kimi K3 (Max) 的 1674 分。其定价为每百万 tokens 输入 $0.435、输出 $0.87,低于 Opus-4.8 的 $5/$25 和 GLM-5.2 的 $1.4/$4.4。目前该分数为早期 AutoEval 结果,后续会随真人投票收敛。AI模型DeepSeekV4-ProCode Arena10 个信源在谈事件专题推荐理由:DeepSeek 又发新模型了,V4-Pro (Max) 在编码榜上排开源第二,比贵得多的 Opus-4.8 还强,价格只要零头。原文稍后读已读值得跟进有用关注 DeepSeek
13:03Geek@geekbb精选DeepSeek V4 Pro-0813 发布后,有开发者认为其表现不如预期惊艳,未达到美国一线模型水平。评论指出,小模型如 DeepSeek-V4-Flash、Qwen 27b 和 GLM-5.2 在同尺寸下表现出色,而大模型可能因训练算力不足显得对齐不够。该观点将 V4 Pro 的落差归因于欠训和算力短缺,而非架构缺陷,并预期随着算力增加会逐步改善。AI模型DeepSeekV4 ProGLM5 个信源在谈事件专题推荐理由:DeepSeek V4 Pro 到底行不行?这条推文用公开数据聊了聊它为什么不够惊艳,顺便夸了 Flash 和 GLM-5.2,观点挺实在。原文稍后读已读值得跟进有用关注 DeepSeek
12:40AI Will@FinanceYF5xAI 官方账号发布 Grok 4.6,称其具备前沿智能水平。官方表示,Grok 4.6 相比上一代 Grok 4.5 有显著改进,但价格维持不变。目前官方尚未公布具体基准测试数据。AI模型Grok 4.6Grok 4.5xAI推荐理由:xAI 悄悄发了 Grok 4.6,说是比 4.5 强不少,还维持原价。用过 4.5 的可以关注下,没准能直接升级。原文稍后读已读值得跟进有用关注 Grok 4.6
12:39AI Will@FinanceYF5精选xAI 在 Grok 4.5 基础上进行了更长的补充训练,加入推理、工程和高级技术数据,并让 Grok 4.5 重新生成 SFT 轨迹。强化学习阶段覆盖知识工作、通用编程、内核优化、网页开发和 CAD 等任务,目标直指复杂工程技术场景。AI模型Grok 4.5xAI推理模型推荐理由:xAI 把 Grok 4.5 又练了更长一轮,还专门强化编程、内核和 CAD,想搞技术活的话可以看看。原文稍后读已读值得跟进有用关注 Grok 4.5
07:20官方账号NVIDIA AI@NVIDIAAI精选NVIDIA 发布全新 MoE 模型 Nemotron 3.5 Lightning。distil labs 作为欧洲发布合作伙伴,对其进行了微调。该团队将微调版与 4 个可比 MoE 模型在 6 项任务上对比,未微调时排名第三,微调后跃居第一。完整数值与失败场景已公布在 distil labs 博客上。AI模型Nemotron 3.5 LightningNVIDIAdistil labs10 个信源在谈事件专题推荐理由:NVIDIA 的 Nemotron 3.5 Lightning 微调后,在 6 项任务上超过 4 个同类 MoE 模型拿了第一。想知道怎么调出来的,可以看这篇。原文稍后读已读值得跟进有用关注 Nemotron 3.5 Lightning
04:58Julien Chaumond@julien_c精选73°开源社区迎来开放权重模型密集发布潮。DeepSeek-V4-Flash-0731(304B MoE)在Terminal-Bench 2.1上从61.8升至82.7,逼近Opus-4.8。Meta发布首个开放智能体模型Muse-Glimmer-30B,支持完全本地运行,采用Apache 2.0。Liquid AI LFM2.5-2.6B以2.69B参数在M5 Max上达220 tok/s,内存占用低于2.5GB。MiniMax-H3支持原生立体声音频,可生成2K/15秒视频。Mistral Shieldstral-1.0-3B在HarmBench上得分99.4,超过LlamaGuard-4-12B和ShieldGemma-9B。AI模型DeepSeekMetaNVIDIA10 个信源在谈事件专题推荐理由:开源模型大爆炸!DeepSeek、Meta、NVIDIA一口气发了十几个新模型,从推理到视频到语音都有,性能还紧追闭源。原文稍后读已读值得跟进有用关注 DeepSeek
04:27Geek@geekbb精选SpaceXAI正式发布Grok 4.6。官方称其性能较Grok 4.5有显著提升,定价保持同一水平。该模型主打前沿智能能力,已开放使用。AI模型Grok 4.6SpaceXAI模型发布推荐理由:Grok 4.6来了,比4.5强不少,价格没涨,终端里就能直接用。原文稍后读已读值得跟进有用关注 Grok 4.6
03:27官方一手歸藏(guizang.ai)@op741871°DeepSeek V4 Pro 正式版 0813 已发布。从流传的测试成绩来看,DeepSeek V4 Pro 依然相当爆炸。目前官方尚未公布 DeepSeek V4 Pro 的具体基准得分。社区对 DeepSeek V4 Pro 的讨论热度很高。AI模型DeepSeekV4 Pro基准测试推荐理由:DeepSeek 又发新版本了,V4 Pro 0813 的社区测试成绩看着很猛,想感受下有多强就点进来吧。原文稍后读已读值得跟进有用关注 DeepSeek
03:27官方一手歸藏(guizang.ai)@op7418精选SpaceX AI 发布 Grok 4.6 模型,官方称其达到前沿智能水平。相比 Grok 4.5,Grok 4.6 在相同价格下性能显著提升。定价为每百万输入 token 2 美元、每百万输出 token 6 美元。Twitter Premium+ 会员可通过 Grok Build 授权免费使用。AI模型Grok 4.6SpaceX AIGrok 4.58 个信源在谈事件专题推荐理由:想用前沿模型又嫌贵?Grok 4.6 比 4.5 强但价格不变,输入百万才 2 美元,Twitter 会员还能白嫖。原文稍后读已读值得跟进有用关注 Grok 4.6
02:57Y Combinator@ycombinator精选Physical Intelligence 联合创始人 Chelsea Finn 在 YC Startup School 2026 上分享了通用机器人的研发经验。她表示强化学习将机器人吞吐量提升了 2 倍。其系统已能自主运行数小时,无需人类全程监护。她认为机器人正进入 GPT 时代,从专用模型走向跨任务、跨机器人、跨环境的通用系统。AI模型Physical IntelligenceChelsea Finn通用机器人推荐理由:Chelsea Finn 在 YC 活动上讲强化学习让机器人效率翻倍,还能连续干活几小时,想了解通用机器人怎么落地可以听听。原文稍后读已读值得跟进有用关注 Physical Intelligence
01:57Mustafa Suleyman@mustafasuleyman精选76°微软发布其首款推理模型 MAI-Thinking-1。该模型从零开始构建,而非基于现成架构。目前已在 Microsoft Foundry 平台上开放使用。团队负责人 Mustafa Suleyman 在 X 平台公布了这一消息。AI模型MAI-Thinking-1Microsoft推理模型推荐理由:微软自己从头搞了个推理模型 MAI-Thinking-1,已经放到 Foundry 里能用了,想试推理模型的可以去看看。原文稍后读已读值得跟进有用关注 MAI-Thinking-1
01:27宝玉@dotey83°DeepSeek V4 Pro 的 API 文档已上线,入口在 api-docs.deepseek.com 的中文快速开始页面。该页面面向开发者提供了模型接入指引。目前官方没有同步公布 V4 Pro 的基准测试数据。开发者可以通过文档开始尝试 DeepSeek V4 Pro 的接口调用。AI模型DeepSeekV4 ProAPI推荐理由:DeepSeek 悄悄放出了 V4 Pro 的 API 文档,想抢先试新模型的开发者赶紧去 api-docs.deepseek.com 看看快速开始。原文稍后读已读值得跟进有用关注 DeepSeek
01:27官方账号Microsoft Research@MSFTResearch精选微软研究院发布MindTopo基准测试,专门检验AI模型对拓扑关系的理解能力。该基准通过路径、围栏、绳结等图形化任务,考察模型在空间推理和规划上的表现。MindTopo旨在发现当前模型在拓扑认知层面的短板,为后续改进提供测试依据。AI模型MindTopo微软拓扑推理推荐理由:微软出了个新基准MindTopo,专测AI懂不懂拓扑关系,像路径绕圈、绳结这种空间题,看看模型会不会犯晕。原文稍后读已读值得跟进有用关注 MindTopo
00:27lmarena.ai@lmarena_ai79°xAI 推出 Grok 4.6,在 LMArena 的 WebDev 基准上以 1618 分排名第7。相较 Grok 4.5 的 1553 分(第13名)提升明显,且定价保持不变。目前 Grok 4.6 与 GPT-5.6 Sol xHigh(1622 分)和 Claude Fable 5(1627 分)仅差 4 到 9 分,三者同处第5至第7区间。AI模型Grok 4.6xAILMArena推荐理由:xAI 把 Grok 4.6 放出来了,网页开发能力直接冲到 LMArena 第7,跟 GPT-5.6 和 Claude 最新版就几分之差,这代提升挺猛。原文稍后读已读值得跟进有用关注 Grok 4.6
23:01Geek@geekbb微信团队推出WeLM系列大语言模型,核心设计理念是资源效率。该模型家族由微信内部团队开发,旨在降低大模型的部署和运行成本。WeLM的发布表明微信在AI领域开始自研基础模型。目前官方尚未公布具体参数规模和基准测试成绩。AI模型WeLM微信大语言模型推荐理由:微信自己下场做模型了,叫WeLM,主打省资源,想看看它跟其他开源模型比有啥不一样的可以关注下。原文稍后读已读值得跟进有用关注 WeLM
22:19小互@imxiaohu83°微信正式官宣自研模型WeLM,包含WeLM-80B和WeLM-617B两款。WeLM-80B总参数量800亿,每次推理激活30亿参数,已部署到微信原生AI助手小微中。小微助手可调用微信原生功能和小程序,用户说一句话,WeLM理解需求后自动完成操作。WeLM-617B总参数量6170亿,每次推理激活230亿参数。AI模型WeLM微信小微助手推荐理由:微信终于亮出自家模型了,80B和617B两个版本,已经跑在小微助手里,能直接帮你调微信功能和小程序,挺实在的。原文稍后读已读值得跟进有用关注 WeLM
21:25OpenRouter@OpenRouterAI精选73°Meta Superintelligence Labs 推出首个开源权重模型 Muse Glimmer,已在 OpenRouter 上线。该模型为 30B 参数稠密文本+图像模型,采用 Apache 2.0 许可证。Muse Glimmer 在 MCP Atlas 基准上得分 75.5,在 SWE-Bench Pro 上得分 51.2,定位为可靠的本地智能体。AI模型Muse GlimmerMetaOpenRouter推荐理由:Meta 新出的开源模型 Muse Glimmer,30B 参数,Apache 2.0 随便用,本地跑智能体挺靠谱,MCP Atlas 和 SWE-Bench Pro 分数都不错,想玩本地 AI 的可以试试。原文稍后读已读值得跟进有用关注 Muse Glimmer
18:51Fireworks AI@FireworksAI_HQ精选Meta Superintelligence Labs 推出开源权重模型 Muse Glimmer,已上线 Fireworks 平台。该模型为 30B 稠密模型,专为持续运行的智能体设计,支持跨多次顺序工具调用进行推理并可从失败中恢复。Muse Glimmer 支持 128K+ 上下文,原生支持图像和文本输入。开发者可通过 Fireworks 平台开始构建应用。AI模型Muse GlimmerMetaFireworks推荐理由:Meta 新开源了个 30B 模型,专为智能体连续调用工具设计的,还能从报错里恢复,128K 上下文,想玩智能体的可以试试。原文稍后读已读值得跟进有用关注 Muse Glimmer
17:45AI Will@FinanceYF5AI Agent在电脑操作基准测试中的成绩一年内从42%提升至85%,超过约72%的人类基准。这些Agent已从演示阶段进入真实业务场景。企业关注的重点已从Agent能否点击按钮,转向其能否稳定完成整份工作。AI模型AI Agent电脑操作基准测试推荐理由:AI Agent操作电脑的成绩一年翻倍,已经超过七成人类,现在开始进企业干整份活了,看看它们到底行不行。原文稍后读已读值得跟进有用关注 AI Agent
17:37AI Will@FinanceYF5电脑操作Agent的基准成绩在一年内从42%提升至85%,超过约72%的人类基准。它们已从演示阶段进入真实业务场景。企业关注点已从能否点击按钮转向能否稳定完成整份工作。这标志着Agent能力提升后,可靠性成为新的核心挑战。AI模型AI Agent电脑操作基准测试推荐理由:看这篇,电脑操作Agent一年从42%冲到85%,但真正难的是稳定干完一整份活,企业现在最头疼这个。原文稍后读已读值得跟进有用关注 AI Agent
17:33官方账号阿里通义 Qwen@Alibaba_Qwen精选Qwen3.8-Max在Legal Research Bench上的得分在不到三个月内几乎翻倍,排名从第22位跃升至第4位。Vals AI在推文中强调了这一进步,并附上了相关链接。该模型在基准测试中的显著提升展示了其在法律研究领域的性能增强。AI模型Qwen3.8-MaxLegal Research BenchVals AI推荐理由:Qwen3.8-Max在Legal Research Bench上从第22冲到第4,三个月内得分翻倍,看看它怎么做到的。原文稍后读已读值得跟进有用关注 Qwen3.8-Max
17:14Genspark@genspark_ai精选字节跳动发布新一代视频生成模型Seedance 2.5,现已集成到Genspark AI视频代理中。该模型支持单次生成30秒高质量音视频片段,无需拼接。用户可输入最多30张图片、10个视频片段和10个音频片段作为参考素材。Seedance 2.5还提供时间戳级控制,可对音视频内容进行精准编辑。AI模型Seedance字节跳动Genspark推荐理由:字节的Seedance 2.5来了,单次出30秒视频不用拼,还能塞30张图当参考,做长视频的可以试试。原文稍后读已读值得跟进有用关注 Seedance
16:04AI Will@FinanceYF5精选NVIDIA推出Nemotron 3.5 Lightning,专为长时运行的智能体任务设计。该模型总参数量30B,激活参数3B,支持高达1M token的上下文,并已开放商用。NVIDIA提供BF16和更小的NVFP4量化检查点,支持在单张H100或DGX Spark上部署,也兼容RTX 5090。通过多token预测、DSpark和DFlash投机解码以及NVFP4量化,生成速度最高提升4倍。在PinchBench基准上,其准确率达86%,完成速度比Qwen3.6 35B快30%。AI模型Nemotron 3.5 LightningNVIDIA智能体10 个信源在谈事件专题推荐理由:NVIDIA出了个轻量模型,30B参数但只激活3B,跑长任务上下文能到1M,单卡就能部署,速度还快4倍。原文稍后读已读值得跟进有用关注 Nemotron 3.5 Lightning
10:01lmarena.ai@lmarena_ai精选Upstage 发布 Solar Pro 4,成为首个登上 Agent Arena、Code Arena: WebDev 和 Text Arena 榜单的韩国实验室模型。Solar Pro 4 在 Agent Arena 排名第 44,与 MiniMax M2.7 和 Nemotron 3 Ultra 并列,整体净改进得分为 -12.10%。该模型在 GDPval-AA 得分为 39,τ³-Banking 为 23,Terminal-Bench 2.1 为 57,定价为每百万 tokens 0.30 美元(输入)和 1.20 美元(输出),缓存价格 0.06 美元,优惠 90% 至 9 月 10 日。AI模型Solar Pro 4UpstageAgent Arena推荐理由:Upstage 的 Solar Pro 4 是首个登上多个 Arena 榜单的韩国模型,适合做生产级智能体,价格便宜,值得试试。原文稍后读已读值得跟进有用关注 Solar Pro 4
09:59lmarena.ai@lmarena_aiSolar Pro 4 在 Code and Text Arena 排行榜中亮相,该榜单由 arena.ai 发布。具体排名和得分未在推文中披露,但推文提供了排行榜链接供查看。Solar Pro 4 是 Solar 系列的最新模型,其性能表现受到关注。用户可通过访问 arena.ai/leaderboard 查看详细排名和对比数据。AI模型Solar Pro 4Code and Text Arena排行榜推荐理由:想知道 Solar Pro 4 在代码和文本任务上的真实水平?直接去 arena.ai 看排行榜,一目了然。原文稍后读已读值得跟进有用关注 Solar Pro 4
09:46lmarena.ai@lmarena_ai精选Agent Arena发布新评测基准,在数百万个真实世界长程智能体任务上衡量模型表现。评测中模型需使用网络搜索、文件系统和终端工具完成复杂工作流,包括编写代码、制作幻灯片、网络研究、构建应用和文档分析。该基准采用因果追踪方法,可深入分析模型在长程任务中的决策过程。评测结果已上线arena.ai/leaderboard/ag榜单。AI模型Agent Arena智能体评测基准推荐理由:想测智能体真实干活能力?Agent Arena用百万真实任务打分,比普通聊天评测靠谱多了。原文稍后读已读值得跟进有用关注 Agent Arena
07:05Jerry Liu@jerryjliu0LlamaIndex推出ExtractBench,一个覆盖4869页、67种文档类型、8个真实领域的企业文档提取基准。该基准包含超过1k行的表格、嵌套表格、跨页表格、扫描件和手写文档等复杂情况。评测了14个系统,包括前沿VLM、编码智能体和专用提取API。关键发现是超过50页的文档中,商业VLM因静默列表截断导致召回率低于35%。同时发布LlamaParse新层级Agentic Plus,以95.6%的值准确率位居榜首,成本仅为最接近对手的三分之一。AI模型ExtractBenchLlamaIndexLlamaParse1 个信源在谈事件专题推荐理由:做文档提取的可以看看,LlamaIndex搞了个大基准,测了14个模型,发现长文档上大模型掉链子,还顺带出了个便宜又准的提取工具。原文稍后读已读值得跟进有用关注 ExtractBench
07:00Latent.Space@latentspacepodChai Discovery联合创始人Matt McPartlon和产品负责人Patil在播客中表示,AI药物设计已从演示阶段进入制药行业信任的工具阶段。Chai-2和Chai-3正推动一次性生成治疗级分子的目标,其CAD式设计套件让科学家精确工程化抗体和结合位点。更快的模型到实验室反馈循环有望将制药的瀑布式发现流程转为迭代循环。他们认为更好的模型、验证、算力和基础设施正将生物学从试错科学转变为工程学科。AI模型Chai-3Chai DiscoveryAI药物设计推荐理由:想了解AI制药怎么从demo变成真工具?听听Chai团队讲Chai-3怎么做到一次性设计治疗级分子,还有CAD式设计套件怎么用。原文稍后读已读值得跟进有用关注 Chai-3
03:46Aravind Srinivas@AravSrinivasNVIDIA推出Nemotron 3.5 Lightning,这是一款开放权重的30B MoE模型,仅3B参数激活,专为常驻智能体设计,可高效处理高吞吐、专业化任务。其输出速度比同类模型快4倍,能在笔记本或DGX Spark等本地硬件上流畅运行。用户也可通过Perplexity使用更大的Nemotron Ultra版本。AI模型Nemotron 3.5 LightningNVIDIAMoE10 个信源在谈事件专题推荐理由:NVIDIA新出的开源MoE模型,30B参数但只激活3B,笔记本就能跑,速度还快4倍,做智能体任务很合适。原文稍后读已读值得跟进有用关注 Nemotron 3.5 Lightning