03:02Harrison Chase@hwchase17LangChain创始人Harrison Chase在X上表示,对NVIDIA发布的Nemotron 3.5 Lightning模型感到兴奋,并计划将其集成到deepagents框架中。NVIDIA CEO黄仁勋称该模型为连续和长期运行智能体设计,具备智能、快速、高效且开源的特点。该模型旨在提升智能体的持续运行能力,可能对AI代理生态产生重要影响。AI模型Nemotron 3.5 LightningNVIDIALangChain10 个信源在谈事件专题推荐理由:LangChain创始人亲自下场点赞,还要集成到deepagents里,说明Nemotron 3.5 Lightning对智能体开发是真有用,搞AI代理的可以关注下。原文稍后读已读值得跟进有用关注 Nemotron 3.5 Lightning
02:43GitHub@github微软的 MAI-Code-1.1-Flash 模型已开始在 GitHub Copilot 中推出,支持原生视觉能力,可理解图像。该模型在编码质量、指令遵循、工具使用和性能方面均有改进。其列表价比 MAI-Code-1-Flash 低 73%,更具成本效益。开发者可在 GitHub Copilot 应用、CLI 和 VS Code 中试用。AI模型MAI-Code-1.1-FlashGitHub Copilot微软推荐理由:微软新模型上架 Copilot,带视觉还能看图,价格砍了七成多,写代码更省钱了。原文稍后读已读值得跟进有用关注 MAI-Code-1.1-Flash
02:29ollama@ollamaOllama宣布与NVIDIA及黄仁勋团队合作,共同推出开源模型Nemotron 3.5 Lightning。该模型主打智能、快速、高效,并保持开源特性,旨在支持持续运行的智能体。双方强调开放模型无边界,未来将继续合作推动生态发展。AI模型OllamaNVIDIANemotron 3.5 Lightning10 个信源在谈事件专题推荐理由:Ollama和NVIDIA联手了,新出的Nemotron 3.5 Lightning主打快和高效,还是开源的,做智能体可以试试。原文稍后读已读值得跟进有用关注 Ollama
01:59Mustafa Suleyman@mustafasuleyman微软CEO穆斯塔法·苏莱曼在X平台宣布推出MAI-Code编程模型,并附上博客链接。该模型面向代码生成与编程辅助场景,是微软MAI系列的最新成员。目前公开信息有限,具体性能参数与基准测试结果待博客披露。AI模型MAI-Code微软编程助手推荐理由:微软官方刚官宣的编程模型,做开发的朋友可以点进博客看细节。原文稍后读已读值得跟进有用关注 MAI-Code
01:45AI Will@FinanceYF5该推文介绍了一种机器人训练方法,沿用人类预训练,后训练仅需数小时数据,成功率随预训练规模从20%提升至53%。通过10分钟遥操作微调,机器人能用双手拧开瓶盖。在新客户现场零样本测试中,成功率从46%跃升至87%。AI模型机器人后训练预训练推荐理由:看这个,机器人训练只要几小时数据就能干活,成功率还翻倍,零样本也能上手,挺神的。原文稍后读已读值得跟进有用关注 机器人
01:36lmarena.ai@lmarena_aiBlack Forest Labs 宣布其 FLUX 3 Video 模型在竞技场排名中位列世界第二。为庆祝这一成绩,该模型在 playground 中免费使用至太平洋时间周日 16 日晚 11:59。官方预告后续将推出 4K 分辨率、视频编辑功能,并支持多张图片和视频作为参考输入。AI模型FLUX 3 VideoBlack Forest Labs视频生成推荐理由:Black Forest Labs 的 FLUX 3 Video 现在免费玩到周日,排名世界第二,还能期待 4K 和视频编辑,快试试。原文稍后读已读值得跟进有用关注 FLUX 3 Video
01:33AI Will@FinanceYF5Dyna Robotics推出Dyna-2,这是一个世界动作模型,预训练数据超过100万小时的人类视频,相当于约170年不间断的清醒经验。该模型的核心在于其背后的扩展定律,目前仍在持续攀升,尚未显现出天花板。Dyna-2的发布标志着机器人领域在利用大规模视频数据进行预训练方面迈出了重要一步。AI模型Dyna-2Dyna Robotics机器人推荐理由:Dyna Robotics搞了个Dyna-2,拿100万小时人类视频训练机器人,相当于170年经验,扩展定律还在涨,想了解机器人怎么靠数据起飞可以看看。原文稍后读已读值得跟进有用关注 Dyna-2
01:32AI Will@FinanceYF5Dyna Robotics推出Dyna-2,这是一个世界动作模型,预训练数据超过100万小时的人类视频,相当于约170年不间断的清醒体验。该模型的核心卖点不是机器人本身,而是其背后的扩展定律仍在持续攀升,尚未看到天花板。Dyna-2的发布表明机器人领域正在找到新的扩展变量。AI模型Dyna-2Dyna Robotics世界动作模型推荐理由:Dyna Robotics发了Dyna-2,用100万小时人类视频训练世界动作模型,相当于170年经验,扩展定律还在涨,做机器人的可以看看。原文稍后读已读值得跟进有用关注 Dyna-2
01:31Rowan Cheung@rowancheung精选Meta CEO扎克伯格宣布开源Muse Glimmer模型的权重,这是一个300亿参数的密集模型,可在本地运行。同时,Meta即将发布Muse Spark 1.2基础模型的权重。扎克伯格在采访中承认Llama 4未达预期,称其相比Llama 3虽有提升但不够领先。他因此重组了实验室工作,强调构建领先模型能力对解锁创造力的重要性。AI模型MetaMuse GlimmerLlama 4推荐理由:Meta把30B模型权重开源了,能本地跑,还有Spark 1.2要来。扎克伯格还亲口承认Llama 4不行,聊了怎么重建的,挺实在。原文稍后读已读值得跟进有用关注 Meta
01:16AI Will@FinanceYF5精选Dyna Robotics推出Dyna-2,这是一个世界动作模型,预训练数据超过100万小时的人类视频,相当于约170年不间断的清醒经验。该模型的核心在于其背后的扩展定律,目前仍在持续攀升,尚未显现天花板。Dyna-2的发布标志着机器人领域在数据规模上的新突破,为机器人行为学习提供了更丰富的先验知识。AI模型Dyna-2Dyna Robotics机器人推荐理由:Dyna Robotics出了个新模型Dyna-2,用100万小时人类视频训练,相当于170年经验,机器人学习的新路子,值得看看。原文稍后读已读值得跟进有用关注 Dyna-2
01:04lmarena.ai@lmarena_aiBlack Forest Labs发布其首个视频模型FLUX 3 Video,并已在Arena平台测试更新版本。更新版以1496分位列Text-to-Video Arena第二名,仅比榜首Gemini Omni Flash的1512分低16分。该模型支持原生音频、文生视频、图生视频、视频续写及多语言对话,提供Draft模式以降低探索成本。输出最高20秒1080p原生视频,API和工具中可用,2K、4K及开放权重即将推出。AI模型FLUX 3 VideoBlack Forest LabsGemini Omni Flash推荐理由:Black Forest Labs的FLUX 3 Video更新版在Arena冲到第二,只差Gemini 16分,支持原生音频和多语言对话,想玩视频生成可以试试。原文稍后读已读值得跟进有用关注 FLUX 3 Video
00:46ollama@ollama精选NVIDIA 的 Nemotron 3.5 Lightning 现已可通过 Ollama 本地运行。这是一款 30B 参数的混合专家模型,仅激活 3B 参数,支持 1M token 上下文。该模型专为常驻运行的智能体设计,擅长编码、工具调用和多轮对话。相比同类规模的开源模型,其吞吐量提升 4 倍,任务完成时间降低 30%。用户可通过 Claude Code、Hermes Agent 或 OpenClaw 等工具直接调用。AI模型Nemotron 3.5 LightningNVIDIAOllama10 个信源在谈事件专题推荐理由:NVIDIA 新出的 30B 模型,跑在本地,专门给常驻智能体用,速度快 4 倍,还支持 1M 上下文,搞智能体的可以试试。原文稍后读已读值得跟进有用关注 Nemotron 3.5 Lightning
00:43官方账号Microsoft Research@MSFTResearch精选微软研究院推出CARE-X,一个结合灵活推理、校准预测和基于测量工具的统一框架,用于胸部X光解读。该框架超越了传统报告生成,旨在提升AI在放射学中的实用性和可靠性。CARE-X通过整合多种能力,可能改善诊断准确性和临床决策支持。相关细节在微软研究院的推文中公布。AI模型CARE-X微软研究院胸部X光推荐理由:微软研究院搞了个CARE-X,把推理、预测和测量工具整合起来做胸片解读,比单纯生成报告更进一步,搞放射AI的可以看看。原文稍后读已读值得跟进有用关注 CARE-X
00:40AI Will@FinanceYF5精选Dyna Robotics 发布世界动作模型 Dyna-2,仅用 100 万小时人类视频预训练,从未接触过任何机器人轨迹数据。实验发现,人类视频数据量从 1000 小时增至 100 万小时,模型在未见过的机器人任务上表现持续提升,呈现跨四数量级的缩放规律。这表明具身差距更像适应问题而非知识问题,可能改写机器人预训练范式。AI模型Dyna-2Dyna Robotics世界动作模型推荐理由:Dyna Robotics 发了 Dyna-2,只靠看人类视频就能学会机器人操作,没碰过机器人数据也能越看越强,跟以前的做法很不一样。原文稍后读已读值得跟进有用关注 Dyna-2
23:31Jerry Liu@jerryjliu0精选LlamaIndex 推出 ExtractBench,号称最全面的复杂企业文档信息提取基准。该基准测试了 14 个系统,包括前沿 VLM、编码智能体和专用提取 API,覆盖 370 份企业文档、4,869 页和 67 种文档类型。最大发现是超过 50 页的文档中,商业 VLM 因静默列表截断,召回率跌破 35%。ExtractBench 评估值准确率、长记录完整性、空间定位和每页成本,完全确定性且无需 LLM 评判。同时发布 LlamaParse 新层级 Agentic Plus,以 95.6% 值准确率位居榜首,成本仅为最接近对手的三分之一。AI模型ExtractBenchLlamaIndexLlamaParse1 个信源在谈事件专题推荐理由:LlamaIndex 搞了个提取基准,测了 14 个系统发现长文档上 VLM 会悄悄丢行,还顺带出了个便宜三倍的提取服务,搞文档处理的值得看看。原文稍后读已读值得跟进有用关注 ExtractBench
23:29Fireworks AI@FireworksAI_HQ精选NVIDIA 推出 Nemotron 3.5 Lightning,这是一款 30B MoE 模型,仅 3B 参数激活,专为高吞吐智能体任务设计。该模型从 Nemotron 3 Ultra 蒸馏而来,在 PinchBench 和 AA-Omniscience Non-Hallucination 基准上表现强劲。目前已在 Fireworks 平台上线,供开发者用于构建智能体工作流。AI模型Nemotron 3.5 LightningNVIDIAFireworks10 个信源在谈事件专题推荐理由:NVIDIA 新出的 30B MoE 模型,3B 激活参数跑得快,专为智能体场景优化,Fireworks 上直接能用。原文稍后读已读值得跟进有用关注 Nemotron 3.5 Lightning
23:22elvis@omarsar0精选Pathway的BDH-CQ模型在ARC-AGI 1基准上获得29.5%的分数,但每个任务成本仅为0.0007美元。该模型通过潜在空间中的循环推理而非链式思维(CoT)来实现这一成绩。研究团队还验证了类似Transformer的扩展规律,参数规模可达6000亿。这一成果展示了在成本效率上的显著优势。AI模型BDH-CQARC-AGIPathway推荐理由:Pathway的BDH-CQ用极低成本在ARC-AGI 1拿到29.5%,靠的是潜在空间推理而不是CoT,还验证了600B参数规模,值得一看。原文稍后读已读值得跟进有用关注 BDH-CQ
22:52官方账号NVIDIA AI@NVIDIAAI精选NVIDIA 推出 Nemotron 3.5 Lightning 模型,延续开放策略,公开权重、训练数据和配方。该模型已上线 Hugging Face 平台,开发者可自由获取和定制。Nemotron 3.5 Lightning 旨在提供高性能推理能力,适用于多种自然语言处理任务。此次发布进一步巩固了 NVIDIA 在开源模型领域的布局。AI模型NemotronNVIDIAHugging Face10 个信源在谈事件专题推荐理由:NVIDIA 把 Nemotron 3.5 Lightning 的权重、数据和配方全开放了,想自己改模型的话直接上 Hugging Face 就能拿,比闭源省事多了。原文稍后读已读值得跟进有用关注 Nemotron
22:43OpenRouter@OpenRouterAI精选NVIDIA Nemotron 3.5 Lightning已在OpenRouter上线。该模型为30B混合专家架构,仅激活3B参数,由Nemotron 3 Ultra蒸馏而来。它面向高容量、专业化的AI智能体工作负载,相比同类模型吞吐量最高提升4倍,任务完成速度最高快30%。AI模型NemotronNVIDIAOpenRouter10 个信源在谈事件专题推荐理由:NVIDIA新出的轻量MoE,30B参数只激活3B,跑智能体任务比同类快30%,想省算力可以试试。原文稍后读已读值得跟进有用关注 Nemotron
22:34Gary Marcus@GaryMarcusGary Marcus在X上发文称,Claude在黎曼猜想上的表现再次证明混合神经符号AI的价值。他指出,如果去掉其中的符号部分,仅靠神经网络无法成功解决该问题。这被视为神经符号AI在数学推理领域的重要验证。AI模型ClaudeGary Marcus神经符号AI推荐理由:想看AI数学推理到底行不行?Marcus说Claude解黎曼猜想靠的是符号+神经混合,不是纯神经网络。原文稍后读已读值得跟进有用关注 Claude
22:04LlamaIndex@llama_index精选LlamaIndex应用研究团队推出ExtractBench,号称最全面的企业复杂文档信息抽取基准。该基准测试了14个系统,包括前沿VLM、编程智能体和抽取API,覆盖370份企业文档、4869页和67种文档类型。评测完全确定性,不使用LLM作为裁判。最大发现是超过50页后,商业VLM的召回率跌破35%,精度虽高但会静默丢失大部分表格行。AI模型ExtractBenchLlamaIndex信息抽取1 个信源在谈事件专题推荐理由:做文档抽取的团队看过来,LlamaIndex 出了个新基准,测了14个系统在370份企业文档上的表现,发现超过50页商业模型召回率就崩了,赶紧看看你的抽取方案中招没。原文稍后读已读值得跟进有用关注 ExtractBench
22:03官方账号NVIDIA AI@NVIDIAAI精选73°NVIDIA推出Nemotron 3.5 Lightning,一个30B参数的MoE模型,仅激活3B参数。该模型专为常驻智能体设计,可快速完成高并发、专业化任务。其输出速度比同类模型快4倍。模型已开源,适合需要高效推理的场景。AI模型NemotronNVIDIAMoE10 个信源在谈事件专题推荐理由:NVIDIA出了个30B MoE模型,只激活3B参数,跑得快4倍,适合做常驻智能体,开源可白嫖。原文稍后读已读值得跟进有用关注 Nemotron
22:02官方账号NVIDIA AI@NVIDIAAI精选NVIDIA推出Nemotron 3.5 Lightning,专为长时间运行的智能体工作流优化,覆盖工具调用、结果验证和任务委派等高频执行场景。该模型体积适中,可从DGX Spark到数据中心灵活部署。NVIDIA展示了其在DGX Spark上运行智能体工作流的实例,并提供了技术细节文档。AI模型Nemotron 3.5 LightningNVIDIA智能体10 个信源在谈事件专题推荐理由:NVIDIA新出的Nemotron 3.5 Lightning,专门为跑智能体高频调用工具的场景优化,体积小到能在DGX Spark上跑,适合做Agent开发的朋友看看。原文稍后读已读值得跟进有用关注 Nemotron 3.5 Lightning
20:25官方账号阿里通义 Qwen@Alibaba_Qwen精选阿里Qwen团队在X平台回应称,Qwen3.6-27B在智能体编码任务中表现强劲。团队确认下一代Qwen3.8-27B将带来更好性能,但未透露具体发布时间。该消息引发社区关注,原推文获得579次点赞和3.2万次浏览。AI模型Qwen3.6-27BQwen3.8-27BAlibaba推荐理由:阿里官方确认Qwen3.8-27B要来了,说会比3.6更强,做智能体编码的可以蹲一波。原文稍后读已读值得跟进有用关注 Qwen3.6-27B
19:30The Rundown AI@therundownaiMeta 在 AI 模型竞赛中重新发力,发布了一款新的推理模型。该模型在多项基准测试中表现突出,包括数学和代码生成任务。Meta 此举旨在与 OpenAI 和 Anthropic 等公司竞争。具体模型名称和详细性能数据尚未完全公开。AI模型Meta推理模型基准测试10 个信源在谈事件专题推荐理由:Meta 又出新推理模型了,想看看它跟 GPT 和 Claude 比怎么样,这篇可以了解个大概。原文稍后读已读值得跟进有用关注 Meta
19:29The Rundown AI@therundownaiMeta推出开源模型Glimmer,回归开源路线。OpenAI扩展Daybreak项目,增强网络安全能力。ChatGPT Work与Codex结合,实现从创意到网站生成。有AI代理通过黑客手段跳过健身房排队。AI模型GlimmerMetaOpenAI10 个信源在谈事件专题推荐理由:今天AI圈的大新闻都在这了,Meta开源新模型,OpenAI搞安全,还有AI代理搞事情,快来看看。原文稍后读已读值得跟进有用关注 Glimmer
18:46官方账号阿里通义 Qwen@Alibaba_Qwen精选73°阿里巴巴Qwen团队在X平台确认,Qwen3.8-27B模型的开源权重将于本周发布。该模型属于Qwen3系列,参数规模为27B,采用开放权重形式供开发者使用。团队感谢社区耐心等待,并期待开发者基于该模型进行创新。AI模型Qwen3.8-27B阿里巴巴开源模型推荐理由:阿里这周要放Qwen3.8-27B的开源权重,27B参数,想玩开源模型的可以蹲一下。原文稍后读已读值得跟进有用关注 Qwen3.8-27B
15:55Hunyuan@TXhunyuan精选腾讯混元推出Hy3D WorldClaw,这是一个智能体工作流,能从文本提示生成大规模3D开放世界。生成的场景不是视频或高斯泼溅,而是完全可自由探索的,由可编辑、游戏就绪的3D资产构成,具备高质量几何和纹理。项目页面已上线,展示了该工作流的能力。AI模型Hy3D WorldClaw腾讯混元3D生成推荐理由:腾讯混元这个新工作流能用文字直接生成能走进去的3D世界,不是视频,全是可编辑的游戏资产,做游戏或虚拟场景的可以看看。原文稍后读已读值得跟进有用关注 Hy3D WorldClaw
11:35shao__meng@shao__meng精选webAI Intelligence Lab 开源了首个形式化推理模型 TwiL-LM3,参数量仅 3B。在 5 项形式化推理基准中,TwiL-LM3 有 4 项超过 OpenAI 的 GPT-OSS-120B,参数量约为后者的 1/40,推理速度快 2.6 倍。该模型基于 webAI 自有的验证数据集训练,而非抓取互联网数据,可在树莓派或 iPhone 等消费级硬件上运行。AI模型TwiL-LM3webAIGPT-OSS10 个信源在谈事件专题推荐理由:3B 的小模型在推理上干翻了 120B 的大家伙,还能跑在树莓派上,开源了直接就能玩。原文稍后读已读值得跟进有用关注 TwiL-LM3
10:32官方账号Simon Willison@simonw精选Simon Willison 在一条获得 19 个喜欢的推文中感叹,视觉 LLM 描述照片细节的能力令人惊叹。他提到部分这类模型可以在自己的笔记本电脑上运行,这条推文目前有 2 条回复。截至现在,推文已有 1865 次浏览和 4 次分享。AI模型视觉LLM多模态本地模型推荐理由:Simon Willison 发推说视觉 LLM 能看清照片细节,还能跑在笔记本上,看完想试试。原文稍后读已读值得跟进有用关注 视觉LLM
09:07lmarena.ai@lmarena_ai精选Meta推出开源权重模型Muse Glimmer,参数量为30B,采用Apache 2.0许可。该模型在Code Arena WebDev基准中拿到1359分,总排名第77位,在开源模型中位列第26。Muse Glimmer专为本地常驻Agent工作流优化,可在Mac或配备高性能GPU的PC等消费级硬件上运行。Meta借此成为美国前三的拥有开源权重模型实验室之一。AI模型Muse GlimmerMeta开源模型推荐理由:Meta发了个30B的开源模型Glimmer,能跑在Mac上,专门给Agent用的,Code Arena开源榜排第26。原文稍后读已读值得跟进有用关注 Muse Glimmer
07:36官方账号Simon Willison@simonwSimon Willison 在推文中称 Claude Haiku 是他当前最不喜欢的模型。他认为该模型幻觉问题严重,性能已被同价位的 GPT-5.6-Luna 超越。他还指出 Claude Code WebFetch 工具仍在调用 Claude Haiku,导致每次抓取 URL 都可能产生幻觉。该推文获得 196 次点赞和 9928 次浏览。AI模型Claude HaikuGPT-5.6-LunaClaude Code推荐理由:Simon Willison 说 Claude Haiku 幻觉多,不如 GPT-5.6-Luna,还会污染 Claude Code 抓网页,用起来要小心。原文稍后读已读值得跟进有用关注 Claude Haiku
07:33lmarena.ai@lmarena_aiAI 竞技场平台 Arena 推出了 Text-to-Image Arena,用于评估文生图模型。用户可在 Image Arena 中直接测试模型,亲自对比不同模型的表现。完整的基准排行榜已在 arena.ai/leaderboard 页面公开,但目前帖文未给出具体模型得分。AI模型Image ArenaText-to-Image Arena文生图排行榜推荐理由:Arena 开了个文生图擂台,你可以自己上去测模型好坏,不用光看别人打分。原文稍后读已读值得跟进有用关注 Image Arena
07:32lmarena.ai@lmarena_aiMAI-Image-2.6 在图像模型竞技场综合排名升至第 2,前代 2.5 为第 10。3D 成像与建模从第 6 跃至第 1,卡通动漫与奇幻从第 8 升至第 2。产品、品牌与商业设计从第 7 升至第 2,文本渲染从第 8 升至第 2,艺术类别从第 4 升至第 2。摄影写实与电影图像从第 11 升至第 3,肖像类也从第 11 升至第 3。AI模型MAI-Image-2.6MAI-Image-2.5图像生成2 个信源在谈事件专题推荐理由:MAI-Image-2.6 在竞技场冲到第二,3D 建模直接第一,比 2.5 提升巨大,可以围观它的生成表现。原文稍后读已读值得跟进有用关注 MAI-Image-2.6
07:05Mustafa Suleyman@mustafasuleyman微软发布 MAI-Image-2.6,在文本到图像竞技场以 1336 分位列第二,仅比第一名的 GPT Image 2 Medium 低 45 分。该成绩领先第三名 Grok Imagine Image 2.0(Low)20 分,相比上一代 MAI-Image-2.5 的 1256 分提升显著。模型将于下周在 Playground 上线,并通过 Foundry 提供早期 API 访问。AI模型MAI-Image-2.6微软GPT Image 22 个信源在谈事件专题推荐理由:微软新出的文生图模型冲到了全球第二,只比 GPT Image 2 差一点,还超过了 Grok 和 Meta,下周就能用 API 了。原文稍后读已读值得跟进有用关注 MAI-Image-2.6
06:58lmarena.ai@lmarena_ai微软的 MAI-Image-2.6 在 Text-to-Image Arena 中排名第二,得分 1336 分,落后第一名的 GPT Image 2 (Medium) 仅 45 分,领先第三名的 Grok Imagine Image 2.0 (Low) 20 分。相比上一代 MAI-Image-2.5 的第 10 名(1256 分),新模型在所有类别上都有明显提升。微软计划下周将 MAI-Image-2.6 上架 Playground,并在 Foundry 提供早期 API 访问。AI模型MAI-Image-2.6MicrosoftGPT Image 22 个信源在谈事件专题推荐理由:微软新出的文生图模型 MAI-Image-2.6 在竞技场排第二,只比 GPT Image 2 低 45 分,下周就能用 API 了。原文稍后读已读值得跟进有用关注 MAI-Image-2.6
05:37官方账号Runway ML@runwaymlRunway上线了P-Image-Ideogram模型。该模型从提示词到生成图像最快仅需0.6秒。提供四种质量模式,用户可根据需求平衡速度与细节。AI模型P-Image-IdeogramRunway文生图推荐理由:Runway现在能用P-Image-Ideogram了,0.6秒出一张图,还能切四种模式调画质,特别快。原文稍后读已读值得跟进有用关注 P-Image-Ideogram
04:53宝玉@dotey91°Anthropic 今日公开了一个未发布研究版 Claude 的数学结果:它把黎曼 ζ 函数非平凡零点在临界线上的已知比例下界从 41.6% 提高到 67.2%。此前人类数学界从 1974 年 Levinson 的 33% 到 2020 年 Pratt 等人的 41.7%,花了近 50 年。Claude 结合了多位数学家近年论文与 Bombieri 2000 年的工作,Anthropic 数学家 Alpöge 和 Furman 已审查验证。Claude 还用 Lean 写出了可机器验证的证明。这次探索由 60 个子智能体协作,运行了 2400 条命令。AI模型ClaudeAnthropic黎曼猜想10 个信源在谈事件专题推荐理由:Claude 把黎曼零点下界从 41.6% 推到 67.2%,人类 50 年才推不到 9 个百分点,它一步干了 26 个点。原文稍后读已读值得跟进有用关注 Claude
04:07官方账号Sam Altman@sama76°OpenAI今日发布GPT-5.6-Cyber,这是其首个直接提升高级网络安全任务能力的大规模尝试,重点针对漏洞利用开发。该模型在加速防御性工作方面表现出色,已被用于OpenAI内部红队测试。安全研究人员使用它在一批开源软件中发现了大量0-day漏洞并完成修补。OpenAI成员Eric Wallace宣布了这一消息,Sam Altman转发并呼吁业界考虑用该模型保护系统。AI模型GPT-5.6-CyberOpenAIAI安全10 个信源在谈事件专题推荐理由:OpenAI出了个专攻安全的GPT-5.6-Cyber,能帮你找漏洞修漏洞,实测抓了不少开源0-day,搞防御的可以试试。原文稍后读已读值得跟进有用关注 GPT-5.6-Cyber
04:00Browser Use@browser_use精选Nous Research 的 Hermes 模型原本需要 12 个浏览器工具。新的 Browser Use 模式将它们合并为一个工具,基于 browser_use 的 CLI 3.0 驱动。代理不再为每次点击发送多个 schema 和调用工具,而是直接编写脚本。内部测试显示,Token 使用量降低 48% 至 66%,且准确率没有下降。AI模型HermesBrowser UseNous Research推荐理由:Hermes 把 12 个浏览器工具合成 1 个,靠 CLI 3.0 写脚本,token 省一半还不掉精度。原文稍后读已读值得跟进有用关注 Hermes