05:21官方账号Sam Altman@samatibo @thsottiaux宣布Codex和ChatGPT Work活跃用户数已达800万。团队重置了所有用户的使用限制,并继续取消5小时速率限制。用户现在可以探索GPT-5.6 Sol的边界,发挥更大创意。更多增长更新将于次日发布。AI模型CodexChatGPT WorkGPT-5.6 Sol10 个信源在谈事件专题推荐理由:OpenAI的GPT-5.6 Sol来了,800万用户活跃,还取消了速率限制,赶紧去试试吧。原文稍后读已读值得跟进有用关注 Codex
04:39elvis@omarsar0精选PrismML 今日发布 Bonsai 27B,这是首个可在手机上本地运行的 27B 参数多模态模型。基于 Qwen3.6 27B,Bonsai 27B 支持多步推理、结构化工具使用、长上下文和智能体循环。Ternary 变体仅 5.9 GB(1.71 有效比特/权重),1-bit 变体仅 3.9 GB(1.125 有效比特/权重),大幅降低本地部署门槛。在 RTX 5090 上,1-bit 版本达到 163 tok/s,Ternary 版本达到 134 tok/s;在 M5 Max 上分别为 87 tok/s 和 58 tok/s。模型以 Apache 2.0 许可证开源。AI模型Bonsai 27BPrismMLQwen3.6推荐理由:手机能跑 27B 模型了?PrismML 的 Bonsai 27B 实际做到了——体积最小 3.9GB,速度还不慢,开源免费。想本地用大模型又嫌大的可以看。原文稍后读已读值得跟进有用关注 Bonsai 27B
04:03Aravind Srinivas@AravSrinivasPerplexity宣布开源其内部用于衡量AI研究能力的基准WANDR。该基准在构建Perplexity Computer的深度研究功能中起到关键作用。公司表示WANDR在成本和性能上均达到最佳效果。Perplexity强调强大的内部评估和基准是其主要优势之一。AI模型PerplexityWANDR开源基准推荐理由:Perplexity把内部跑得最好的研究能力基准WANDR开源了,你要评测推理模型可以拿来用。原文稍后读已读值得跟进有用关注 Perplexity
04:01官方账号Perplexity@perplexity_ai精选Perplexity AI 宣布开源其内部基准测试 WANDR,该基准用于评估计算机在深度与广度研究能力上的表现。WANDR 最初是为构建 Perplexity Computer 而开发的。开源后,开发者可利用此基准测试自己的模型或系统。目前该基准已发布在 research.perplexity.ai 上。AI模型Perplexity AIWANDR开源推荐理由:Perplexity AI 把他们自己用来测试 AI 研究深度的工具 WANDR 开源了,想测测自家模型的研究能力可以用它。原文稍后读已读值得跟进有用关注 Perplexity AI
03:56官方账号Perplexity@perplexity_aiWANDR不再使用预定义的黄金解决方案来评分,而是动态重新抓取每个引用的页面。它逐条核对每个声明与引证证据的一致性。这种方法适用于需要处理随时间变化事实的任务。AI模型WANDRPerplexity AI事实验证推荐理由:Perplexity AI 搞了个新评估方式 WANDR,不用固定答案打分,而是实时对证据,适合处理时效性事实。原文稍后读已读值得跟进有用关注 WANDR
03:55官方账号Perplexity@perplexity_ai精选Perplexity AI 引入了软分数(soft scores)和硬分数(hard scores)两种评估机制,软分数允许部分正确给分,硬分数要求成员完全正确。相关基准任务和评估工具已开源至 GitHub。这套方法为细粒度评估提供了新思路。AI模型Perplexity AI基准测试评估方法推荐理由:Perplexity AI 搞了个新评估方法,软硬分数区别很清晰,基准和工具都开源了,做评测的可以看看。原文稍后读已读值得跟进有用关注 Perplexity AI
03:33官方一手@OpenAIDevs@OpenAIDevsOpenAI开发者使用GPT-5.6从零构建了针对NotionHQ架构的模型评估命令行工具。该工具可自动化评估新模型在NotionHQ架构上的性能。这是GPT-5.6在具体工程任务中的一次实际应用展示。AI模型GPT-5.6NotionHQOpenAI10 个信源在谈事件专题推荐理由:OpenAI用GPT-5.6写了个命令行工具,专门给Notion架构跑模型评估,挺酷的原文稍后读已读值得跟进有用关注 GPT-5.6
03:15宝玉@doteyGPT-5.6 Sol 是 Codex Desktop 所基于的模型,其完整系统提示已由 Pliny the Liberator 泄露,全文超过 42,000 字。提示详细描述了 Codex 的个性,要求它作为智能体与用户协作,以友好、好奇的风格进行交流。它规定写作时避免过度使用粗体、标题和列表等格式,若使用列表须遵循 CommonMark 标准。技术沟通时应先陈述结果再解释步骤,并使用平实语言代替术语。AI模型GPT-5.6 SolCodexSystem Prompt推荐理由:Pliny 爆出了 GPT-5.6 Sol 在 Codex 里的系统提示,四万多字,教你它怎么跟你聊天、怎么写代码,值得看看背后的设计思路。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol
03:04@koltregaskes@koltregaskes73°Anthropic 的 Claude Opus 5 预计在本周或下周发布。Fable 5 在 Opus 5 发布后不再为订阅者延长。下一版 Fable 预计在 8 月推出,与同期发布的 GPT-6 竞争。AI模型Claude Opus 5Fable 5GPT-610 个信源在谈事件专题推荐理由:Claude Opus 5 马上来了,Fable 5 不再延期,8月Fable要正面刚GPT-6,赶紧关注。原文稍后读已读值得跟进有用关注 Claude Opus 5
02:42The Rundown AI@therundownai精选斯坦福大学与Arc Institute联合实验室发布开源框架Proto,整合了120多个AI生物学模型,这些模型能设计蛋白质、DNA和RNA。此前因软件和数据格式不兼容,整合需耗时数周,Proto通过共享语言解决了这一问题。例如,设计细胞特异性基因开关,传统方法需筛选数千个候选,而Proto仅测试几十个。AI智能体也能直接编写Proto程序。Proto提供了一个通用接口,让新模型可以即插即用。AI模型ProtoStanfordArc Institute推荐理由:斯坦福实验室搞了个Proto框架,能把120多个AI生物学模型串起来用,以前要几周,现在快多了,AI agent还能自己写程序,挺有意思。原文稍后读已读值得跟进有用关注 Proto
02:16官方账号Clement Delangue@ClementDelangue精选Clement Delangue 转推了 SpiritBun 的 VBR(Variable Bit Rate)KV 缓存格式。该格式在会话增长过程中逐层动态量化 KV 缓存,在 VRAM 限制内最大化生成质量。目前代码已合入主分支并可用。AI模型VBRKV缓存量化推荐理由:SpiritBun 搞了个新 KV 缓存格式 VBR,逐层动态量化,在显存限制内榨出最高质量,已开源可用。原文稍后读已读值得跟进有用关注 VBR
01:49Justine Moore@venturetwinsSeedance 2 模型通过单次生成(one-shot)输出一段仿2000年代早期DV摄像机风格的庞贝古城纪录片片段,模拟维苏威火山喷发瞬间。提示词描述了从日常景象到人群恐慌的完整叙事,包含自然摇晃、对焦失误、曝光问题等瑕疵。该演示展示了AI在历史事件想象场景中的高保真度与可控性。AI模型Seedance 2视频生成历史事件推荐理由:Seedance 2 能根据一条提示词直接生成纪录片质感的庞贝火山爆发视频,连旧DV的抖动和曝光错误都模拟了,很逼真。原文稍后读已读值得跟进有用关注 Seedance 2
01:27官方账号NVIDIA AI@NVIDIAAI精选零样本模型漏检了一个可见交通信号。用 LoRA 对 Cosmos 3 Nano 进行后训练后,WTS 验证准确率从 54.41% 提升到 87.14%。结合 NVIDIA TAO AutoML,准确率进一步达到 93.35%。整个微调流程在一天内完成。AI模型NVIDIACosmos 3 NanoLoRA10 个信源在谈事件专题推荐理由:NVIDIA 用 LoRA 微调小模型 Cosmos 3 Nano 做交通信号识别,准确率从 54% 蹿到 93%,一天内搞定,效果很猛。原文稍后读已读值得跟进有用关注 NVIDIA
00:55官方账号Sam Altman@samaGPT-5.6的价格是fable的一半,token效率约为fable的两倍。Sam Altman宣布该模型能以更低的成本完成相同任务。具体而言,GPT-5.6在多个场景中实现了价格减半和效率翻倍的性能提升。AI模型GPT-5.6OpenAIfable10 个信源在谈事件专题推荐理由:OpenAI发了GPT-5.6,价格比fable便宜一半,token效率高两倍,省钱又省力。原文稍后读已读值得跟进有用关注 GPT-5.6
00:43elvis@omarsar0精选大多数世界模型在几秒后出现纹理涂抹、几何扭曲等失败模式。LingBot-World 2.0来自@robbyant_brain,在720p分辨率下以60fps保持互动长达一小时。该模型解决了长期视频生成中的一致性难题。其架构创新使得长时间高保真世界模拟成为可能。AI模型LingBot-World 2.0世界模型视频生成推荐理由:别的世界模型几秒就崩,LingBot-World 2.0能稳跑一小时720p 60fps,超实用。来看看它怎么做到的。原文稍后读已读值得跟进有用关注 LingBot-World 2.0
00:40elvis@omarsar0精选Robbyant(蚂蚁集团旗下具身AI公司)发布LingBot模型,据论文比较,它是首个实现小时级实时高保真生成且完全开源的研究模型。该模型没有长期记忆,离开的区域会被重新生成而非记住。代码、论文、权重已在GitHub、arXiv和Hugging Face上开源,演示由合作伙伴托管。AI模型LingBotRobbyantAnt Group1 个信源在谈事件专题推荐理由:Robbyant出了个LingBot,能小时级实时生成高保真3D场景,还完全开源,想动手跑模型直接下权重就行。原文稍后读已读值得跟进有用关注 LingBot
00:35官方账号NVIDIA AI@NVIDIAAI精选NVIDIA 展示一个编码智能体,利用 NeMo RL 和 NeMo Gym 框架,在有限时间内自主构建训练环境并指导 Qwen3-VL-2B 视觉模型学习数彩色星星。模型准确率从 25% 跃升至 96.9%。智能体还能主动提出下一项实验方案,研究员全程仅进行方向性指导。AI模型NVIDIANeMo RLNeMo Gym10 个信源在谈事件专题推荐理由:NVIDIA 让智能体自己搭环境教模型,Qwen3-VL-2B 准确率从 25% 飙到 96.9%,还能自动想下一步实验,挺有意思。原文稍后读已读值得跟进有用关注 NVIDIA
23:42Fireworks AI@FireworksAI_HQ精选76°LangChain 与 NVIDIA 合作推出 Deep Agents,基于 Nemotron 3 Ultra 开放模型。该智能体成本仅为封闭模型的十分之一。用户可在 Fireworks 上运行,并进行后训练定制化。最终得到专属的专用智能体。AI模型LangChainNVIDIA Nemotron 3 UltraFireworks10 个信源在谈事件专题推荐理由:LangChain 和 NVIDIA 搞了个开放智能体,成本是封闭模型的1/10,还能自己后训练定制,挺实用的。原文稍后读已读值得跟进有用关注 LangChain
18:12AI Will@FinanceYF5一位开发者@Angaisb_正在用GPT-5.6进行大量强化学习实验。实验尝试将涌现行为与强化学习混合。早期结果显示积极效果。AI模型GPT-5.6强化学习涌现行为推荐理由:有人正在让GPT-5.6通过强化学习变得更聪明,早期效果不错,可以关注一下。原文稍后读已读值得跟进有用关注 GPT-5.6
18:07AI Will@FinanceYF5OpenAI在5天前发布GPT-5.6。用户已展示10个富有创意的应用案例。这些案例凸显GPT-5.6的强大能力。AI模型GPT-5.6OpenAI应用案例10 个信源在谈事件专题推荐理由:OpenAI的GPT-5.6才发五天,网友就整出了10个炸裂案例,创意拉满,来看看有多夸张。原文稍后读已读值得跟进有用关注 GPT-5.6
17:43Hunyuan@TXhunyuan腾讯混元发布了Hy3模型的1-bit和4-bit量化版本,原始模型为295B参数的MoE架构,在同等规模中性能最佳,可媲美万亿参数旗舰模型。量化后模型可在单张GPU上运行,支持llama.cpp和MTP(多令牌预测)。模型采用Apache 2.0协议,对商用友好,并提供两周免费API试用。AI模型Hy3Tencent量化推荐理由:腾讯混元把295B的旗舰模型量化到1-bit和4-bit,单卡就能跑,还免费两周API,适合做智能体。原文稍后读已读值得跟进有用关注 Hy3
17:28小互@imxiaohu推文比较了三个 Claude 模型的人格特征。Sonnet 4.6 偏顺从、温暖、简洁。Opus 4.6 偏严格、顺从、简洁。Opus 4.7 偏谨慎、深度,更常挑战错误假设并主动指出风险。详细报告来自 best.xiaohu.ai。AI模型Sonnet 4.6Opus 4.6Opus 4.71 个信源在谈事件专题推荐理由:想了解Claude不同版本的个性差异?这篇文直接对比了Sonnet 4.6、Opus 4.6和Opus 4.7的回复风格,帮你选更合适的模型。原文稍后读已读值得跟进有用关注 Sonnet 4.6
16:44berryxia@berryxia用户使用GPT-5.6 Sol模型,仅用一句提示词,在10分钟内复刻了一个应用,成功还原了90%的功能。该模型展现出强大的代码生成和指令跟随能力。经过进一步调优,有望达到接近原版的效果。AI模型GPT-5.6 Sol编程助手代码生成推荐理由:GPT-5.6 Sol太强了,一句话加10分钟就能复刻90%功能,编程效率飞起!原文稍后读已读值得跟进有用关注 GPT-5.6 Sol
15:44AI Will@FinanceYF5精选72°Prime Intellect工程师指出,GPT-5.5在256k token上下文时检索准确率达80%,但扩展到1M token时准确率骤降至36%。工程师称这种现象为“context rot”(上下文腐烂),即模型虽能接受长上下文,但无法有效推理。他建议通过持续学习、基于自身轨迹训练和真实环境来改进,而非单纯扩大上下文窗口。该观点引发对长上下文实用性的讨论。AI模型GPT-5.5Prime Intellect上下文窗口推荐理由:别被百万token的噱头骗了!这位工程师用GPT-5.5的数据告诉你,上下文越长准确率反而暴跌,真正的解法是持续学习和真实环境训练。原文稍后读已读值得跟进有用关注 GPT-5.5
15:37AI Will@FinanceYF5精选Meta CTO确认过去一年CEO扎克伯格(Zuck)必须进入“创始人模式”推动项目,并感谢Scale AI创始人Alexandr Wang加入团队。为构建最新模型,Meta执行紧急转型,抽调数千名员工脱离常规职责,生成“专家轨迹”——即人工指导的编码示例,用于模型后训练。这表明前沿模型的瓶颈不仅是算力,更是高保真、人工验证的强化数据。该信息来自CapexAndChill的X平台播客片段。AI模型MetaZuckerbergAlexandr Wang推荐理由:Meta为了新模型,居然让几千人停下手头工作去搞人工标注,可见高质量数据比算力还稀缺。想了解前沿模型训练的内幕?听听CTO怎么说。原文稍后读已读值得跟进有用关注 Meta
14:35AI Will@FinanceYF5精选Prime Intellect一位工程师指出,GPT-5.5在256k上下文窗口下检索准确率为80%,但扩展到100万token时准确率骤降至36%。这种性能下降被称作context rot,模型并非无法容纳长文本,而是推理能力随上下文长度增加而衰减。该工程师认为,更大上下文无法解决Agent问题,其方案是采用持续学习、训练自身轨迹并在真实环境中部署。AI模型GPT-5.5Prime Intellect上下文窗口推荐理由:别被百万token的宣传忽悠了,GPT-5.5实际测试256k时准确率80%,拉到100万直接掉到36%。这不只是容量问题,是模型推理跟不上了。原文稍后读已读值得跟进有用关注 GPT-5.5
13:55官方账号vLLM@vllm_project精选NVIDIA NeMo 团队发布了新的智能体优先强化学习框架 Molt,采用 vLLM(基于 Ray)作为 rollout 引擎。vLLM 支持快速异步服务,最高可扩展至 1T 级 MoE 规模,且易于集成,让上层的强化学习核心保持小巧和可修改。AI模型vLLMMoltNVIDIA10 个信源在谈事件专题推荐理由:vLLM 被 NVIDIA 新框架 Molt 选为 rollout 主力,支持 1T 级 MoE 规模,想搞强化学习可以试试这套组合。原文稍后读已读值得跟进有用关注 vLLM
12:39官方账号Greg Brockman@gdbOpenAI 的 GPT-5.6 系列模型(Sol、Terra、Luna)正式在 Amazon Bedrock 上全面可用。该系列提供三个智能层级,从旗舰推理(Sol)到快速推理(Luna)。基于 Bedrock 的下一代推理引擎,支持高性能、安全、规模和可靠性。开发者可直接在 AWS 上调用这三种模型。AI模型GPT-5.6OpenAIAmazon Bedrock10 个信源在谈事件专题推荐理由:OpenAI 在 Bedrock 上了 GPT-5.6 的三个档位:Sol 负责强推理,Luna 跑得快,中间 Terra 平衡。现在 AWS 用户直接用,不用折腾部署了。原文稍后读已读值得跟进有用关注 GPT-5.6
11:41向阳乔木@vista8GPT 5.6推出Ultra模式,通过并行运行多个Sub-agent来加速推理。Terra和Sol型号支持Ultra模式,而最便宜的Luna型号仅支持Extra High。该功能被描述为“又快又好”,但具体性能数据未公布。AI模型GPT 5.6Ultra模式Sub-agent推荐理由:GPT 5.6的Ultra模式让子智能体并行跑,比之前快很多。但只有高价版能用,便宜版只给了Extra High。原文稍后读已读值得跟进有用关注 GPT 5.6
11:36小互@imxiaohuSakana AI 将群体智能和细胞自动机理论从软件模拟移植到真实物理世界硬件中。他们验证了在存在信号干扰和延迟的现实条件下,这套原理依然能够稳定运行。该成果表明群体智能可在实际机器人或物理系统中部署,突破了传统仅限仿真的局限。AI模型Sakana AI群体智能细胞自动机推荐理由:Sakana AI 把细胞自动机从电脑模拟搬到真实硬件里,还扛得住信号干扰,挺有看头。原文稍后读已读值得跟进有用关注 Sakana AI
10:59岚叔@lufzzlizGoogle 计划于本周17日发布新模型 Gemini 3.5。据称在内部测试中,Gemini 3.5 性能超越 GPT-5.6 和 Fable 5。相比上一代 Gemini 3.1 Pro,新模型有显著提升。具体基准成绩未公开。AI模型Gemini 3.5GoogleGPT-5.67 个信源在谈事件专题推荐理由:Google 的新模型 Gemini 3.5 本周就要来了,内部测试居然超过了 GPT-5.6 和 Fable 5,比前代 Pro 版强不少。原文稍后读已读值得跟进有用关注 Gemini 3.5
10:36Marc Andreessen@pmarcaGPT-5.6 成功解决了 Erdős #793 问题,这是一个关于两素数集(2-primitive sets)的数论难题,已困扰数学界超过 50 年。该成果由 Jared Duker Lichtman 验证并公布。GPT-5.6 展现出在数学推理领域的强大能力。AI模型GPT-5.6推理模型数论推荐理由:GPT-5.6 又解开了一个 50 年没人能搞定的数学题,数学推理能力真的强。原文稍后读已读值得跟进有用关注 GPT-5.6
10:27ollama@ollamaNvidia新开源模型Nemotron Ultra在Ollama平台上快速增长。该模型专为开发者设计,可处理复杂且长时间运行的任务。Ollama的集成使得开发者能更便捷地使用这一模型。目前Nemotron Ultra在社区中热度持续上升。AI模型NvidiaNemotron UltraOllama8 个信源在谈事件专题推荐理由:Nvidia新出的Nemotron Ultra开源模型在Ollama上很火,能搞定复杂长流程任务,适合做深度开发。原文稍后读已读值得跟进有用关注 Nvidia
10:16官方账号NVIDIA AI@NVIDIAAINVIDIA 在社交平台感谢开源社区,并回应了关于 Nemotron 的提及。NVIDIA 最新的开源模型 Nemotron Ultra 在 Ollama 平台上的使用量迅速增长,为开发者解锁了更复杂、更长时间运行的任务执行能力。该模型是 NVIDIA 支持开源生态的又一举措,目前已被越来越多的开发者采用。AI模型NVIDIANemotron UltraOllama8 个信源在谈事件专题推荐理由:NVIDIA 发了新开源模型 Nemotron Ultra,在 Ollama 上跑得很火,专门搞定复杂长任务,比之前的版本更强。原文稍后读已读值得跟进有用关注 NVIDIA
09:49官方账号Sam Altman@samaOpenAI CEO Sam Altman在X平台发推,表示看到自家模型在设计方面终于表现出色,令他感到惊讶。该推文获得2276个赞、12.6万次查看和377条回复。目前尚未公布具体模型版本或基准成绩。AI模型OpenAI设计AI模型10 个信源在谈事件专题推荐理由:OpenAI老板亲自说模型设计能力进步了,想看看具体强在哪?原文稍后读已读值得跟进有用关注 OpenAI
07:24官方账号Greg Brockman@gdbPrzemek Chojecki 发推称 GPT-5.6 Sol Ultra 找到了 Erdős 问题 #793 的一个解法。该问题涉及 2-primitive 集的渐近性质。GPT 提出的构造极短且优雅,增强了 Erdős 原本用于证明较弱结果的方法。AI模型GPT-5.6Sol Ultra推理模型推荐理由:GPT-5.6 Sol Ultra 又解了一个 Erdős 难题 #793,构造比原方法更短更优雅,数学推理让人眼前一亮。原文稍后读已读值得跟进有用关注 GPT-5.6
06:35宝玉@dotey73°Agent Arena 基于 7.8K 真实世界的 agent 会话评测,GPT-5.6 Sol 位居第2,相比 GPT-5.5 (xHigh) 净提升 +1.6%,缩小了与领先的 Claude Fable 5 的差距。关键信号“Praise vs Complaint”显示 Claude Fable 5 得分为 +17.3%,高于 GPT-5.6 Sol 的 +10.9%。该排行榜由 Arena.ai 维护,通过数百万个长期 agent 任务测量模型表现,并采用因果追踪方法计算相对于平均模型的结果。AI模型GPT-5.6 SolClaude Fable 5OpenAI10 个信源在谈事件专题推荐理由:OpenAI 的 GPT-5.6 Sol 在 Agent Arena 上冲到第2,离 Claude Fable 5 更近了。看看具体指标差异,特别是用户满意度的信号。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol
06:24Ate-a-Pi@svpino该模型规模达1万亿参数,专为医疗领域设计,采用递归自我改进训练。在自有基准上,模型性能优于Opus,与Fable相当。推理成本仅为竞品的1/20至1/100。基准详情和运作方式已公开。AI模型万亿参数模型医疗AIOpus推荐理由:医疗AI新模型参数1万亿,推理比Claude Opus便宜20-100倍,性能还更强,值得一看。原文稍后读已读值得跟进有用关注 万亿参数模型
06:23Ate-a-Pi@svpino76°LingBot-World-Infinity 是一个开权重世界模型,参数规模14B,另有1.3B变体可在单消费级GPU运行。该模型通过让自身在训练时主动进入错误状态,再学习如何恢复,从而生成长达1小时以上且跨场景连贯的视频,克服了传统逐帧模型误差累积的问题。论文详细描述了其自我纠错训练方法,并已公开GitHub仓库和模型权重。AI模型LingBot-World-Infinity视频生成开源模型推荐理由:开源权重模型,14B参数就能生成1小时连贯视频,还带1.3B小版本跑在单显卡上,长视频生成终于不崩了。原文稍后读已读值得跟进有用关注 LingBot-World-Infinity
06:21官方账号Greg Brockman@gdbOpenAI推出GPT-Live语音模型,在Kevin Lee的测试中,它能在毫秒内响应,从不打断用户,提供比之前版本更流畅的对话体验。Lee在进行执行教练会话时认为效果惊人。该模型适用于语音交互场景。AI模型GPT-LiveOpenAI语音模型10 个信源在谈事件专题推荐理由:OpenAI的GPT-Live语音模型体验超棒,反应快且不打断,适合语音交互场景。原文稍后读已读值得跟进有用关注 GPT-Live