09:49Gary Marcus@GaryMarcusGary Marcus转发Wenjie Ma的工作,指出神经符号AI方法schema可能使ARC-AGI-3基准变得可解。schema将经验转化为程序世界模型,并基于完整历史验证,然后搜索解决方案,无需进一步试错。该方法已在交互演示中展示效果,相关分析和演示托管在schema-harness.github.io。AI模型神经符号AIARC-AGI-3schema推荐理由:这个新方法用程序世界模型解决了ARC-AGI-3难题,不用反复试错,比纯神经网络更聪明。原文稍后读已读值得跟进有用关注 神经符号AI
09:31官方一手arXiv: OpenAI@Amir Bralin, N. Sanjay Rebello研究团队评估了OpenAI的o4-mini模型在Halliday和Resnick的《物理学基础》习题上的表现。整体准确率约90%,但文本问题准确率高达96%,而需要图文协调的问题仅79%。问题难度从低到高时,准确率显著下降。结果表明,当前最强推理模型能解答大部分标准物理题,但表现受模态和难度制约。AI模型o4-miniOpenAI推理模型10 个信源在谈事件专题推荐理由:OpenAI的o4-mini做大学物理题整体准,但看图题就露馅了,准确率从96%掉到79%。原文稍后读已读值得跟进有用关注 o4-mini
08:09elvis@omarsar0Impossible Research 团队推出自定义 agent harness 系统 Schema,能模拟物理学家思维方式。Schema 在 ARC-AGI-3 基准上达到饱和水平,支持游戏、代码编写和复杂推理。该工具旨在解决超困难问题,已公开演示成果。AI模型SchemaARC-AGI-3Impossible Research推荐理由:他们搞了个叫 Schema 的 harness,让 AI 学物理学家那样思考,直接刷爆 ARC-AGI-3 基准,挺有意思的。原文稍后读已读值得跟进有用关注 Schema
07:19官方账号Greg Brockman@gdb精选GPT-5.6 Sol Pro在prinzbench上取得91/99的成绩,基本饱和该基准。该基准包含两道从未被任何模型解出的问题(各值3分),排除后模型正确回答了93题中的91题。相比GPT-5.4 Pro的79/99和GPT-5.5 Pro的82/99有明显提升。prinzbench于2026年1月发布,仅5个月后被GPT-5.6 Sol Pro饱和,加速趋势显著。AI模型GPT-5.6 Sol ProprinzbenchOpenAI10 个信源在谈事件专题推荐理由:GPT-5.6 Sol Pro把prinzbench刷到91分,比前代高出一截,连从未解出的题都快能答了,基准加速饱和太明显。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol Pro
05:27Latent.Space@latentspacepodLila Sciences的CTO Andy Beam和CSO Rafa Gómez-Bombarelli在播客中提出,未来实验室应像数据中心一样运行。他们将湿实验室转变为24/7的token生成器,已积累10万亿实验验证推理token。跨生物学、化学、材料科学的广度训练能产生更好的通用推理模型。他们讨论了从超人类考试能力到真正科学发现的路径。行业Lila Sciences推理模型科学AI推荐理由:Lila Sciences的两位高管聊了个大胆想法:把实验室当数据中心用,用10万亿实验token训练AI,跨学科搞推理,比单纯刷题更有价值。原文稍后读已读值得跟进有用关注 Lila Sciences
04:57官方账号Simon Willison’s Weblog(博客/媒体)73°Moonshot AI发布Kimi K3模型,参数规模达2.8万亿,自称首个开放权重3T级模型。在自报基准中,K3多数指标超过Claude Opus 4.8和GPT-5.5 high,但输给Claude Fable 5和GPT-5.6 Sol。Artificial Analysis报告显示,K3在长时知识工作评测中Elo为1547,比K2.6提升732点,每任务成本0.94美元,低于Opus 4.8的1.80美元。该模型在Arena.ai前端代码竞技场排名第一,超越Claude Fable 5。定价为输入3美元/百万tokens、输出15美元/百万tokens,为中国AI实验室最贵模型。AI模型Kimi K3Moonshot AI开放权重10 个信源在谈事件专题推荐理由:Moonshot发了2.8万亿参数Kimi K3,前端代码超越Fable 5,开放权重版月底就能用,价格虽高但看齐Claude Sonnet。原文稍后读已读值得跟进有用关注 Kimi K3
04:54AI SDK@aisdk76°Moonshot推出Kimi K3模型,拥有2.8万亿参数和100万上下文窗口,支持原生多模态。采用Kimi Delta Attention技术,百万token上下文解码速度提升至6.3倍。Attention Residuals机制实现约25%更高训练效率,成本仅增加不到2%。模型已上线Kimi.com、Kimi Work、Kimi Code及Kimi API,计划2026年7月27日开源权重。AI模型MoonshotKimi K3推理模型10 个信源在谈事件专题推荐理由:Kimi K3参数2.8万亿,百万上下文,解码快6.3倍,适合长任务编程,赶紧试试。原文稍后读已读值得跟进有用关注 Moonshot
04:21Paul Couvert@itsPaulAi73°Kimi K3由Kimi.ai发布,拥有2.8T参数和1M上下文窗口。在编程和智能体任务上表现领先,部分指标超越Fable 5和GPT-5.6 Sol。定价与Sonnet 5相同,但推理成本更低。在前端设计竞技场首次登顶。AI模型Kimi K3Kimi_Moonshot开源模型10 个信源在谈事件专题推荐理由:Kimi K3开源了,2.8T参数比Fable 5还便宜,编码和智能体任务很强,试试看。原文稍后读已读值得跟进有用关注 Kimi K3
04:13lmarena.ai@lmarena_ai精选74°Kimi K3拥有2.8万亿参数和100万token上下文窗口,采用Kimi Delta Attention技术,在百万token上下文中解码速度提升最多6.3倍。Attention Residuals技术以不到2%的额外成本实现约25%更高的训练效率。该模型专注于长时智能体编码和自演进工作流,已在Kimi.com等平台上线,开放权重将于2026年7月27日发布。AI模型Kimi K3Kimi长上下文10 个信源在谈事件专题推荐理由:月之暗面刚发Kimi K3,2.8万亿参数能处理百万上下文,解码快6倍多,适合搞长代码项目。原文稍后读已读值得跟进有用关注 Kimi K3
04:09Ethan Mollick@emollick一项新基准测试要求AI一次性程序化生成不同历史时期的港口城镇文件。目前已有GPT-5.6 Pro、Fable、Kimi K3和Inkling四个模型参与。作者提供了所有模拟的可交互链接。该基准被认为能出人意料地反映模型能力。AI模型GPT-5.6 ProFableKimi K310 个信源在谈事件专题推荐理由:想看看不同AI在一次性生成复杂历史场景上的表现?这里有GPT-5.6 Pro、Fable、Kimi K3和Inkling的对比,还能自己玩模拟。原文稍后读已读值得跟进有用关注 GPT-5.6 Pro
02:54OpenRouter@OpenRouterAIMuse Spark 1.1 是一个多模态推理模型,专为智能体任务设计,涵盖编码、工具使用、计算机使用和多模态理解。该模型在多个能力维度上展示了性能表现。AI模型Muse Spark 1.1多模态推理模型推荐理由:Muse Spark 1.1 专门做智能体任务,能同时处理代码、工具调用和多模态理解,和通用模型路线不一样。原文稍后读已读值得跟进有用关注 Muse Spark 1.1
00:21Naval@navalImpossible Research团队发布了名为[schema]的agent harness,能使LLM像物理学家一样推理。在ARC-AGI-3公开测试中,该harness结合Opus 4.8与Fable 5达到99% RHAE,使用GPT-5.6 Sol达到95.35% RHAE。它还能玩游戏、写代码。AI模型Impossible ResearchschemaARC-AGI-3推荐理由:Impossible Research的[schema]让LLM像物理学家推理,ARC-AGI-3刷到99% RHAE,太强了原文稍后读已读值得跟进有用关注 Impossible Research
23:13Ethan Mollick@emollick73°Kimi K3 模型在多个基准上接近前沿水平,但测试中发现其习惯反复循环调整任务参数。该行为导致输出延迟,具体评估案例仍在进行中。AI模型Kimi K3推理模型智能体10 个信源在谈事件专题推荐理由:Kimi K3 是当前最接近前沿的开源模型之一,但运行时会反复调整任务,适合对迭代过程敏感的开发者。原文稍后读已读值得跟进有用关注 Kimi K3
13:43向阳乔木@vista8Kimi_Moonshot在一则推文中表示“这次模型很不一样”,并配发视频,暗示模型能力提升。该推文已获得2000多次浏览。内容未提供具体模型名称或基准成绩,但引发了社区猜测和讨论。AI模型Kimi_Moonshot推理模型模型预告推荐理由:月之暗面的Kimi发了新模型预告,虽然没说名字,但语气很自信,可以关注后续。原文稍后读已读值得跟进有用关注 Kimi_Moonshot
12:39Junyang Lin@JustinLin610Thinking Machines 推出名为 Inkling 的新模型,支持文本、图像和音频三种模态的推理。Inkling 的完整权重已开放,可在 Tinker 平台进行微调。用户还能通过 Inkling Playground 直接体验模型。该模型发布后获得了社区关注,原推文作者点赞其新架构。AI模型InklingThinking Machines多模态10 个信源在谈事件专题推荐理由:Thinking Machines 发了 Inkling,一个能看图文听音频的推理模型,而且权重全开放,能自己微调,还能在 Playground 试玩。原文稍后读已读值得跟进有用关注 Inkling
11:20官方账号arXiv cs.LG@Leitian Tao, Baolin Peng, Wenlin Yao, Tao Ge, Hao Cheng, Mike Hang Wang, Jianfeng Gao, Sharon LiTRACE是一种密集信用分配方法,用于代理强化学习,通过冻结参考模型获取黄金答案的log概率,转化为log比值状态值,并利用时间差分变化推导每动作奖励。在长程复杂搜索中,该方法无需冷启动监督微调或中间训练,即可显著提升基础模型工具使用能力。在封闭网络BrowseComp-Plus基准上,TRACE将Qwen3-4B从7.2提升至35.6,将Qwen3-30B-A3B从8.4提升至42.6。学习曲线显示RL训练期间更快改进和收敛。论文TRACEQwen3BrowseComp-Plus推荐理由:想解决Agent长程任务奖励稀疏问题?看TRACE方法,无需额外批评器,用TD变化给每步打分,Qwen3在BrowseComp-Plus上从7分直接跳到35分。原文稍后读已读值得跟进有用关注 TRACE
10:54IT之家(博客/媒体)在 Tracking AI 最新离线 IQ 测试中,GPT-5.6 全系列模型(SOL、TERRA、视觉版等)均获得 136 分,首次将大模型智商推过 130 的天才门槛,全球仅约 1% 人类达到此分数。此前 o3 等旗舰模型均卡在 130 分以下,Claude-5 Fable 以 130 分紧随其后。开发者测试显示 GPT-5.6 Sol 能通过单条 prompt 生成物理模拟、RAG 客服系统等应用,成本仅为 Fable 5 的零头。但 IQ 测试仅衡量抽象模式识别和逻辑推理,无法评估事实可靠性、工具调用等真实场景能力。AI模型GPT-5.6Claude-5 FableOpenAI10 个信源在谈事件专题推荐理由:GPT-5.6 智商飙到 136 分,比 Claude-5 还高出一截,而且干活也不含糊,一句话就能造出应用,值得看看它到底多强。原文稍后读已读值得跟进有用关注 GPT-5.6
10:40官方账号arXiv cs.AI@Hefeng Zhou, Jinxuan Zhang, Jiong Lou, Yuxin Liu, Chaochao Lu, Jingjing Qu, Jie LiDeep Interaction 是一种针对大推理模型的人机交互方法,允许用户直接编辑 Chain-of-Thought (CoT) 推理中的错误步骤。该方法将编辑后的 CoT 精炼为蒸馏提示,引导模型沿校正路径推理。在 STEM 任务上,纠正成功率提升超过 25%,token 使用减少约 40%。实验基于多个 STEM 推理基准,展示了显著的效率提升。论文Deep InteractionChain-of-ThoughtLLM推荐理由:这篇论文提出 Deep Interaction,让你可以直接改推理步骤的错误,不用推倒重来。实验说 STEM 任务上纠错成功率涨 25%,token 还省 40%,挺实用的方法。原文稍后读已读值得跟进有用关注 Deep Interaction
07:51官方一手marktechpost@Asif Razzaq74°2026年7月15日,Thinking Machines Lab 发布其首个从头训练的模型 Inkling。Inkling 拥有 975B 总参数、41B 激活参数,采用 Mixture-of-Experts 架构,原生支持文本、图像和音频输入,上下文窗口达 1M token。模型权重基于 Apache 2.0 许可开源,实验室明确它并非当下最强模型,而是定位为定制基础,其可控思考努力(Controllable Thinking Effort)是主要差异化功能。AI模型InklingThinking Machines LabMoE10 个信源在谈事件专题推荐理由:Inkling 让你能控制模型思考深度,975B 参数但只激活 41B,适合做定制化基础模型。原文稍后读已读值得跟进有用关注 Inkling
06:05官方账号Allen AI (Ai2)@allen_aiAllen AI 构建的 SciArena 基准测试用于评估 AI 模型处理科学文献问题的能力,评判者均为研究人员。该基准将于 7 月 15 日退役,最终数据包括约 1700 名用户投出的约 3900 次投票。结果揭示了模型在科学问答、文献理解等任务上的表现对比。具体排名和用户偏好信息已在推文线程中公布。AI模型SciArenaAllen AI科学文献推荐理由:Allen AI 用研究者投票测了 AI 的科学文献能力,1700 人投了 3900 票,想看看哪个模型更靠谱?这里直接给结果。原文稍后读已读值得跟进有用关注 SciArena
03:39Lilian Weng@lilianwengThinking Machines 发布 Inkling 模型,提供完整开源权重。该模型在文本、图像、音频三种模态上均具备高效推理能力。用户可在 Tinker 平台上直接进行微调。基准性能覆盖广泛能力类别,适合实际应用与定制开发。AI模型InklingThinking Machines多模态10 个信源在谈事件专题推荐理由:Thinking Machines 开源了 Inkling,能同时处理文本、图像和音频,还能在 Tinker 上微调,挺实用的。原文稍后读已读值得跟进有用关注 Inkling
01:56lmarena.ai@lmarena_aiArena团队推出新的事实性信号方法,用于测量模型是否生成真实且可验证的声明。该方法分析了前沿模型在事实性上的表现差异,揭示了模型在真实世界可靠性中的关键指标。目前该评测尚未公开具体模型得分,但提供了新的评估维度。AI模型Arenafactuality模型评估推荐理由:Arena团队搞了个新方法测模型真假话,比基准靠谱,想知道你的模型有多爱吹牛?看点这个。原文稍后读已读值得跟进有用关注 Arena
01:54官方账号Decoder@Matthias Bastian88°宾夕法尼亚大学统计学教授使用OpenAI的GPT-5.6 Sol Pro在90分钟内证伪了关于Benjamini-Hochberg方法的一个核心开放猜想,该猜想已悬而未决30年。作为对比,前代模型GPT-5.5连续运行20小时仍无法找到解。模型通过现有方法的新颖组合达成结果,引发AI能否产生真正新知识的讨论。AI模型GPT-5.6 SolOpenAIBenjamini-Hochberg10 个信源在谈事件专题推荐理由:OpenAI的GPT-5.6 Sol居然90分钟就搞定了人类30年没破解的统计难题,前代模型20小时都搞不定,这进步太猛了。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol
23:52Jim Fan@DrJimFan76°研究团队推出RoboTTT模型,通过测试时训练(TTT)机制,将机器人策略的上下文窗口从不足0.1秒扩展到8000时间步(约5分钟),推理成本保持恒定。该模型在上下文长度上比现有SOTA提升了3个数量级。实验显示,从128到8000时间步,闭环性能持续提升,8K预训练比1K提升62%。RoboTTT支持从人类视频进行一次性上下文学习,并能在执行过程中自我纠正错误。AI模型RoboTTT机器人模型上下文学习2 个信源在谈事件专题推荐理由:机器人模型终于能记住5分钟内的动作了!RoboTTT用TTT方法让机器人从人类视频一次学会新任务,还能边干边自我纠错,性能随上下文增长持续提升。原文稍后读已读值得跟进有用关注 RoboTTT
11:01官方账号arXiv cs.AI@Aleh Manchuliantsau一篇论文研究了LLM计划评估器的漏洞:计划可通过省略必要工作提高得分。在26条路线组成的队列中,所有57次合法删除都匹配了分析恒等式,且每条路线至少有一次得分提升的删除。评分优化器在21/26条路线中发现了未被覆盖的结构。GATE机制在26/26条静默路线上拒绝得分释放,0次诚实暂停;之后47/54次修订转为覆盖结构,严格覆盖改进从1/26升至13/26。自适应编译器感知合著者揭示了注册表-来源边界:义务通道规避在v1/v1.5条件下保持6/6,而delta索引成本下限将诚实路线从6/6降至3/6,静默可融资性从5/6降至0/6。论文LLMGATEAI安全推荐理由:这篇论文深挖了一个漏洞:计划评估器可能因为计划含糊就给高分。他们用数学证明并在26条路线上验证了。搞LLM安全或评估的值得一读。原文稍后读已读值得跟进有用关注 LLM
10:04官方账号arXiv cs.LG@Takumi Shioda, Kohei Terashima, Tatsuo Nagai本研究采用带可验证奖励的强化学习(RLVR)微调开源推理模型,用于建筑热能存储调度。仅用30条训练提示,强化微调(RFT)将排放从70.5降至61.2 kg-CO2,接近动态规划最优值60.8。GPT-5无需微调即接近最优,而GPT-4o(非推理模型)排放高于无存储基线。分析表明,RFT主要稳定了候选比较、前瞻和可行性检查等规划模式,并在预测误差和未见条件下保持鲁棒。论文RLVRRFTGPT-5推荐理由:这篇论文用30条提示微调开源模型,让建筑冷负荷调度排放从70.5降到61.2,逼近最优,比GPT-4o强得多。原文稍后读已读值得跟进有用关注 RLVR
09:26官方账号arXiv cs.AI@Hiroto Osaka, Shohei Taniguchi, Gouki Minegishi, Kai Yamashita, Masahiro Suzuki, Yutaka Matsuo论文提出Visual Access Sweep方法,通过遮蔽生成token到图像token的注意力,定义Visual Access Boundary (VAB)。在Qwen2.5-VL-32B和InternVL3的14B、38B规模上,CoT的VAB层与无CoT全访问目标差异最多两层。CoT提升受限于感知读出:当视觉属性可可靠读出时CoT有效,否则无效。符号属性oracle显示,提供真实属性文本后CoT可改善计数。单目标探针-解码检查表明,困难属性可从隐藏状态线性恢复但模型难以输出。论文Qwen2.5-VLInternVL3CoT推荐理由:这篇论文用实验告诉你,视觉语言模型做CoT推理时,图像其实只在开头看一次,后面全靠语言处理。想知道为什么CoT有时没用?进来看看原文稍后读已读值得跟进有用关注 Qwen2.5-VL
09:11官方账号arXiv cs.LG@Xingyu Dang, Haocheng Tang, Junmei Wang, Yanjun Li研究团队构建了大规模反应机理推理数据集,并创建了FukuyamaBench基准,该基准源自Fukuyama的《高级有机反应机理》一书,用于评估模型的分层机理推理能力。微调后的Qwen3-30B-A3B模型在FukuyamaBench Set A上达到8.3%的精确路径匹配率,超过专用FlowER模型的5.1%。结果表明机理感知训练可显著增强语言模型的化学推理能力。AI模型Qwen3FlowER化学反应推荐理由:Qwen3微调模型在化学机理推理上直接击败了专用FlowER,准确率从5.1%提升到8.3%,化学和AI交叉领域值得一看。原文稍后读已读值得跟进有用关注 Qwen3
09:07官方账号arXiv cs.LG@Julius Steiglechner, Lucas Mahler, Gabriele LohmannElenchos是一个基于lambda演算系统的生成式评估框架,用于测试大语言模型(LLM)的溯因推理能力。评估发现,前沿和中端模型在检测系统是否被修改时表现较好,但识别具体规则修改的能力显著不足。在交互突变场景下,模型性能大幅下降,通常只能恢复部分突变。初步证据显示,增加推理时间预算仅带来微小改进,收益递减。论文LLMElenchos溯因推理推荐理由:这篇论文用Elenchos框架测了LLM的溯因推理,发现模型能发现异常但猜不准具体改了啥,挺有意思的。原文稍后读已读值得跟进有用关注 LLM
09:03官方账号arXiv cs.LG@Junyu Ren精选EG-VAR提出基于Lean 4的形式化验证架构,通过工具调用公理和源声明确保每个输出都结构性地源自可验证的工具调用(定理3.1)和内核检查的有效推理链(定理3.2)。在TableBench数值推理子集(n=120)上,EG-VAR达到120/120,而相同工具基线为95%。在覆盖5个领域×2个模型的反事实压力测试中,EG-VAR保持100%源忠实度,相同工具下降至80-90%,无工具则为50-80%。LLM作为部署时形式化器时,Sonnet上的残余语义形式化错误率为3.3%,Opus为1.7%。论文EG-VARLean 4TableBench推荐理由:这论文搞了个叫EG-VAR的框架,用Lean内核做形式化验证,让LLM的推理结果100%可追溯,在TableBench上满分,比普通工具调用靠谱太多了。原文稍后读已读值得跟进有用关注 EG-VAR
05:51lmarena.ai@lmarena_ai精选72°Meta 推出了 Muse Spark 1.1,这是其早期模型 Muse Spark 的升级版。该模型在 Agent Arena 排行榜上位列所有实验室第五、模型排行榜第十七。Meta 同时开放了 Meta Model API 公开预览,开发者可通过该 API 访问 Muse Spark 1.1。模型已在 Meta AI app 及 meta.ai 的 "思考" 模式下可用。AI模型Muse Spark 1.1MetaAgent Arena推荐理由:Meta 终于入局智能体赛场,Muse Spark 1.1 一上榜就拿第五,还开放了 API 和思考模式,想试试新模型可以冲。原文稍后读已读值得跟进有用关注 Muse Spark 1.1
05:49官方账号Meta AI@AIatMeta72°Meta AI 提交其推理与多模态模型参加了亚洲物理奥林匹克(APhO)理论考试。该模型取得满分 30/30 的成绩,与排名前三的学生选手并列。APhO 委员会允许该模型参赛,展示其在复杂物理推理任务上的能力。AI模型Meta AI推理模型多模态推荐理由:Meta 的模型在物理奥赛里拿了满分,和前三名人类选手并列,看看AI的理科能力有多强。原文稍后读已读值得跟进有用关注 Meta AI
04:03Aravind Srinivas@AravSrinivasPerplexity宣布开源其内部用于衡量AI研究能力的基准WANDR。该基准在构建Perplexity Computer的深度研究功能中起到关键作用。公司表示WANDR在成本和性能上均达到最佳效果。Perplexity强调强大的内部评估和基准是其主要优势之一。AI模型PerplexityWANDR开源基准推荐理由:Perplexity把内部跑得最好的研究能力基准WANDR开源了,你要评测推理模型可以拿来用。原文稍后读已读值得跟进有用关注 Perplexity
04:00官方账号Perplexity@perplexity_aiPerplexity AI 在推文中指出,智能体进行广泛深入研究需具备两种关键能力:一是搜索范围足够广,以找到所有符合条件的实体;二是深入调查足够深,为每个主张提供证据支持。该观点为AI搜索和推理任务提供了方法论指导。技巧Perplexity AI智能体搜索推荐理由:Perplexity AI 教你做深度研究:既要搜得全,又要挖得深,少一个都不行。原文稍后读已读值得跟进有用关注 Perplexity AI
00:55官方账号Sam Altman@samaGPT-5.6的价格是fable的一半,token效率约为fable的两倍。Sam Altman宣布该模型能以更低的成本完成相同任务。具体而言,GPT-5.6在多个场景中实现了价格减半和效率翻倍的性能提升。AI模型GPT-5.6OpenAIfable10 个信源在谈事件专题推荐理由:OpenAI发了GPT-5.6,价格比fable便宜一半,token效率高两倍,省钱又省力。原文稍后读已读值得跟进有用关注 GPT-5.6
22:08量子位@一水DeepSeek-Coder-V2在SWE-bench Verified上以67.3%的成绩超越GPT-4o和Claude 3.5 Sonnet,成为首个免费开源的编码模型达到该水平。该模型在HumanEval上得分92.1%,在MBPP上得分90.5%。开发者可通过Hugging Face免费下载使用。AI模型DeepSeek-Coder-V2DeepSeek开源模型推荐理由:DeepSeek-Coder-V2免费开源,性能还超过了GPT-4o和Claude,写代码直接省钱了。原文稍后读已读值得跟进有用关注 DeepSeek-Coder-V2
21:35官方账号LangChain@LangChainAI黄仁勋在 LangChain 分享中指出,过去六个月最大变化是智能体系统(agentic systems)终于有了足够强大的模型支撑。这些系统集成了知识、工具、记忆,并能迭代执行任务直到完成。他强调模型能力的提升使这一架构不再是理论,而是可落地的工程实践。行业Jensen HuangNVIDIA智能体9 个信源在谈事件专题推荐理由:老黄用一句话点透AI趋势:智能体不再是画饼,模型进步让Agent系统终于能跑起来了。原文稍后读已读值得跟进有用关注 Jensen Huang
17:43Hunyuan@TXhunyuan腾讯混元发布了Hy3模型的1-bit和4-bit量化版本,原始模型为295B参数的MoE架构,在同等规模中性能最佳,可媲美万亿参数旗舰模型。量化后模型可在单张GPU上运行,支持llama.cpp和MTP(多令牌预测)。模型采用Apache 2.0协议,对商用友好,并提供两周免费API试用。AI模型Hy3Tencent量化推荐理由:腾讯混元把295B的旗舰模型量化到1-bit和4-bit,单卡就能跑,还免费两周API,适合做智能体。原文稍后读已读值得跟进有用关注 Hy3
12:39官方账号Greg Brockman@gdbOpenAI 的 GPT-5.6 系列模型(Sol、Terra、Luna)正式在 Amazon Bedrock 上全面可用。该系列提供三个智能层级,从旗舰推理(Sol)到快速推理(Luna)。基于 Bedrock 的下一代推理引擎,支持高性能、安全、规模和可靠性。开发者可直接在 AWS 上调用这三种模型。AI模型GPT-5.6OpenAIAmazon Bedrock10 个信源在谈事件专题推荐理由:OpenAI 在 Bedrock 上了 GPT-5.6 的三个档位:Sol 负责强推理,Luna 跑得快,中间 Terra 平衡。现在 AWS 用户直接用,不用折腾部署了。原文稍后读已读值得跟进有用关注 GPT-5.6
11:14官方一手arXiv: DeepSeek@Jinglan Gong, Jiefan Lu, Hewei Guo, Kehan Li, Zhiyuan Han, Jihang Jiang, Wenwen Tong, Lewei LuEYT-Bench是一个评估LLM多轮对话能力的基准,采用三部分解耦设计:基于人工语料库(Nemotron-Personas-USA和PersonaMem-v2)的特定角色用户模拟器、分离意图感知与回复生成的目标模型、以及独立第三方LLM评判器。在17个目标模型×200段对话的评估中,闭源与开源模型在主观维度(共情/人格化等)差异不超过0.3,但客观意图追踪差距可达9倍。开启推理模式后,Gemma-4的长上下文潜在意图准确率提升0.47-0.50。交叉评判消融实验通过DeepSeek-v4-pro验证了目标排名和最终意图满意度的一致性。论文EYT-Bench多轮对话基准测试2 个信源在谈事件专题推荐理由:这篇论文提出了EYT-Bench,能更真实地测出LLM在多轮对话中的意图追踪能力。用16/17模型发现推理模式大幅提升长上下文准确率,值得关注。原文稍后读已读值得跟进有用关注 EYT-Bench