01:55Google Gemini App@GeminiApp72°谷歌发布 Gemini 3.6 Flash 和 3.5 Flash-Lite 升级版。新版本在推理能力和响应速度上均有提升。用户可在 gemini.google 或 App 的模型下拉菜单中切换使用。两个模型目前均已开放体验。AI模型GeminiGemini 3.6 FlashGemini 3.5 Flash-Lite1 个信源在谈事件专题推荐理由:谷歌把 Flash 和 Flash-Lite 都升级了,推理更强速度更快,打开 Gemini 选模型就能试。原文稍后读已读值得跟进有用关注 Gemini
15:47IT之家(博客/媒体)79°OpenAI通过两项框架改进,让GPT-5.6 Sol在ARC-AGI-3基准得分从7.8%升至38.3%。改进前的官方框架会丢弃私有推理,且滚动截断窗口导致早期动作丢失。OpenAI提出推理保留和上下文压缩两个方案,分别解决上述问题。启用改进后,GPT-5.6 Sol输出token降至六分之一,成绩增长188.42%。AI模型GPT-5.6 SolOpenAIARC-AGI-310 个信源在谈事件专题推荐理由:OpenAI给GPT-5.6 Sol换了套测试框架,ARC-AGI-3得分从7.8%涨到38.3%,输出还省了六分之五,这招挺妙。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol
13:53官方账号Greg Brockman@gdb76°GPT-5.6 Sol 找到了 Maxwell 猜想的反例,证实该猜想错误。这一猜想已存在超过 100 年,反例由 AI 发现后经人类数学家确认,论文已上传至 arXiv(编号 2607.27197)。成果展示了 GPT-5.6 Sol 在数学推理上的具体能力。AI模型GPT-5.6 SolMaxwell conjecture推理模型推荐理由:GPT-5.6 Sol 直接给 Maxwell 猜想找出了反例,人类数学家还验证了,这推理能力真有点吓人。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol
12:31官方账号arXiv cs.LG@Jiawei Xu, Minghui Liu, Juzheng Zhang, Tom Goldstein, Furong Huang论文提出β-OPSD,将普通在线自蒸馏(OPSD)推广为β=1特例的策略优化家族。β作为正则化参数,控制学生模型相对参考策略与特权教师之间的权衡。最优策略被推导为参考策略与教师的几何插值,实现时混合二者的token级logits。在数学推理基准上,β-OPSD比vanilla OPSD更稳定、推理性能更好。论文β-OPSD自蒸馏策略优化推荐理由:这篇论文把OPSD的隐式β变成可控参数,用蒸馏近似强化学习,数学推理上比原版更稳更强。原文稍后读已读值得跟进有用关注 β-OPSD
12:21官方账号arXiv cs.LG@Alexander Boesgaard Lorup该论文在 Qwen2.5 衍生系统上用 200 项配对实验对比保留 live cache 与一次性 prefill。BF16 下两种构造在 166 个后缀和 20 个正确性标签上出现分歧,准确率差 1 个百分点(95% CI [-3.5, +5.5])。FP32 固定前缀 2x2 对比没有解码分歧(Wilson 95% 上限 1.88%)。跨 48 层 key/value 的双向缓存移植让每个测试分歧跟随缓存供体(24/24 和 43/43)。论文Qwen2.5KV Cache推理模型推荐理由:用Qwen2.5做200组实验:BF16有166处分歧,FP32无分歧;移植48层KV缓存后分歧跟随供体。原文稍后读已读值得跟进有用关注 Qwen2.5
08:09Scott Wu@ScottWu46Cognition 更新了 FrontierCode 1.1 基准,为 GPT-5.6 Terra 和 GPT-5.6 Luna 提供新折扣。更新后 GPT-5.6 系列在价格/性能效率上位于帕累托曲线前沿。所有 Devin 用户将自动享受到成本下降,无需手动调整。AI模型GPT-5.6FrontierCodeDevin推荐理由:GPT-5.6 系列降价了,在 FrontierCode 上性价比拉满,用 Devin 的自动省钱。原文稍后读已读值得跟进有用关注 GPT-5.6
06:44官方账号OpenAI@OpenAI (@OpenAI)ARC-AGI-3基准测试要求模型无需指令学习不熟悉的2D游戏。标准测试丢弃了GPT-5.6 Sol每步后的推理,并在上下文填满时丢弃早期动作。这导致模型无法积累有效经验,只能不断重启。测试结果凸显了长上下文维持对推理模型的关键性。AI模型ARC-AGI-3GPT-5.6 SolOpenAI10 个信源在谈事件专题推荐理由:ARC-AGI这个测试挺刁钻,GPT-5.6 Sol在没法记住之前推理的情况下学不会新游戏,说明长上下文对推理很重要。原文稍后读已读值得跟进有用关注 ARC-AGI-3
04:48Cognition@cognition_labsCognition更新了编码基准FrontierCode 1.1,以反映GPT-5.6 Terra和GPT-5.6 Luna的新成本折扣。基于更新后的价格,GPT-5.6系列在价格/性能效率上处于帕累托曲线前沿。这意味着该系列模型在同等性能下更具成本优势。AI模型GPT-5.6 TerraGPT-5.6 LunaFrontierCode推荐理由:GPT-5.6系列降价了,在FrontierCode基准上性价比更突出了,做编码任务可以关注下。原文稍后读已读值得跟进有用关注 GPT-5.6 Terra
03:33官方账号Sam Altman@samaOpenAI 在部署后应用 GPT-5.6 Sol 进行效率自优化,让模型自身改进运行效率。结果显示,通过生产 GPU 内核优化,服务成本降低 20%。此外,改进的投机解码使 token 生成效率提升 15% 以上。这一成果展示了模型自我优化的实际收益。AI模型GPT-5.6 SolOpenAI效率优化10 个信源在谈事件专题推荐理由:OpenAI 的 GPT-5.6 Sol 通过自学习优化运行,服务成本降了 20%,生成速度提了 15%,比手动调优更省心省钱。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol
03:16OpenRouter@OpenRouterAI77°OpenAI 宣布 GPT-5.6 Luna 降价 80%,GPT-5.6 Terra 降价 20%。GPT-5.6 Sol 在 API 中提供更快的推理选项。降价后,在 Codex 和 ChatGPT Work 中的用量计算方式同步调整,用户使用额度更耐用。AI产品GPT-5.6OpenAIAPI定价10 个信源在谈事件专题推荐理由:OpenAI 给 GPT-5.6 系列降价了,Luna 降八成、Terra 降两成,Sol 还更快。正在用这些模型做产品或开发的,赶紧看下新价格和用量规则。原文稍后读已读值得跟进有用关注 GPT-5.6
02:12官方账号NVIDIA AI@NVIDIAAI精选Thinking Machines 发布 Inkling-Small,总参数量 276B,活跃参数 12B,性能与 Inkling 相当但体积仅为四分之一。该模型原生支持音频和图像推理,并具备可变思考努力能力。完整权重已开放,可使用 NVIDIA NeMo 在 DGX Station 上微调。用户可在 Tinker 上通过文本、图像或音频方式与之交互。AI模型Inkling-SmallThinking Machines多模态6 个信源在谈事件专题推荐理由:Thinking Machines 出了个 Inkling-Small,276B 参数量但只激活 12B,能处理音频和图像,性能不打折,适合拿来微调玩。原文稍后读已读值得跟进有用关注 Inkling-Small
01:40官方账号OpenAI@OpenAI (@OpenAI)81°OpenAI 通过 GPT-5.6 Sol 实现自身运行效率提升,使服务成本降低 20%。改进推测解码后,令牌生成效率提升 15% 以上。这些优化已转化为 Luna 和 Terra 模型的 API 价格下调。OpenAI 旨在让先进智能更普及。AI模型GPT-5.6 SolLunaTerra10 个信源在谈事件专题推荐理由:OpenAI 又升级了,GPT-5.6 Sol 让运行成本降了20%,速度快了15%,Luna 和 Terra 也降价了,开发者快看。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol
23:32Google AI Developers@googleaidevs75°谷歌发布Gemini Robotics ER 2,这是其最强的具身推理模型。该模型连接Gemini Live API,可处理连续视频流、调用工具、搜索网页并实时命令动作模型。升级包括增强进度跟踪、实时执行失败检测、多机器人协作和高级安全指令遵循。面向开发者,提升机器人控制能力。AI模型Gemini Robotics ER 2Gemini Live APIGoogle推荐理由:谷歌出了Gemini Robotics ER 2,能边看视频边指挥机器人,还支持多机器人协作和实时纠错,搞机器人的必须关注。原文稍后读已读值得跟进有用关注 Gemini Robotics ER 2
22:14Latent.Space@latentspacepod本体论作为经典知识表示工具,正被AI工程师用于约束LLM和Agent行为。Frank Coyle和Emile Ifrem在aiDotEngineer World's Fair上展示了如何用本体论保持模型输出诚实、确保Agent遵循确定性路径。这种方法利用旧网络技术为概率模型设置规则边界,减少幻觉和偏离。技巧ontologiesLLMAgent推荐理由:想治LLM乱编和Agent跑偏?看看本体论这个老办法怎么新用。两个实际案例,讲得明白。原文稍后读已读值得跟进有用关注 ontologies
17:57官方账号OpenAI@OpenAI72°OpenAI 通过 Responses API 实现了一项测试,启用了 Retained reasoning 和 Context compaction 功能。在公开数据集上,GPT-5.6 Sol 的得分提升了 188%,同时输出 token 数量减少了 6 倍。这一改进显著提高了模型的推理效率和输出质量。AI模型GPT-5.6 SolOpenAI推理模型10 个信源在谈事件专题推荐理由:OpenAI 用 Responses API 让 GPT-5.6 Sol 分数涨了 188%,输出 token 还少了 6 倍,效率提升很明显。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol
15:47官方账号Decoder@Matthias Bastian82°OpenAI声称其GPT-5.6 Sol模型在ARC-AGI-3基准测试中通过自定义测试环境获得38.3%的分数,高于Anthropic Opus 5的30.2%。但在官方标准环境下,GPT-5.6 Sol仅得7.8%,远低于Opus 5的30.2%。OpenAI的定制测试保留了推理链和上下文压缩作为辅助手段,而Opus 5在无辅助下完成。这一差异引发了关于基准测试公平性的讨论。AI模型GPT-5.6 SolOpus 5ARC-AGI-310 个信源在谈事件专题推荐理由:OpenAI推出GPT-5.6 Sol,在自定测试里赢了Anthropic的Opus 5,但换官方环境就掉到7.8%,差距挺大。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol
13:59IT之家(博客/媒体)72°SpaceXAI发布Grok Voice Think Fast 2.0语音模型,每分钟音频费用0.08美元。该模型在AA Speech-to-Speech Quality Index达82.9%,较1.0版提升7.2个百分点。xAI内部评估显示,转录表现较Deepgram Nova 3和ElevenLabs Scribe v2提升1.5-2.0倍,较1.0版提升1.4倍。在背景噪声场景下,与专用语音转文字模型的差距可扩大至约10倍。模型支持24种语言,可在说话时同步完成推理。AI模型Grok Voice Think Fast 2.0SpaceXAIDeepgram Nova 31 个信源在谈事件专题推荐理由:SpaceXAI刚发的Grok Voice Think Fast 2.0,语音转语音又快又准,一分钟才8分钱,比上一代强了一大截,还支持24种语言,适合做语音助手。原文稍后读已读值得跟进有用关注 Grok Voice Think Fast 2.0
13:31小互@imxiaohu81°OpenAI 发现 GPT-5.6 Sol 在 ARC-AGI-3 公开题库中仅得 13.3%,原因是推理过程中的私有思考被丢弃,上下文到达阈值后直接删除早期消息。通过开启 Responses API 将上一次响应 ID 传回以保留推理链,并启用 compaction 将超限上下文压缩为浓缩摘要,得分升至 38.3%。最高档每局输出 token 从 290 万降至 49 万,新程序在“高”档即达到旧程序“最高”档的分数,token 消耗相差约 12 倍。技巧GPT-5.6OpenAIARC-AGI-310 个信源在谈事件专题推荐理由:OpenAI 分享了两个超实用的 API 开关,GPT-5.6 Sol 在 ARC-AGI-3 上分数直接翻了三倍,token 还省了十二倍,搞推理优化的一定要看看。原文稍后读已读值得跟进有用关注 GPT-5.6
11:09小互@imxiaohuMagnific 发布了 38 页的全新提示词手册,核心观点是传统关键词式提示已失效。手册提出 AI 已进入推理(Reasoning)与导演对话时代,需要用明确的专业视觉语言指挥前沿模型。该手册针对当前主流图像和视频生成模型提供实用指南。技巧Magnific提示词工程推理模型推荐理由:Magnific 出了本 38 页的提示词手册,教你用导演思维跟 AI 对话,不再堆关键词,适合想用好前沿图像视频模型的人。原文稍后读已读值得跟进有用关注 Magnific
10:33SuperTechFans(博客/媒体)精选TurboFieldfare 是一个采用 Swift 和 Metal 编写的开源推理运行时,专为 Apple Silicon Mac 设计。它通过 SSD 流式加载专家权重,使 Gemma 4 26B-A4B 模型仅需约 2GB 内存即可运行,无需加载完整的 14.3GB 模型。实测在 8GB M2 MacBook Air 上达到 5.1-6.3 tok/s,在 24GB M5 Pro 上达到 31-35 tok/s。项目提供本地 Mac 应用、CLI 和 OpenAI 兼容服务器,要求 macOS 26、Metal 4 和 Xcode 26。AI模型TurboFieldfareGemma 4Apple Silicon10 个信源在谈事件专题推荐理由:想在老 Mac 上跑大模型?这个开源引擎让 Gemma 4 26B 只需 2GB 内存就能跑起来,M2 上还有 5-6 tok/s,挺实用的。原文稍后读已读值得跟进有用关注 TurboFieldfare
10:32官方账号arXiv cs.AI@Mehrad Yaghoubi, Azam Bastanfard, Abbas Jalilvand, Ashkan Rezaei该论文提出Belief-Guided架构,将策略头与信念头分离,后者作为内部模拟器和独立批评者,建模认知不确定性和战略稳定性。通过Transformer/GRU处理长期依赖和劫争规则,并利用门控机制过滤过度自信的策略错误。实验表明,该架构显著提升无需搜索的胜率并减少幻觉,在消费者级硬件上实现专业水平对弈,而传统方法需要大规模MCTS。AI模型Belief-Guided围棋AIMCTS推荐理由:这篇论文提出一个新架构,让围棋AI不用大量搜索也能在普通电脑上达到专业水平,比AlphaZero更省资源。原文稍后读已读值得跟进有用关注 Belief-Guided
10:30官方账号Simon Willison@simonw精选GPT-5.6 通过 Codex 分析生产流量、改进负载均衡、重写 GPU kernel 和运行数百次推测解码实验,将端到端服务成本降低 20%。推测解码使 token 生成效率提升超 15%。这些优化为 OpenAI 每月节省数十亿美元成本。AI模型GPT-5.6Codex推理模型10 个信源在谈事件专题推荐理由:GPT-5.6 自己优化自己,服务成本降了20%,生成效率提了15%,省下来的钱都能买好几个数据中心了。原文稍后读已读值得跟进有用关注 GPT-5.6
10:09官方一手Pandaily@contact@pandaily.com (Pandaily)蚂蚁集团旗下Ant Bailing推出Ling-3.0-flash执行模型,总参数量124B,激活参数仅5.1B。该模型在12个基准测试中,以12%的参数量在11项上超越万亿参数模型Ring-2.6。在34个评估维度中,Ling-3.0-flash获得15个第一、19个第二,与DeepSeek V4 Flash并列平均最高分。AI模型Ling-3.0-flashAnt BailingRing-2.610 个信源在谈事件专题推荐理由:蚂蚁百灵的新模型Ling-3.0-flash参数量只有124B,却在大多数基准测试里干翻了万亿参数的Ring-2.6,还和DeepSeek V4 Flash并列第一,小模型也能这么猛。原文稍后读已读值得跟进有用关注 Ling-3.0-flash
09:37官方账号Sam Altman@samaSam Altman 转发消息称,OpenAI 的 GPT-5.6 Sol 在 ARC-AGI-3 基准测试中达到 SoTA(最高性能)。该模型仅通过两个设置变化实现:允许其在多个上下文窗口中进行推理,并配合规范化的压缩实现。这一结果暗示通过调整推理机制,模型在挑战性视觉推理任务上表现显著提升。目前官方博客已发布详细方法说明。AI模型GPT-5.6 SolOpenAIARC-AGI-310 个信源在谈事件专题推荐理由:OpenAI 的 GPT-5.6 Sol 改了俩设置就在 ARC-AGI-3 上屠榜,教你多窗口推理+规范化压缩这套新打法。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol
07:18官方一手@OpenAIDevs@OpenAIDevs78°OpenAI 使用 GPT-5.6 Sol 模型在 Codex 环境中对自身基础设施进行优化,改进在推理和智能体循环中产生更多有用工作。生产 GPU 内核优化使服务成本降低 20%,改进的推测解码使 token 生成效率提升 15% 以上。这些改进通过复用在相同硬件上获得更大的性能提升。AI模型GPT-5.6 SolCodexOpenAI10 个信源在谈事件专题推荐理由:OpenAI 让最新的 GPT-5.6 Sol 自己给自己打工,结果运行成本降了 20%、输出速度提升超 15%,看看模型怎么自己优化自己。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol
07:12官方一手OpenAI Blog(博客/媒体)OpenAI 通过启用两个 API 设置(保留推理轨迹和启用结果压缩)让模型在 ARC-AGI-3 基准上的得分提升至原来的三倍。这些设置分别作用于推理过程和输出压缩,不增加额外计算成本。具体配置方法在官方博客中公开。技巧ARC-AGI-3OpenAI推理模型10 个信源在谈事件专题推荐理由:OpenAI 官方分享的实用技巧,只改两个参数就让 ARC-AGI-3 分数翻三倍,玩模型的可以试试。原文稍后读已读值得跟进有用关注 ARC-AGI-3
05:33官方账号OpenAI@OpenAI85°OpenAI 推文宣布推出 GPT-5,通过全栈优化(涵盖架构、训练与推理)在成本-智能曲线上每个点都达到最佳性能。该模型系列包含多种版本,针对不同计算成本进行调优。具体基准成绩尚未公开,但声称在各成本区间均保持领先。AI模型OpenAIGPT-5推理模型10 个信源在谈事件专题推荐理由:OpenAI 发了 GPT-5 系列,从低到高每个价位都做了性能最优的版本,想省钱或追求极致都能选到合适的。原文稍后读已读值得跟进有用关注 OpenAI
04:04官方一手OpenAI Blog(博客/媒体)OpenAI发布GPT-5.6,该模型在模型架构、推理过程和智能体工作流上进行了效率优化,旨在提升每美元实现的智能水平。AI模型GPT-5.6OpenAI推理模型10 个信源在谈事件专题推荐理由:OpenAI新模型GPT-5.6,在模型、推理和智能体效率上都有提升,每美元能换更多智能,值得关注。原文稍后读已读值得跟进有用关注 GPT-5.6
03:44官方账号xAI@xaixAI 发布 Grok Voice Think Fast 2.0,专为语音代理设计。该模型在嘈杂环境下能保持清晰听取。它能推理复杂工作流,并生成更自然的对话。相比前代,在实时交互中延迟更低、鲁棒性更强。AI模型Grok VoicexAI语音模型1 个信源在谈事件专题推荐理由:xAI 出了个新语音模型,专门解决噪声环境下听不清的问题,还能处理复杂任务,适合做语音助手的开发者试试。原文稍后读已读值得跟进有用关注 Grok Voice
01:48OpenRouter@OpenRouterAI阿里巴巴的Qwen3.7-Flash模型在OpenRouter平台正式上线。该模型具备视觉能力,支持多模态代理、视觉编码、搜索和计算机交互,上下文窗口达100万tokens。同时支持工具调用,适合快速推理场景。AI模型Qwen3.7-FlashOpenRouter阿里巴巴推荐理由:阿里新模型上线OpenRouter,百万上下文还能看图和操作电脑,多模态推理速度很快。原文稍后读已读值得跟进有用关注 Qwen3.7-Flash
00:15lmarena.ai@lmarena_ai82°Anthropic 的 Claude Opus 5 (Max) 在 Agent Arena 中排名第二,基于超过 7000 次真实代理会话,净提升 11.88%。Opus 5 (High) 紧随其后排名第三,净提升 11.73%,两者均低于第一名 Fable 5,但高于 GPT-5.6 Sol (xHigh)。在 Frontend Code Arena 中,Opus 5 Max 排名第一,Opus 5 High 排名第三(落后于 Kimi K3)。在 Text Arena(事实性开启)中,Opus 5 Max 位列第一,Opus 5 High 第二。这些成绩基于全球社区的百万级真实长周期任务评测。AI模型Claude Opus 5Agent ArenaAnthropic10 个信源在谈事件专题推荐理由:Claude Opus 5 在 Agent Arena 和代码榜都冲进前三,Max 版更是双榜第一,比 GPT-5.6 还靠前,很强悍。原文稍后读已读值得跟进有用关注 Claude Opus 5
13:36AI Will@FinanceYF582°Ilya Sutskever的SSI公司据推测采用脑启发方法让AI持续学习,而非传统训练后冻结。关键技术包括从极少经验学习新技能、提前识别失败、不覆盖旧知识迁移。证据来自Ilya对泛化局限的批评及WSJ报道Nvidia投资并给予10倍算力。其70%置信度认为核心是类人泛化与持续学习,40%置信度指向内部价值系统作为能力与安全同机制。AI模型SSIIlya Sutskever推理模型10 个信源在谈事件专题推荐理由:Ilya Sutskever的SSI可能找到了让AI像天才少年一样持续学习的方法,能力与安全在同一训练回路里,这个方向很不一样。原文稍后读已读值得跟进有用关注 SSI
13:14Amjad Masad@amasad精选阿马德·马萨德训练国际象棋LLM时发现,单纯用棋盘→走法配对数据在投入超1000小时后遭遇明显收益递减。一次意外中,一个"先思考再走棋"的分支因产生幻觉走法而失败,但他将约8%的这种推理轨迹混合进纯走法数据,在同等训练预算下取得了优于纯数据的效果。模型通过吸收推理轨迹,在推理时不再实际执行思考过程。最终模型Elo得分达到1300。AI模型象棋AI推理模型训练技巧推荐理由:他试了在象棋AI数据里掺8%的推理数据,效果直接碾压纯数据,轻松上1300分。原文稍后读已读值得跟进有用关注 象棋AI
12:24官方一手歸藏(guizang.ai)@op741882°OpenAI 宣布重置所有 ChatGPT Work 和 Codex 用户的用量限制。针对 GPT-5.6 Sol 消耗速度过快的反馈,团队优化后典型使用续航提升约 18%。明天将恢复此前暂停的 5 小时限制。调查发现 Sol 因更愿长时间工作和多工具调用,导致部分重度用户消耗更快。中位数用户 token 效率良好,长尾场景得到改进。AI产品CodexGPT-5.6 SolOpenAI10 个信源在谈事件专题推荐理由:OpenAI 承认 Sol 消耗快的问题并修复了,Codex 用户记得用量已重置,续航能多撑近两成。原文稍后读已读值得跟进有用关注 Codex
12:05官方账号Greg Brockman@gdbOpenAI 联合创始人 Greg Brockman 公布 GPT-5.6 成功解决了概率论中长期未解决的 Feige 1/e 猜想。该猜想涉及独立非负随机变量 X_i(期望 ≤1)的部分和 S_n,断言 P(S_n ≤ E[S_n] + 1) ≥ 1/e。Brockman 的友人 Zhengqing 使用 GPT-5.6 完成了这一证明,该问题曾是他们午餐时反复讨论的难题。AI模型GPT-5.6Feige 1/e 猜想推理模型10 个信源在谈事件专题推荐理由:GPT-5.6 刚又搞定一个数学难题,这次是概率论里老牌的 Feige 猜想,你可以看看 AI 证明数学定理有多猛。原文稍后读已读值得跟进有用关注 GPT-5.6
11:59官方账号arXiv cs.AI@Abhishek Pillai, Samir Kumar Nayak, Yuan ChenDesktop-Delta Bench (DDB) 是一个离线步骤级基准,包含2,013个人工验证的实例,覆盖约15个应用和50个任务域。DDB通过463个三帧时序排序实例(含105个跨轨迹干扰)和1,550个前后对比对来评估模型。在8个闭源和开源模型家族、32个排序和16个单动作设置中,最佳非干扰和干扰精确匹配率分别为65.1%和65.7%。单动作结果显示,推断动作类型比定位更难:点击F1为0.96,拖拽为0.76。DDB填补了GUI定位与最终任务成功之间的诊断空白。论文Desktop-Delta Bench计算机使用模型GUI代理推荐理由:想测试你的桌面Agent到底能不能分清操作后的界面变化?这个新基准有2000多个真实案例,能看出模型在哪类失败上翻车。原文稍后读已读值得跟进有用关注 Desktop-Delta Bench
11:23官方一手arXiv: DeepSeek@Jia Liu, Veena Krishnaraj, Kateryna Vovk, Kosuke Aizawa, Adrian E. Bayer, Linda Blot, Jessica Cowell, Suyog Garg, Jonathan Grée, Anamaria Hell, Ben Horowitz, Masaya Ichikawa, Kanyuni Iemoto, Keigo Kondo, Zacharie Lorsin, Kevin McCarthy, Jamie Robinson, Miguel Ruiz-Granda, Leander Thiele, Ievgen Vovk, Mingshen Zhou该研究测试了大型语言模型(LLMs)在科研项目规划和提案评估中的表现。人类研究者与ChatGPT、Claude、DeepSeek(2025年中模型)分别生成了8个专家构思的研究项目的一页计划,共计32份提案。4位人类评审员和2个前沿LLM(Claude Opus 4.8、ChatGPT Pro 5.5)采用四维度评估标准盲审。人类评审员对AI和人类提案的整体评分相似,而AI评审员对AI提案的评分平均高出约1分(5分制)。人类评审员正确识别人类和AI提案的比例分别为72%和79%,而两个AI评审员均100%正确分类。研究表明当前LLM能生成与人类提案相当的计划,但AI评审员存在系统性偏好。论文ChatGPTClaudeDeepSeek推荐理由:这篇论文测试了ChatGPT、Claude、DeepSeek写科研计划的能力,发现人类评委分不出好坏,但AI评委偏爱AI写的。值得一读。原文稍后读已读值得跟进有用关注 ChatGPT
11:02IT之家(博客/媒体)72°月之暗面于7月28日开源了2.8万亿参数模型Kimi K3,该模型采用KDA混合注意力机制和Stable Latent MoE架构,原生支持视觉理解与100万token上下文。摩尔线程基于MTT S5000智算卡及MUSA软件栈,第一时间完成了Day-0适配,包括核心算子、分布式链路及SGLang-MUSA的Hybrid State Pool管理。面对Kimi K3的MXFP4 checkpoint,摩尔线程设计了在线逐层量化方案,无需离线转换即可推理。MTT S5000单卡AI稠密算力达1000TFLOPS,配备80GB显存和1.6TB/s显存带宽。AI模型Kimi K3摩尔线程MTT S500010 个信源在谈事件专题推荐理由:月之暗面刚开源2.8万亿参数的Kimi K3,摩尔线程的国产GPU MTT S5000立马适配,能直接跑官方MXFP4格式,推理部署很方便。原文稍后读已读值得跟进有用关注 Kimi K3
09:53宝玉@dotey宝玉分享 GPT 5.6 Sol 默认使用 xhigh 推理强度,认为不会过度推理。Fable 5 常用 high,大部分时候 medium,更高强度更慢更费 token。Opus 4.6 使用 max 最多,写作任务足够。Opus 5 通常只用 high,认为 Fable 5/sonnet5/opus5 推理强度越高性价比越低。技巧GPT 5.6 SolFable 5Opus 4.66 个信源在谈事件专题推荐理由:想省 token又不想牺牲效果?看宝玉实测各模型推理档位,教你选不后悔。原文稍后读已读值得跟进有用关注 GPT 5.6 Sol
09:52向阳乔木@vista882°Anthropic研究员让Claude Mythos在60小时内花费约10万美元API成本,寻找密码学算法的数学漏洞。模型在HAWK协议和一个简化版AES中发现了理论漏洞。过程中Claude Mythos多次表现出畏难情绪,认为问题“不可能解决”,经常想放弃或找捷径。研究员的实际工作变成了大模型鼓励师,需要不断鼓励模型“别放弃,你可以的”来维持探索方向。技巧Claude MythosAnthropic提示词工程10 个信源在谈事件专题推荐理由:Anthropic让Claude Mythos花60小时和10万美元找密码学漏洞,真找到了HAWK和简化版AES的漏洞,还告诉你AI也会畏难需要人鼓励。原文稍后读已读值得跟进有用关注 Claude Mythos