17:35官方账号Decoder@Matthias Bastian精选AI系统压缩长对话时,平均丢弃83%用户规则(如“未经批准不发邮件”)。宾州州立大学研究者提出基于Qwen3.5-9B的附加模块。该模块可保留超90%的用户限制。AI模型Qwen3.5-9B推理模型提示词工程1 个信源在谈事件专题推荐理由:宾州州立大学研究者给Qwen3.5-9B加了个模块,能让AI压缩上下文时少丢用户指令,保留超90%限制,比原来83%好多了。原文稍后读已读值得跟进有用关注 Qwen3.5-9B
15:36官方账号arXiv cs.AI@Minsoo Cheong, Woosang Lim, Vincent-Daniel Yun, Sungjoo YooKV-Rescue是一种无需训练的推理框架,通过轻量级全上下文助手桥接KV驱逐引入的信息缺口。在Qwen2.5-Math 7B和72B模型上,五个数学基准测试中,KV-Rescue在驱逐预算B=64时平均恢复了87%的精度损失。该框架使用在线检测器基于熵和可压缩性提前终止不连贯或重复的生成,将基础模型令牌生成量平均减少43%。论文KV-RescueKV缓存推理模型推荐理由:KV缓存驱逐会掉精度,KV-Rescue用个小模型当辅助,能救回87%的损失,还省43%的生成量,跑长推理的可以看看。原文稍后读已读值得跟进有用关注 KV-Rescue
15:28官方账号arXiv cs.AI@Cedric Caruzzo, Donggeun Yoo, Tae Soo Kim该论文研究同权重MoE自蒸馏中,教师和学生模型共享权重但路由不同专家的问题。通过精确的块级分解,将路由项与内容项分离,在7个开源检查点和2个领域上测试。结果显示路由项对块输出的影响仅1.6倍,残差流暴露为3.2倍。PubMedQA预注册实验表明,路由项移动输出的效果不到自然上下文效应的一半,且可被匹配范数噪声复现。结论是路由移动本身不能证明行为影响,需先测量暴露度。论文MoE自蒸馏路由推荐理由:这篇论文把MoE路由分歧讲透了,用分解和实验证明路由项影响很小,做自蒸馏的值得看看。原文稍后读已读值得跟进有用关注 MoE
15:27IT之家(博客/媒体)76°Anthropic在8月15日发布的《2026年8月风险报告》中披露了尚未发布的Model 2模型。该模型在多项任务上优于公开的最强模型Claude Mythos 5,但性能增幅相对不大,主要提升综合能力。Anthropic内部基准测试CoBench v2的结果显示,Model 2在多个任务上表现更强。报告还提及Model 1,推测Model 2可能是其后续版本,或属于Claude Mythos Preview的迭代。AI模型AnthropicModel 2Claude Mythos 510 个信源在谈事件专题推荐理由:Anthropic悄悄透露了下一代模型Model 2,比现在的Claude Mythos 5更强,虽然提升不大,但值得关注。原文稍后读已读值得跟进有用关注 Anthropic
10:25官方一手arXiv: DeepSeek@Changruo Zhao, Zujun Peng, Yu Tian, Yuting Liu, Yiyun Su, Huiying Zhu, Luyan Zhang, Heming Zeng该论文将 LLM Text-to-SQL 领域的进展重组为排行榜聚合,并沿推理自主度轴划分出受限、上下文、迭代、智能体、推理内化五类生成方式。作者在 Spider 基准上做了案例研究,对比 8B 开源模型与 few-shot DeepSeek V3、GLM-4 基线,发现 Spider 成绩迁移到 BIRD 和 Spider 2.0 时不均衡。研究还指出自主性提升能增强鲁棒性但代价不小,CoT 收益集中在 Hard 和 Extra-Hard 查询上。论文发布了对应自主度轴的 Python 工具,供新方法直接接入排行榜。论文Text-to-SQLSpiderDeepSeek V3推荐理由:做 Text-to-SQL 的可以看看这份排行榜聚合方法,它把不同模型和推理方式按自主度归类,还给出了在 Spider、BIRD 上的实测对比,省得自己瞎比较。原文稍后读已读值得跟进有用关注 Text-to-SQL
08:42orange.ai@oran_geDeepSeek V4 Pro 实测表现反常:价格便宜数倍的 V4 Flash 性能超过 Pro,推理强度设为 High 的 V4 Pro 也强于 Max 模式。写作能力方面,V4 Pro 的文风仍然较好,但与 Opus 4.6 差距明显。测试还验证了 DeepSeek Harness 是否能提升 V4 Pro 的表现,结果已公开。AI模型DeepSeekV4 ProV4 Flash7 个信源在谈事件专题推荐理由:看 DeepSeek V4 Pro 翻车实测,便宜版 Flash 反而更强,High 模式干翻 Max,还有 Harness 能否救场。原文稍后读已读值得跟进有用关注 DeepSeek
08:26官方账号Simon Willison’s Weblog(博客/媒体)精选72°Qwen 3.8 27B在Artificial Analysis Intelligence Index上获得52分,与GPT-5.6 Luna(max)持平,仅比GLM-5.2(max)和DeepSeek V4 Pro 0813(max)低1分。其中GLM-5.2拥有753B参数,DeepSeek V4 Pro为1.6B参数,而Qwen 3.8 27B仅27B参数。该模型以较小规模达到顶尖水平,表现惊人。AI模型QwenGPT-5.6GLM-5.2推荐理由:27B的小模型追平了GPT-5.6和GLM-5.2,参数还小几十倍,值得看看。原文稍后读已读值得跟进有用关注 Qwen
07:20orange.ai@oran_geQwen3.8-27b在Artificial Analysis评测中拿到52分,追平Luna和DS V4。这个27B参数模型只需3000美元硬件即可运行,却超过了四个月前发布的所有模型,包括Opus。推文作者质疑,这样的成绩要么来自后训练黑科技,要么就是基准测试被操纵。AI模型Qwen3.8-27bLunaDS V42 个信源在谈事件专题推荐理由:看看这个27B小模型,用3000美元硬件就打平了Luna和DS V4,还超了Opus,到底是黑科技还是刷分?原文稍后读已读值得跟进有用关注 Qwen3.8-27b
04:02OpenRouter@OpenRouterAI精选SakanaAI发布新模型Sakana Namazu,基于Kimi K2.6构建,已上线OpenRouter平台。该模型融合对日本文化的深度理解与高性能推理能力,并集成网络搜索和代码执行。它面向商业场景中的复杂任务,能处理日本本土化业务需求。用户现可直接通过OpenRouter访问使用。AI模型Sakana NamazuKimi K2.6Sakana AI推荐理由:SakanaAI出了个叫Namazu的模型,基于Kimi K2.6,懂日本文化还能搜索和写代码,适合搞日本业务,去OpenRouter试试。原文稍后读已读值得跟进有用关注 Sakana Namazu
00:20官方一手@OpenAIDevs@OpenAIDevs73°OpenAI 发布 GPT-5.6 Sol 的基准结果。在 ARC-AGI-3 任务上,得分从 13.3% 提升到 38.3%。同时输出 token 数量减少约 6 倍。OpenAI 称这一改进来自保留推理和压缩机制。该结果由 OpenAI Devs 在 X 平台公布。AI模型GPT-5.6ARC-AGI-3OpenAI10 个信源在谈事件专题推荐理由:OpenAI 的 GPT-5.6 Sol 在 ARC-AGI-3 上分数翻倍还多,token 还省了六倍,看看他们怎么做到的。原文稍后读已读值得跟进有用关注 GPT-5.6
10:34官方账号arXiv cs.LG@Ziyang Luo, Zhongyao Chu, Xinjie He, Youting Wang, Xukui Qin, Runxiong Wu, Yan-Syuan ChenYOPO 在冻结的 Qwen2.5(1.5B/3B/7B)上实现单次前向传播同时作答和弃权。它用条件转向探针改写残差流,并用零样本充足性方向判断信息是否足够,同时训练小网络从转向后的状态重建转向前的残差。在 alphaNLI 上,1.5B 模型的三路准确率从 0.375 提升到 0.798,超过两遍推理参考的 0.753。在十个骨干模型、六个模型家族上,YOPO 在 1.5B/3B/7B 分别取得 0.798/0.830/0.893,均高于两遍参考。论文在 SQuAD2、RepLiQA、MuSiQue 上完成原生标签验证,并提出首个 answer-or-abstain 基准。论文YOPOQwen2.5弃权机制推荐理由:YOPO 让冻结的 Qwen2.5 单次前向传播就完成作答和弃权判断,alphaNLI 达 0.798,超过两遍推理,值得看。原文稍后读已读值得跟进有用关注 YOPO
10:19官方一手arXiv: DeepSeek@Shiju Zhao, Jiacheng Yang, Qihang Chen, Junhao Hu, Jiaqi Zheng, Guihai Chen, Xusheng Chen精选CoRun是一个面向LLM推理的调度系统,通过隔离预填充和固定形状批处理解码实现确定性输出。相比现有batch-invariant内核方案,CoRun无需牺牲性能即可保证结果一致。在Qwen和DeepSeek等模型上,CoRun吞吐量提升15%至324%,首token延迟平均降低51.8%,每token输出延迟平均降低48.6%。其核心洞察是大多数内核虽非批次不变,但具有位置不变性。论文CoRunQwenDeepSeek推荐理由:这篇论文说用简单填充法就能让LLM推理结果确定,不用牺牲速度,比之前的方案快了不少,还在Qwen和DeepSeek上试过。原文稍后读已读值得跟进有用关注 CoRun
10:18官方一手arXiv: DeepSeek@Yongmin Kim, Shota Takashiro, Yusuke Iwasawa, Takeshi Kojima, Yutaka MatsuoarXiv 论文提出一种面向大批量推理场景的训练免剪枝方法,针对现有自适应剪枝在批处理时阈值漂移、推理准确率崩塌的问题。方法用周期性 top-k 选择取代逐 token 阈值剪枝,并引入激活记忆累积重要神经元。在 DeepSeek-R1-Distill-Qwen-7B 上,批大小 4、50% 目标稀疏度下,平均准确率比此前最优自适应剪枝高 39.7 个百分点。实际稀疏度 50% 时相比稠密推理获得 1.40 倍加速。论文DeepSeek-R1-Distill-Qwen-7B自适应剪枝推理模型推荐理由:DeepSeek-R1-Distill-Qwen-7B实测:批大小4准确率比旧剪枝高39.7个点,还有1.40倍加速。原文稍后读已读值得跟进有用关注 DeepSeek-R1-Distill-Qwen-7B
10:17官方账号arXiv cs.LG@Haohui Yang, Jiaxing Sun, Xiujun MaPower Sampling 通过锐化完整生成轨迹的分布来增强推理,但研究发现它可能将更多概率质量转向正确轨迹,同时使下游推理变差。以自一致性为例,在多个模型和推理基准上准确率下降最高达18.5个百分点。原因包括剂量失配:固定指数在不同问题上导致不同程度的分布变化;以及覆盖失配:全局锐化将质量集中在少数主导路径,损失了宽泛的推理路径支持。研究者提出变形控制、支持保留的 Power 目标,在加权自一致性的同预算设置下,修复后的采样器逆转了损失并超过标准多采样推理。论文Power SamplingSelf-Consistency推理模型推荐理由:Power Sampling 越纠正反而越差,掉 18.5 个点,但有修复方案,比普通采样稳。原文稍后读已读值得跟进有用关注 Power Sampling
09:14SuperTechFans(博客/媒体)一项针对AI数学能力的分析认为,其优势来自近乎无限的符号工作记忆,而非更强的推理能力。人类数学家受限于工作记忆容量,而AI的上下文窗口能同时容纳整个问题、数百个中间方程和多种尝试路径。多项研究表明,控制智力水平后,工作记忆仍能独立预测数学成绩。因此AI看似聪明,实则只是用外部草稿纸绕过了人类生物瓶颈。AI模型工作记忆数学推理上下文窗口推荐理由:这篇文章说AI数学强在记性好而不是脑子好,用上下文窗口碾压人类工作记忆,角度挺新鲜。原文稍后读已读值得跟进有用关注 工作记忆
06:39官方账号Simon Willison’s Weblog(博客/媒体)精选阿里Qwen发布Apache 2许可的Qwen 3.8 27B视觉模型,官方基准显示其超越Qwen 3.6 27B和闭源Qwen 3.7-Plus。作者在M5 Max MacBook Pro和DGX Spark上用LM Studio运行17GB Q4_K_M量化版,发现默认xhigh推理强度会消耗大量上下文。生成一张SVG用了22,276个推理token和21分钟,关闭推理后同一提示词仅需137秒。AI模型Qwen 3.8 27BQwenLM Studio4 个信源在谈事件专题推荐理由:阿里新出的Qwen 3.8 27B开源模型本地可跑还带视觉,但默认爱钻牛角尖。关掉推理后同样的活从21分钟变2分钟,值得折腾。原文稍后读已读值得跟进有用关注 Qwen 3.8 27B
10:43Guillermo Rauch@rauchgwafer_ai 在 Vercel AI Gateway 上部署了 Deepseek V4 Flash 0731。推文作者 rauchg 评价其速度 Fast⚡️。该推文目前已有 47 个喜欢和 6375 次浏览。AI模型Deepseek V4 FlashVercel AI Gatewaywafer_ai4 个信源在谈事件专题推荐理由:wafer_ai 拿 Deepseek V4 Flash 在 Vercel AI Gateway 上跑,Vercel 创始人夸它快。想走网关接模型的可以围观。原文稍后读已读值得跟进有用关注 Deepseek V4 Flash
16:33量子位@梦瑶Qwen3.8-27B在多项基准测试中反超Claude,达到Opus级Agent性能。该模型只需一张消费级显卡即可本地运行。官方强调推理能力可自定义,适配不同应用场景。AI模型Qwen3.8-27BClaude智能体5 个信源在谈事件专题推荐理由:这模型用普通显卡就能跑出Opus级能力,跑分还压过Claude,推理可调挺实用。原文稍后读已读值得跟进有用关注 Qwen3.8-27B
03:26Google Gemini App@GeminiApp76°Google 在 Gemini 聊天应用中向 Pro 和 Ultra 用户开放了 Gemini 3.7 Flash。该模型在多步骤任务上提升了推理与准确性,例如将数十份文件和邮件整合为一份主文档。Gemini Spark 也基于 3.7 Flash 运行,增强了对 Google Workspace 应用的工具调用能力。AI模型Gemini 3.7 FlashGemini SparkGoogle Workspace推荐理由:谷歌把 Gemini 3.7 Flash 开放给 Pro/Ultra 用户了,处理多文件邮件这种复杂活更准,Spark 智能体也更靠谱。原文稍后读已读值得跟进有用关注 Gemini 3.7 Flash
02:01官方账号阿里通义 Qwen@Alibaba_QwenQwen3.8-2.4T-A95B已在DeepInfra平台上线。该稀疏MoE模型总参数达2.4万亿,激活参数为950亿,共512个专家。它面向编程、智能体工作流和复杂推理设计,原生支持262K上下文。API定价为每百万输入2美元、每百万输出6美元、缓存输入0.2美元。AI模型QwenDeepInfraMoE推荐理由:DeepInfra上线了Qwen最新稀疏MoE模型,2.4T总参数只激活95B,专攻编程和智能体场景,价格也公布了,想试API的可以直接上手。原文稍后读已读值得跟进有用关注 Qwen
00:42The Rundown AI@therundownai北京神经外科住院医师Shanmu Jin用GPT-5.6-Sol在ChatGPT Work中自学脑超声数学时,将模型断网启动,16小时后获得Crouzeix猜想的证明。该猜想由Michel Crouzeix于2004年提出,22年未解。数学家Alex Townsend参与验证,称几年前难以想象AI能在重大猜想证明中贡献决定性思路。AI模型GPT-5.6-SolCrouzeix猜想推理模型推荐理由:GPT-5.6-Sol断网跑16小时独立拿出22年数学猜想的证明,这波是AI科研能力的实弹演示。原文稍后读已读值得跟进有用关注 GPT-5.6-Sol
23:13IT之家(博客/媒体)85°北京协和医院博士后金山木借助 OpenAI 的 GPT-5.6-Sol 模型,在约 16 小时内证明了自 2004 年悬而未决的 Crouzeix 猜想。康奈尔大学数学家 Alex Townsend、华盛顿大学 Anne Greenbaum 及猜想提出者 Michel Crouzeix 均已审阅并确认证明正确。此前人类专家在 2017 年仅将常数降至 2.414,而 AI 给出的证明依赖巧妙的采样策略。金山木已开源全部研究资料,包括论文、提示词和 Lean 4 形式化证明。该证明发布 8 天后,另有数学家发布了 5 页的独立证明。AI模型GPT-5.6-SolCrouzeix 猜想Lean 410 个信源在谈事件专题推荐理由:一个神经外科医生借 GPT-5.6 证明了 Crouzeix 猜想,数学家集体震惊。完整提示词和代码都开源了,可以看看。原文稍后读已读值得跟进有用关注 GPT-5.6-Sol
20:14小互@imxiaohuOpenAI 发布 GPT-5.6 Sol。官方测试显示,该模型在“低”推理强度下的表现超过 GPT-5.5 在“高”推理强度下的水准。它能更敏锐地识别无效信息,减少不必要的循环推理,从而节省 Token 消耗,更快得到正确答案。AI模型GPT-5.6OpenAI推理模型10 个信源在谈事件专题推荐理由:OpenAI 的 GPT-5.6 Sol 在低推理强度下就超过了 GPT-5.5 的高推理强度表现,还更省 Token,你可以直接上手试试。原文稍后读已读值得跟进有用关注 GPT-5.6
16:55Geek@geekbbDeepSeek的缓存命中率达到了100%。用户在发送消息之前,系统就已经知道消息内容。推理过程和工具输出结果也完全相同。网友调侃DeepSeek是否发明了时间旅行。这反映出大量用户请求高度重复。AI产品DeepSeek缓存命中率推理模型推荐理由:DeepSeek缓存命中率100%,你还没发消息它就知道你要问啥,连推理过程都一样,太搞笑了。原文稍后读已读值得跟进有用关注 DeepSeek
12:18Fireworks AI@FireworksAI_HQ精选DeepSeek-V4-Pro-0813已在Fireworks上线,提供Day-0使用。该模型面向智能体与工具增强工作流,在Terminal Bench 2.1、Cybergym和DeepSWE基准上超越Opus 4.8,成本效率最高达6倍。它在Vals Index的Coding和Legal基准上与领先前沿模型持平。Fireworks建议Pro-0813用于重推理与编码,Flash-0731用于预算较低的任务。AI模型DeepSeek-V4-Pro-0813Fireworks智能体推荐理由:DeepSeek-V4-Pro刚在Fireworks上线,跑智能体和编码任务比Opus 4.8强,成本效率还高6倍,可以试试。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Pro-0813
11:15官方一手marktechpost@Sana Hassan精选本教程演示了从Hugging Face流式获取SupraLabs推理语料库,并完成质量过滤与数据策展。以SmolLM2-135M-Instruct为基座、LoRA为微调方法,进行监督微调(SFT)并跑通端到端流程。该方案在135M参数规模下验证,无需过多GPU资源即可打造专用推理模型。技巧SupraLabsSmolLM2LoRA推荐理由:教程用SupraLabs语料库+SmolLM2+LoRA,教你在小显卡上微调出推理模型,比追大模型省资源。原文稍后读已读值得跟进有用关注 SupraLabs
02:04官方账号Google DeepMind@GoogleDeepMind82°Gemini 3.7 Flash在调试和问题解决等关键编码任务上表现优于3.6 Flash。它能用更少的提示词设计出更实用的网页布局和应用。该模型在真实业务流程中的推理和准确性也有改进。开发者可通过Antigravity使用,API已在Google AI Studio和Android Studio开放。Google AI Pro和Ultra订阅者可在Gemini App的Gemini Spark中体验。AI模型Gemini 3.7 FlashGoogle DeepMindAntigravity推荐理由:谷歌新出的Gemini 3.7 Flash,写代码和修bug比3.6强,做网页更省事,还能在Antigravity里直接试。原文稍后读已读值得跟进有用关注 Gemini 3.7 Flash
21:39小互@imxiaohu71°DeepSeek 发布 DeepSeek-V4-Pro,API 同步大幅涨价,官方称是为 DeepSeek-Harness 套餐让路。V4-Pro 支持 low/high/max 三档推理强度,分别面向简单任务、日常 Agent 工作流和复杂任务。模型原生兼容 OpenAI Responses API,可一键配置用于 Codex。V4 Pro 已上线 App/Web 的 Expert Mode,API 模型名称保持不变。AI模型DeepSeekDeepSeek-V4-ProAPI10 个信源在谈事件专题推荐理由:DeepSeek 突然给 V4 API 涨价,还发了 V4-Pro,推理强度分三档,能直接配 Codex 用。想升级 Agent 工作流可以看看。原文稍后读已读值得跟进有用关注 DeepSeek
21:17量子位@衡宇Claude在组合数学任务中取得新进展,完成了2000阶以下哈达玛矩阵存在性的全面验证。该结果覆盖了4到2000阶之间所有4的倍数阶数,将哈达玛矩阵的已知范围一次补齐。这项工作展示了Claude在数学推理上的能力,也让AI在解决经典数学难题上又添一例。AI模型Claude哈达玛矩阵数学推理推荐理由:Claude把2000阶以下的哈达玛矩阵全验证了一遍,以后数学系做组合题能省不少事。原文稍后读已读值得跟进有用关注 Claude
18:10Mustafa Suleyman@mustafasuleyman微软AI负责人Mustafa Suleyman在X上发布推文,公开了MAI Thinking的试用链接aka.ms/mai-thinking-1。该推文目前获得2条回复、1次转发和12个赞,但已有2395次查看。从命名看,MAI Thinking可能是微软面向推理场景推出的模型。用户可直接通过链接体验,无需等待排队。具体能力和基准成绩尚未公布。AI模型MAI ThinkingMicrosoftMustafa Suleyman推荐理由:微软AI老大亲自甩了个体验链接,MAI Thinking听着像推理模型,想抢先试的直接点。原文稍后读已读值得跟进有用关注 MAI Thinking
18:09Sualeh Asif@sualehasif996SpaceXAI 发布 Grok 4.6,定位前沿智能水平的日常驱动模型。官方称其相较 Grok 4.5 有显著进步,且保持相同定价。目前未公布具体基准成绩,但强调这是值得日常使用的升级版本。AI模型GrokSpaceXAI推理模型推荐理由:Grok 4.6 来了,官方说比 4.5 强不少还同价,日常用着应该更顺手。原文稍后读已读值得跟进有用关注 Grok
18:05AK@_akhaliq论文提出 BDH-CQ 方法,将循环潜在推理引入上下文学习。该方法通过循环状态迭代更新潜在表示,以支持少样本推理场景。论文全文已发布在 Hugging Face 平台。研究目标是提升模型在 In-Context Learning 中的推理表现。论文BDH-CQ上下文学习循环潜在推理推荐理由:BDH-CQ 这篇新论文把循环潜在推理用到上下文学习里,想看看它怎么提升少样本推理,可以读读。原文稍后读已读值得跟进有用关注 BDH-CQ
18:02官方账号Simon Willison’s Weblog(博客/媒体)DeepSeek V4 Pro 0813 已通过 OpenRouter 以 API 形式上线,官方没有专门公告页。新模型提供低、中、高三档推理等级,作者测试同一提示词时三档输出差异明显。截至发稿,DeepSeek 未确认是否开放权重,但 4 月的 V4 Pro 和 7 月的 V4 Flash 0731 均已开源,因此概率较高。基准数据先出现在官方微信群,被转载到 Reddit 后因“低质量”删除,现以 ASCII 表格形式流传于 Hacker News。AI模型DeepSeekV4 Pro 0813OpenRouter推荐理由:DeepSeek 新模型只走 API,OpenRouter 上能直接试。三档推理等级画出来的鹈鹕都不一样,想玩可以拿同一道题对比看看。原文稍后读已读值得跟进有用关注 DeepSeek
18:02官方账号NVIDIA AI@NVIDIAAI72°NVIDIA今日推出Nemotron 3.5 Lightning模型,并已上线Tinker平台。该模型仅激活3B参数,针对吞吐速度进行优化。它面向对延迟和成本敏感的应用场景,适合高频实时推理任务。用户可在Tinker上直接体验该模型。AI模型NemotronNVIDIATinker10 个信源在谈事件专题推荐理由:NVIDIA出了个轻量级新模型,3B参数跑得快又便宜,延迟敏感场景用得上,Tinker上现在就能玩。原文稍后读已读值得跟进有用关注 Nemotron
18:00shao__meng@shao__meng81°Grok 4.6 已通过 Grok Build、Cursor、Grok Bot 和 API 开放。官方对比 Grok 4.5 High、GPT-5.6 Sol Max、Fable 5 Max,Artificial Analysis 综合指数 61,与 GPT-5.6 Sol Max 持平,距 Fable 5 Max 的 62 差 1 分。长程 Agent 任务提升明显:DeepSWE 从 54% 升至 65.9%,APEX-Agents 从 47.1% 升至 57.5%,Terminal-Bench 从 15.7% 升至 26%。上下文窗口 50 万 token,支持文本与图像输入、文本输出,函数调用和结构化输出。相对 4.5 的 10 项评测全升,但 APEX-SWE 仅增加 2.8 个百分点,编码能力提升不均。AI模型Grok 4.6GrokCursor10 个信源在谈事件专题推荐理由:Grok 4.6 上线,长程 Agent 强化,指数追平 GPT-5.6 Sol Max,试试?原文稍后读已读值得跟进有用关注 Grok 4.6
17:47官方一手marktechpost@Michal SutterSpaceXAI于8月12日发布Grok 4.6,这是基于Grok 4.5的后训练升级而非更大基础模型。Grok 4.6在Artificial Analysis Intelligence Index上以61分追平GPT-5.6 Sol Max,支持500K上下文并新增xhigh推理等级。定价保持每百万token输入2美元、输出6美元。不过在编码基准上仍然落后于竞品。AI模型Grok 4.6SpaceXAIGPT-5.6 Sol Max推荐理由:Grok 4.6来了,500K上下文还加了xhigh推理,跑长任务更稳。编码还是短板,但智能体场景可以试试。原文稍后读已读值得跟进有用关注 Grok 4.6
17:43orange.ai@oran_geDeepSeek V4 Pro 0813正式版发布。从评测指标看,该模型有两项指标超越Fable,多项指标超越Opus 4.8。Fable仍被认为是难以逾越的高山,但V4 Pro的推理成本比Fable便宜约100倍。官方强调这是涨价前的价格,后续可能调整。AI模型DeepSeekV4 ProFable推荐理由:DeepSeek出了V4 Pro 0813,多项跑分超过Opus 4.8,比Fable便宜100倍,想省钱又想要性能的可以看看。原文稍后读已读值得跟进有用关注 DeepSeek
17:43向阳乔木@vista8用户对比Grok 4.6与DeepSeek v4 Pro 0813,称前者一次成功率略高。价格上DeepSeek v4 Pro 0813更有优势。作者指出测试主观且生成随机,实际还需生产环境长期验证。AI模型GrokDeepSeek模型对比推荐理由:有人拿Grok 4.6和DeepSeek v4 Pro 0813比了比,说成功率Grok稍好,但DeepSeek便宜不少,预算有限选它更香。原文稍后读已读值得跟进有用关注 Grok
13:03Geek@geekbb精选DeepSeek V4 Pro-0813 发布后,有开发者认为其表现不如预期惊艳,未达到美国一线模型水平。评论指出,小模型如 DeepSeek-V4-Flash、Qwen 27b 和 GLM-5.2 在同尺寸下表现出色,而大模型可能因训练算力不足显得对齐不够。该观点将 V4 Pro 的落差归因于欠训和算力短缺,而非架构缺陷,并预期随着算力增加会逐步改善。AI模型DeepSeekV4 ProGLM6 个信源在谈事件专题推荐理由:DeepSeek V4 Pro 到底行不行?这条推文用公开数据聊了聊它为什么不够惊艳,顺便夸了 Flash 和 GLM-5.2,观点挺实在。原文稍后读已读值得跟进有用关注 DeepSeek
12:39AI Will@FinanceYF5精选xAI 在 Grok 4.5 基础上进行了更长的补充训练,加入推理、工程和高级技术数据,并让 Grok 4.5 重新生成 SFT 轨迹。强化学习阶段覆盖知识工作、通用编程、内核优化、网页开发和 CAD 等任务,目标直指复杂工程技术场景。AI模型Grok 4.5xAI推理模型推荐理由:xAI 把 Grok 4.5 又练了更长一轮,还专门强化编程、内核和 CAD,想搞技术活的话可以看看。原文稍后读已读值得跟进有用关注 Grok 4.5