8月18日
17:35
17:35官方账号Decoder@Matthias Bastian
精选
AI系统压缩长对话时,平均丢弃83%用户规则(如“未经批准不发邮件”)。宾州州立大学研究者提出基于Qwen3.5-9B的附加模块。该模块可保留超90%的用户限制。
事件专题

推荐理由:宾州州立大学研究者给Qwen3.5-9B加了个模块,能让AI压缩上下文时少丢用户指令,保留超90%限制,比原来83%好多了。
15:36
15:36官方账号arXiv cs.AI@Minsoo Cheong, Woosang Lim, Vincent-Daniel Yun, Sungjoo Yoo
KV-Rescue是一种无需训练的推理框架,通过轻量级全上下文助手桥接KV驱逐引入的信息缺口。在Qwen2.5-Math 7B和72B模型上,五个数学基准测试中,KV-Rescue在驱逐预算B=64时平均恢复了87%的精度损失。该框架使用在线检测器基于熵和可压缩性提前终止不连贯或重复的生成,将基础模型令牌生成量平均减少43%。
推荐理由:KV缓存驱逐会掉精度,KV-Rescue用个小模型当辅助,能救回87%的损失,还省43%的生成量,跑长推理的可以看看。
07:20
00:20
00:20官方一手@OpenAIDevs@OpenAIDevs
73°
OpenAI 发布 GPT-5.6 Sol 的基准结果。在 ARC-AGI-3 任务上,得分从 13.3% 提升到 38.3%。同时输出 token 数量减少约 6 倍。OpenAI 称这一改进来自保留推理和压缩机制。该结果由 OpenAI Devs 在 X 平台公布。
事件专题

推荐理由:OpenAI 的 GPT-5.6 Sol 在 ARC-AGI-3 上分数翻倍还多,token 还省了六倍,看看他们怎么做到的。
8月17日
10:19
10:19官方一手arXiv: DeepSeek@Shiju Zhao, Jiacheng Yang, Qihang Chen, Junhao Hu, Jiaqi Zheng, Guihai Chen, Xusheng Chen
精选
CoRun是一个面向LLM推理的调度系统,通过隔离预填充和固定形状批处理解码实现确定性输出。相比现有batch-invariant内核方案,CoRun无需牺牲性能即可保证结果一致。在Qwen和DeepSeek等模型上,CoRun吞吐量提升15%至324%,首token延迟平均降低51.8%,每token输出延迟平均降低48.6%。其核心洞察是大多数内核虽非批次不变,但具有位置不变性。
推荐理由:这篇论文说用简单填充法就能让LLM推理结果确定,不用牺牲速度,比之前的方案快了不少,还在Qwen和DeepSeek上试过。
06:39
06:39官方账号Simon Willison’s Weblog博客/媒体
精选
阿里Qwen发布Apache 2许可的Qwen 3.8 27B视觉模型,官方基准显示其超越Qwen 3.6 27B和闭源Qwen 3.7-Plus。作者在M5 Max MacBook Pro和DGX Spark上用LM Studio运行17GB Q4_K_M量化版,发现默认xhigh推理强度会消耗大量上下文。生成一张SVG用了22,276个推理token和21分钟,关闭推理后同一提示词仅需137秒。
事件专题

推荐理由:阿里新出的Qwen 3.8 27B开源模型本地可跑还带视觉,但默认爱钻牛角尖。关掉推理后同样的活从21分钟变2分钟,值得折腾。
8月16日
10:43
8月15日
16:33
03:26
02:01
02:01官方账号阿里通义 Qwen@Alibaba_Qwen
Qwen3.8-2.4T-A95B已在DeepInfra平台上线。该稀疏MoE模型总参数达2.4万亿,激活参数为950亿,共512个专家。它面向编程、智能体工作流和复杂推理设计,原生支持262K上下文。API定价为每百万输入2美元、每百万输出6美元、缓存输入0.2美元。
推荐理由:DeepInfra上线了Qwen最新稀疏MoE模型,2.4T总参数只激活95B,专攻编程和智能体场景,价格也公布了,想试API的可以直接上手。
8月14日
20:14
20:14小互@imxiaohu
OpenAI 发布 GPT-5.6 Sol。官方测试显示,该模型在“低”推理强度下的表现超过 GPT-5.5 在“高”推理强度下的水准。它能更敏锐地识别无效信息,减少不必要的循环推理,从而节省 Token 消耗,更快得到正确答案。
事件专题

推荐理由:OpenAI 的 GPT-5.6 Sol 在低推理强度下就超过了 GPT-5.5 的高推理强度表现,还更省 Token,你可以直接上手试试。
8月13日
18:09
18:02
18:02官方账号NVIDIA AI@NVIDIAAI
72°
NVIDIA今日推出Nemotron 3.5 Lightning模型,并已上线Tinker平台。该模型仅激活3B参数,针对吞吐速度进行优化。它面向对延迟和成本敏感的应用场景,适合高频实时推理任务。用户可在Tinker上直接体验该模型。
事件专题

推荐理由:NVIDIA出了个轻量级新模型,3B参数跑得快又便宜,延迟敏感场景用得上,Tinker上现在就能玩。
17:43
17:43