11:16AI Engineer@aiDotEngineer71°Qwen 27B在RTX 3090上超过了21个月前发布的Llama 405B。GLM 5.2通过保护超权重,从1.5TB压缩到250GB。Cognition用前沿模型规划、廉价模型执行,将Fable级智能成本降低40%。OpenRouter的自动路由在两年后因openclaw的十分钟心跳找到用途。EXO Labs与NVIDIA合作三周,让DGX Spark提速10倍。AI模型QwenLlamaGLM 5.24 个信源在谈事件专题推荐理由:本地AI真的起来了,27B的Qwen能打赢405B的Llama,GLM 5.2还能压到250GB,普通显卡就能跑。原文稍后读已读值得跟进有用关注 Qwen
08:41IT之家(博客/媒体)精选AMD 于 8 月 7 日公告计划收购 AI 推理芯片初创公司 Taalas。Taalas 的芯片针对单一 AI 模型定制,基于 Meta 的 Llama 3.1 模型,采用台积电成熟工艺和高速 SRAM,特定模型输出速度比传统 GPU 快数千倍。该方案牺牲通用性以换取更低成本和更高速度,且芯片绑定特定模型无法升级。Taalas CEO 称其平台可将任意 AI 模型转化为定制硅片,并能在 2 个月内完成新模型适配。Taalas 自 2023 年成立以来累计融资 2.19 亿美元,交易规模未披露。行业TaalasAMD收购推荐理由:AMD 要收购 Taalas,这家公司做定制 AI 推理芯片,比 GPU 快几千倍,但绑定单个模型,适合想了解 AI 芯片新路线的人。原文稍后读已读值得跟进有用关注 Taalas
11:10官方账号arXiv cs.AI@Carlos Celemin, Benedict Wilkins, Adrián Barahona-Ríos, Saman Zadtootaghaj, Nabajeet Barman该研究探索了视觉语言模型(VLMs)在基于agent的游戏QA管道中检测几何裁剪异常。自定义探索agent收集视觉数据,自动标注管道提供帧级标签。零样本设置下测试了Gemini、GPT、Qwen、Gemma、Llama和Ministral六种VLM及四种提示变体。Gemini-3.1-Flash在总体准确率和提示鲁棒性上表现最佳,开源模型则对提示设计敏感。当前VLMs更适合作为多阶段QA管道中的高召回候选过滤器。论文GeminiGPTQwen推荐理由:这篇论文用六种VLM检测游戏里的几何裁剪bug,发现Gemini最稳,开源模型要看怎么问提示词。想了解VLM实际落地坑点的可以看看。原文稍后读已读值得跟进有用关注 Gemini
23:18IT之家(博客/媒体)Meta 宣布将于 2026 年 7 月 6 日正式下线 Llama API 公共预览版,该服务自发布以来一直处于公开预览阶段。下线后所有 API 请求将返回停用提示和重定向指引。Llama 模型本身不受影响,用户仍可通过 Meta 官方页面下载。Meta 建议用户迁移至支持 Llama 模型的第三方提供商,并计划未来提供使用 Meta AI 模型开发的新途径。行业Llama APIMetaLlama推荐理由:Meta 的 Llama API 要关了,但模型还能自己下,赶紧看看迁移方案吧原文稍后读已读值得跟进有用关注 Llama API
09:46官方一手arXiv: DeepSeek@Gabriel Hurtado精选该论文提出一种无需阈值的审计方法,结合两种内部信号——参考锚定的激活拒绝间隙与基础到候选权重的恢复能量——来检测开放权重检查点是否被剥离拒绝机制。在包含Qwen、DeepSeek-distilled Qwen、Llama和Gemma的273个检查点注册表上,两个信号的z-sum分离了57个公开的abliterations与37个良性微调、合并和指令微调,AUROC达到0.95,显著高于任一单独信号(0.84和0.90)。经Youden校准的阈值在留出族上达到平衡准确率0.89(FPR 0.11),仅漏掉57个中的4个。论文还映射了两种失败模式:伪造参考可无训练规避两个信号,白盒所有者可训练出超过阈值但仍不安全且连贯的检查点。论文QwenDeepSeekLlama推荐理由:想知道模型有没有被偷偷去掉安全护栏?这篇论文用两个内部信号在273个模型上做到95%的准确率,比单信号靠谱多了。原文稍后读已读值得跟进有用关注 Qwen
23:26官方账号Latent Space (swyx)@Brandon Anderson精选前Meta Llama负责人Evan Feinberg与Sergey Edunov创立Genesis Molecular AI,将扩散模型应用于药物发现。其模型PEARL在OpenBind基准上实现零样本分子对接,无需训练即可预测蛋白质-配体结合构象。同时,共折叠技术(co-folding)首次越过准确度阈值,使AI能同时预测分子与受体的三维结合状态。这标志着扩散模型在生物学领域超越了传统LLM的应用边界。AI模型Genesis Molecular AILlamaPEARL推荐理由:前Llama老大跑去做药了,他们用扩散模型搞的PEARL在OpenBind零样本赢了,共折叠也终于过了门槛。想了解AI怎么设计新药的可以看这个。原文稍后读已读值得跟进有用关注 Genesis Molecular AI
11:05官方账号arXiv cs.LG@Philippe Chlenski, Zachariah Carmichael, Ayush Warikoo, Chia-Tse Shao, Yingxiao Ye, Aobo Yang, Vivek Miglani, Nehal Bandi该论文研究使用开放语言模型(如Llama、Qwen)解释封闭API模型(如GPT、Gemini)时的可靠性问题。在11个模型上的实验表明,预测层面的保真度(log-odds一致性)远高于归因层面的保真度(leave-one-out重要性)。存在访问-效度反转:白盒信号(如注意力模式)虽稳定但无法预测因果归因,而黑盒输入消融能直接捕捉归因。论文警告,仅凭预测一致性不足以证明机械可解释性可从开放模型迁移到封闭模型。论文LlamaQwenGPT推荐理由:想用开源模型解释GPT?这篇论文告诉你预测一致不代表归因一致,小心踩坑。原文稍后读已读值得跟进有用关注 Llama
03:05@koltregaskes@koltregaskes精选前沿模型成本上升、令牌使用量攀升以及近期禁令,使企业自建AI变得更加必要。通过下载Llama或Qwen等开源模型,使用LoRA在自有数据上微调,部署在自有基础设施,可一次性计算成本取代按席收费。Hugging Face和LoRA已降低技术门槛,关键在于管理层是否将其视为基础设施投资而非普通软件开支。行业LlamaQwenLoRA推荐理由:前沿模型越来越贵还被禁,自己微调Llama或Qwen更可控,一次性投入省月费,数据也安全。原文稍后读已读值得跟进有用关注 Llama
09:31官方一手arXiv: DeepSeek@Siyue Chen, Yifu Guo, Yuquan Lu, Zishan Xu, Jiaye Lin, Jianbo Lin, Siyu Zhang, Cheng Yang, Junxin Li, Yujia Li, Yu Huo, Ruixuan Wang该论文提出了LLM代码推理的内部生命周期概念:模型先在早期层中酝酿答案,使其线性可解,然后在后期层分化为四种解析结果——已解析、过度处理、错误解析、未解析。研究对Qwen、Llama、DeepSeek三个架构的16个模型进行了6类代码推理任务的层析探针和上下文剥离解码(CSD)实验。结果显示已解析平均仅41.5%,且函数调用任务中,调用深度从1层增至3层时已解析率从61.1%骤降至2.5%。所有模型的酝酿持续时长稳定在24%-42%,但解析成功率随模型能力和规模变化。论文代码推理QwenLlama推荐理由:这篇论文用层析探针找到了LLM做代码推理时“酝酿”到“解析”的秘密,发现即便准确率相近,内部失败模式也截然不同,值得想理解推理本质的人读。原文稍后读已读值得跟进有用关注 代码推理
20:16官方账号vLLM@vllm_project精选73°vLLM v0.23.0 包含 408 次提交,来自 200 位贡献者(63 位新贡献者)。主要亮点:DeepSeek-V4 在多个后端上成熟,引入 TRTLLM-gen attention 内核、与 V3.2 解耦的稀疏 MLA 以及用于 Mega-MoE 的 EPLB 调度。Model Runner V2 现已成为 Llama 和 Mistral 稠密模型的默认运行器。新增 Gemma 4 Unified(无编码器)及 MTP 支持。还提供了多层级 KV 缓存卸载(含对象存储层)和统一的推理与工具调用解析器。AI产品vLLMDeepSeek-V4Llama4 个信源在谈事件专题推荐理由:vLLM v0.23.0 大更新,DeepSeek-V4 和 Llama 用户值得升级,新的 KV 缓存卸载能省显存,推理与工具调用解析也更顺了。原文稍后读已读值得跟进有用关注 vLLM
06:12Gary Marcus@GaryMarcusGary Marcus在X上发文指出,扎克伯格和LeCun单方面决定开源Llama模型,可能部分催化了中国AI产业的发展,并对美国商业利益造成巨大损害。他引用nxthompson的数据显示,自今年年初以来,美国AI初创公司正显著转向使用中国模型。这一趋势引发了关于开源策略对地缘政治和产业竞争影响的讨论。Marcus认为,现在开始看到这些决策的后果。行业开源/仓库Llama中国AI推荐理由:开源策略如何影响全球AI竞争格局?关注地缘政治与商业利益的开发者、政策研究者,值得看看这个观点引发的讨论。原文稍后读已读值得跟进有用关注 开源/仓库
12:08官方账号arXiv cs.AI@Senmiao Wang, Tiantian Fang, Haoran Zhang, Yushun Zhang, Kunxiang Zhao, Alex Schwing, Ruoyu Sun精选研究人员提出了一种名为PC Layer(Preconditioning Layer)的权重参数化方法,通过在训练过程中对权重矩阵进行低阶多项式预处理,稳定其奇异值谱,从而改善大型语言模型(LLM)的预训练效果。该方法与AdamW和Muon优化器兼容,在Llama-1B模型上验证了其优于标准Transformer架构。训练后,预处理权重可合并回原始架构,不增加推理开销。理论证明,均匀限制每层奇异值能确保梯度下降在深层线性网络中收敛到全局最小值。代码已开源。论文预训练权重预处理奇异值谱推荐理由:这项研究解决了LLM训练中权重矩阵病态条件数导致的收敛不稳定问题,做预训练优化的团队可以直接在Llama等模型上尝试,无需额外推理成本。原文稍后读已读值得跟进有用关注 预训练
10:10官方一手arXiv: DeepSeek@Libo Sun, Po-wei Harn, Peixiong He, Xiao Qin精选该研究系统评估了七种KV缓存压缩机制在数学推理任务上的表现,发现所有现有方法在小预算下均被拒绝。作者提出一种名为α的简单修改,通过引入多样性惩罚项替代传统argmax-top-k选择,在Qwen-7B和Llama-8B模型上,在64和128预算下,α在两项测试中显著优于基线。该发现表明,最小化的评分修改比复杂的结构重设计更有效,且严格的实验协议使这一不对称性得以显现。论文KV缓存压缩推理模型数学推理推荐理由:KV缓存压缩是长上下文推理的关键瓶颈,做LLM推理优化的开发者可以直接参考α方法——它用一行修改就打败了七种复杂方案,值得在自家模型上试试。原文稍后读已读值得跟进有用关注 KV缓存压缩