精选 AI 资讯 · AI 热点

6月28日

01:25

01:25

宝玉@dotey

精选

Codex 和 Claude Code 的上下文压缩功能结合 Prompt Caching，使得在单个 Session 内持续对话的成本压力显著降低。用户可以通过 fork 功能从对话的某个位置创建分支，只保留之前的历史记录，使上下文更纯粹。/btw 或 /side 命令允许在不影响当前任务上下文的情况下提问，例如在 plan 模式下用 /btw 详细解释选项含义。VB 提到自 GPT 5.3 Codex 以来，他不再担心上下文问题，且 Codex 的支线线程功能非常出色。

技巧 Codex Claude Code Prompt Caching 上下文压缩编程助手

推荐理由：如果你用 Codex 或 Claude Code 做长任务，这个技巧能省下不少 token 费用，fork 和 /btw 命令特别实用。

6月11日

15:28

AITOP6月11日 15:28

1107 vs 303：谷歌悄悄开源了一个“拆打字机”的模型，把大模型速度翻了4倍

15:23

AITOP6月11日 15:23

DiffusionGemma颠覆文本生成？自回归模型的“统治”要结束了

15:07

AITOP6月11日 15:07

每秒1107个token，Google开源的扩散模型为什么能改变本地推理格局？

12:09

12:09

arXiv cs.LG@Yeongseo Jung, Jaehyeok Kim, Eunseo Jung, Jiachuan Wang, Yongqi Zhang, Ka Chun Cheung, Simon See, Lei Chen

精选

现有对话模型在长对话中因历史累积导致计算冗余和注意力分散，简单截断或摘要会损失信息。研究者提出 C-DIC（Context-Driven Incremental Compression），将对话拆分为可修订的上下文线程，存储紧凑的对话记忆，并通过轻量级检索-修订-回写机制跨轮共享信息、更新过时记忆。该方法还适配了截断反向传播（TBPTT）来学习跨轮依赖，无需完整历史反向传播。实验表明，C-DIC 在数百轮对话中保持稳定的推理延迟和困惑度，为高质量长对话建模提供了可扩展路径。

论文对话系统上下文压缩长对话增量学习 C-DIC

推荐理由：长对话场景（如客服、角色扮演）的开发者终于有了一个兼顾效率与保真度的压缩方案——C-DIC 能稳定处理数百轮对话，值得在长上下文任务中试试。

6月9日

11:03

11:03

arXiv cs.AI@Ang Li, Sean McLeish, Haozhe Chen, Nimit Kalra, Zaiqian Chen, Artem Gazizov, Venkata Anoop Suhas Kumar Morisetty, Bhavya Kailkhura, Harshitha Menon, Zhuang Liu, Brian R. Bartoldson, Tom Goldstein, Sanae Lotfi, Micah Goldblum, Pavel Izmailov

精选

长上下文语言模型推理受限于内存，KV缓存随上下文长度增长。现有压缩方法要么降低模型质量，要么需要大量计算。本文提出Latent Context Language Models (LCLMs)，一种编码器-解码器压缩器，通过架构搜索和预训练350B+ tokens，实现1:4、1:8、1:16压缩比。LCLMs在通用任务性能、压缩速度和峰值内存使用上均优于现有方法，并可作为长时智能体的高效骨干，支持自适应扩展相关片段。

论文上下文压缩 KV缓存长上下文推理编码器-解码器 LCLM

推荐理由：长上下文推理的内存瓶颈终于有了一个兼顾质量与速度的解法，做LLM推理优化或长时智能体的开发者值得关注，LCLM的压缩方案可以直接用于生产环境。

6月1日

00:09

AITOP6月1日 00:09

OpenAI 发起“Codex for Open Source”：免费赠送 6 个月 Pro 订阅，开源维护者能否迎来 AI 变革？

5月29日

08:02

AITOP5月29日 08:02

Opus 4.8发布：编程助手的“静默时刻”，是解放开发者，还是新门槛？🔥Anthropic 把 AI 编程的“确认键”彻底删掉了！Claude Code 搭载全新 Opus 4.8 模型，长时间任务不跑偏、不废话、不中断，像一个资深工程师一样默默干活，从功能开发到漏洞清扫全包圆，你在旁边喝茶等结果就行。过去 AI 写代码三步一问“这样可以吗”，现在它直接交完整交付物……自主编程的最后一层窗户纸，被捅破了。做自动化开发和代码审查的团队，这个模型建议直接上手，效率差距肉眼可见……

Opus 4.8发布：编程助手的“静默时刻”，是解放开发者，还是新门槛？

5月19日

11:07

11:07

arXiv cs.LG@Junyi Wu, Tianchen Zhao, Shaoqiu Zhang, Linfeng Zhang, Guohao Dai, Yu Wang

精选

扩散语言模型（dLLM）通过联合去噪一批[MASK]令牌实现并行解码，但大块掩码令牌导致大量计算冗余。研究发现，许多计算花费在重复处理前文上下文和特征表示相同的[MASK]令牌上。为此，提出位置保持的[MASK]令牌压缩和终端感知增强方法，通过压缩冗余计算加速解码，并自然扩展到长上下文场景。在LLaDA-8B-Instruct和LLaDA-1.5等全序列dLLM上验证了效果，对LLaDA2.0-mini等块dLLM，通过保护终端[MASK]令牌增强上下文，以极小开销提升生成质量。

论文扩散语言模型上下文压缩并行解码 LLaDA 计算冗余

推荐理由：扩散LLM的并行解码效率一直是痛点，这篇工作直接戳中计算冗余的核心，做模型推理加速或长上下文应用的开发者值得关注，压缩方法可以直接集成到现有dLLM中。

5月14日

15:39

15:39IT之家（博客/媒体）

精选

腾讯云正式开源 TencentDB Agent Memory，面向 Agent 长任务场景提供短期记忆压缩与长期个性化记忆能力。该方案通过“上下文卸载”和 Mermaid 任务画布技术，将完整信息卸载到外部存储，同时以结构化任务图保留关键状态，使 Agent 在长任务中保持轻量上下文。在多任务连续 Session 实验中，最高降低 61% Token 消耗，并提升任务成功率。项目已适配 OpenClaw 和 Hermes 等主流 Agent 框架，支持一键集成，默认使用本地 SQLite 存储，零外部依赖。

AI产品腾讯 Agent Memory 开源/仓库上下文压缩长任务

推荐理由：做 Agent 长任务开发的团队终于有了省 Token 又保精度的开源方案——上下文卸载加任务画布让 Token 消耗降 61% 的同时成功率还上升，建议直接集成试试。