11:14官方一手arXiv: DeepSeek@Jinglan Gong, Jiefan Lu, Hewei Guo, Kehan Li, Zhiyuan Han, Jihang Jiang, Wenwen Tong, Lewei LuEYT-Bench是一个评估LLM多轮对话能力的基准,采用三部分解耦设计:基于人工语料库(Nemotron-Personas-USA和PersonaMem-v2)的特定角色用户模拟器、分离意图感知与回复生成的目标模型、以及独立第三方LLM评判器。在17个目标模型×200段对话的评估中,闭源与开源模型在主观维度(共情/人格化等)差异不超过0.3,但客观意图追踪差距可达9倍。开启推理模式后,Gemma-4的长上下文潜在意图准确率提升0.47-0.50。交叉评判消融实验通过DeepSeek-v4-pro验证了目标排名和最终意图满意度的一致性。论文EYT-Bench多轮对话基准测试2 个信源在谈事件专题推荐理由:这篇论文提出了EYT-Bench,能更真实地测出LLM在多轮对话中的意图追踪能力。用16/17模型发现推理模式大幅提升长上下文准确率,值得关注。原文稍后读已读值得跟进有用关注 EYT-Bench
13:13官方账号vLLM@vllm_projectvLLM 项目宣布支持 DFlash 投机解码,用户只需将 EAGLE-3 检查点替换为 DFlash 检查点即可启用,无需修改代码。该功能通过开源 Speculators 库将 DFlash 草案模型与目标模型的隐藏状态连接。在单块 Blackwell Ultra GPU 上运行 Gemma-4 31B 模型,Math500 基准取得 5.8 倍吞吐量提升,GSM8K 提升 5.3 倍,HumanEval 提升 5.6 倍,MBPP 提升 4.4 倍。AI模型DFlashvLLMGemma-410 个信源在谈事件专题推荐理由:vLLM 和 NVIDIA 合作推出 DFlash 投机解码,Gemma-4 31B 推理速度提升近 6 倍,配置只需改一行 checkpoint 路径。原文稍后读已读值得跟进有用关注 DFlash
10:27官方账号arXiv cs.AI@Quentin Fuxa, Dominik MacháčekAlignAtt4LLM 是 IWSLT 2026 同声传译任务的参赛系统,支持英语到德语、意大利语和中文的实时翻译。它采用同步级联架构:Qwen3-ASR 通过强制对齐生成逐步更新的源文本,Gemma-4 E4B-it 在 MT 侧使用 AlignAtt 策略进行翻译。这是首次将 AlignAtt 应用于纯解码器 LLM,解决了缺少编码器-解码器交叉注意力的问题,通过显式源跨度提示、离线选择翻译专用注意力头、选择性 qk-fast replay 和运行时查询/键捕获实现。在 IWSLT 2026 开发集上,该系统在低延迟(约2秒)和高延迟(低于4秒)场景下,对欧洲目标语言(英译德、英译意)均优于基线,对英译中结果较复杂,但方法不限于 Gemma-4,可复用于更强的翻译解码器 LLM。论文同声传译AlignAtt纯解码器LLM10 个信源在谈事件专题推荐理由:做同声传译或实时翻译系统的团队,终于有了一个在纯解码器 LLM 上跑 AlignAtt 的可行方案,低延迟场景下效果显著,值得参考实现。原文稍后读已读值得跟进有用关注 同声传译