模型中美对照精选15:12DeepSeek 发布 v4.1-Flash 模型,采用新架构DeepSeek 新模型来了,参数更大架构更新,性能提升明显。#DeepSeek#v4.1-Flash#编码器-解码器#GLUE官方账号Latent Space (swyx)原文稍后读已读值得跟进有用关注 DeepSeek
论文12:10匹配任务与目标:编码器-解码器预训练语言模型的微调和提示调优策略这篇论文教你怎么给不同任务选对预训练目标,少样本下性能直接翻倍,比传统方法强一大截。#MTO框架#微调#提示调优#编码器-解码器aarXiv cs.AI@Ahmad Pouramini, Hesham Faili原文稍后读已读值得跟进有用关注 MTO框架
论文精选11:03LCLM:端到端上下文压缩新方法,提升长上下文推理效率长上下文推理的内存瓶颈终于有了一个兼顾质量与速度的解法,做LLM推理优化或长时智能体的开发者值得关注,LCLM的压缩方案可以直接用于生产环境。#上下文压缩#KV缓存#长上下文推理#编码器-解码器aarXiv cs.AI@Ang Li 等 15 人原文稍后读已读值得跟进有用关注 上下文压缩