09:05官方账号arXiv cs.LG@Linze Wu, Xinrui Chen73°PASK模型在Qwen3-4B上测试,于8个BFCL子类别平均超越最强压缩基线17.39个百分点。该模型针对JSON、SQL和函数调用等结构化生成任务,将解析器结构转化为层组特定的KV持久化决策。在端到端服务中,PASK实现2.2倍更高吞吐量,3.3倍更低TPOT,仅使用全KV 0.53倍的峰值GPU内存。论文PASK结构化生成KV压缩推荐理由:PASK让结构化生成更高效,在保持准确性的同时大幅降低内存使用,提升处理速度。原文稍后读已读值得跟进有用关注 PASK