09:39官方账号arXiv cs.AI@Simiao Ren该研究提出CallScreenBench基准,用来评估手机端侧模型代接未知来电的表现。评测从五个质量维度打分,不合并为单一总分。研究用6个0.6B到4B参数的端侧模型,在4-bit量化下做测试,发现能力越高回答质量越好,但来电分流质量并不随之提升。修正脚本化退化基线后,11/15个模型对的分流差异在预注册操作点归零。一个只会挂断和复述对方的智能体也能拿到完美消息保真分数。论文CallScreenBench端侧模型智能体推荐理由:别只看模型跑分,这篇论文拆穿了端侧模型的电话代接短板,还附了踩坑评测方法,做手机智能体的值得读。原文稍后读已读值得跟进有用关注 CallScreenBench