论文14:31给大模型测谎:PIR 从内部状态读出被隐瞒的答案借法医测谎思路做的 PIR,能从 Gemma、Qwen 等模型内部读出它明明知道却装不知道的答案。#PIR#sandbagging#unlearning#AI安全aarXiv cs.AI@Hiskias Dingeto原文稍后读已读值得跟进有用关注 PIR