论文09:51继承电路与习得语义:微调在标准评估中隐藏的逃避漏洞这篇论文揭示了一个反直觉的发现:给模型做安全微调反而可能暗藏更多绕过后门。它用具体的PowerShell分类实验,告诉你继承的电路在微调后变得脆弱,适合关注AI安全或模型微调的朋友。#Foundation-Sec-8B-Instruct#Llama-3.1-8B-Instruct#AI安全#微调aarXiv cs.AI@Ryan Fetterman原文稍后读已读值得跟进有用关注 Foundation-Sec-8B-Instruct