#忠实性
共 5 条 · 7 天 0 条 · 30 天 0 条
信息流里打上「忠实性」标签的资讯、产品与论文,按刊登时间排,新的在上。
8月5日
7月8日
6月25日
5月13日
机械论(不)忠实性的玩具模型:transcoder 出错时
做 AI 可解释性研究的人会直接受益——这篇论文揭示了 transcoder 可能产生虚假特征的根本原因,看完会对现有方法的可靠性有更清醒的认识。建议所有用稀疏自编码器做模型分析的人点开。
研究揭示思维链并非可靠监督通道:58% 步骤存在虚构延续
这项研究戳破了 CoT 推理过程忠实反映模型思考过程的假设,做 AI 安全、可解释性研究或依赖 CoT 审计的团队值得关注——它提醒我们,看起来合理的推理链条可能只是事后编造的故事。