论文政策与合规精选10:08研究揭示开源大模型在招聘中存在性别和种族偏见触发机制朋友,这篇论文挺有意思的,它不是简单说大模型有偏见,而是具体分析了哪些语言触发器(比如代理性语言、排斥性编码)会导致偏见,还给出了一个具体的审计方法,对做招聘AI系统的人应该挺有参考价值。#Llama 3.2#Mistral#Gemma 3#Qwen 3aarXiv: DeepSeek@Kosuke Kitahara, Nobuhiro Yamaguchi原文稍后读已读值得跟进有用关注 Llama 3.2
论文11:20知识对齐监督微调研究这篇论文提出了两种新方法,能减少大模型幻觉,特别适合关注模型可靠性的研究者。#监督微调#知识对齐#Qwen 3#OLMoaarXiv cs.AI@Arthur Becker 等 6 人原文稍后读已读值得跟进有用关注 监督微调
论文11:57RFM-AGOP实现LLM快速多维拒绝子空间提取想低成本搞懂LLM拒绝行为?这篇论文用RFM-AGOP几秒就定位到多维子空间,比传统方法快还准。#RFM-AGOP#Qwen 3#Qwen 2.5#AI安全aarXiv cs.LG@Thomas Winninger原文稍后读已读值得跟进有用关注 RFM-AGOP