18:01官方账号arXiv cs.AI@Girma Yohannis Bade, Olga Kolesnikova, Jose Luis Oropeza, Grigori Sidorov该研究针对社交媒体政治话语,设计并评估了基于XGBoost和BERT的两种多类情感分析模型。在标注的政治社交媒体帖子数据集上,XGBoost模型测试集F1分数为0.2835,BERT模型为0.2806。结果显示政治话语情感分类的复杂性,为未来多类政治情感分析提供基线。论文XGBoostBERT情感分析推荐理由:想了解政治文本情感分类的难度?这篇论文用XGBoost和BERT实测,F1都不到0.3,看看数据有多难搞。原文稍后读已读值得跟进有用关注 XGBoost
12:19官方账号arXiv cs.AI@Arya Labroo, Mengjie Qian, Kate Knill该研究将概念激活向量(CAV)方法扩展至基于BERT的文本评分器和基于Whisper的多模态语音文本评分器,用于检测L2口语评估中因母语或年龄等无关属性产生的偏差。CAV通过激活空间方向表示概念,并用梯度敏感度区分概念是否被编码及是否影响分数。研究发现概念的可恢复性主要取决于模型表示和架构,而非概念本身。稀疏自编码器(SAE)虽使概念更线性可恢复,但会削弱原始激活空间的敏感度,尤其在低维层。论文Concept Activation VectorsBERTWhisper推荐理由:这篇论文教你怎么用CAV和稀疏自编码器查口语评分模型有没有偏袒某类考生,结果发现模型架构影响很大,别光看概念能不能被提取出来。原文稍后读已读值得跟进有用关注 Concept Activation Vectors
11:38官方账号arXiv cs.AI@Sina Heydari, Amirreza Abbasi, Mohsen Hooshmand, Majid Ramezani该论文提出轻量级对比去噪自编码器CDAE,通过联合优化对比学习和重构目标来精炼BERT嵌入,使其对同义替换、掩码和词丢弃等语义保持扰动不敏感。实验在多种扰动强度下对比了原始BERT和SimCSE,CDAE在嵌入相似度上始终更高。改进幅度随扰动增强而增大,表明其能在提升表示稳定性的同时保留语义信息。代码已开源。论文CDAEBERTSimCSE推荐理由:想提升句向量对微小改动的抵抗力?这个CDAE方法比SimCSE更扛扰动,代码开源,可以试试。原文稍后读已读值得跟进有用关注 CDAE
11:31官方账号arXiv cs.AI@Ahmad Pouramini, Mahsa Afsharzadeh论文提出Maskability Index (MI)度量,基于DepthRank分数差异计算,用于判断在T5和BERT等预训练语言模型上,针对知识关系生成,masked-style提示是否优于prefix-style提示。在ATOMIC2020知识库补全基准上评估,MI与下游生成性能呈正相关。该指标在低资源场景下可辅助提示模板选择与适配策略。论文Maskability IndexT5BERT推荐理由:这篇论文搞了个叫Maskability Index的指标,帮你省掉试不同提示的功夫,直接判断填空提示还是前缀提示更管用,在ATOMIC2020上验证过了。原文稍后读已读值得跟进有用关注 Maskability Index
09:39官方账号arXiv cs.LG@Ana Schwengber Kelm, Christian Bockermann, Jörg Frochte该论文将CVE到CWE映射视为文本分类任务,比较了多类(每CVE预测一个CWE)和多标签(允许多个CWE)两种公式。在三个编码器(BERT Base、SecureBERT、CySecBERT)和三个嵌套标签空间(83、47、25类)上评估,多类训练在所有设置中macro-F1更高,但差距从21个百分点缩小至2个百分点。后处理阈值优化在25类设置中弥补了差距。混淆分析显示,主要错误模式遵循CWE层次结构,且三个编码器间高度相关(Pearson r>0.92),表明错误结构主要由分类体系设计而非编码器选择驱动。层次放松评估将macro-F1从约81%提升至约90%,表明严格指标低估了分支级分类质量。CySecBERT在多数设置中取得最强结果。论文CVECWEBERT推荐理由:这篇论文用三种BERT模型对比了多类和多标签的漏洞分类效果,发现错误更多来自CWE层次结构而非模型选择,对安全领域做文本分类的人很有参考价值。原文稍后读已读值得跟进有用关注 CVE