AITP
精选全部 AI 动态AI 日报Agent 接入关于更新日志信源提报反馈
登录 / 注册
AITOP
全部 AI 动态
AI 相关资讯全量信息流
全部博客资讯推文论文
全部模型产品行业论文技巧
标签:置信度×
6月16日
20:46
AITOP6月16日 20:46
600亿美元买下Cursor,xAI终于拿到了编程工具,但真正值得跟踪的或许不是AI600亿美元买下Cursor,xAI终于拿到了编程工具,但真正值得跟踪的或许不是AI
6月12日
12:57
AITOP6月12日 12:57
Claude代码里藏了个20260612,18个月后的AI记忆革命已经开始倒计时
6月11日
15:28
AITOP6月11日 15:28
1107 vs 303:谷歌悄悄开源了一个“拆打字机”的模型,把大模型速度翻了4倍
15:23
AITOP6月11日 15:23
DiffusionGemma颠覆文本生成?自回归模型的“统治”要结束了
15:07
AITOP6月11日 15:07
每秒1107个token,Google开源的扩散模型为什么能改变本地推理格局?
5月13日
19:12
19:12arXiv: DeepSeek@Jinyuan Wang, Ningyuan Deng, Yi Yang
精选
大型语言模型(LLM)越来越多地被用于社会科学研究,将非结构化文本转换为可进入实证设计的变量。但研究发现,LLM的置信度与真实正确率严重不匹配,导致基于置信度过滤会扭曲下游回归估计。研究对GPT-5-mini、DeepSeek-V3.2等14个社会科学构念进行审计,发现所有模型都存在校准偏差。作为解决方案,提出软标签蒸馏管道,将LLM得分和置信度转化为软目标分布,训练小型判别分类器,平均降低ECE 43.2%和Brier 34.0%。研究呼吁将校准视为测量有效性的组成部分,而非可选的后期处理。
论文LLM社会科学校准置信度软标签蒸馏

推荐理由:做社会科学量化分析的团队终于有了校准LLM输出的实操方案——软标签蒸馏能显著降低置信度偏差,建议做文本编码和实证研究的点开看看具体方法。
原文
精选全部日报登录