#评估方法

共 33 条 · 7 天 2 条 · 30 天 4 条
信息流里打上「评估方法」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月10日
10月6日
9月26日
9月23日
9月7日
8月26日
8月18日
8月5日
7月30日
7月15日
7月7日
7月3日
6月30日
6月24日
6月13日
6月12日
6月9日
6月8日
6月7日
6月5日
6月3日
论文精选10:47
大型推理模型无法忠实表达置信度:新框架量化FC问题

LRM的推理链常被用户视为深思熟虑的证据,但这项研究戳破了这个幻觉——推理行为并不等于置信度表达更可靠。做模型对齐或安全评估的团队值得关注,尤其是那些在医疗、金融等高风险场景部署LRM的开发者,看完会重新审视你的置信度校准策略。

arXiv cs.AI@Areeb Gani 等 4 人原文
6月2日
5月21日
论文精选72°11:01
DeepWeb-Bench:更难的深度研究基准,揭示模型推理短板

做 AI 评估或研究基准的团队会发现,DeepWeb-Bench 揭示了现有基准无法区分的模型能力差异——尤其是推导和校准的短板。建议关注其分能力族评估和来源溯源设计,这对理解模型真实研究能力很有帮助。

arXiv cs.AI@Sixiong Xie 等 11 人原文
5月19日
5月14日
5月12日