#可靠性

共 28 条 · 7 天 0 条 · 30 天 0 条
信息流里打上「可靠性」标签的资讯、产品与论文,按刊登时间排,新的在上。
8月12日
7月31日
7月28日
7月24日
7月14日
7月9日
6月30日
6月25日
6月10日
6月4日
6月3日
论文精选10:47
大型推理模型无法忠实表达置信度:新框架量化FC问题

LRM的推理链常被用户视为深思熟虑的证据,但这项研究戳破了这个幻觉——推理行为并不等于置信度表达更可靠。做模型对齐或安全评估的团队值得关注,尤其是那些在医疗、金融等高风险场景部署LRM的开发者,看完会重新审视你的置信度校准策略。

arXiv cs.AI@Areeb Gani 等 4 人原文
6月2日
6月1日
5月29日
5月28日
产品多源确认精选72°08:57
2026 年生产环境 AI Agent 评估指南:刷上限 vs 抬下限

做 AI Agent 产品的团队终于有了区分「刷榜」和「保底」的实用框架——先选目标再定评估策略,比盲目堆 benchmark 有效得多。建议所有做客服、金融、医疗等自主 Agent 的开发者点开看看,尤其是那些被线上失败搞到头疼的。

事件专题
shao__meng@shao__meng11 个信源在谈原文
5月22日
5月20日
5月17日
5月13日