#arXiv
共 79 条 · 7 天 19 条 · 30 天 34 条
8月14日
8月13日
8月12日
AI助力数学研究:Grothendieck常数界限改进案例
想知道AI怎么帮数学家干活?这篇论文用Grothendieck常数当例子,讲AI怎么把已知界限又收紧了一截,还聊了AI的强项和翻车点,挺实在的。
8月11日
论文11:57
TTS评估新基准:10维度拆解自然度,MOS与Audio-LLM各有短板做TTS评测的可以看看,这篇把自然度拆成10个维度,实测发现MOS和Audio-LLM都测不全,还公开了数据集和代码。
8月7日
8月5日
8月4日
8月3日
7月31日
论文13:13
一个人,N个智能体:置信度校准与相关误差下的LLM智能体审计预算分配这篇论文用数学告诉你,LLM自报置信度不靠谱时,按置信度排序审计可能比随机还差,而且越省预算越危险,值得做AI治理的人看看。
7月28日
论文12:19
Reason-Mediated Behavioral Models 审计 LLM 社会模拟器的推理缺陷这篇论文告诉你,LLM 当模拟器时可能答对结果但用错理由。作者用94人的防晒霜测试证明了这一点,并提供审计方法。
7月22日
7月21日
论文10:02
Auditing Question-Order Effects in LLMs with the QQ Equality这篇论文用QQ等式定量审计LLM的顺序效应,还给出了理论机制和实用流水线,适合对模型行为一致性感兴趣的人读。
7月20日
7月17日
7月15日
7月13日
论文09:58
Beyond Fixed Representations: 词汇与验证缺口阻碍AI开放创新这篇论文明确提出当前AI在真正开放创新上的两个瓶颈,不是堆能力就能解决的。搞AI研究和产品的人都该看看这个分析。
7月7日
7月2日
6月30日
6月26日
论文11:04
AI医疗聊天机器人信息基础设施:用户报告故障大规模研究这篇论文分析了59款AI医疗聊天机器人的1.5万条用户评论,告诉你最常见的故障在哪里,尤其是隐私和安全问题最影响体验。做医疗AI的值得看看。
6月17日
论文10:22
KGFM泛化机制:半链接足以预测完整链接,论文发布在arXiv这篇论文把知识图谱模型泛化的底层逻辑讲清楚了——原来只要看到半个链接就能猜出整条,还分出了四种情况。搞图神经网络或KG推理的人别错过。
6月12日
6月2日
5月15日
行业22:42
arXiv 收紧 AI 生成内容规则:未核实将禁投一年arXiv 的新规直接影响了所有使用 AI 辅助写论文的研究者,尤其是计算机科学领域。如果你用大模型生成内容,务必仔细核查,否则可能面临一年禁投——建议所有预印本作者点开了解执法细节。
IT之家原文