全部动态
AI 相关资讯全量信息流 · 5084 条
9月21日
CIBuzzBench:首个跨语言中文网络热词理解基准测试
这篇论文挺有意思的,专门研究大模型如何理解中文网络热词,比如“yyds”这种,还做了个专门的基准测试,对做跨语言AI或者安全相关的研究应该挺有参考价值。
RegKT 模型提升知识追踪的准确性与可解释性
这篇论文介绍了一种叫 RegKT 的新技术,专门用来提升知识追踪模型的性能,让它在处理教育数据时更稳定,不容易过拟合,同时还能保持模型的可解释性,对做教育应用的开发者可能有帮助。
医学视觉语言模型在胸片结核筛查中的基准测试审计研究
这个研究很实用,它告诉你别只看模型在基准测试上的分数,因为换一个数据集或者换一种提问方式,结果可能就大不一样了,比如健康对照组换成非结核病对照组,模型的准确率就会下降。
TrialAtlas 多智能体系统用于临床试验设计与优化
朋友,TrialAtlas 这个多智能体系统挺有意思的,专门帮药企做临床试验设计,能从文献和监管历史里学习经验,比 OpenAI 和 Gemini 的效果都好,值得看看。
9月18日
CARE-VI算法提升强化学习目标可靠性
这是篇关于如何提升强化学习目标可靠性的论文,作者提出了CARE-VI框架,通过CARS、SEVA和DARE三个组件来管理候选动作和修正量,在多个基准任务上取得了更好的结果。
RetireOPD:一种用于强化学习智能体的自退火策略蒸馏方法
朋友,这是篇挺有意思的论文,讲的是怎么用一种叫RetireOPD的新方法来训练AI智能体,效果比直接用强化学习好不少,在几个任务上都有明显提升。
研究不同分布偏移对神经PDE代理模型预训练增益的影响
这个研究很具体,不是泛泛而谈,而是用真实数据(254,909个样本)和具体模型(RANS解)测试了预训练在神经PDE代理模型中的价值,对做相关研究的人应该有用。
仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档