全部动态
这个系统解决了企业用AI时最头疼的问题——不知道效果好不好,能不能用。它不是简单测试模型能力,而是模拟真实工作流,给出具体的数据和决策标准。
朋友,这是篇挺有意思的论文,研究的是临床预测中 VLM 模型如何利用 ECG 数据。他们发现模型虽然能处理多模态信息,但可能没真正用到 ECG,然后提出了一种叫视觉提示词调优的方法来解决这个问题。
这篇论文挺有意思的,专门研究大模型如何理解中文网络热词,比如“yyds”这种,还做了个专门的基准测试,对做跨语言AI或者安全相关的研究应该挺有参考价值。
这篇论文介绍了一种叫 RegKT 的新技术,专门用来提升知识追踪模型的性能,让它在处理教育数据时更稳定,不容易过拟合,同时还能保持模型的可解释性,对做教育应用的开发者可能有帮助。
这个研究很实用,它告诉你别只看模型在基准测试上的分数,因为换一个数据集或者换一种提问方式,结果可能就大不一样了,比如健康对照组换成非结核病对照组,模型的准确率就会下降。
朋友,TrialAtlas 这个多智能体系统挺有意思的,专门帮药企做临床试验设计,能从文献和监管历史里学习经验,比 OpenAI 和 Gemini 的效果都好,值得看看。
Gary Marcus 发推澄清,他之前的研究并未证明大语言模型(LLM)能感受痛苦。该研究主要关注模型内部动态和行为模式,而非情感体验。许多“AI 影响者”过度解读了研究结果。
牛津研究团队发表新论文,通过数学论证指出,大模型(LLMs)无法真正“发明”新事物,因为它们本质上是预测下一个词的模型,无法相信现有数据中错误的信息。作者认为,人类能够基于现有数据提出新理论,而大模型则只能反映过去。作者每天使用这些模型,发现新突破通常来自人类判断现有数据错误并做出新理论。
DAIR.AI 和 MIT 新方法 SIFT,用 LLM 判定器筛选,把代码生成效率提升 10 倍,比 DGM 算法快很多。
仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档