#大语言模型
共 134 条 · 7 天 2 条 · 30 天 28 条 · 话题观测 →
信息流里打上「大语言模型」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月9日
10月5日
10月2日
10月1日
9月30日
9月28日
ACEMAGIC 推出搭载锐龙 AI Max+ 495 的 AI 迷你工作站 F9A,售价 6499 美元
ACEMAGIC 的 F9A 用锐龙 AI Max+ 495 塞进 1.4kg 机身,192GB 内存能分 160GB 给显存,本地跑大模型不用租云 GPU,6499 美元。
IT之家原文
9月23日
9月21日
研究作者澄清:LLM 感受痛苦的说法无依据
Gary Marcus 发推澄清,他之前的研究并未证明大语言模型(LLM)能感受痛苦。该研究主要关注模型内部动态和行为模式,而非情感体验。许多“AI 影响者”过度解读了研究结果。
9月19日
9月18日
9月17日
研究提出用含误导前提的数据训练大语言模型提升安全警惕性
朋友,这个研究挺有意思,作者不是直接教模型怎么拒绝有害指令,而是反过来,用一些故意有误导性的问题来训练模型,让它学会“留个心眼”,这样在遇到真正的安全威胁时可能更不容易被绕过。
泰国国家电子与计算机技术中心升级本地大语言模型 Pathumma 为 AI 平台
泰国国家电子与计算机技术中心发布了升级后的 Pathumma AI 平台,能帮助政府更高效地为公民完成任务,比单纯回答问题更进一步。
9月16日
一种改进的模型蒸馏方法,通过时间信用分配提升大语言模型性能
这篇论文提出了一种新的模型蒸馏方法γOPD,它通过引入折扣时间信用分配来平衡长时程监督和优化稳定性。实验表明,该方法在数学和代码推理任务上,比现有方法有更稳定的提升效果。
9月15日
一种新方法让大语言模型训练提速 37%,减少 34% 训练时间
朋友A对朋友B说:刚看到个挺有意思的论文,叫MoARa,是DeepSeek团队搞的,专门针对大语言模型训练优化,能让训练速度提升37%,时间缩短34%,挺实用的。
9月14日
9月11日
Nature Medicine 发表研究:用大语言模型从电子病历中提取可计算的患者长期数据
朋友,Nature Medicine 发表了一篇研究,用大语言模型从电子病历里提取数据,做成知识图谱,能分析患者长期情况,挺实用的。
9月10日
9月9日
腾讯 WorkBuddy 调整混元 Hy4 preview 限免权益
腾讯调整了混元 Hy4 preview 的免费使用政策,新老用户权益不同,夜间仍可免费使用,视频图像任务会切换其他模型。
IT之家原文
9月8日
论文15:36
罕见病护理中使用大语言模型聊天机器人NEJM AI最新研究,罕见病家庭如何使用AI聊天机器人获取医疗信息,家长视角值得关注。
9月7日
9月4日
9月3日