全部动态
这篇论文揭示了一个反直觉的发现:LLM会被文本的风格欺骗,而不是内容。研究者用简单的'去风格化'就能把攻击成功率从61%打到10%,对理解AI安全很有启发。
帝国理工团队用两台锶-87原子干涉仪互相校准,把激光噪声抵消掉,单台被噪声淹没时照样能提取真实信号,为探测暗物质和早期引力波扫清了一个大障碍。
OpenAI发现,只给模型一点点“诚实”训练,它就在53个测试里赢了44个,连健康领域的骗术都能识破。和Anthropic的路数不一样,挺有意思。
做代码预训练或大规模数据处理的研究人员可以直接复用这套管道,省去下载和解析海量元数据的麻烦,值得一试。
做语音助手或客服系统的团队会发现,当前ASR模型在双语用户面前漏洞百出——代码切换场景的错误率远高于单语言,这个基准测试直接暴露了痛点,建议点开看看你的模型能否过关。
这项研究用数据证明了AI智能体在自主工作上的巨大优势,做自动化流程或研究效率优化的团队值得一看,能帮你重新评估智能体替代搜索的可行性。
做 AI 安全评估或数据集分析的开发者,可以直接跟着教程跑一遍端到端流程,从数据加载到模型训练都有代码示例,省去自己摸索的时间。
这项突破解决了高频晶体管在太赫兹频段的应用瓶颈,做射频通信、6G或半导体器件的科研人员值得关注——它直接给出了一个可实测验证的新架构,且理论潜力巨大。
这项研究揭示了AI在复杂场景推理上的真实短板,做体育内容或依赖AI分析的团队可以借此评估工具边界,值得点开看看AI到底哪里不行。
长文本推理的延迟痛点终于有了低成本解法——Stem 用 25% 算力实现近无损精度,做 LLM 推理优化的团队可以直接用开源代码实测,128K 上下文下首字延迟降低 3.6 倍的效果值得关注。
NVIDIA 用任务种子生成合成数据,解决了预训练数据稀缺和多样性不足的问题,做 NLP 和模型训练的团队可以关注,能显著降低数据标注成本。
X-Token 解决了知识蒸馏中分词器不匹配的痛点,做模型压缩或边缘部署的团队可以直接用这个思路提升小模型推理能力,值得关注。