全部 AI 动态 · AI 热点

6月16日

20:46

AITOP6月16日 20:46

600亿美元买下Cursor，xAI终于拿到了编程工具，但真正值得跟踪的或许不是AI

600亿美元买下Cursor，xAI终于拿到了编程工具，但真正值得跟踪的或许不是AI

11:12

11:12

arXiv cs.LG@Matteo Cartiglia, Sandro Kuppel, Wouter Botermans Wannes Peeters, Natan Biesmans, Liam Vandekerckhove, Eric Beamish, Koen Ongena, Wouter Renckens, Pol Van Dorpe, Sanjin Marion

该研究提出用对比编码器将随机单分子信号映射到可解释分子坐标，编码器仅基于物理模型模拟信号训练。编码器对结构参数敏感，对采集条件和构象不变，允许跨设备数据整合。单次编码完成分子识别，计算成本比对齐方法降低三个数量级。实验验证了混合物定量、稀有变异检测和实时信号采集。

论文纳米孔单分子传感对比学习编码器可解释性

推荐理由：这篇论文用模拟信号训练编码器，把纳米孔信号转成可解释坐标，识别快了一千倍，实验也扎实。

6月12日

12:57

AITOP6月12日 12:57

Claude代码里藏了个20260612，18个月后的AI记忆革命已经开始倒计时

6月11日

15:28

AITOP6月11日 15:28

1107 vs 303：谷歌悄悄开源了一个“拆打字机”的模型，把大模型速度翻了4倍

15:23

AITOP6月11日 15:23

DiffusionGemma颠覆文本生成？自回归模型的“统治”要结束了

15:07

AITOP6月11日 15:07

每秒1107个token，Google开源的扩散模型为什么能改变本地推理格局？

5月27日

23:55

23:55

Perplexity@perplexity_ai

精选

Perplexity AI发布的编码器在生产输入长度下，p50延迟比HuggingFace tokenizers低约5倍，比SentencePiece C++低2倍，比IREE C低1.5倍。在514 tokens的输入时，运行时间仅为63微秒，且实现零堆分配。该编码器专门针对长输入场景优化，显著提升推理效率。

AI模型 Perplexity AI HuggingFace SentencePiece 编码器性能优化

推荐理由：Perplexity AI编码器快了5倍

5月13日

19:12

19:12

arXiv cs.AI@Rian Touchent, Eric de la Clergerie

精选

论文提出一种编码器领域适配新方法：先用因果语言建模（CLM）训练，再切换回掩码语言建模（MLM）微调。在 ModernBERT 上测试，该方法在 8 个法语和 11 个英语生物医学任务上，相比纯 MLM 基线提升 0.3-2.8 个百分点。研究发现 CLM 的密集监督主要影响低层 Transformer 层（0-7），冻结低层会消除收益，而冻结中层则保留收益。这种表征变化在后续 MLM 阶段持续存在，且随模型规模扩大而增强。团队发布了 ModernCamemBERT-bio 和 ModernBERT-bio 作为生物医学编码器新基准。

论文编码器领域适配因果语言建模掩码语言建模 ModernBERT

推荐理由：做 NLP 领域适配的团队终于有了比纯 MLM 更优的预训练策略——CLM 绕路法简单有效，在生物医学任务上直接涨点，建议做领域编码器的开发者试试这个两阶段方案。