精选 AI 资讯 · AI 热点

6月11日

15:28

AITOP6月11日 15:28

1107 vs 303：谷歌悄悄开源了一个“拆打字机”的模型，把大模型速度翻了4倍

15:23

AITOP6月11日 15:23

DiffusionGemma颠覆文本生成？自回归模型的“统治”要结束了

15:07

AITOP6月11日 15:07

每秒1107个token，Google开源的扩散模型为什么能改变本地推理格局？

6月1日

00:09

AITOP6月1日 00:09

OpenAI 发起“Codex for Open Source”：免费赠送 6 个月 Pro 订阅，开源维护者能否迎来 AI 变革？

5月29日

08:02

AITOP5月29日 08:02

Opus 4.8发布：编程助手的“静默时刻”，是解放开发者，还是新门槛？🔥Anthropic 把 AI 编程的“确认键”彻底删掉了！Claude Code 搭载全新 Opus 4.8 模型，长时间任务不跑偏、不废话、不中断，像一个资深工程师一样默默干活，从功能开发到漏洞清扫全包圆，你在旁边喝茶等结果就行。过去 AI 写代码三步一问“这样可以吗”，现在它直接交完整交付物……自主编程的最后一层窗户纸，被捅破了。做自动化开发和代码审查的团队，这个模型建议直接上手，效率差距肉眼可见……

Opus 4.8发布：编程助手的“静默时刻”，是解放开发者，还是新门槛？

5月22日

11:18

11:18

arXiv cs.LG@Jan Tempus, Philip Whittington, Craig W. Schmidt, Dennis Komm, Tiago Pimentel

精选

当前主流分词算法（如BPE、Unigram）本质上是贪心算法，只做局部最优决策，无法保证整体词汇表质量。研究者将分词器构建形式化为线性规划问题，利用凸优化工具求解，提出新算法ConvexTok。实验表明，ConvexTok在内在分词指标和语言模型的bits-per-byte（BpB）上持续优于现有方法，下游任务性能也有提升但不够稳定。更重要的是，ConvexTok能给出一个下界，证明其分词器在常见词汇表大小下距离最优解不超过1%。

论文分词凸优化 NLP 线性规划 ConvexTok

推荐理由：分词是NLP的基础环节，贪心算法长期占据主流——ConvexTok用凸优化给出了可证明接近最优的方案，做分词器优化或语言模型预训练的团队值得关注。

5月21日

09:46

09:46

arXiv cs.AI@Fernando Ortega, Raúl Lara-Cabrera, Jorge Dueñas-Lerín, Alejandro de la Torre-Luque, Mercé Salvador Robert, Enrique Baca-García

精选

该研究利用自然语言处理与机器学习技术，将自由文本的精神科诊断描述自动映射到国际疾病分类（ICD）编码。研究基于14.5万条西班牙语精神科描述数据集，比较了从词袋模型、TF-IDF到大型语言模型（如e5_large、BioLORD、Llama-3-8B）等多种文本表示方法。结果显示，基于Transformer的嵌入方法在捕捉隐含语义和医学术语方面显著优于传统方法，其中e5_large模型通过端到端微调取得了0.866的F1_micro最高分。研究强调，将LLM适配到特定临床术语对于克服“长尾”标签分布和精神科话语的固有歧义至关重要。

论文 NLP ICD编码精神科诊断大型语言模型临床文本

推荐理由：精神科医生和医疗编码员每天面对大量诊断文本，这项研究展示了如何用LLM自动化ICD编码，大幅减轻行政负担。做医疗NLP或临床信息学的团队值得关注其方法。

5月15日

23:12

23:12

AlphaSignal@AlphaSignalAI

精选73°

研究人员提出Embedded Language Flows方法，让扩散模型在文本生成任务上仅需传统方法十分之一的数据量即可达到更优性能。该方法全程在连续嵌入空间操作，仅在最后一步将向量转换为单词，无需单独的解码器。通过预测干净嵌入而非噪声，并在训练中应用无分类器引导，该方法在语言基准测试中困惑度更低，并在翻译和摘要任务上超越自回归模型。这一成果挑战了“连续扩散在语言领域行不通”的普遍认知。

论文扩散模型文本生成连续嵌入 Embedded Language Flows NLP

推荐理由：扩散模型终于能高效处理文本了，做NLP或生成式AI的团队可以关注这个新范式——数据需求降低10倍，性能反而更好，值得一试。