8月14日
01:32
01:32Fireworks AI@FireworksAI_HQ
精选
Fireworks AI 将 Anthropic 的 J-Lens 探针部署到开源模型 Kimi K3 和 Qwen 3.5-9B 上。通过检查模型的内部状态,发现它们在生成首个 token 之前就已布置好对应词汇。相关结果发布在 Fireworks 的 J-Lens 研究博客页面。
事件专题

推荐理由:Fireworks 把 Anthropic 的 J-Lens 探针装到 Kimi K3 和 Qwen 3.5-9B 上,发现模型在蹦出第一个 token 前就把词准备好了。看内部状态搞可解释性,挺有意思。
8月13日
22:48
22:48小互@imxiaohu
76°
欧洲研究团队在8月10日发表论文,成功读取Anthropic、OpenAI、Google三家旗舰模型的隐藏推理链。团队从6708份公开AI会话日志中提取出62把真实API密钥。研究指出加密算法本身未被攻破,问题出在API设计上。
事件专题

推荐理由:欧洲团队破解了三大AI的加密思维链,还从公开日志里翻出62把API密钥,看完你就知道API设计有多危险。
18:05
8月12日
04:05
8月11日
03:58
8月8日
8月7日
01:00
01:00AK@_akhaliq
论文《Towards Physics of Multimodal Pretraining》已在Hugging Face发布,编号2608.05。论文围绕知识流、模态协同、早期统一三个核心议题展开。作者针对这些议题给出了具体的预训练配方。

推荐理由:这篇论文把多模态预训练拆成知识流、模态协同和早期统一,还给了训练配方,搞多模态的可以读读。
8月6日
01:48
01:48AK@_akhaliq
精选
MerchantBench 是一个专门评测 LLM 智能体在电商运营中长期连贯性的新基准。MerchantBench 包含跨多轮任务的测试场景,用于检验智能体在长时间运营中的记忆与决策一致性。论文全文已发布在 Hugging Face 平台上。

推荐理由:MerchantBench 专门测 LLM 智能体在电商里的长期连贯性,比单轮问答更贴近实际运营,可以看看。
8月4日
06:24
06:24官方账号Microsoft Research@MSFTResearch
微软研究院发布 SocialRL,让小型语言模型学会多轮谈判。PazaBench V2 扩展了非洲语言语音 AI 评测。EvoLib 用于帮智能体把经验转化为知识。另公布了更可靠的 A/B 测试方法和 AI 精准肿瘤学新进展。
推荐理由:看微软研究院这周新东西:SocialRL 教小模型谈判,PazaBench V2 补非洲语言语音评测,顺带还有 EvoLib 智能体知识库。
03:08