6月13日
6月12日
21:56
21:56官方账号vLLM@vllm_project
Kimi 发布 K2.7-Code,一个专注于编程的智能体模型,基于 K2.6 构建。该模型采用 1T 参数的混合专家架构,每次推理仅激活 32B 参数,配备 MLA 注意力机制和 256K 上下文窗口。相比 K2.6,K2.7-Code 的思考 token 减少了约 30%,推理更高效。该模型已获 vLLM 支持,可直接复用 K2.6 的部署配置,降低了迁移成本。

推荐理由:编程智能体模型终于有了更高效的选择——K2.7-Code 在保持 1T 参数规模的同时,将激活参数压缩到 32B,做代码生成和推理的开发者可以直接在 vLLM 上复用现有部署,值得一试。
12:35
12:35官方账号Mark Chen (OpenAI 研究)@markchen90
83°
OpenAI 的一个模型成功推翻了 Erdős 长期未解的单位距离猜想,给出了一个优雅而复杂的证明,融合了代数数论与几何的深刻思想。数学成为 AI 研究突破最显著的领域,专家们愿意与 AI 生成的证明深度互动。OpenAI 强调目标并非取代人类,而是探索人类在强大 AI 时代仍能发挥重要作用的路径。团队计划与数学界合作,并将经验推广到编程和通用协作领域。
事件专题

推荐理由:数学研究者或对 AI 推理能力感兴趣的人会震撼——OpenAI 模型解决了数论几何交叉的经典难题,证明过程优雅且可验证。建议点开看看 AI 如何用代数数论工具攻克几何猜想,这对理解 AI 在严谨科学中的潜力很有启发。
11:46
11:46官方账号Noam Brown (OpenAI 推理)@polynoamial
83°
OpenAI 的一个通用内部模型在著名的组合几何问题上取得了突破性进展。不到一年前,前沿 AI 模型在 IMO(国际数学奥林匹克)中已达到金牌水平。这表明 AI 在数学推理能力上的进步速度惊人,且预计这一趋势将持续。该突破展示了通用模型在解决复杂数学问题上的潜力,而非依赖专门训练的模型。
事件专题

推荐理由:数学和 AI 研究者值得关注——OpenAI 的通用模型在组合几何难题上取得突破,展示了 AI 推理能力的快速提升,建议点开了解具体进展。
11:45
11:45官方账号Microsoft AI@MicrosoftAI
精选
微软AI实验室在MSBuild 2026上发布了7个新模型,涵盖推理、代码、图像、语音和转录能力。这些模型基于科学和清洁的商业安全数据构建,设计为无缝协作。微软AI负责人Mustafa Suleyman在主题演讲中展示了这些进展,标志着微软在AI领域的快速扩张。

推荐理由:微软一口气推出7个覆盖多模态的模型,做AI应用开发的团队可以直接集成这些能力,减少自研成本,值得关注。
10:19
10:19官方账号arXiv cs.AI@Zach Studdiford, Gary Lupyan
该研究通过对比人类与25个大型语言模型在常识推理任务中的表现,发现两者在推理错误上存在相似模式。研究进一步识别出驱动LLM响应的注意力头,这些注意力头实现了模式匹配机制,并能预测人类因无关提示细节而产生的看似不合理的推理错误。结果表明,人类和LLM的日常因果推理更符合模式匹配而非抽象世界模型。
推荐理由:这项研究挑战了“人类推理基于抽象模型”的传统观点,对AI开发者和认知科学家都有启发——如果你关心LLM为何会犯“愚蠢”错误,或者想理解人类推理的底层机制,这篇论文值得一读。
6月11日
6月10日
21:51
21:51官方账号Decoder@Maximilian Schreiner
88°
Anthropic推出了Claude Fable 5,这是其新Mythos模型系列的首款产品。该模型在几乎所有基准测试中领先,包括SWE-bench Verified达到95%,但价格是Opus 4.8的两倍,每百万token收费10或50美元。严格的安全过滤器会阻止约9%的请求,并且新的30天数据保留政策甚至适用于零数据保留合同。这标志着Anthropic在追求极致性能的同时,也加强了安全控制和商业化策略。
事件专题

推荐理由:Claude Fable 5在编程和推理任务上创下新高,但高昂成本和严格过滤让开发者需要权衡。做AI应用或自动化流程的团队,建议先评估预算和合规需求再决定是否接入。
17:27
17:27官方账号Together AI@togethercompute
精选
DeepCogito团队需要为其前沿推理模型实现低于500毫秒的首令牌时间,并支持每分钟1000+请求。Together AI提供了解决方案,满足了这一严苛的性能要求。DeepCogito团队分享了在创业公司时间线上构建前沿模型的经验。这展示了AI基础设施提供商如何帮助初创企业实现高性能推理。

推荐理由:做推理模型部署的团队会关心这个案例——Together AI帮DeepCogito在创业节奏下实现了500ms首令牌延迟,值得点开看看他们怎么做到的。
15:11
15:11@koltregaskes@koltregaskes
72°
Claude Fable 5(Mythos 通用变体)已发布,其算力消耗是 Opus 的两倍。该模型提供低、中、高、极高和最大五个计算级别,用户可根据需求选择。目前 Fable 仅限订阅用户使用至 6 月 22 日,团队计划在算力充足后重新上线。由于消耗巨大,有用户担心在 $20 订阅计划下,一次提示可能耗尽 5 小时会话额度。
事件专题

推荐理由:Claude Fable 5 的算力消耗翻倍意味着更强的推理能力,但也会快速消耗订阅额度。重度 Claude 用户需要权衡性能与成本,建议在 6 月 22 日前体验并评估是否值得长期使用。
11:56
11:56Genspark@genspark_ai
Anthropic 的 Claude Fable 5 模型已在 Genspark Code Agent 和 Genspark Claw 中上线,这是 Anthropic 最强大的 Mythos 级模型,已通过安全评估可日常使用。该模型在编程、研究、知识工作和视觉任务上达到业界领先水平,任务越长越复杂,优势越明显。用户可直接在 Genspark 平台体验这一最新模型。
事件专题

推荐理由:Claude Fable 5 是 Anthropic 目前最强的可公开使用模型,在长复杂任务上表现突出,做编程、研究或知识工作的团队值得立即试用,体验其领先能力。
09:27
09:27官方账号Simon Willison@simonw
83°
Simon Willison 分享了对 Claude Fable 5 的初步印象,称其具有“大模型气味”:运行缓慢、价格昂贵,但几乎能处理他抛出的所有任务。该模型在复杂推理和多步骤任务上表现出色,但高昂的成本和延迟可能限制其普及。Willison 认为,对于需要极致能力的专业用户来说,Fable 5 是值得的,但对普通开发者而言,性价比仍是问题。
事件专题

推荐理由:Claude Fable 5 的“大模型气味”揭示了当前顶尖模型的取舍——慢、贵但能力惊人。做复杂推理或高难度任务的开发者,值得看看 Willison 的实测感受,判断它是否值得你的预算。
08:14
08:14小互@imxiaohu
72°
Anthropic 计划于今晚发布其最强 AI 模型 Mythos,这将是该公司在 AI 领域的重要进展。Mythos 预计在推理、代码生成等任务上超越前代,可能对标 OpenAI 的 GPT-4 系列。消息来自知名爆料者小互,可信度较高。该发布可能引发新一轮 AI 模型竞争,值得关注。
事件专题

推荐理由:Anthropic 新旗舰模型 Mythos 今晚发布,做 AI 应用开发或模型对比的团队可以第一时间关注,看看它能否在推理和代码任务上超越 GPT-4。