6月4日
6月3日
10:09
10:09Latent.Space@latentspacepod
88°
GitHub COO 在访谈中透露,AI 智能体正在推动 GitHub 从代码托管平台向智能体协作平台进化。Copilot 将从自动补全扩展到 CLI、桌面、云智能体和环境工作流。GitHub Actions 已成为 CI/CD 和自动化的计算层。当 80% 的 PR 来自智能体时,信任将成为开源的新瓶颈。GitHub 正在为智能体编写、审查和部署代码的世界做准备。
推荐理由:GitHub 的转型方向直接关系到所有开发者和开源维护者——当智能体成为主要贡献者,代码审查和信任机制将彻底改变,建议关注这个趋势的开发者点开了解。
5月29日
11:17
11:17官方一手pandaily@contact@pandaily.com (Pandaily)
78°
Stepfun 开源了 Step 3.7 Flash,这是一个 196B 参数的稀疏 MoE 大语言模型,专为智能体工作流优化。该模型推理速度达 400 tokens/s,并原生支持工具调用,能高效执行复杂任务。开源此举旨在推动智能体生态发展,降低开发者构建自主系统的门槛。Step 3.7 Flash 在多项基准测试中表现优异,尤其适合需要快速响应和工具集成的场景。

推荐理由:做智能体开发的团队终于有了一个原生支持工具调用且速度极快的开源模型——400 tokens/s 的推理速度能显著提升任务执行效率,建议直接上手测试。
5月27日
11:12
11:12官方一手歸藏(guizang.ai)@op7418
MiniMax 宣布即将发布新一代 M3 模型,并开源其 MSA 架构。这是 MiniMax 沉寂一段时间后的重要更新,M3 模型预计在性能上有显著提升。开源 MSA 架构将推动社区研究和应用发展。该消息在推特上引发关注,但具体细节尚未公布。
推荐理由:MiniMax 的 M3 模型和开源 MSA 架构值得关注,尤其是对开源大模型和架构研究感兴趣的开发者,可以提前了解并准备试用。
5月26日
15:15
15:15IT之家博客/媒体
76°
美团推出“跑腿 Skill”,可零开发接入各大 AI 助手,用户通过自然语言即可完成下单。该 Skill 自动识别场景、匹配地址、预估价格并提交订单,将多步操作压缩为一步。它兼容 OpenClaw 本地版、云部署版及第三方客户端,代码已在 GitHub 开源。高频用户可直接口述需求完成全流程,并在 AI 助手中查询配送进度。此举降低了跑腿服务的使用门槛,有望提升订单高峰期效率。
事件专题

推荐理由:美团把跑腿服务做成了 AI 助手的 Skill,点外卖/寄东西的普通用户和开发者都能受益——用户一句话下单,开发者零接入就能集成。高频跑腿用户直接口述需求,省去手动输入,建议试试。
5月23日
5月21日
08:01
08:01官方账号Simon Willison’s Weblog博客/媒体
Mike Veerman 开发了一个 HTML 应用,模拟从 5 到 800 tokens/s 的 LLM 输出速度,帮助用户直观感受不同 token 速率下的文本生成效果。当看到模型宣传“30 tokens/s”时,可以用这个工具快速理解实际体验。该工具通过 Hacker News 传播,对评估和比较不同 LLM 的响应速度很有帮助。
推荐理由:选模型时经常被 token 速率数字搞晕?这个工具让你直接看到不同速度下的文本生成效果,做模型选型或写提示词优化的开发者值得一试。
5月19日
5月18日
17:12
17:12官方账号AlphaSignal@AlphaSignalAI
76°
本周(5月11日至17日)GitHub 热门仓库包括 DeepSeek 4 Flash 本地推理引擎(支持 Metal 和 CUDA)、更稀疏快速的 Transformer 语言模型、利用 WiFi 信号实现空间感知的 RuView、面向法律工作流的 Claude 插件套件,以及 X 平台开源的 feed 排序算法。这些项目覆盖了模型推理、架构优化、环境感知、行业应用和算法透明化等多个方向,值得开发者关注。
推荐理由:做本地推理或模型优化的开发者可以看看 DeepSeek 4 Flash 和稀疏 Transformer 项目,前者直接提升 Metal/CUDA 部署效率,后者可能改变模型架构设计思路。法律从业者或对行业 AI 应用感兴趣的人,Claude 插件套件提供了现成的 workflow 参考。
5月14日
16:33
16:33官方账号百川智能 Baichuan@BaichuanAI
百川智能正式开源了新一代医疗大模型Baichuan-M3,该模型在HealthBench上取得65.1分,并在HealthBench Hard上以44.4分夺冠。在医疗领域,Baichuan-M3全面超越了GPT-5.2。这一开源举措将推动医疗AI的普及和进步,为医疗行业开发者提供强大的工具。

推荐理由:医疗AI开发者终于有了开源且超越GPT-5.2的模型——Baichuan-M3在HealthBench上夺冠,做医疗诊断或健康咨询的团队可以直接拿来用,建议点开看看具体性能。
13:26
13:26官方账号arXiv cs.LG@Tara Bogavelli, Gabrielle Gauthier Melançon, Katrina Stankiewicz, Oluwanifemi Bamgbose, Fanny Riols, Hoang H. Nguyen, Raghav Mehndiratta, Lindsay Devon Brin, Joseph Marinier, Hari Subramani, Anil Madamala, Sridhar Krishna Nemala, Srinivas Sunkara
精选
EVA-Bench 是一个全新的端到端评估框架,专门用于测试语音智能体(Voice Agents)在真实对话场景中的表现。它解决了现有基准无法同时模拟动态对话和全面衡量语音特有失败模式的问题。框架包含 213 个企业级场景,并引入两个复合指标:EVA-A(准确性)和 EVA-X(体验),分别评估任务完成度、忠实度、语音保真度以及对话流畅性、简洁性和轮次时机。在 12 个系统上的测试显示,没有系统能同时在两个指标上超过 0.5,且峰值性能与可靠性能差距显著。该框架已开源,为语音智能体的标准化评估提供了新工具。
推荐理由:做语音智能体或对话系统的团队终于有了一个能同时测准确性和体验感的基准——EVA-Bench 覆盖了企业场景和噪声鲁棒性,直接帮你对比不同架构的优劣,建议点开看看具体指标设计。
10:56
10:56官方账号Simon Willison’s Weblog博客/媒体
Datasette 项目正式推出官方博客,用于发布一系列即将到来的新功能公告。该博客由 OpenAI Codex desktop 构建,利用了其 Markdown 会话记录导出功能,展示了 AI 辅助编程在网站搭建中的实际应用。博客的构建过程已公开在 GitHub 上,供开发者参考。
事件专题

推荐理由:Datasette 用户和 AI 编程爱好者可以看看这个博客的构建过程——用 Codex 直接生成网站,省去了手动搭建的繁琐,值得一试。
00:33