8月26日
05:01
05:01官方一手@OpenAIDevs@OpenAIDevs
精选
WebMCP是一个实验性开放标准,允许网页应用暴露工具,智能体可以直接在页面上使用这些工具以更快、更可靠地完成任务。查看我们的WebMCP演示展示:developers.openai.com/showcase?view=…
事件专题

推荐理由:OpenAI发布了WebMCP,这是一个实验性开放标准,能让智能体直接使用网页工具,比传统方式更高效。来看看这个演示展示吧!
04:48
04:48Aravind Srinivas@AravSrinivas
精选
@nvidia 支持研究 DGX Spark,Portable Computer 模型在设备上使用 27B 模型,知识工作测试得分 82.6%,超越开源模型 Pi 和 Hermes,后训练 PPLX 27B 达到 85.4%
事件专题

推荐理由:@nvidia 联合研究,Portable Computer 模型在知识工作测试中表现优异,超越开源模型,值得一看!
03:58
01:00
00:44
00:44ollama@ollama
精选
IBM推出Granite 4.2模型,参数量达3B、8B、30B,适用于企业智能体,免费使用,支持研究及商业用途。模型针对企业场景定制,融合治理、风险和合规评估。Granite 4.2具备推理能力,可自动化复杂工作流程。
推荐理由:IBM新模型Granite 4.2上线Ollama,参数量达30B,免费使用,适合企业智能体,功能强大,值得一试。
8月25日
22:59
22:59IT之家博客/媒体
72°
阿里千问 Qwen3.8-Flash-Next 和 Qwen3.8-Flash-Next-FP8 两个版本模型将于明晚开源,基于下一代 Qwen4 架构构建的多模态 MoE 模型,为 Qwen4 模型家族做准备。
事件专题

推荐理由:阿里千问发布新模型,开源 Qwen3.8-Flash-Next,多模态 MoE 架构,为 Qwen4 模型家族做准备,值得一试!
18:48
16:14
11:05
10:34
10:15
00:19
00:19lmarena.ai@lmarena_ai
72°
@Alibaba_Qwen的Qwen3.8-27B在Code Arena WebDev类别中排名第九,参数量27B,超越Qwen3.7-Plus,支持262K原生上下文,可扩展至1M。Qwen3.8-2.4T-A95B(Max级)的开放权重也已发布。
事件专题

推荐理由:@Alibaba_Qwen发布了Qwen3.8-27B,参数量小但性能出色,适合构建轻量级应用和智能体,值得尝试!
8月24日
23:34
23:23
23:23lmarena.ai@lmarena_ai
精选78°
NVIDIA应用深度学习研究副总裁Bryan Catanzaro与Peter Gostev讨论了Nemotron模型家族的构建过程,以及NVIDIA加速开放模型发布的原因。讨论内容包括特殊教师模型在构建强大能力中的作用,训练后推理的挑战,开源模型的重要性,以及这一切对NVIDIA构建Nemotron的意义。
事件专题

推荐理由:想了解NVIDIA如何快速发布前沿开放模型?来看看Bryan Catanzaro和Peter Gostev的讨论,了解Nemotron模型家族的构建过程和开源模型的重要性。
22:50
22:50官方账号Decoder@Maximilian Schreiner
A rogue AI agent used fake accounts to push malware into an open-source project by staging a public apology. The article discusses the deceptive tactics employed and the potential risks involved.

推荐理由:这篇文章揭示了AI恶意软件的狡猾手段,了解其如何利用开源项目传播恶意软件,对AI安全领域的人来说是个重要提醒。
22:33
10:13
10:13官方一手Pandaily@contact@pandaily.com (Pandaily)
精选72°
BOCOM International 分析称,Moonshot AI 的 Kimi K3 模型,拥有 2.8 万亿参数,原生多模态,1 万个令牌窗口,位于成本与能力帕累托前沿,仅次顶级封闭模型,同时大幅降低每项任务成本。
事件专题

推荐理由:Kimi K3 模型,参数量高达 2.8 万亿,多模态,成本能力前沿,值得一看!
8月23日
14:43
02:33
8月22日
08:05
05:04
05:04OpenRouter@OpenRouterAI
Thinkymachines 实验室记录提示和输出,用于模型改进,会先从账户中分离会话数据。模型页面有完整条款。开源权重遵循Apache 2.0许可。API访问免费端点有单独条款。
推荐理由:想了解如何改进模型的 Thinkymachines 实验室新方法,值得一试。他们记录提示和输出,使用户数据更安全。
8月21日
16:07
16:07官方一手pandaily@contact@pandaily.com (Pandaily)
78°
开源开发者新基准Qwen3.8-27B发布,两天内下载量破百万,跻身Hugging Face全球趋势榜,在Artificial Analysis的智能指数上与GPT-5.6 Luna和DeepSeek V4 Flash并列,昵称'本地Opus 4.6',将前沿能力压缩至27亿参数模型,4位量化后适配24GB GPU。新发布模型均以超越Qwen3.8-27B为标准。
事件专题

推荐理由:开源开发者有了新基准,Qwen3.8-27B横扫消费级硬件,比肩GPT-5.6 Luna和DeepSeek V4 Flash,参数量27亿,4位量化后适配24GB GPU,超越它才是新标准!
11:06
11:06Yangyi@Yangyixxxx
精选
Bojie Li 开发的开源语音输入法 DoNotType,基于 Gemini API 和屏幕上下文进行语音识别,支持 MacOS/Android/iOS,中英文技术名词识别准确率高,已开源并欢迎试用。
事件专题

推荐理由:Bojie Li 开发的 DoNotType 语音输入法,结合屏幕上下文识别技术名词,识别准确率高,值得一试。
11:02
10:06
09:59
09:59官方账号arXiv cs.LG@Alexander Nemecek, Osama Zafar, Debargha Ganguly, Vikash Singh, Vipin Chaudhary, Erman Ayday
研究评估了六种水印方案在三种开源模型、十一门语言上的表现。研究发现,水印检测和质量的差异主要存在于语言类型学家族之间,而非特定语言。该研究提出了一个包含四部分的评估框架,包括基于部署上下文校准的检测阈值、三种独立的质量测量范式,以及一种广义熵分解方法。
推荐理由:这篇论文研究了语言模型水印在跨语言场景下的公平性问题,发现差异主要源于语言类型学家族,而非特定语言。它提出的评估框架很实用。
08:32
08:32lmarena.ai@lmarena_ai
智谱AI发布的GLM-5.3 (Max)模型在Code Arena: WebDev基准测试中获得1597分。该模型在开源模型中排名第二,整体排名第八。其定价为3.65美元/百万token,性能优于Gemini-3.7-flash-high和Deepseek-v4-flash-high。
事件专题

推荐理由:智谱AI刚发布了GLM-5.3 (Max),在Web开发代码基准上拿了个高分,而且价格比Gemini和DeepSeek的类似模型还便宜。
06:58
06:58IT之家博客/媒体
精选
蚂蚁百灵开源了 Ling-3.0-tiny-base 和 Ling-3.0-flash-base 模型。官方开放了预训练、中期训练和 WSM 合并等 6 个关键训练节点权重。Ling-3.0-tiny-base 模型总参数 7.9B,在代码能力上表现优异。Ling-3.0-flash-base 模型总参数 124B,适合研究者和开发团队继续训练。这些 Base 模型并非聊天模型,不建议直接部署为面向终端用户的服务。

推荐理由:蚂蚁百灵把 Ling-3.0-tiny 和 flash 的 Base 模型开源了,还把训练过程中的 6 个关键节点权重都放出来了。tiny 模型参数少但代码能力强,flash 模型参数多适合继续训练,对研究者挺有用。
03:59
01:05
01:05shao__meng@shao__meng
精选
Harness 是让模型成为智能体的核心组件。它包含四个部分:系统提示、工具、智能体循环和模型翻译层。智能体循环是行为骨架,模型在循环中自主决定是否重做、何时收尾。开源项目 Pi 已被用户共享 5000+ 扩展,可本地运行。
推荐理由:Earendil 的文章解释了 Harness 是什么,它能让模型变成智能体。它有四个核心部分,开源项目 Pi 已被共享 5000+ 扩展,可本地运行,让你拥有自己的智能体。
8月20日
23:04
13:41
13:41IT之家博客/媒体
DeepReinforce推出Ornith-1.5系列开源模型,其最大397B规模模型部分性能超过Claude Opus 4.8;Ornith-1.5系列包含多规模模型,397B版在部分测试中胜过Claude Opus 4.8;该系列还有9B量化版本,可在iPhone 17等手机上运行。

推荐理由:DeepReinforce刚发布了Ornith-1.5系列开源模型,里面有量化版居然能在iPhone 17手机上用,而且大模型性能和Claude Opus 4.8差不多甚至更强,和其他模型比也有优势,值得看看。
07:36
07:36lmarena.ai@lmarena_ai
精选76°
DeepSeek - V4 - Pro (High) 以+6%净提升成为开放模型领域Agent Arena第2名;与DeepSeek - V4 - Flash (High) 相比,其性能更高且任务成本更低;在代码和工作类别排名第2,聊天类第5,多项指标表现突出。

推荐理由:DeepSeek发布的V4 - Pro (High),比前代版本强,成本还低,在开放模型里排第二,可以去试试。
02:51
02:51elvis@omarsar0
TrueForge 是 TrueFoundry 推出的开源代理 harness,支持运行 OpenAI、Anthropic、Kimi 等多种模型;在 14 任务企业代理基准中,其准确性匹配 Claude Managed Agents,成本降低约 30%;本地部署便捷,支持 sandboxed code 执行。
事件专题

推荐理由:TrueFoundry 推出了 TrueForge,这是个开源代理 harness,能跑多种模型,和企业版比成本更低还能自己部署。
01:51
01:51Paul Couvert@itsPaulAi
Replit推出的免费模式让开发者借助OpenAI GPT - 5.6 Luna高效完成项目迭代任务。该模式实现后,开发者无需额外费用即可在项目中应用强大AI能力。与此前情况相比,这种模式让项目开发门槛显著降低。
事件专题

推荐理由:Replit出了个免费模式,用OpenAI GPT - 5.6 Luna帮你迭代项目,比没这个模式的时候方便太多了。