8月25日
05:04
00:19
00:19lmarena.ai@lmarena_ai
72°
@Alibaba_Qwen的Qwen3.8-27B在Code Arena WebDev类别中排名第九,参数量27B,超越Qwen3.7-Plus,支持262K原生上下文,可扩展至1M。Qwen3.8-2.4T-A95B(Max级)的开放权重也已发布。
事件专题

推荐理由:@Alibaba_Qwen发布了Qwen3.8-27B,参数量小但性能出色,适合构建轻量级应用和智能体,值得尝试!
8月24日
10:13
10:13官方一手Pandaily@contact@pandaily.com (Pandaily)
精选72°
BOCOM International 分析称,Moonshot AI 的 Kimi K3 模型,拥有 2.8 万亿参数,原生多模态,1 万个令牌窗口,位于成本与能力帕累托前沿,仅次顶级封闭模型,同时大幅降低每项任务成本。
事件专题

推荐理由:Kimi K3 模型,参数量高达 2.8 万亿,多模态,成本能力前沿,值得一看!
05:34
8月23日
17:59
17:59官方一手歸藏(guizang.ai)@op7418
Ox Alpha 模型、DeepSeek V4 Flash、Vision EXP 模型和 Claude Fable 5 模型进行对比,Claude Fable 5 在排版细节和色散处理上表现更佳;Ox Alpha 模型在多模态和代码能力上表现出色,可还原 3D 玻璃材质质感。
事件专题

推荐理由:看看 Claude Fable 5 在排版和色散处理上的优势,以及 Ox Alpha 模型的多模态和代码能力,和其它模型有何不同。
17:13
14:10
8月22日
14:58
05:03
03:38
03:38官方账号Decoder@Matthias Bastian
Deepseek推出V4-Flash-Vision-Exp,一个实验性多模态模型,为V4-Flash的文本能力添加图像理解。在公司自己的多模态智能体基准测试中,其性能接近Opus 4.8,有时甚至超越它。

推荐理由:Deepseek新推出的V4-Flash-Vision-Exp模型,将图像理解能力与文本处理结合,在多模态智能体基准测试中表现优异,与Opus 4.8不相上下,值得一试。
00:03
8月21日
22:05
19:58
19:53
18:53
18:38
18:05
18:03
18:03
18:03官方账号深度求索 DeepSeek@deepseek_ai
78°
DeepSeek-V4-Flash-Vision-Exp模型在DeepSeek API平台上线,文本能力与DeepSeek-V4-Flash相当,多模态性能提升显著,接近Opus-4.8。DeepSeek Harness 0.1.1版本支持新模型。
事件专题

推荐理由:DeepSeek新模型上线,文本和推理能力提升,多模态性能接近Opus-4.8,值得一试!
17:28
17:28IT之家博客/媒体
精选
深度求索发布多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp,支持多模态适配,API 计费按 token 计算,支持 Chat Completions、Messages、Responses 三种格式调用。Files API 已上线,不收费。

推荐理由:深度求索新模型上线,多模态能力提升,API 访问方便,适合各种 Agent 工具集成。
16:09
16:09官方一手Pandaily@contact@pandaily.com (Pandaily)
精选
小红书发布自研大模型dots3-note,MoE模型,总参数280B,激活参数16B,512K上下文,支持文本、视觉和语音理解。以Apache 2.0协议在Hugging Face和GitHub上开源,华为Ascend零延迟适配,标志着月活跃用户超3亿的平台上,AI从功能转变为基础。

推荐理由:小红书开源自研大模型,支持多模态理解,与华为Ascend深度适配,为内容平台构建AI基础,值得关注。
14:34
11:29
11:02
09:36
09:36OpenRouter@OpenRouterAI
OpenRouter 发布了 FLUX Video Upscale 工具。该工具提供两种模式:`precise` 模式可更快完成放大并保留更多身份特征。`creative` 模式则能修复并生成更多细节。
事件专题

推荐理由:OpenRouter 刚刚发布了 FLUX Video Upscale,能放大视频,有 `precise` 和 `creative` 两种模式,一个快一个细节多。
06:43
06:02
06:02官方一手AWS Machine Learning Blog@Melanie Li
Amazon Bedrock 现在在超过 25 个 AWS 区域提供 OpenAI GPT-5.6 模型(Sol、Terra 和 Luna)的跨区域推理功能。该功能通过 US 地理和全球推理配置文件来路由请求,以实现更高的吞吐量。用户可以通过 OpenAI 和 Converse API 调用这些模型。文档还介绍了如何配置 IAM、配额和监控。
事件专题

推荐理由:AWS 在 Bedrock 上为 OpenAI GPT-5.6 模型增加了跨区域推理,能提升全球请求的吞吐量,适合需要低延迟和高可用性的开发者。
05:03
05:03elvis@omarsar0
精选
一篇关于持续学习的新论文提出了一种名为“受保护 harness 演化”的方法。该方法将 harness 组件的更新提议与实际提交分离开来。通过使用持续优化器和持续评估器,该方法在文本推理、多模态感知和开放世界交互等任务上实现了超过10%的相对增益。论文还定义并量化了“harness 级别遗忘”这一现象。

推荐理由:这篇论文讲的是怎么让AI智能体在更新技能或记忆时,不会把之前学好的东西忘了。它把更新和评估分开,效果比原来好10%以上,对做智能体的人很有用。
03:43
03:06
03:05
03:02
02:20
02:20官方账号Pika Labs@pika_labs
Pika Labs 发布了新的 Pika Music 模型。该模型接受文本、歌词、语音参考和音乐参考四种输入模态。这些信号在一个共享的潜在扩散解码器中融合,生成完整的音乐曲目。它不是一系列独立的工作流程。
推荐理由:Pika Labs 新出的 Pika Music 模型,能同时用文字、歌词、声音和音乐来生成一首歌,比分开处理更方便。
01:37
01:37lmarena.ai@lmarena_ai
Agent Arena 排行榜衡量模型在数百万个真实世界、长周期任务中的表现。模型可使用网络搜索、文件系统和终端工具完成复杂工作流。该榜单通过因果追踪方法,衡量模型相对于平均模型的结果表现。
推荐理由:看看 arena.ai 上新出的 Agent Arena 排行榜,它用真实任务测试模型,还能用工具,比普通测试更实用。
01:29
01:29官方一手@OpenAIDevs@OpenAIDevs
78°
ChatGPT Pro、Business 和 Enterprise 用户可在 Mac 上使用 Computer History 功能。该功能可让 ChatGPT 记住用户在应用和网站上的活动。Computer History 能为 ChatGPT 提供更丰富的上下文,帮助其理解工作模式并建议重复性任务的技能或计划。
事件专题

推荐理由:OpenAI 给 ChatGPT Pro、Business 和 Enterprise 用户上了个新功能,能让它记住你之前在电脑上干了啥,下次聊天不用再重复解释背景了。