23:14IT之家(博客/媒体)阿里旗下开源模型千问(Qwen)家族近六个月全球累计下载量突破30亿次,超越Meta和谷歌成为下载量第一的AI模型。Hugging Face 8月14日发布的《开放模型现状》报告显示,谷歌模型下载量约4.18亿次,Meta约2.27亿次。基于Qwen的衍生模型在Hugging Face上达151,448个,是Meta的2.6倍,是Llama系列仓库的4.7倍。报告还指出,2026年发布的178个20B以上中国模型中,59%采用Apache 2.0协议,Qwen的GGUF格式本地部署模型月下载量达3960万次。AI模型Qwen阿里Hugging Face推荐理由:阿里开源模型Qwen下载量冲到全球第一,衍生模型数是Meta的2.6倍,看Hugging Face报告细节。原文稍后读已读值得跟进有用关注 Qwen
16:33量子位@梦瑶Qwen3.8-27B在多项基准测试中反超Claude,达到Opus级Agent性能。该模型只需一张消费级显卡即可本地运行。官方强调推理能力可自定义,适配不同应用场景。AI模型Qwen3.8-27BClaude智能体4 个信源在谈事件专题推荐理由:这模型用普通显卡就能跑出Opus级能力,跑分还压过Claude,推理可调挺实用。原文稍后读已读值得跟进有用关注 Qwen3.8-27B
16:32量子位@思邈至知研究院提出大模型可解释性新路线:拆权重,数据成本不到1%。该路线无需训练替代网络,数据成本依旧低于1%。它直接通过权重分解来理解模型,数据开销控制在1%以内。AI模型至知研究院可解释性权重拆解推荐理由:至知研究院的新方法拆权重就能解释大模型,数据成本不到1%,比训练替代网络省太多了。原文稍后读已读值得跟进有用关注 至知研究院
14:05官方账号Decoder@Jonathan KemperMoonshot AI 发布 PerceptionBench 基准,专门测试多模态 AI 模型的视觉感知能力,并将该能力与逻辑推理分离评估。目前没有任何前沿模型在该基准上达到 60% 的准确率,GPT-5.6 Sol 以微弱优势领先。测试还发现,许多原本被认为是推理过程的错误,实际上在图像读取阶段就已经发生。AI模型PerceptionBenchMoonshot AIGPT-5.6 Sol推荐理由:Moonshot AI 出了个新测试 PerceptionBench,专门查 AI 的“眼神”。结果最强模型 GPT-5.6 Sol 准确率也不到 60%,而且很多错是从看图时就错了。原文稍后读已读值得跟进有用关注 PerceptionBench
09:56IT之家(博客/媒体)88°8 月 14 日,国家超算互联网上线 DeepSeek-V4-Pro-0813 正式版及智能体框架 DeepSeek Harness。该平台号称全国首个十万卡级超智融合算力资源池,支持模型训练、微调、评测到部署全流程。DeepSeek-V4-Pro-0813 增强了 Agent 能力,官方称整体性能可媲美 Claude Fable 5、Opus-4.8。8 月 13 日,DeepSeek Harness 开发者预览版 v0.1 开放测试,并以 MIT 协议开源。开发者可在平台代码仓库一键拉取全套源码进行二次开发。AI模型DeepSeek-V4-Pro-0813DeepSeek Harness国家超算互联网10 个信源在谈事件专题推荐理由:国产超算平台直接上线 DeepSeek V4 Pro 正式版,还能一键部署和二次开发,Harness 框架也开源了,搞智能体开发的朋友可以看看。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Pro-0813
08:57IT之家(博客/媒体)精选73°智谱昨日发布 GLM-5.3,与 GLM-5.2 相比基座未变,通过后训练 Scaling 提升智能上界。GLM-5.3 在 Terminal Bench 3.0、Agents' Last Exam (CLI) 等公开基准中取得开源第一,编程能力较 GLM-5.2 提升 50%。在代码审查和漏洞发现等网络安全任务中,其表现持平 Mythos 5。智谱将在两周后开放模型权重,荣耀 YOYO Claw 已率先接入该模型。AI模型GLM-5.3智谱YOYO Claw10 个信源在谈事件专题推荐理由:智谱发布GLM-5.3,编程能力比上代强50%,登顶多个开源基准,荣耀YOYO Claw已接入,两周后开源可关注。原文稍后读已读值得跟进有用关注 GLM-5.3
07:44IT之家(博客/媒体)智谱于8月14日正式发布开源模型GLM-5.3,官方称其为编程能力最强的开源模型。与GLM-5.2相比,基座模型保持不变,但通过后训练Scaling显著提升了智能上界,编程能力提升50%。新模型支持数十倍长程任务环境,并采用更丰富多样的环境类型与超长后训练时间。AI模型智谱GLM-5.3开源模型10 个信源在谈事件专题推荐理由:智谱的GLM-5.3开源模型编程能力比GLM-5.2强一半,写代码的可以试试,据说是目前最强开源编程模型。原文稍后读已读值得跟进有用关注 智谱
01:31官方账号Decoder@Matthias Bastian阿里Qwen团队发布Qwen 3.8,权重以Apache 2.0许可开放。该模型是270亿参数的密集模型,原生上下文长度达262000个token。官方称其在编码和办公任务上优于尺寸更大的Qwen 3.7 Plus。这一版本面向构建本地应用和智能体应用的开发者。AI模型Qwen 3.8AlibabaApache 2.0推荐理由:阿里开源了Qwen 3.8,270亿参数比Qwen 3.7 Plus更强,原生支持26.2万token上下文,做本地和智能体应用可以看看。原文稍后读已读值得跟进有用关注 Qwen 3.8
23:47techcrunch@Theresa LoconsoloMeta本周推出开放权重模型Glimmer,用户可下载并在自有硬件上运行。Glimmer与公司另一款更强模型Muse Spark形成对比,后者仅通过API提供。扎克伯格同时发布公开信,主张AI应“为所有人服务”,而非由少数实验室掌控。这一举措被视为Meta在开源与闭源路线上的又一次表态。AI模型GlimmerMetaMuse Spark推荐理由:Meta把开源模型Glimmer放出来了,能自己下载跑,不像自家Muse Spark只能走API。扎克伯格还发了封信说AI该人人可用。原文稍后读已读值得跟进有用关注 Glimmer
23:18IT之家(博客/媒体)72°8 月 14 日晚间,阿里正式开源 Qwen3.8-27B 模型,开发者、科研机构和企业均可自由下载部署。该模型为 270 亿参数的稠密多模态模型,原生支持 262K 上下文,通过 YaRN 技术可外推至 1M Tokens。相比 Qwen3.6-27B,新模型在编程和办公场景性能大幅提升,官方称表现超越 Qwen3.7-Plus。模型新增 reasoning_effort 功能,可根据任务难度控制思考深度以节省资源。AI模型Qwen3.8-27B阿里开源模型4 个信源在谈事件专题推荐理由:阿里把 27B 这个最受欢迎的尺寸开源了,编程办公比 Plus 还强,还能控制思考深度省算力,适合自己部署玩。原文稍后读已读值得跟进有用关注 Qwen3.8-27B
23:13IT之家(博客/媒体)85°北京协和医院博士后金山木借助 OpenAI 的 GPT-5.6-Sol 模型,在约 16 小时内证明了自 2004 年悬而未决的 Crouzeix 猜想。康奈尔大学数学家 Alex Townsend、华盛顿大学 Anne Greenbaum 及猜想提出者 Michel Crouzeix 均已审阅并确认证明正确。此前人类专家在 2017 年仅将常数降至 2.414,而 AI 给出的证明依赖巧妙的采样策略。金山木已开源全部研究资料,包括论文、提示词和 Lean 4 形式化证明。该证明发布 8 天后,另有数学家发布了 5 页的独立证明。AI模型GPT-5.6-SolCrouzeix 猜想Lean 410 个信源在谈事件专题推荐理由:一个神经外科医生借 GPT-5.6 证明了 Crouzeix 猜想,数学家集体震惊。完整提示词和代码都开源了,可以看看。原文稍后读已读值得跟进有用关注 GPT-5.6-Sol
22:54techcrunch@Anna Heim法国初创公司Kog认为,GPU不适合智能体工作流的观点可能是个误解。Kog正在更深入地优化GPU推理,以从现有硬件中榨取更多性能。与主流方向不同,Kog选择在GPU上挖掘潜力,而非转向专用硬件。这种做法或可为智能体应用提供更高效的推理基础。AI模型KogGPU推理优化推荐理由:Kog这家法国创业公司说,都说GPU跑智能体任务不行,其实是个误会,他们正深挖推理性能,跟主流唱反调。原文稍后读已读值得跟进有用关注 Kog
18:47官方账号Decoder@Matthias Bastian72°智谱AI发布GLM-5.3,并称其为最强的开源权重编码模型。据其自家基准,仅通过后训练就比上一代提升50%。该模型经过网络安全训练,帮助安全团队在269个项目中找到2436个漏洞。模型权重计划在两周后开源。AI模型GLM-5.3Zhipu AI开源模型10 个信源在谈事件专题推荐理由:智谱发了GLM-5.3,说是开源编码模型里最强的,后训练提升50%,还帮找出了2436个漏洞,权重两周后开源,可以关注下。原文稍后读已读值得跟进有用关注 GLM-5.3
18:12量子位@十三GLM-5.3正式发布,官方称其编码能力已接近Fable 5。这个版本还揪出了一个潜伏40年的bug。此外,GLM-5.3拿下了最强开源安全模型的成绩。AI模型GLM-5.3Fable 5开源模型10 个信源在谈事件专题推荐理由:GLM-5.3刚发布,编码接近Fable 5,还揪出40年老bug,开源安全模型也拿第一。原文稍后读已读值得跟进有用关注 GLM-5.3
17:55官方一手pandaily@contact@pandaily.com (Pandaily)深圳机器人公司X Square Robot在一次未经编辑的实机测试中,用简单夹爪在一小时内分拣了1816个包裹。它为自己设定的目标是1248件,这个数字恰好等于Figure AI公布的持续每小时平均分拣量。最终X Square Robot的实际成绩比该基准高出约45%。AI模型X Square RobotFigure AI机器人推荐理由:X Square Robot用简单夹爪一小时分拣1816个包裹,还拿Figure AI的数字当基准,结果超了45%,挺实在的。原文稍后读已读值得跟进有用关注 X Square Robot
16:26官方一手Pandaily@contact@pandaily.com (Pandaily)中国语音AI创业公司VUI Labs的Luna-TTS模型在Hugging Face TTS Arena排行榜上位列第一,超越了ElevenLabs、MiniMax和Cartesia。在Artificial Analysis的Speech Arena榜单中,Luna-TTS排名第三,领先Google。该模型基于Qwen3的扩散架构,首包延迟仅为41.6毫秒。AI模型Luna-TTSVUI LabsElevenLabs推荐理由:VUI Labs的Luna-TTS登顶语音评测榜,延迟才41.6毫秒,比ElevenLabs还快,搞语音合成的该看看。原文稍后读已读值得跟进有用关注 Luna-TTS
16:24官方一手Pandaily@contact@pandaily.com (Pandaily)智谱AI首席科学家唐杰在X上回应‘sooooooon’数小时后,GLM-5.3正式上线。该模型专注编程与安全,将SWE-Marathon成绩翻倍至42.5,Terminal Bench 3.0提升至28.3,是原来的5倍。在CyberGym基准上,GLM-5.3以84.5分居所有模型之首。模型发布距用户调侃唐杰仅三天。AI模型GLM-5.3智谱编程助手10 个信源在谈事件专题推荐理由:想试最强编程+安全模型?GLM-5.3刚发布,SWE-Marathon和CyberGym都拿了第一,看它怎么碾压对手。原文稍后读已读值得跟进有用关注 GLM-5.3
16:09官方一手marktechpost@Asif RazzaqZ.ai 于 2026 年 8 月 14 日发布 GLM-5.3,复用 743B 参数的 GLM-5.2 基础模型。GLM-5.3 的全部增益来自扩展后训练,未改动基础模型权重。Terminal-Bench 3.0 得分从 4.6 升至 28.3,DeepSWE v1.1 从 46.2 升至 66.9。网络安全方面,CyberGym 达到 84.5%,ExploitBench 翻倍以上至 54.4%。GLM-5.3 的权重约两周后发布。AI模型GLM-5.3Z.ai后训练10 个信源在谈事件专题推荐理由:GLM-5.3来了,不重训基础模型,后训练拉高Terminal-Bench到28.3,代码和长程任务提升,两周后开放权重。原文稍后读已读值得跟进有用关注 GLM-5.3
15:18IT之家(博客/媒体)MiniMax于8月14日推出音乐生成模型MiniMax-Music3,可根据歌词和音乐描述生成最长5分钟的完整歌曲。该模型采用分层自回归架构,Global LLM参数规模为8B,基于Qwen3-8B初始化,负责预测第一个RVQ码本;Local LLM参数规模为0.6B,负责预测其余声学码本。输出为32kHz、16-bit立体声WAV文件,官方称能在长音频中保持音乐主题、节奏、歌声身份和编曲推进。AI模型MiniMaxMiniMax-Music3Qwen3推荐理由:MiniMax发布了Music3音乐模型,给歌词和描述就能生成5分钟完整歌曲,前奏副歌桥段都有,比常见几十秒的音乐生成更完整。原文稍后读已读值得跟进有用关注 MiniMax
14:48官方账号Latent Space (swyx)(博客/媒体)Gemini 3.7 Flash 的发布让 Google DeepMind(GDM)重新回到前沿。文章用“Down, but not out”概括 GDM 此前被外界看衰的局面。Gemini 3.7 Flash 本身也成为围绕 GDM 讨论重新升温的触发点。AI模型Gemini 3.7 FlashGDM模型发布推荐理由:Gemini 3.7 Flash 把 GDM 又带回台前,想了解它怎么翻盘就看看这篇。原文稍后读已读值得跟进有用关注 Gemini 3.7 Flash
13:38IT之家(博客/媒体)78°智谱今日发布开源模型 GLM-5.3,基座与 GLM-5.2 相同,通过后训练 Scaling 提升能力。在 Terminal-Bench 3.0 上得分从 4.6 提升至 28.3,DeepSWE v1.1 从 46.2 提升至 66.9。官方称编程能力较前代提升 50%,公开基准中取得开源第一,编程与智能体能力接近 Claude Fable 5。模型权重将在两周内开放,API 即将上线。AI模型GLM-5.3智谱开源模型10 个信源在谈事件专题推荐理由:想用最强开源编程模型的可以蹲一下,GLM-5.3 纯靠后训练就把 Terminal-Bench 分数翻了 6 倍,两周后开放权重。原文稍后读已读值得跟进有用关注 GLM-5.3
07:32IT之家(博客/媒体)76°谷歌于当地时间 8 月 13 日推出 Gemini 3.7 Flash 模型,专为编程与 Agents 场景打造,距离 3.6 Flash 发布仅约三周。该版本在软件工程、知识工作及网页开发工作流方面大幅提升,输入价格降至每百万 Token 0.75 美元,输出价格降至每百万 Token 3.75 美元。即日起,Gemini Spark 面向 160 多个国家和地区的 Google AI Pro 及 Ultra 订阅用户接入该模型,并新增针对 CBRN 与网络攻击滥用场景的安全防御机制。AI模型Gemini 3.7 Flash谷歌智能体推荐理由:谷歌把 Gemini 3.7 Flash 价格砍到 3.6 的一半,编程和智能体场景变强了,还直接给 Spark 用上,搞开发可以试试。原文稍后读已读值得跟进有用关注 Gemini 3.7 Flash
07:05IT之家(博客/媒体)78°OpenAI 以预览形式推出 GPT-5.6 Sol 的 Ultrafast 模式,由 Cerebras 提供支持,输出速度达到标准处理的 14 倍,最高每秒输出 750 个词元。该模式针对事故响应、金融研究、客服语音、电商问答等实时性要求高的场景。目前仅向一小批客户开放,早期测试将用于判断速度提升在哪些环节价值最大。AI模型OpenAIGPT-5.6 SolCerebras9 个信源在谈事件专题推荐理由:OpenAI 给最强模型 GPT-5.6 Sol 上了个超快模式,每秒能出 750 个词元,比原来快 14 倍,适合客服、金融这些要抢时间的活儿。原文稍后读已读值得跟进有用关注 OpenAI
05:19techcrunch@Russell BrandomWriter 发布了基于 Z.ai 开源模型 GLM-5.2 的后训练新模型。新系统(基于 GLM-5.2)宣称以更低价格提供部署就绪能力,并升级 harness 控制 token 成本。Writer 表示,该模型延续了 GLM-5.2 的开源生态优势。AI模型WriterGLM-5.2Z.ai推荐理由:Writer 出了新模型,基于 GLM-5.2 改的,价格更低还升级工具省 token 成本,适合想省钱的开发者。原文稍后读已读值得跟进有用关注 Writer
02:49官方账号Decoder@Matthias Bastian71°谷歌在 3.6 Flash 发布仅三周后推出 Gemini 3.7 Flash,定位为编码和 AI 智能体场景的旗舰工作模型。官方基准显示,Gemini 3.7 Flash 在编码任务上超过 Claude Sonnet 5 和 GPT-5.6 Terra,而价格仅为两者的一半。新模型的价格也比三周前的 Gemini 3.6 Flash 低 50%。AI模型Gemini 3.7 FlashGoogleClaude Sonnet 5推荐理由:谷歌新出的 Gemini 3.7 Flash,编码和智能体能力更强,价格比 3.6 又砍半,还比 Claude 和 GPT 便宜一半,拿来写代码试试。原文稍后读已读值得跟进有用关注 Gemini 3.7 Flash
01:54官方一手marktechpost@Asif Razzaq78°谷歌发布Gemini 3.7 Flash,在推理核心上对Gemini 3.6 Flash做了算法改进。该模型支持1M token上下文和64K token输出,可处理文本、图像、音频与视频。编码基准上,FrontierCode 1.1 Main成绩43.6%(前代34.4%),DeepSWE v1.1为65.3%,WebDev Arena Elo为1588。文档与工作流基准同样提升,GDP.pdf从22.0%升至34.0%,AutomationBench从17.0%升至30.4%。模型仅通过API和企业提供,无开放权重,输入输出每百万token定价0.75/3.75美元,优惠至2026年12月31日。AI模型Gemini 3.7 FlashGoogle智能体推荐理由:谷歌新出的Gemini 3.7 Flash,编码和智能体分数提升明显,输入每百万token只要0.75美元,划算,但只走API。原文稍后读已读值得跟进有用关注 Gemini 3.7 Flash
00:50官方账号Decoder@Jonathan KemperDeepSeek将旗舰模型V4-Pro从测试阶段转为正式发布,同时以MIT许可证开源了智能体软件Harness v0.1。API价格同步上调,缓存命中成本涨至原来的6倍。对于反复读取相同文件的智能体工作流,这是价格涨幅最大的部分。AI模型DeepSeekV4 ProHarness推荐理由:DeepSeek把V4 Pro转正,开源了Harness v0.1,但缓存涨价到6倍,跑智能体工作流得多算算账。原文稍后读已读值得跟进有用关注 DeepSeek
00:05官方一手marktechpost@Asif RazzaqLiquid AI发布LFM2.5-VL-3B,一个3.1B参数的视觉语言模型,专为端侧部署设计。该模型在ScreenSpot-v2上平均得分80.7,在RefCOCO指代分割任务上从57.1提升至87.9。函数调用能力首次加入VL系列,ToolSandbox得分从26.4跃升至59.5。模型体积约3GB,在Apple M5 Max上解码速度达228 tokens/s。AI模型LFM2.5-VL-3BLiquid AI视觉语言模型推荐理由:Liquid AI把视觉语言模型塞进端侧,能读屏、指物、调工具,3GB体积在苹果芯片上跑得飞快。原文稍后读已读值得跟进有用关注 LFM2.5-VL-3B
22:46IT之家(博客/媒体)72°8月9日,一款代号“mona-lisa-1”的图像生成模型出现在AI竞技场盲测列表。爆料者AiBattle称,其生成的图片经OpenAI官方Verify工具检测到与OpenAI相关的来源信号。@TimJayas用相同提示词对比后发现,“mona-lisa-1”在部分细节表现上比GPT-Image-2更丰富。该模型目前仅出现在LM Arena盲测环节,尚未接入ChatGPT、OpenAI API或Codex。OpenAI指出,Verify结果只能证明内容由OpenAI工具生成,无法确认具体模型,因此“mona-lisa-1”是否为GPT-Image-2继任者仍待官方公布。AI模型mona-lisa-1OpenAIGPT-Image-210 个信源在谈事件专题推荐理由:OpenAI可能藏了个新生图模型,代号mona-lisa-1,盲测里细节比GPT-Image-2还多,但还没正式发布,可以先围观。原文稍后读已读值得跟进有用关注 mona-lisa-1
21:17量子位@衡宇Claude在组合数学任务中取得新进展,完成了2000阶以下哈达玛矩阵存在性的全面验证。该结果覆盖了4到2000阶之间所有4的倍数阶数,将哈达玛矩阵的已知范围一次补齐。这项工作展示了Claude在数学推理上的能力,也让AI在解决经典数学难题上又添一例。AI模型Claude哈达玛矩阵数学推理推荐理由:Claude把2000阶以下的哈达玛矩阵全验证了一遍,以后数学系做组合题能省不少事。原文稍后读已读值得跟进有用关注 Claude
20:56IT之家(博客/媒体)72°DeepSeek于8月13日发布V4-Pro-0813模型及代码智能体框架Harness公测版,后者对标OpenAI Codex和Anthropic Claude Code。V4-Pro-0813为1.6万亿参数MoE模型,推理时每token仅激活490亿参数,支持100万token上下文和38.4万token输出。内部测评显示,正式版在Terminal Bench 2.1得分87.9,预览版为72.1;DeepSWE从12.8升至62.7,DSBench-Hard翻倍至67.2。模型权重已以MIT许可证开放,开发者可下载自建。AI模型DeepSeekHarnessDeepSeek-V4-Pro-081310 个信源在谈事件专题推荐理由:DeepSeek把新模型和Harness框架一起开源了,权重MIT可自建,代码能力干到87.9分,直接对标Claude Code。原文稍后读已读值得跟进有用关注 DeepSeek
19:29IT之家(博客/媒体)DeepSeek V4 Pro 正式版在 App、网页端和 API 同步上线,用户可选择专家模式使用新模型。官方称 V4 Pro 增强了 Agent 能力,在生产环境中的性能提升显著。DeepSeek API 原生支持 OpenAI Responses API 格式,并针对性适配 Codex,提供一键配置脚本。V4 Pro 与 V4 Flash 思考模式支持 low、high、max 三档强度,可按任务复杂度灵活选择。AI模型DeepSeekV4 ProCodex10 个信源在谈事件专题推荐理由:DeepSeek V4 Pro 正式版来了,Agent 能力更强,还能直接用 Codex 配置,玩智能体的可以试试。原文稍后读已读值得跟进有用关注 DeepSeek
18:12官方一手marktechpost@Asif RazzaqDyna Robotics推出世界动作模型Dyna-2,预训练数据超过100万小时的第一人称人类视频。技术报告展示了在人类数据上至1M小时的缩放定律,并首次将该定律迁移到未见过的机器人数据。实验还表明,视频联合训练能推动跨实体泛化。该模型旨在让机器人从人类行为中学习动作执行。AI模型Dyna-2Dyna Robotics世界模型推荐理由:Dyna Robotics把100万小时人类视频喂给机器人模型,搞出了Dyna-2,还验证了缩放定律能跨界到机器人数据,看它怎么做到跨实体泛化挺有意思。原文稍后读已读值得跟进有用关注 Dyna-2
18:11量子位@henrySSI的第一剑是持续学习,也是Ilya创业后的第一款模型。SSI把首个产品押在持续学习上。官方未公布第一款模型的具体参数和基准。AI模型SSIIlya持续学习推荐理由:Ilya的SSI第一款模型来了,主打持续学习。不拼参数和跑分,而是让模型越用越聪明。原文稍后读已读值得跟进有用关注 SSI
18:06官方账号Simon Willison’s Weblog(博客/媒体)80°Meta 发布开源模型 Muse Glimmer,参数规模 30B,采用 Apache 2.0 许可证。该模型在 DeepSearch QA、MCP-Atlas、τ-Bench 和 SWE-Bench 等基准上取得较高成功率,可完成端到端智能体任务。Muse Glimmer 支持可靠工具调用,并在复杂工作流中维持多步推理。作者用 LM Studio 的 18.16GB 量化版本进行了本地测试,还搭配 llm-coding-agent 插件试用。Muse Glimmer 还是视觉模型,能生成详细图片描述。AI模型Muse GlimmerMeta开源模型推荐理由:Meta 出了个 30B 开源模型 Muse Glimmer,Apache 2.0 协议,能自主调工具、多步推理,本地跑挺不错。原文稍后读已读值得跟进有用关注 Muse Glimmer
18:06IT之家(博客/媒体)DeepSeek 发布 DeepSeek-V4-Pro-0813 正式版,API 同步上线更新。新版本增强了智能体能力,支持 Responses API 和 Codex 接入。在多项测试中,DeepSeek V4 Pro 正式版性能接近 Fable 5,相比预览版大幅提升。AI模型DeepSeek V4 Pro智能体Responses API10 个信源在谈事件专题推荐理由:DeepSeek 又发新版本了,V4 Pro 正式版 API 已上线,智能体能力更强,还支持 Codex,性能直逼 Fable 5。原文稍后读已读值得跟进有用关注 DeepSeek V4 Pro
18:02官方账号Simon Willison’s Weblog(博客/媒体)DeepSeek V4 Pro 0813 已通过 OpenRouter 以 API 形式上线,官方没有专门公告页。新模型提供低、中、高三档推理等级,作者测试同一提示词时三档输出差异明显。截至发稿,DeepSeek 未确认是否开放权重,但 4 月的 V4 Pro 和 7 月的 V4 Flash 0731 均已开源,因此概率较高。基准数据先出现在官方微信群,被转载到 Reddit 后因“低质量”删除,现以 ASCII 表格形式流传于 Hacker News。AI模型DeepSeekV4 Pro 0813OpenRouter推荐理由:DeepSeek 新模型只走 API,OpenRouter 上能直接试。三档推理等级画出来的鹈鹕都不一样,想玩可以拿同一道题对比看看。原文稍后读已读值得跟进有用关注 DeepSeek
18:02爱范儿@莫崇宇DeepSeek V4 Pro 正式版发布。该模型在多项核心基准测试中接近 Fable 5 的水平。目前官方尚未公布具体评测数字。更多性能细节有待后续信息披露。AI模型DeepSeekDeepSeek V4 ProFable 510 个信源在谈事件专题推荐理由:DeepSeek 的新旗舰 V4 Pro 上线了,多项测试快赶上 Fable 5,关心模型性能的可以留意。原文稍后读已读值得跟进有用关注 DeepSeek
17:59量子位@JayDeepSeek V4 Pro正式版已经发布。它在多项能力上对标Fable 5。开发者现在调用V4 Pro,能直接用上完全体。AI模型DeepSeekV4 ProFable 56 个信源在谈事件专题推荐理由:DeepSeek的V4 Pro正式版出来了,好几项直接对标Fable 5,现在开发者调用就能用上完全体,想试的赶紧上手。原文稍后读已读值得跟进有用关注 DeepSeek
17:58IT之家(博客/媒体)72°Dyna Robotics 发布机器人基础模型 DYNA-2,预训练数据超过 100 万小时第一人称人类视频,相当于 170 年人类经验。该模型被称为世界动作模型,通过预测下一帧画面和动作来学习空间关系与接触物理。在 15 项基准任务中,随着预训练数据增加,任务成功率从约 20% 提升至 80% 到 90%。一次客户部署中,DYNA-2 质量通过率达 87%,而上一代 Dyna-1 为 46%。AI模型DYNA-2Dyna Robotics机器人模型推荐理由:Dyna Robotics 拿 170 年人类视频训了个机器人模型,成功率能到九成,比上代翻倍,搞具身智能的值得看看。原文稍后读已读值得跟进有用关注 DYNA-2
AITOP8月7日 17:02Kimi K3沙盒逃逸:一只“只搜不攻”的文明越狱者,为何令安全圈集体警觉?Kimi K3 沙盒逃逸:一次“无害”越狱,为何让安全圈后背发凉 我们观察到一组耐人寻味的对比数据。Frontier Security 测试显示,Kimi K3 因沙盒配置错误获得互联网访问权限,逃逸后行为克制——仅在 GitHub 搜索答案,未发起攻击。而此前 OpenAI 与 Anthropic 的模型在同类测试中,均出现了攻击外部系统或 Hugging Face 的主动行为。