06:44OpenRouter@OpenRouterAI精选OpenRouter 新增代码检索模型 Voyage Code 4,由 VoyageAI 与 MongoDB 联合推出。该模型支持 Matryoshka 嵌入,可在 256、512、1024、2048 四种维度间灵活切换。同时提供多种量化选项,帮助开发者降低存储与计算成本。开发者可直接在 OpenRouter 平台上调用该模型。AI模型OpenRouterVoyage Code 4VoyageAI推荐理由:写代码的智能体要检索代码库?OpenRouter 上新了 Voyage Code 4,四档嵌入维度可调,还有量化选项,省资源又灵活。原文稍后读已读值得跟进有用关注 OpenRouter
05:42Hailuo AI@Hailuo_AI精选76°MiniMax 正式发布新一代开源权重音乐模型 MiniMax-Music3。该模型定位生产级(production-ready),可用于多种音乐生成场景。官方称其为 SOTA 级开源音乐模型。权重开放,开发者可自行部署和微调。AI模型MiniMaxMusic3开源模型推荐理由:MiniMax 把音乐模型开源了,叫 Music3,号称开源里最强,能直接生成各种风格的音乐,适合想做 AI 音乐应用的人。原文稍后读已读值得跟进有用关注 MiniMax
03:28官方账号Simon Willison@simonw精选Google DeepMind 发布 Gemini 3.7 Flash,官方称其在调试、问题解决等编码任务上较 3.6 Flash 有明显提升。该模型能用更少提示词设计更实用的网页布局和应用,并在真实业务工作流中提供更好的推理和准确性。API 已上线 Google AI Studio 和 Android Studio,Pro/Ultra 用户可在 Gemini App 中使用。不过 3.7 Flash 的“入门定价”计划于 2026 年 12 月 31 日翻倍,发布者认为五个月后该模型可能已过时。AI模型Gemini 3.7 FlashGoogle DeepMind3.6 Flash推荐理由:3.7 Flash 刚出,定价却预告明年翻倍,有点怪。想试试新模型的可以看看它比 3.6 强在哪。原文稍后读已读值得跟进有用关注 Gemini 3.7 Flash
03:23官方账号xAI@xai精选76°Grok 4.6 已上线 Pi 平台。该版本面向长时间运行的智能体任务,编码、知识工作和视觉能力有所提升。定价为输入每百万 tokens 2 美元,输出每百万 tokens 6 美元。用户刷新模型目录即可选用。AI模型Grok 4.6PixAI推荐理由:Pi 上现在能直接用 Grok 4.6,跑长任务智能体更稳,编码和视觉也比之前强,价格也公布了。原文稍后读已读值得跟进有用关注 Grok 4.6
03:02lmarena.ai@lmarena_ai精选Gemini 3.7 Flash (High) 在 Text Arena 中以1490分排名第9,较前代 Gemini 3.6 Flash (High) 的第16位明显提升。分项中创意写作从第12升至第3,数学从第7升至第4,指令跟随从第17升至第9,多轮对话从第21升至第10。其得分与 Qwen-3.8 (Max) 的1491分、Claude Opus 5 (Max) 的1493分几乎持平。AI模型Gemini 3.7 FlashText ArenaQwen-3.8推荐理由:Gemini 3.7 Flash在Text Arena冲到第9,创意写作第3,数学第4,跟Qwen-3.8和Claude Opus 5只差几分。原文稍后读已读值得跟进有用关注 Gemini 3.7 Flash
02:47lmarena.ai@lmarena_ai精选Agent Arena完整排行榜详情已在官网公开,页面地址为arena.ai/leaderboard。官方通过X平台账号发布了链接,该推文目前已有1233次浏览,并附带1张数据图表。用户可前往页面查看各智能体的具体排名与表现。AI模型Agent Arena智能体评测基准推荐理由:想看AI智能体谁强谁弱?Agent Arena完整榜单出来了,去arena.ai/leaderboard就能看。原文稍后读已读值得跟进有用关注 Agent Arena
02:46lmarena.ai@lmarena_ai精选arena.ai更新了Code Arena: WebDev和Text Arena的帕累托前沿图。帕累托前沿展示了不同模型在多维性能上的最优组合。用户可据此快速比较模型,并跳转到对应排行榜查看详细数据。AI模型Code ArenaText Arena帕累托前沿推荐理由:想去arena.ai找代码或文本任务的最强模型?看这个帕累托前沿图,一眼就能知道哪些模型在权衡点上更值。原文稍后读已读值得跟进有用关注 Code Arena
02:31Philipp Schmid@_philschmid精选3.7 Flash在智能体循环中不再过度急切,而是先进行更多探索。3.7 Flash会先解析错误并运行测试,再修改代码。3.7 Flash的首次通过准确率明显更高,浪费的智能体轮次也更少。AI模型3.7 Flash智能体编程推荐理由:3.7 Flash改代码前先摸清环境、跑测试,少走弯路,能省不少无效循环。原文稍后读已读值得跟进有用关注 3.7 Flash
22:49LlamaIndex@llama_index精选ExtractBench测试了14个文档提取系统,使用1950年代监管文件、手填税表和手机拍摄等非数字化文档。Codex在扫描和手写场景准确率超93%,但处理旋转或纯图像页面时降至约80%。专用API表现相反,旋转和手写识别良好,扫描准确率为81%。Gemini 3.5 Flash从干净PDF的88.6%跌至扫描件的71.1%。LlamaIndex的Agentic Plus是唯一无盲区系统,在旋转、扫描和手写三项上分别达到95.9%、93.9%和93.8%。AI模型ExtractBenchCodexGemini 3.5 Flash1 个信源在谈事件专题推荐理由:LlamaIndex测了14个文档提取系统,Codex、Gemini在扫描件上都掉链子,只有Agentic Plus三项全在93%以上。原文稍后读已读值得跟进有用关注 ExtractBench
19:53向阳乔木@vista8精选71°DeepSeek正式发布V4-Pro版本。官方更新文档已在api-docs.deepseek.com上线。开发者可通过该文档查看模型详情与接口变更。AI模型DeepSeekV4-ProAPI推荐理由:DeepSeek的V4-Pro正式版来了,官方文档已更新,想用新模型的可以去看看接口说明。原文稍后读已读值得跟进有用关注 DeepSeek
18:15官方账号NVIDIA AI@NVIDIAAI精选英伟达发布Nemotron 3.5 Lightning,一款30B参数的MoE模型,活跃参数仅3B。该模型由Nemotron 3 Ultra蒸馏而来,现已上线Fireworks平台。它在PinchBench上表现强劲,并在AA-Omniscience非幻觉测试中获得顶尖分数。模型专为高吞吐智能体工作流设计,强调可靠性与专精化。AI模型NemotronFireworksNVIDIA10 个信源在谈事件专题推荐理由:想做智能体又怕模型太贵太慢?Nemotron 3.5 Lightning只有3B活跃参数,在Fireworks上直接就能调。原文稍后读已读值得跟进有用关注 Nemotron
18:14向阳乔木@vista8精选DeepSeek-V4-Pro-0813 已发布,命名日期为 8 月 13 日。百万 tokens 输入缓存命中价 0.025 元,未命中价 3 元,输出价 6 元。对比 Flash 版本,各项价格分别高出 0.005 元、2 元和 4 元。并发限制为 500,明显低于 Flash 的 2500。官方提示当前价格将在近期上涨。AI模型DeepSeekV4-Pro-0813Flash推荐理由:DeepSeek出了V4-Pro-0813,价格比Flash贵不少,并发限制500也更低,想用的话注意近期要涨价。原文稍后读已读值得跟进有用关注 DeepSeek
18:13OpenRouter@OpenRouterAI精选72°xAI 的 Grok 4.6 已上线 OpenRouter,相比 Grok 4.5 有明显提升。在 GPDVal-AA V2 基准上,Grok 4.6 超过其他前沿模型。定价保持每百万输入 2 美元、输出 6 美元。开发者现可通过 openrouter.ai/x-ai/grok-4.6 调用。AI模型GrokOpenRouterxAI推荐理由:Grok 4.6 在 OpenRouter 上线,基准超其他前沿模型,价格还是 2 进 6 出,想试就直接用。原文稍后读已读值得跟进有用关注 Grok
18:11官方一手歸藏(guizang.ai)@op7418精选DeepSeek V4 Pro 的 0831 版本在 API 模型列表中显示为 0813,但更新日志页面没有任何对应记录。官网原本标注“DeepSeek V4 Pro 更新正式版”的横幅已被撤下。模型文档与更新日志版本不一致,且官方没有发布公众号文章或公告。Artificial Analysis 的测试中,V4 Pro 正式版仅比 V4 Flash 高 1 分,几乎持平。作者认为这让熬夜等待测试的用户感到困惑和被戏弄。AI模型DeepSeekV4 ProV4 Flash推荐理由:DeepSeek 悄悄改了 V4 Pro 版本号,但更新日志和公告都没跟上,连跑分也只比 V4 Flash 高 1 分,想确认是不是撤了模型的可以看看这个讨论。原文稍后读已读值得跟进有用关注 DeepSeek
18:10Fireworks AI@FireworksAI_HQ精选Qwen3.8-2.4T-A95B 已在 Fireworks 平台上线,提供 Day-0 支持。该模型采用 2.4T 参数 MoE 架构,专为自主智能体、重度编码和大上下文窗口设计。Fireworks 表示它适合编码和智能体任务,开发者现在即可开始使用。AI模型Qwen3.8-2.4T-A95BFireworks智能体推荐理由:Fireworks 上线了 Qwen3.8-2.4T-A95B,2.4T 参数 MoE,主打智能体和写代码,有 Day-0 支持,直接就能用。原文稍后读已读值得跟进有用关注 Qwen3.8-2.4T-A95B
18:09Windsurf@windsurf_ai精选Cognition 宣布 Grok 4.6 登陆 Devin Desktop 和 Devin CLI。相比 Grok 4.5 提升明显,性能超过 GPT-5.6 Sol。目前表现仅次于 Opus 5 和 Fable 5。AI模型Grok 4.6DevinGPT-5.6 Sol推荐理由:Grok 4.6 已经能在 Devin 里用了,Desktop 和 CLI 都支持,比 GPT-5.6 Sol 强,仅次于 Opus 5 和 Fable 5,想尝鲜的赶紧试试。原文稍后读已读值得跟进有用关注 Grok 4.6
18:08官方账号Cohere@cohere精选Cohere 今日推出 North Micro Vision,这是其最小的视觉语言模型,专为复杂文档理解设计。该模型以 Apache 2.0 许可证开源,权重已上传至 Hugging Face。相比 Cohere 其他模型,North Micro Vision 更轻量,适合在资源受限场景下处理视觉任务。开发者可直接从 Hugging Face 下载权重进行部署。AI模型CohereNorth Micro Vision视觉语言模型推荐理由:Cohere 出了个超小的视觉模型 North Micro Vision,专门用来读懂复杂文档,而且开源了,直接去 Hugging Face 就能下载权重。原文稍后读已读值得跟进有用关注 Cohere
18:06官方账号NVIDIA AI@NVIDIAAI精选71°Harvey联合Trajectory Labs对NVIDIA的Nemotron 3.5 Lightning进行后训练,在Legal Agent Bench上得分从0%升至8.3%。该成绩超过了Opus 4.6和更大的后训练版Nemotron 3 Ultra。后训练覆盖九个执业领域,未出现能力退化。平均输出长度从90k tokens降至37k tokens,每token奖励提升2.4倍。AI模型Nemotron 3.5 LightningNVIDIAHarvey10 个信源在谈事件专题推荐理由:Harvey把Nemotron 3.5 Lightning后训练了一把,法律Agent评测从0冲到8.3%,比Opus 4.6还强,输出也从90k缩到37k,省Token。原文稍后读已读值得跟进有用关注 Nemotron 3.5 Lightning
18:04官方账号NVIDIA AI@NVIDIAAI精选NVIDIA Nemotron 3.5 Lightning 已在 Together AI 平台上线。该模型被定位为同类中速度最快的开源模型。它专为常驻型智能体设计,能快速完成高吞吐量的专业工作。AI模型NVIDIANemotron 3.5 LightningTogether AI10 个信源在谈事件专题推荐理由:NVIDIA 的 Nemotron 3.5 Lightning 开源模型上线 Together AI,跑得最快,适合需要高强度处理任务的智能体。原文稍后读已读值得跟进有用关注 NVIDIA
18:04官方账号NVIDIA AI@NVIDIAAI精选Reasonable 团队用 4B token 的合成 Verus 数据微调了 NVIDIA 最新开源模型 Nemotron 3.5 Lightning(30B)。微调后的模型在单次尝试通过率上超越了一个规模约 50 倍于它的模型,pass@3 则几乎持平。它的 token 生成速度也快于测试过的所有同尺寸开源模型。配套博客还分析了各模型在形式化证明中的失败方式、作弊行为,以及微调带来的影响。AI模型NemotronNVIDIAVerus10 个信源在谈事件专题推荐理由:Reasonable微调了NVIDIA的30B开源模型,形式化证明通过率胜过50倍大的模型,生成还更快。博客还拆解了模型怎么作弊。原文稍后读已读值得跟进有用关注 Nemotron
17:54官方账号Cohere@cohere精选Cohere 宣布其视觉模型 North Micro Vision 已集成至开源微调框架 Axolotl。用户无需自备 GPU 或服务器,即可直接开始训练该模型。Axolotl 官方文档已提供 Cohere 模型的配置说明,地址为 docs.axolotl.ai。这降低了视觉模型微调的门槛。AI模型North Micro VisionAxolotlCohere推荐理由:想微调 Cohere 的视觉模型 North Micro Vision?现在用 Axolotl 就能跑,不用自己买显卡,直接上手试试吧。原文稍后读已读值得跟进有用关注 North Micro Vision
17:53官方账号NVIDIA AI@NVIDIAAI精选Trajectory 获得 NVIDIA Nemotron 3.5 Lightning 早期访问权,在 Harvey LAB 上完成后训练。该后训练在 Trajectory 平台一键完成,无需新工程。模型在一项测试中从 0% 提升到 8.3%,超过 Opus 4.6 的 6.6%。Trajectory 强调持续学习让小型模型可每晚、按客户反复训练,逼近按量计费的智能。AI模型NemotronNVIDIATrajectory10 个信源在谈事件专题推荐理由:Trajectory 一键后训练 Nemotron 3.5 Lightning,测试冲到 8.3% 超 Opus 4.6,小模型按客户定制能落地。原文稍后读已读值得跟进有用关注 Nemotron
17:52lmarena.ai@lmarena_ai精选DeepSeek-V4-Pro (Max)在LMArena Code Arena WebDev榜单以1607分暂列第8,开源模型中排名第2。其分数低于Kimi K3 (Max)的1674分,也低于GPT-5.6 Sol (xHigh)的1622分。该成绩来自AutoEval早期评分,由奖励模型基于人类偏好自动投票产生,并非真人实时投票。后续真人投票加入后,最终排名可能变化。AI模型DeepSeek-V4-ProCode ArenaKimi K310 个信源在谈事件专题推荐理由:DeepSeek新模型V4-Pro专攻代码生成,在Code Arena排第8,开源第2,仅次于Kimi K3,还超过了GPT-5.6 Sol。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Pro
17:51向阳乔木@vista8精选Deepseek V4 Pro 0813在网友vista8的测试中完成了三个任务。第一个任务调用3个Skill完成网站开发、子域名解析和上线。第二个任务模仿60种设计风格生成Bento卡片图。第三个任务用Three.js制作3D打砖块游戏。AI模型Deepseek V4 Pro 0813Three.js网站开发推荐理由:vista8用Deepseek V4 Pro 0813跑了三个活:网站部署、60种设计风格、3D游戏,视频挺直观。原文稍后读已读值得跟进有用关注 Deepseek V4 Pro 0813
17:46LlamaIndex@llama_index精选ExtractBench 基准包含 370 份企业文档和 14 个提取系统。最难的测试是长列表完整性,例如 26,725 行的未认领财产清单。前沿视觉语言模型在长文档上 F1 仅为 8.9%–35.8%,精度高但召回率大幅下降。LlamaIndex 的新方案 Agentic Plus 将长文档迭代处理,在长列表任务上达到 96.1% F1。AI模型ExtractBenchLlamaIndexAgentic Plus1 个信源在谈事件专题推荐理由:LlamaIndex 搞了个 ExtractBench,测了 14 个系统,发现长文档提取召回率很低。它家 Agentic Plus 能到 96.1%,比别的都稳。原文稍后读已读值得跟进有用关注 ExtractBench
17:45lmarena.ai@lmarena_ai精选Arena AutoEval 使用数千万条历史人类对战数据训练奖励模型,以大规模估算人类偏好并快速输出评估结果。与 LLM-as-judge 方法不同,AutoEval 是实时基准,来源于真实对战数据,由奖励模型对用户提示和模型回复打分。该方法由 Arena 机器学习工程师 Haoran Guo 和 Wayne Zhang 介绍。AI模型Arena AutoEval奖励模型基准测试推荐理由:Arena 用数千万人类真实对战数据训了个奖励模型,评估速度飞快,还比 LLM-as-judge 更贴近真实偏好。原文稍后读已读值得跟进有用关注 Arena AutoEval
17:42lmarena.ai@lmarena_ai精选DeepSeek-V4-Pro (Max) 在 Code Arena: WebDev 的 AutoEval 中获得 1607 分,总分第 8,开放权重模型中排第 2。该成绩仅次于 GPT-5.6 Sol 的 1622 分和 Kimi K3 (Max) 的 1674 分。其定价为每百万 tokens 输入 $0.435、输出 $0.87,低于 Opus-4.8 的 $5/$25 和 GLM-5.2 的 $1.4/$4.4。目前该分数为早期 AutoEval 结果,后续会随真人投票收敛。AI模型DeepSeekV4-ProCode Arena8 个信源在谈事件专题推荐理由:DeepSeek 又发新模型了,V4-Pro (Max) 在编码榜上排开源第二,比贵得多的 Opus-4.8 还强,价格只要零头。原文稍后读已读值得跟进有用关注 DeepSeek
13:03Geek@geekbb精选DeepSeek V4 Pro-0813 发布后,有开发者认为其表现不如预期惊艳,未达到美国一线模型水平。评论指出,小模型如 DeepSeek-V4-Flash、Qwen 27b 和 GLM-5.2 在同尺寸下表现出色,而大模型可能因训练算力不足显得对齐不够。该观点将 V4 Pro 的落差归因于欠训和算力短缺,而非架构缺陷,并预期随着算力增加会逐步改善。AI模型DeepSeekV4 ProGLM3 个信源在谈事件专题推荐理由:DeepSeek V4 Pro 到底行不行?这条推文用公开数据聊了聊它为什么不够惊艳,顺便夸了 Flash 和 GLM-5.2,观点挺实在。原文稍后读已读值得跟进有用关注 DeepSeek
12:39AI Will@FinanceYF5精选xAI 在 Grok 4.5 基础上进行了更长的补充训练,加入推理、工程和高级技术数据,并让 Grok 4.5 重新生成 SFT 轨迹。强化学习阶段覆盖知识工作、通用编程、内核优化、网页开发和 CAD 等任务,目标直指复杂工程技术场景。AI模型Grok 4.5xAI推理模型推荐理由:xAI 把 Grok 4.5 又练了更长一轮,还专门强化编程、内核和 CAD,想搞技术活的话可以看看。原文稍后读已读值得跟进有用关注 Grok 4.5
07:20官方账号NVIDIA AI@NVIDIAAI精选NVIDIA 发布全新 MoE 模型 Nemotron 3.5 Lightning。distil labs 作为欧洲发布合作伙伴,对其进行了微调。该团队将微调版与 4 个可比 MoE 模型在 6 项任务上对比,未微调时排名第三,微调后跃居第一。完整数值与失败场景已公布在 distil labs 博客上。AI模型Nemotron 3.5 LightningNVIDIAdistil labs10 个信源在谈事件专题推荐理由:NVIDIA 的 Nemotron 3.5 Lightning 微调后,在 6 项任务上超过 4 个同类 MoE 模型拿了第一。想知道怎么调出来的,可以看这篇。原文稍后读已读值得跟进有用关注 Nemotron 3.5 Lightning
AITOP7月8日 10:58智谱AI GLM-Image:中文AI图像生成领域的破局者智谱AI最近发布的GLM-Image确实在AI图像生成领域投下了一枚重磅炸弹。免费、无水印、中文文本渲染能力强,这三个特点组合在一起,足以让整个行业重新审视中国AI技术的实际进展。 国内AI图像生成工具一直面临着中文文本渲染的难题。Midjourney等国外工具虽然在图像质量上表现优异,但对中文的支持却始终不尽如人意。GLM-Image的出现,似乎正在改变这一现状。GLM