03:27官方账号NVIDIA AI@NVIDIAAI精选NVIDIA 发布 Metropolis Blueprint for Video Search and Summarization (VSS) 3,允许用自然语言提示分析实时流和视频库。新版本包含16种智能体技能,如搜索、摘要、警报、报告和片段审查。提供统一开源仓库,附带 Docker 和 Helm 部署配置以加速部署。支持多视频报告,集成 Nemotron 3 Nano Omni 模型实现跨视频和音频的规模化洞察。3D 多摄像头追踪达到生产就绪级别,并取得 SOTA 性能。AI模型NVIDIAMetropolisVSS 37 个信源在谈事件专题推荐理由:NVIDIA 刚发了 VSS 3,你的编程代理现在能用一句话搜索、总结视频了,新增16种技能和3D追踪,比以前好用得多。原文稍后读已读值得跟进有用关注 NVIDIA
02:37AK@_akhaliq阿里发布Qwen-AgentWorld,一个基于Qwen的语言世界模型,专为通用智能体设计。该模型旨在帮助智能体理解环境动态并做出决策。目前尚未公开具体的基准测试结果或性能数据。AI模型Qwen-AgentWorldQwen阿里推荐理由:阿里出了AgentWorld世界模型,让智能体能更好地理解环境,做Agent开发的朋友可以关注一下。原文稍后读已读值得跟进有用关注 Qwen-AgentWorld
02:24官方账号Clement Delangue@ClementDelangue精选Kog在HuggingFace上开源了其2B参数模型,该模型此前被用于演示,运行速度达到3000+ tokens每秒。开源模型可供开发者下载和部署,适用于快速推理场景。AI模型KogHuggingFace2B模型推荐理由:Kog开源了一个2B模型,每秒能处理3000多个token,适合需要高速推理的任务。原文稍后读已读值得跟进有用关注 Kog
02:12官方账号OpenAI@OpenAI73°OpenAI发布新版GPT-5.5 Instant,提升了理解问题意图和自适应回答的能力。新模型能更可靠地处理复杂约束,并让购物与本地推荐更实用连贯。该版本今天向付费用户推送,明天向免费用户开放。AI模型GPT-5.5OpenAI推理模型10 个信源在谈事件专题推荐理由:聊天更懂你,推荐更靠谱,免费用户明天就能用上,赶紧试试。原文稍后读已读值得跟进有用关注 GPT-5.5
01:39Philipp Schmid@_philschmid83°Google 在 Gemini 3.5 Flash 模型中内置了计算机使用功能,代理可接收屏幕和目标后自主执行操作。支持浏览器、手机(安卓/iOS)和桌面环境三种模式。内置安全防护、用户确认机制和自动停止功能,并针对提示注入进行了额外训练。开发者演示了让代理自动审计网页、运行代码片段并返回报告。AI模型Gemini 3.5 FlashGoogle计算机使用推荐理由:Gemini 3.5 Flash 现在能直接操控你的屏幕,自动干测试网页、点按钮这些活,比普通 AI 助手更像真工具。原文稍后读已读值得跟进有用关注 Gemini 3.5 Flash
01:18Jerry Liu@jerryjliu0精选Mistral OCR 在 ParseBench 上与多个前沿和开源权重模型进行对比测试。它在语义格式化方面表现突出,能准确处理删除线、上下标、标题层级和链接。在内容忠实度(阅读顺序、幻觉、遗漏)和视觉定位(边界框)上也具有竞争力。表格处理能力一般,几乎没有图表能力。其价格明显低于 Azure Doc Intelligence 和 AWS Textract 等 OCR 服务商。AI模型Mistral OCRParseBenchOCR推荐理由:Mistral OCR 在 ParseBench 上语义格式化很强,价格还比 Azure/AWS 便宜,适合做高质量 OCR 又不愿花大价钱的场景。原文稍后读已读值得跟进有用关注 Mistral OCR
00:49berryxia@berryxia77°Qwen团队直接训练了一个语言世界模型Qwen-AgentWorld,核心目标是从头建模环境而非仅训练Agent行为。模型需预测终端输出、网页变化及代码执行后状态,而非单纯学习操作。利用该模型作为模拟器进行可控Sim RL,在某些任务上模拟训练的Agent性能甚至超过真实环境训练的Agent。此外,仅做环境预测的预训练能力可直接迁移到多轮Agent任务,在多个benchmark上取得显著提升,包括未见领域。Qwen开源了35B MoE版本及对应基准。AI模型QwenQwen-AgentWorld世界模型推荐理由:通义千问出了个新模型,不是教Agent怎么动,而是先让模型懂环境变化。用模拟环境练出的Agent反而比真实环境练的还强,还开源了35B版,值得看看。原文稍后读已读值得跟进有用关注 Qwen
00:24OpenRouter@OpenRouterAISakanaAI 推出 Fugu Ultra,这是一个多模型协作系统,已在 OpenRouter 平台上线。该系统让多个模型协同工作,旨在超越单一模型性能。它体现了“集体智能”理念,目前可在 OpenRouter 上试用。AI模型SakanaAIFugu UltraOpenRouter推荐理由:想试试多个模型一起干活的效果?Fugu Ultra 在 OpenRouter 上就能玩,感受集体智能。原文稍后读已读值得跟进有用关注 SakanaAI
00:10berryxia@berryxiaEverOS 是一个为 AI Agent 设计的开源记忆操作系统,在 ACL 2026 发表。其核心 HyperMem 采用超图结构组织记忆,在长期对话任务中召回率超过 93%,而传统 RAG 约 45%。加上 Skills 自进化策略后,27B 参数模型任务成功率提升 234.8%,性能追平 397B 模型。该项目在 GitHub 获得 7200 星,支持 Claude Code、Codex 等主流框架,安装只需三行命令。AI模型EverOSHyperMemACL 2026推荐理由:EverOS 开源了,安装三行命令就能让 AI 记住所有对话,27B 小模型靠记忆打败 397B 大模型,试试看。原文稍后读已读值得跟进有用关注 EverOS
22:40官方账号阿里通义 Qwen@Alibaba_Qwen精选Qwen发布Paradigm II,一种基于世界建模的Agent基础模型。它通过单轮环境预测直接测试于多轮工具调用任务,无需Agent强化学习或任务特定调优。在7项基准上均取得提升,域内Terminal-Bench 2.0提升6.3%、SWE-Bench提升3.4%、WideSearch提升12.8%。域外基准Claw-Eval提升11.3%、QwenClawBench提升9.7%、BFCL v4提升9.0%。世界建模将'先预测后行动'内化为可迁移的推理模式。AI模型QwenParadigm II推理模型推荐理由:Qwen做了个新Agent模型Paradigm II,不用额外训练就在终端、编码、搜索和工具调用任务上全涨分,尤其没见过的任务也管用。原文稍后读已读值得跟进有用关注 Qwen
22:39官方账号阿里通义 Qwen@Alibaba_Qwen精选73°阿里Qwen团队开源了Qwen-AgentWorld-35B-A3B模型,采用MoE架构,总参数量35B,每次推理激活3B参数,支持256K上下文长度。同时发布了AgentWorldBench基准,用于评估智能体的世界建模能力。该模型在多个现实环境模拟任务上表现优于同等规模模型。相关论文已发布于arXiv,代码和模型权重在GitHub和Hugging Face上开放。AI模型QwenAgentWorldMoE推荐理由:阿里新开源了35B参数的MoE模型,只激活3B,256K超长上下文,配合AgentWorldBench,研究智能体世界建模的赶紧试试。原文稍后读已读值得跟进有用关注 Qwen
22:39官方账号阿里通义 Qwen@Alibaba_Qwen精选71°Qwen-AgentWorld是阿里Qwen团队发布的原生语言世界模型,在单一模型中模拟MCP、搜索、终端、SWE、Web、OS和Android共7种智能体环境。环境建模被设定为训练目标,而非后处理适配。在AgentWorldBench基准上,该模型超越Claude Opus 4.8和GPT-5.4。可控SimRL利用此世界模型作为环境进行强化学习,效果超过在真实环境中训练。仅通过预测环境的预热训练,无需智能体特定微调,预测知识即可零微调迁移至智能体任务。AI模型Qwen-AgentWorld智能体世界模型推荐理由:阿里Qwen造了个能模拟7种环境的AgentWorld,在AgentWorldBench上干掉了Claude和GPT最新版,训练智能体不用真实环境也能更强,零微调迁移呢。原文稍后读已读值得跟进有用关注 Qwen-AgentWorld
22:36小互@imxiaohu字节跳动推出新 AI 音乐模型 SeedMusic 1.0 Preview,用户输入一句话提示词即可在 2-3 分钟内生成一首完整歌曲。该模型支持古风、流行等风格混合,效果流畅且节奏感强。测试提示词为“来一首古风歌曲,但有现代流行节奏感”,输出结果朗朗上口。AI模型SeedMusic字节跳动音乐生成推荐理由:字节跳动新出的 SeedMusic 1.0 Preview 能一句话生成完整歌曲,2-3分钟出活,古风混流行节奏的效果挺不错。原文稍后读已读值得跟进有用关注 SeedMusic
22:18shao__meng@shao__meng89°OpenAI 联合 Broadcom 和 Celestica 从零设计并成功流片了首款自研 LLM 推理加速器 Jalapeño,耗时 9 个月,宣称能效显著优于当前 SOTA。该芯片专为 ChatGPT、Codex 和 API 等工作负载优化,计划从 2026 年底起以吉瓦级规模部署。此举是 OpenAI 垂直整合战略的一部分,与 Google TPU、Amazon Trainium 等路径一致,旨在通过自研芯片提升推理效率、降低成本和改善用户体验。AI模型JalapeñoOpenAIBroadcom10 个信源在谈事件专题推荐理由:OpenAI 和 Broadcom 联手搞了颗推理芯片 Jalapeño,9 个月就流片了,能效比现在最好的还强,计划 2026 年底大规模部署,想自己掌控底层硬件。原文稍后读已读值得跟进有用关注 Jalapeño
19:54Geek@geekbbDeepseek V4 Flash 是一款小型模型,能完成约 80% 原本需要 Claude 或 Codex 处理的任务。每任务成本仅为 Fable 的 1/137,性价比极高。该模型展示了小模型在特定场景下的实用价值,但需要更优的编排来发挥全部潜力。AI模型Deepseek V4 FlashClaudeCodex推荐理由:小模型 Deepseek V4 Flash 能搞定八成任务,成本只有 Fable 的零头,超划算!原文稍后读已读值得跟进有用关注 Deepseek V4 Flash
19:12orange.ai@oran_geCola上线了Seed 2.1 Pro模型,这是一款原生多模态模型,官方声称是目前多模态最强。相比Seed 2.0版本,该模型在Coding和Agent能力上有所增强。用户可通过colaos.ai进行体验。AI模型ColaSeed 2.1 Pro多模态3 个信源在谈事件专题推荐理由:Cola刚发了Seed 2.1 Pro,说是多模态最强,coding和agent比2.0强不少,想试试去colaos.ai就行。原文稍后读已读值得跟进有用关注 Cola
15:24Stanford AI Lab@StanfordAILab精选斯坦福团队提出SPIRAL框架,通过强化学习让LLM在测试时自动协调顺序推理、并行采样和结果聚合。与传统只优化单链推理的训练方法不同,SPIRAL使用set RL训练模型生成对聚合器集体有用的多个候选答案,并用标准RL优化聚合器从这些候选合成改进答案。该方法使所有测试时计算维度(长链、并行样本、聚合)端到端可学习,缩小训练与部署的差距。AI模型SPIRALLLM强化学习推荐理由:斯坦福团队发了SPIRAL,让LLM训练时就学会并行采样和聚合答案,不是只会单链思考,更符合实际推理场景。原文稍后读已读值得跟进有用关注 SPIRAL
13:13官方账号vLLM@vllm_projectvLLM 项目宣布支持 DFlash 投机解码,用户只需将 EAGLE-3 检查点替换为 DFlash 检查点即可启用,无需修改代码。该功能通过开源 Speculators 库将 DFlash 草案模型与目标模型的隐藏状态连接。在单块 Blackwell Ultra GPU 上运行 Gemma-4 31B 模型,Math500 基准取得 5.8 倍吞吐量提升,GSM8K 提升 5.3 倍,HumanEval 提升 5.6 倍,MBPP 提升 4.4 倍。AI模型DFlashvLLMGemma-410 个信源在谈事件专题推荐理由:vLLM 和 NVIDIA 合作推出 DFlash 投机解码,Gemma-4 31B 推理速度提升近 6 倍,配置只需改一行 checkpoint 路径。原文稍后读已读值得跟进有用关注 DFlash
12:40小互@imxiaohu精选百度发布新 OCR 模型 UnlimitedOCR,支持单次推理解析数百页文档,同时保持高吞吐速度。在 OmniDocBench v1.5 基准上,其准确率达到 93%,比原始 DeepSeek-OCR 基线提升 6 个百分点。模型已开源,可在 Hugging Face 和 GitHub 下载。AI模型UnlimitedOCRBaiduOmniDocBench8 个信源在谈事件专题推荐理由:百度新出的 UnlimitedOCR 能一次处理几百页,速度还很快,直接比 DeepSeek-OCR 高了 6 个点,真正好用。原文稍后读已读值得跟进有用关注 UnlimitedOCR
12:39小互@imxiaohu精选百度开源的Unlimited OCR模型采用参考滑动窗口注意力(R-SWA)技术,能在32K上下文内一次前向推理处理数十页文档,无需分页。模型仅3B参数、500M激活,显存和算力不随页数增长。传统逐页OCR需要拼接结果,而R-SWA模拟人类连续抄写,始终记忆固定大小的文本。该模型据称基于DeepSeek OCR核心贡献者开发,已在标准长度文档上测试。AI模型Unlimited OCR百度R-SWA8 个信源在谈事件专题推荐理由:百度开源了一款OCR模型,3B参数就能一次处理几十页PDF,不用切页,比传统逐页OCR强太多。原文稍后读已读值得跟进有用关注 Unlimited OCR
10:56AI Will@FinanceYF5Anthropic 在官方博客中发布了 Claude 3.5 Sonnet。该模型在 HumanEval 和 GSM8K 等基准上相比前代有提升。博客还提供了性能细节和定价信息。AI模型AnthropicClaude推理模型10 个信源在谈事件专题推荐理由:Anthropic 发了篇博客讲他们的新模型,基准测试成绩比前代好,开发者和研究者可以看看。原文稍后读已读值得跟进有用关注 Anthropic
07:34官方账号Mistral AI@MistralAIMistral 推出 OCR 4,独立标注员对600多份真实文档进行盲评,涵盖12种以上语言。在所有对比系统中,OCR 4 被优先选择,平均胜率达72%。该结果基于随机排序的双盲测试,标注员无法识别系统来源。AI模型MistralOCR 4OCR推荐理由:Mistral 的 OCR 4 盲测赢了所有对手,处理多国语言文档很稳,平均胜率72%,值得试试。原文稍后读已读值得跟进有用关注 Mistral
06:03OpenRouter@OpenRouterAIOpenRouter 宣布提供 GLM 5.2 模型的所有服务商入口,共列出 20 个提供商。其中一条服务线路的推理速度超过 125 tokens/秒。用户可在单一页面比较并选择不同服务商。这标志着 GLM 5.2 的部署生态进一步开放。AI模型GLM 5.2OpenRouter开源模型推荐理由:想用 GLM 5.2 但不清楚哪家快?OpenRouter 把 20 个提供商列在一起了,还能直接选超 125 TPS 的那条线。原文稍后读已读值得跟进有用关注 GLM 5.2
03:27AK@_akhaliqLing and Ring 2.6 技术报告发布,展示了在万亿参数规模下实现高效且即时的智能体智能。该模型专注于 agentic intelligence 领域,通过优化架构和推理机制降低延迟。报告详细介绍了其训练方法、性能基准以及与传统大模型的对比结果。具体数字和基准名称需查阅完整报告。AI模型Ling and Ring智能体万亿参数规模推荐理由:想了解万亿参数级别的智能体模型怎么做吗?Ling and Ring 2.6 报告给出了具体方案。原文稍后读已读值得跟进有用关注 Ling and Ring
03:18官方账号NVIDIA AI@NVIDIAAI精选NVIDIA发布DFlash,一种开源轻量级块扩散模型,专为投机解码设计。在NVIDIA Blackwell硬件上,DFlash可实现高达15倍的推理吞吐量提升,同时保持相同的用户交互响应速度。与传统逐token解码不同,DFlash一次生成整个token块,由主模型并行验证。该方案即插即用,已集成到SGLang、TensorRT-LLM和vLLM等框架中。AI模型DFlashNVIDIABlackwell8 个信源在谈事件专题推荐理由:NVIDIA开源了DFlash,用块扩散投机解码让Blackwell推理提速15倍,还支持SGLang和vLLM,随手就能用。原文稍后读已读值得跟进有用关注 DFlash
01:10Milvus@milvusio精选Milvus 尝试跳过压缩步骤,直接在文档完整 embedding list 上建立 HNSW 图索引。该方法在 TREC-COVID 上 nDCG@10 达 0.98,远超 MUVERA、LEMUR 等方法的 0.87-0.89。端到端检索中 TREC-COVID 分数 0.516 与 BruteForce 完全持平,MS MARCO 上 0.957 接近精确上限的 0.966。但构建成本显著增大:MS MARCO 平均长度 87 时耗时 6 倍,TREC-COVID 长度 236 时达 18 倍。对于 ColQwen2 等每文档含 5143 个 patches 的长向量,该方法成本过高无法实用。实验揭示当前近似策略的质量损失主要源自向量压缩步骤而非 HNSW 索引本身。AI模型HNSWMilvus嵌入列表索引推荐理由:Milvus 把 embedding 列表直接塞进 HNSW,质量几乎追上暴力搜索,比 MUVERA 高了一截,但成本也翻了 6-18 倍,长文档还不支持。适合对精度有极致需求的项目。原文稍后读已读值得跟进有用关注 HNSW
01:02官方账号LMSYS Org (SGLang)@lmsysorg79°与NVIDIA合作,在GB300上使用SGLang服务DeepSeek-V4,实现5倍吞吐量提升(~2,200→~11,200 tok/s/GPU,交互性~50 tok/s/user)。借助MTP,在80 tok/s/user交互性下吞吐再提升2.6倍。Blackwell Ultra聚合模式下30 tok/s/user时吞吐提升2.91倍,峰值无MTP吞吐提升超6倍。采用W4A4 MegaMoE量化(MXFP4)且精度损失可忽略。单个FP8-einsum修复将MTP接受率从0.57提至0.70。AI模型DeepSeek-V4GB300SGLang8 个信源在谈事件专题推荐理由:想用SGLang在GB300上榨干DeepSeek-V4?NVIDIA合作实测,吞吐翻5倍,交互延迟不变,MTP和量化细节全公开。原文稍后读已读值得跟进有用关注 DeepSeek-V4
01:01官方账号LMSYS Org (SGLang)@lmsysorg精选Krea 2 是由 Krea AI 推出的开源文本到图像模型,在独立评测机构 Artificial Analysis 上排名第一。它包含两个版本:RAW 为未蒸馏基座检查点,适合微调和 LoRA 训练;Turbo 为 8 步蒸馏检查点,实现快速高质量生成。用户可在 RAW 上训练 LoRA,在 Turbo 上进行推理,并已获得 SGLang 的 Day-0 支持。AI模型Krea 2SGLangRAW推荐理由:Krea 2 开源了双版本,RAW 用来训练 LoRA,Turbo 跑推理,直接用 SGLang 就能跑,比闭源模型更灵活。原文稍后读已读值得跟进有用关注 Krea 2
00:57AK@_akhaliqPlanBench-XL是一个新基准,专门评估LLM工具使用智能体在包含数千个工具的大型生态系统中的长程规划能力。该基准通过构建复杂任务链,要求智能体在工具选择、参数传递和结果融合中做出多步决策。初步测试中,GPT-4和Claude 3.5等主流模型在PlanBench-XL上的平均成功率低于40%,暴露了当前模型在规划深度和工具协调上的局限。AI模型PlanBench-XLLLM智能体推荐理由:想看看你用的LLM在多工具长流程场景下到底多靠谱?PlanBench-XL用上千个工具设计了真实任务链,测出来主流模型成功率不到40%,值得一测。原文稍后读已读值得跟进有用关注 PlanBench-XL
23:26官方一手歸藏(guizang.ai)@op7418作者测试了 Seed 2.1 Pro,发现它在智能体和编程任务上的短板已被补上。该模型现在能更流畅地处理复杂代理场景。作者计划将 Seed 2.1 Pro 作为内容创作的主要模型。AI模型Seed 2.1 Pro豆包智能体3 个信源在谈事件专题推荐理由:豆包刚更新的 Seed 2.1 Pro,智能体和编程短板都补上了,做内容创作更顺手,可以试一下。原文稍后读已读值得跟进有用关注 Seed 2.1 Pro
20:25berryxia@berryxiaSeedance 的视频生成模型在发布后展现出显著的领先优势,短期内其他模型难以追赶。该模型在视频生成质量、连贯性和一致性等方面表现突出,但具体基准数据未披露。AI模型Seedance视频生成推荐理由:Seedance 刚出的视频生成模型,效果确实碾压同行,还没看到能打的。原文稍后读已读值得跟进有用关注 Seedance
20:18官方账号SiliconFlowAI@siliconflowaiSiliconFlow 对 GLM-5.2、GPT-5.5、Opus 4.8 和 GLM-5.1 进行了同提示词测试。结果显示 GLM-5.2 在性能上逼近 Opus 4.8,同时输入成本仅为 Opus 的约 1/3.6,输出成本为约 1/5.7。这意味着用户可以在 SiliconFlow 平台上以大幅降低的成本获得接近 Opus 级别的前端生成能力。AI模型GLM-5.2Opus 4.8SiliconFlow2 个信源在谈事件专题推荐理由:SiliconFlow 测了 GLM-5.2,性能跟 Opus 4.8 差不多,但输入输出成本都低了好几倍,想省钱的可以试试。原文稍后读已读值得跟进有用关注 GLM-5.2
19:56The Rundown AI@therundownai日本AI实验室Sakana发布了编排模型,旨在提升多智能体协作效率。SpaceX将Colossus超级计算机租赁给Reflection AI用于训练。Google投资独立电影公司A24,联合开发AI电影制作工具。AI语音命令工具可实现打字时间减半。AI模型Sakana编排模型Colossus4 个信源在谈事件专题推荐理由:Sakana的编排模型能协调多个AI任务,SpaceX租算力给Reflection AI,Google投A24造电影工具,每个都新鲜原文稍后读已读值得跟进有用关注 Sakana
17:33Aravind Srinivas@AravSrinivas精选Perplexity 的 Agent API 新增了对智谱 AI 旗舰模型 GLM-5.2 的支持。GLM-5.2 是目前最强的开源模型之一,在长周期编码和智能体工作流上表现突出。它充分利用了 Perplexity 的 Search as Code 架构,用户通过一次 API 调用即可结合前沿推理与实时程序化搜索。该接口兼容 OpenAI 格式,且 Perplexity 提供第一方定价,无额外加价。AI模型GLM-5.2PerplexityAgent API10 个信源在谈事件专题推荐理由:Perplexity Agent API 现在能调用 GLM-5.2 了,这个模型编码和智能体任务很强,还能边推理边搜索,价格也透明。原文稍后读已读值得跟进有用关注 GLM-5.2
14:56向阳乔木@vista8火山引擎在活动中透露Seeddance 2.5预计7月上线,具体定价未公布。Seedream 5.0 Pro新增箭头和高亮区块编辑功能。这些更新提升了视频和图像编辑的交互精度。AI模型Seeddance 2.5Seedream 5.0 Pro火山引擎3 个信源在谈事件专题推荐理由:火山引擎的Seeddance 2.5视频模型7月就来,Seedream 5.0 Pro还能加箭头高亮编辑,挺实用。原文稍后读已读值得跟进有用关注 Seeddance 2.5
14:46向阳乔木@vista876°百度发布Unlimited OCR,模拟人类抄书注意力模式,每生成一个token时参考完整图像和提示词,但输出侧仅回看前128个token。KV缓存固定为128长度,避免长文档推理时内存爆炸。在超长文档OCR任务上效果显著,已在GitHub和Hugging Face开源。AI模型UnlimitedOCR百度OCR6 个信源在谈事件专题推荐理由:百度开源了一个超聪明的OCR方案,用固定128 token缓存模拟人眼抄书,长文档不爆内存,快去试试!原文稍后读已读值得跟进有用关注 UnlimitedOCR
14:45向阳乔木@vista8百度近日开源了Unlimited OCR模型,参数量3B但仅需500M激活参数。该模型参考了滑动注意力窗口技术,在OCR任务上取得了出乎意料的好效果。轻量级设计使其更易于部署。AI模型百度Unlimited OCROCR6 个信源在谈事件专题推荐理由:百度刚开源的Unlimited OCR,3B参数只激活500M,效果居然这么强,做OCR的赶紧看看。原文稍后读已读值得跟进有用关注 百度
14:19小互@imxiaohu76°Seedance 2.5能一次生成30秒短片,原生支持4K分辨率。它可输入最多50个全模台参考素材,并支持3D白模引导生成。同时字节跳动推出了AI版权商业化平台,允许用户使用官方授权IP进行创作并获取分成。AI模型Seedance字节跳动视频生成推荐理由:字节跳动新出的视频模型Seedance 2.5能一次生成30秒4K短片,还支持3D白模和50个素材输入,做视频效率很高。原文稍后读已读值得跟进有用关注 Seedance
14:15小互@imxiaohu72°字节跳动在今天2026火山引擎大会上发布视频生成模型Seedance2.5。语言模型豆包seed2.1据称能力达到Opus4.6水平。图像模型Seeddream 5.0也一同推出。AI模型Seedance2.5豆包seed2.1Seeddream 5.03 个信源在谈事件专题推荐理由:字节跳动一次更新三个模型:Seedance2.5视频生成、豆包seed2.1对标Opus4.6、Seeddream 5.0图像生成,值得关注。原文稍后读已读值得跟进有用关注 Seedance2.5
14:09shao__meng@shao__meng72°字节跳动在火山引擎 FORCE 2026 原动力大会上发布 Seedream 5.0 Pro 图像生成模型和 Seedance 2.5 视频生成模型。OpenAI Sora 已关停,Google Veo 尚未更新,目前图像与视频生成赛道主要由中国厂商竞争,包括字节跳动、阿里巴巴、快手等。新模型在图像理解和视频生成能力上进一步升级。AI模型Seedream 5.0 ProSeedance 2.5字节跳动10 个信源在谈事件专题推荐理由:字节跳动刚发了两个新模型,图像和视频生成都升级了,中国大厂继续内卷,可以看看原文稍后读已读值得跟进有用关注 Seedream 5.0 Pro