09:52官方账号arXiv cs.AI@Xinheng Han, Jianfei Wang, Yu Chen, Xiang Wang, Shuai Li, Weixing Li, Feng Pan现有GRPO等组相对强化学习方法只提供响应级监督,与结构化多目标预测存在粒度失配。MCR-GRPO通过留一比较估计每个预测框的边际贡献,并利用连续匹配集值评估器改进归一化与定位。在REC、DOD、分割和计数基准上,该方法超越了现有GRPO基线。论文MCR-GRPOGRPO多模态推荐理由:GRPO以前只看整体得分,现在MCR-GRPO能逐个框算功劳,定位和分割都更准了。原文稍后读已读值得跟进有用关注 MCR-GRPO
09:47OpenRouter@OpenRouterAI79°阿里旗舰模型 Qwen3.8 Max 已在 OpenRouter 上线。它拥有 2.4T 总参数,激活参数为 95B。Qwen3.8 Max 面向长时程编码、科研和多模态智能体任务优化。官方计划下周开放权重,这是 Qwen Max 级模型首次开源。AI模型Qwen3.8 MaxOpenRouter阿里巴巴推荐理由:阿里把 2.4T 参数的 Qwen3.8 Max 放 OpenRouter 了,下周开源,长时程编码和多模态智能体都能用,想体验可以直接去跑。原文稍后读已读值得跟进有用关注 Qwen3.8 Max
09:30官方账号arXiv cs.AI@Timothee Mickus, Claudio Savelli, Eduardo Calò, Emilio Raimond, Stella Frank, Hengyu Luo, Flavio Giobergia, Vincent Segonne, Chuyuan Li, Aman Sinha, Lorenzo Vaiani, Jörg Tiedemann, Raúl Vázquez该研究构建了包含1,600个人类编写的幻觉样本数据集,覆盖中、英、法、意四种语言,并同时收集了来自五个视觉语言模型的18,400个样本进行对比。所有样本采用细粒度的跨度级标注方案来标记幻觉。实验发现,人类编写的样本在标注一致性上更高,且便于控制数据集内容,同时与模型生成样本在分布上保持相似。这表明人类数据可以替代模型生成的幻觉基准,用于更稳定的模型幻觉评估。论文幻觉检测基准测试视觉语言模型推荐理由:这篇论文用1,600个人类写的幻觉样本对比了18,400个模型生成的样本,发现人类样本更稳定、更好控制,以后测幻觉不用老换模型了。原文稍后读已读值得跟进有用关注 幻觉检测
09:20官方账号arXiv cs.AI@Junkai Lin, Junkai Chen, Siqi Hou, Yuhao He, Ruiqi Liu, Chenhan Jin, Shengze Xu, Tieyong Zeng多模态大语言模型会泄露敏感信息,现有隐私基准多采用画像级删除,而实际请求往往更细粒度。本文提出属性级遗忘任务,覆盖长文本、数值、短文本三类目标和多种遗忘比例。作者提出训练无关的CLRP框架,用激活修补定位因果层,再通过保留感知投影移除目标属性子空间。实验在多种不同架构和参数规模的MLLM上验证了CLRP的有效性。论文机器遗忘属性遗忘多模态推荐理由:论文把机器遗忘做到属性级:让模型忘掉指定属性,但保留同一人的其他信息。CLRP不用重训练,在多种多模态模型上都有效。原文稍后读已读值得跟进有用关注 机器遗忘
06:30官方一手marktechpost@Sana Hassan本教程介绍如何用Moonshot PerceptionBench搭建多模态视觉模型评估工作流,覆盖OCR、计数、定位、上下文推理、比较、深度理解与幻觉检测等任务。教程使用Colab环境安装依赖,并加载数据集的平衡子集。通过健壮数据加载与自动判定流程,实现端到端评测。教程同时说明如何配置自动评判模块以减少人工干预。技巧PerceptionBenchMoonshot多模态推荐理由:想测自家视觉模型?用Moonshot的PerceptionBench,从OCR到幻觉检测都覆盖,跟着这教程搭流程就行。原文稍后读已读值得跟进有用关注 PerceptionBench
16:39官方一手marktechpost@Asif Razzaq76°阿里Qwen团队将Qwen3.8-Max从预览转为正式可用,并公布了按token计费的价格。该模型为2.4万亿参数的MoE架构,支持文本、图像和视频输入,上下文窗口为100万token。官方尚未公布基准测试结果,开放权重预计下周发布。AI模型Qwen3.8-MaxAlibaba多模态推荐理由:Qwen3.8-Max正式上线,2.4T参数MoE,能看视频,上下文100万token,权重下周开源。原文稍后读已读值得跟进有用关注 Qwen3.8-Max
16:14IT之家(博客/媒体)商汤科技开源轻量级统一多模态模型 SenseNova U1.5-Lite-Preview。该模型仅有 8B-MoT 参数规模,原生支持 4K 图像生成。在多项主流生成与编辑质量评测基准上,其表现显著超越前代 U1。官方称其图像生成与编辑效果可比肩商用闭源模型。此外,该模型在中英文文字生成、复杂版式组织以及视觉指令遵循方面均有提升。AI模型SenseNova商汤科技多模态推荐理由:商汤开源了新多模态模型,8B参数就能生成4K图,编辑效果还追上闭源大厂,想玩图像生成的可以试试。原文稍后读已读值得跟进有用关注 SenseNova
15:14量子位@梦瑶阿里发布Qwen3.8-Max。Qwen3.8-Max在编程、专业工作、长程任务、多模态分析等场景表现突出。其综合能力进入全球第一梯队,与Claude表现相近。AI模型Qwen3.8-MaxClaude阿里推荐理由:阿里发了Qwen3.8-Max,编程和多模态都强,据说能跟Claude掰手腕,想升级的可以关注。原文稍后读已读值得跟进有用关注 Qwen3.8-Max
14:45IT之家(博客/媒体)沐曦股份8月3日宣布,曦云C系列GPU完成对MiniMax H3多模态生成模型的Day 0适配。该适配依托全自研MXMACA软件栈,用户可快速部署MiniMax H3。曦云C系列基于自研核心GPU IP,匹配超大规模参数处理和长上下文推理需求。MXMACA软件栈兼容PyTorch、TensorFlow、vLLM等40余种AI框架,支持500+模型稳定运行。AI产品MiniMax H3沐曦曦云C系列7 个信源在谈事件专题推荐理由:国产GPU沐曦曦云C系列现在能直接跑MiniMax H3了,多模态部署更快,还兼容40多个框架,玩国产卡的人可以留意下。原文稍后读已读值得跟进有用关注 MiniMax H3
14:08shao__meng@shao__meng81°阿里发布 Qwen3.8-Max,参数规模 2.4T,主打自主编码和长时任务。官方称它能在无人干预下完成 10 天以上的开发流程,并跑过 500 多轮芯片设计优化。定价为输入 2 美元/百万 tokens,输出 6 美元/百万 tokens,缓存 0.25 美元/百万 tokens。下周 Qwen3.8-Max 和 Qwen3.8-27B 的权重将一同开源。AI模型Qwen3.8-MaxQwen3.8-27B开源模型1 个信源在谈事件专题推荐理由:阿里把 2.4T 参数的 Qwen3.8-Max 拿出来,下周连 27B 一起开源,缓存价只要 0.25 美元,可以蹲一手。原文稍后读已读值得跟进有用关注 Qwen3.8-Max
13:30官方账号阿里通义 Qwen@Alibaba_Qwen阿里巴巴Qwen在X平台发布Visual Agentic Intelligence,推文展示相关视频,获得142次点赞和2.8万次浏览。该命名暗示Qwen正在推进视觉与智能体结合的技术方向。目前除了标题和视频外,Qwen未给出更多技术参数。AI模型Qwen视觉智能智能体推荐理由:Qwen官方发了个视觉智能体的视频,具体演示内容还不清楚,但可以去看看这条新动态。原文稍后读已读值得跟进有用关注 Qwen
12:36小互@imxiaohu72°Qwen3.8-Max 总参数量 2.4T、激活参数 95B,官方宣布下周开源,是 Qwen Max 系列首次开源。它在 oh-my-cli 项目中自主运行 16 天完成无人编程,并在电商多模态意图识别竞赛中提交 45 次,准确率从 0.60 提升到 0.853,击败 458 支队伍。在 365 天模拟电商经营中,模型实现 4.16 倍资金回报,净赚超 10 万元。它还花 125 小时写 7,600 行代码复现论文,并在 AIME24 上反超原论文 2.71 分。视觉与多模态方面,模型支持分析 100+ 小时长视频,并能通过 Hybrid Agent 编程与 GUI 操作复刻应用。AI模型Qwen3.8-Max开源模型智能体推荐理由:Qwen Max 首次开源,2.4T 参数下周见;它能自己跑 16 天干活,还拿过 4.16 倍回报。原文稍后读已读值得跟进有用关注 Qwen3.8-Max
12:24官方一手歸藏(guizang.ai)@op741881°Qwen3.8-Max是阿里通义千问最新旗舰模型,参数规模达2.4T。输入每百万token定价2美元,输出6美元,缓存0.25美元。官方称其可自主完成10天以上的编码开发,并支持500多轮芯片设计优化和365天电商策略。开放权重的版本将于下周发布,同时Qwen3.8-27B也将开源。AI模型Qwen3.8-MaxAlibaba开源模型推荐理由:阿里发了Qwen3.8-Max,2.4T参数,能自己写代码跑10天,下周开源权重,还有便宜缓存,想试大模型可以看看。原文稍后读已读值得跟进有用关注 Qwen3.8-Max
11:13lmarena.ai@lmarena_ai精选Qwen3.8-Max在Frontend Code Arena以1668分位列第四,仅次于Claude Opus 5 (Max)的1705分和Kimi K3 (Max)的1676分。该模型参数达2.4T,支持自主编码、多模态感知和长程规划,官方称可完成500+轮芯片设计优化。API定价为输入2.0美元/百万tokens,输出6.0美元/百万tokens,隐式缓存0.25美元/百万tokens。Alibaba Qwen表示下周将开放Qwen3.8-Max及Qwen3.8-27B的权重。AI模型Qwen3.8-MaxAlibaba_QwenFrontend Code Arena推荐理由:阿里的Qwen3.8-Max刚发布,前端代码榜排第四,分数紧咬Claude和Kimi,下周还开源权重,可以蹲一下。原文稍后读已读值得跟进有用关注 Qwen3.8-Max
11:11lmarena.ai@lmarena_aiQwen3.8-Max在Vision Arena基准中排名第二,获得1305分。榜首是Claude Fable 5(High),领先优势仅13分。这一差距表明两者在视觉任务上的表现非常接近。AI模型Qwen3.8-MaxVision ArenaClaude Fable 51 个信源在谈事件专题推荐理由:Qwen3.8-Max在视觉榜单冲到第二,只比Claude Fable 5低13分,想看看国产视觉模型底子的可以关注。原文稍后读已读值得跟进有用关注 Qwen3.8-Max
10:57IT之家(博客/媒体)MiniMax 于 8 月 3 日开源新一代通用视频模型 H3,支持文本、图像、视频、音频统一理解与生成。H3 可输出最高 2K 分辨率、15 秒时长、32kHz 立体声音频的视频,帧率为 24 FPS。其输入规格包含 H3-Base-FL2VA 首尾帧模式和 H3-Base-Ref2VA 全模态参考模式,后者最多支持 9 张图像与 3 段视频。H3 稳定支持中英阿法等 11 种语言,完整系统由 H3-Context-IR、H3-Base 和 H3-Regenerate-2K 三模块组成。AI模型MiniMaxH3视频生成推荐理由:MiniMax 把能处理多模态上下文的视频模型直接开源了,最长生成 15 秒 2K 带立体声的视频,比一般文生视频强在能看懂图片、音频和视频混合输入。原文稍后读已读值得跟进有用关注 MiniMax
10:47SuperTechFans(博客/媒体)字节跳动发布新一代视频生成模型 Seedance 2.5,单次可生成最长 30 秒视频。Seedance 2.5 支持多模态引用,可参考图片和视频素材进行创作。该模型还提供高级编辑功能,方便用户调整生成内容。目前 Seedance 2.5 已上线多个平台,官方表示 API 即将推出。AI模型Seedance 2.5字节跳动视频生成3 个信源在谈事件专题推荐理由:字节跳动发布了 Seedance 2.5,一次能生成 30 秒视频,还能参考多模态素材,API 也快出了。原文稍后读已读值得跟进有用关注 Seedance 2.5
10:35IT之家(博客/媒体)阿里巴巴今日发布千问 Qwen3.8-Max,参数规模达 2.4 万亿。官方称其在编程、真实办公、长程任务与多模态智能体方面实现提升。该模型能以极少人工介入端到端完成复杂开放目标。模型权重将于下周开源。AI模型Qwen3.8-Max阿里巴巴智能体推荐理由:千问新模型 Qwen3.8-Max 有 2.4 万亿参数,编程办公更强,端到端自主干活,下周还开源。原文稍后读已读值得跟进有用关注 Qwen3.8-Max
10:30Binyuan Hui@huyberyAndrej Karpathy用《指环王》第一段测试Opus 5,给它约1M token的预算(约10美元)并要求生成three.js渲染版本。Opus 5花了大约2小时写出5500行代码,程序化渲染了故事,但效果有些粗糙。Karpathy认为这类超定制世界生成是LLM的新应用场景,同时暴露了模型无法高效观看视频或玩游戏的短板,只能靠截图慢慢检查。AI模型Opus 5Karpathythree.js5 个信源在谈事件专题推荐理由:Karpathy用《指环王》首段测Opus 5,1M token生成5500行three.js代码,效果糙但脑洞大。原文稍后读已读值得跟进有用关注 Opus 5
10:29官方账号arXiv cs.AI@Ilya Mikhelson这篇论文提出了Socratic Test的自动化计算机中介对话式评估框架,整合动态评估原则、多模态工作区、Bloom分类学实时监考和SOLO分类学结构评估。传统静态评估依赖减法扣分制,而面对面口试会引入表现焦虑和学术权力失衡等无关变量。Socratic Test通过渐进化支架量化最近发展区(ZPD),并采用非补偿性加法评分架构,优先衡量掌握程度而非惩罚错误。论文Socratic Test动态评估多模态推荐理由:这篇论文给考试设计开了个新脑洞:用多模态对话和动态评估测认知边界,比传统考试更看重进步而不是扣分。原文稍后读已读值得跟进有用关注 Socratic Test
10:25官方账号arXiv cs.AI@Jeffrey M. Girard, Jason Z. Zheng, Jacqueline R. Vertino, Antony D'Avirro, Benjamin PeloquinFriendBench 是一个新基准,要求从20秒破冰对话片段判断两人是否熟识。研究对比了7家公司的26个模型与人类受试者在96组对话上的表现。最佳模型与人类在准确率上无显著差异,但模型更倾向于回答“陌生人”。音频和视频信息对模型和人类的好处不同,只有人类能从可见行为中获益。论文公开了全部刺激材料、人类评分和模型预测。论文FriendBench多模态LLM推荐理由:试试看这个新基准,FriendBench测AI能不能从20秒对话看出两人是不是熟人。最强模型和人类打了个平手,但AI有偏见:拿不准就说是陌生人。原文稍后读已读值得跟进有用关注 FriendBench
09:33官方账号arXiv cs.LG@Carlos Rodriguez-Pardo, Massimo TavoniTerraNova 是一个面向人类世的地球与社会耦合基础模型,在 arXiv 2607.29527 发布。它用 1,024 条记录训练,其中 512 个格点化地球系统场和 512 个国家指标。跨模态 Transformer 融合位置、国家、时间和任务,两个对比目标分别对齐国家与境内坐标、预训练地理空间嵌入。TerraNova 在消费级硬件上数分钟内即可重构稀疏观测的密集场并适配未见变量。与专用地理空间编码器相比,TerraNova 还覆盖时间、海洋和不确定性维度。论文TerraNova地球系统模型多模态推荐理由:TerraNova把地球和社会数据一起训练,能几分钟适配新变量,比地理模型多覆盖海洋和不确定性。原文稍后读已读值得跟进有用关注 TerraNova
08:53官方一手marktechpost@Michal Sutter旧金山搜索与发现公司Onton发布神经符号模型Ontology 1,服务于复杂、对话式、多模态商品搜索。在由三个独立LLM评委评分的90条查询基准上,Ontology 1的mean precision@10达0.630,Google Shopping为0.543,Amazon为0.469。该模型仅索引约1%的商品数据。Onton称其比全球最佳电商搜索引擎准确率高2.7倍。AI模型OntonOntology 1神经符号推荐理由:Onton发布了搜索模型Ontology 1,90条查询上precision@10到0.630,压过Google Shopping和Amazon,而且只用了1%索引数据。做搜索的可以看看。原文稍后读已读值得跟进有用关注 Onton
01:23elvis@omarsar0精选72°谷歌DeepMind在arXiv:2607.27497提出SkillSmith,把模型权重当作额外模态让LLM原生读取。SkillSmith增强后的模型摄入现有前缀权重和描述能力的文本,直接输出体现该技能的新前缀权重。SkillSmith让技能组合变成推理期操作,不再需要训练。论文指出,SkillSmith的效果超过单独文本或单独权重适配。论文SkillSmithDeepMind模型权重推荐理由:DeepMind真会玩:把模型权重当文本喂给LLM,不用训练就能直接生成新技能,论文在arXiv可看。原文稍后读已读值得跟进有用关注 SkillSmith
14:11Hailuo AI@Hailuo_AI创作者 @ponzponz15 用 MiniMax H3 测试绿幕编辑。他上传了原视频、编辑后视频和参考图像,验证 H3 能否在保持相机运动与人物位置的同时,将背景和服装替换为参考图像的世界观。测试结果显示,编辑后的画面在部分场景中轮廓反而更清晰。H3 支持参考图像转换、相机运动测试和时间一致性。AI模型MiniMax H3视频编辑多模态7 个信源在谈事件专题推荐理由:海螺AI官方转发了用户用MiniMax H3做绿幕编辑的测试,换背景和衣服还能保持镜头和人物不动,编辑后轮廓还更清楚,挺有意思。原文稍后读已读值得跟进有用关注 MiniMax H3
14:10宝玉@dotey精选Andrej Karpathy 用《指环王》第一段做测试,给 Opus 5 提供 100 万 token 预算(约 10 美元)和 three.js 渲染任务。Opus 5 用约 2 小时写了 5500 行代码,程序化生成故事场景,结果有点粗糙但能跑。Karpathy 认为 LLM 目前无法直接观看视频或玩游戏,只能靠截屏检查效果,因此出错不少。他设想按需生成'临时版 GTA'式的定制 3D 世界。AI模型Opus 5three.js3D渲染5 个信源在谈事件专题推荐理由:Karpathy 让 Opus 5 花 10 美元做了个《指环王》3D 渲染,5500 行代码,还聊了模型短板。原文稍后读已读值得跟进有用关注 Opus 5
12:14官方一手歸藏(guizang.ai)@op741885°Karpathy加入Anthropic后首次发布长帖,给Opus 5约100万Token(约10美元)预算,让它用three.js渲染《指环王》故事。Opus 5耗时约2小时,写出5500行代码,最终生成一个3D版本。Karpathy指出,模型无法直接观看或游玩生成的视频/游戏,只能靠逐段截图检查,过程中出错多次。他认为多模态感知与游戏内交互能力仍是LLM明显的短板。AI模型Opus 5AnthropicKarpathy7 个信源在谈事件专题推荐理由:Karpathy给Opus 5百万Token预算,让它做《指环王》3D渲染,还吐槽模型没法自己看结果。原文稍后读已读值得跟进有用关注 Opus 5
21:56官方账号Decoder@Gregor Kobsik72°字节跳动发布AI视频模型Seedance 2.5,可同时生成视频与音频。单段片段最长30秒,是谷歌Gemini Omni Flash输出时长的三倍。用户可输入数十张图片、视频和音频文件作为参考。对广告团队而言,这省去了逐段拼接短片的流程。AI模型Seedance 2.5ByteDance视频生成1 个信源在谈事件专题推荐理由:字节Seedance2.5生成30秒带声视频,是Gemini Omni Flash的三倍,广告剪辑省事。原文稍后读已读值得跟进有用关注 Seedance 2.5
16:33官方一手marktechpost@Asif RazzaqMiniMax发布新一代多模态生成模型MiniMax H3。该模型将文本、图像、视频、音频作为统一上下文处理,直接输出视频及原生立体声。H3支持2K分辨率,时长可在4至15秒之间选择,且仅支持整数时长。MiniMax称其不是简单的文生视频外加组件,而是通用多模态生成模型。AI模型MiniMax H3MiniMax视频生成7 个信源在谈事件专题推荐理由:MiniMax H3能一次读文本、图、视频、音频,直接出带立体声的2K视频,最长15秒,试试看。原文稍后读已读值得跟进有用关注 MiniMax H3
09:41IT之家(博客/媒体)KTC在2026 ChinaJoy展出移动智慧屏“闺蜜机”A25Q5。该机采用24.5英寸FHD 60Hz面板,内置阶跃星辰Step系列大模型,并接入StepFun GUI助手。同场另一款“闺蜜机”为豆包大模型UMAX版,支持UHD分辨率。KTC还展出四款大师系列电竞显示器,包括600Hz TN的25M1Pro和1000Hz的27M2Pro。AI产品KTC阶跃星辰Step系列大模型推荐理由:KTC把阶跃星辰Step大模型塞进移动屏,还能多模态交互;现场还有1000Hz显示器,挺有意思。原文稍后读已读值得跟进有用关注 KTC
03:20官方账号NVIDIA AI@NVIDIAAINVIDIA Research发布空间推理诊断基准Spatial-IQ,将3D物体计数拆分为九项感知与认知子任务。人类在该基准上计数准确率为82.1%,而最好的现成多模态模型仅达17.7%。针对子任务训练后,Qwen2.5-VL-32B的计数准确率从2.9%提升到62.6%。该基准可帮助研究者定位空间推理失败点并验证能力改进。AI模型NVIDIASpatial-IQQwen2.5-VL2 个信源在谈事件专题推荐理由:NVIDIA搞了个Spatial-IQ基准,把数箱子拆成九个子任务,Qwen2.5-VL练完后准确率从2.9%飙到62.6%,但离人类82.1%还远。原文稍后读已读值得跟进有用关注 NVIDIA
02:10OpenRouter@OpenRouterAIRunway推出视频生成模型Gen-4.5,主打可控性、电影感和跨镜头一致性。该模型强调精确遵循用户提示,并支持多种生成模式下的高级运动质量。开发者可通过OpenRouter平台直接调用Gen-4.5。官方示例展示了其在保持角色和场景连贯方面的能力。AI模型RunwayGen-4.5OpenRouter推荐理由:Runway 出了 Gen-4.5,视频生成更听指令了,还能保持前后镜头一致,现在 OpenRouter 上就能直接调。原文稍后读已读值得跟进有用关注 Runway
01:51Google Gemini App@GeminiApp76°Gemini 应用宣布,个性化图像生成功能正式面向美国所有用户开放。这项依托 Gemini 模型的新功能,可根据用户的独特兴趣和偏好生成定制图像。官方在 X 平台发布公告,并附带了功能演示视频。AI产品Gemini图像生成多模态推荐理由:Gemini 出了新功能,按你的兴趣生成定制图像,美国全量开放,赶紧试试。原文稍后读已读值得跟进有用关注 Gemini
00:15Milvus@milvusio82°向量数据库Milvus 3.0正式发布,主打湖原生向量检索。新版本通过External Collections支持直接查询对象存储中的Parquet、Vortex格式数据,以及Lance、Iceberg等开放表格式。Loon Storage v3优化了S3对象存储上的点读取性能,快照与Spark DataSource V2让批处理和回填更稳定。检索引擎新增ORDER BY、聚合和分面搜索,StructArray与SINDI增强了多向量和稀疏混合检索能力。AI产品MilvusRAG智能体推荐理由:Milvus 3.0把向量检索直接做到数据所在的湖上,不用来回搬数据,搞RAG和Agent的可以试试。原文稍后读已读值得跟进有用关注 Milvus
21:17IT之家(博客/媒体)稀宇科技宣布 MiniMax H3 通用多模态视频模型将于北京时间 8 月 3 日 0 点在魔搭社区开源。该模型支持文本、图像、视频、声音组成的多模态上下文统一理解,可输出带原生双声道的音视频,最高支持 15 秒 2K 分辨率。官方称其默认提供 2K 分辨率,每秒价格不到主流模型的 1/3,768P 分辨率下价格为主流模型 720P 的 1/2。AI模型MiniMaxH3视频生成推荐理由:MiniMax H3 8 月 3 日开源,能做 15 秒 2K 音视频,价格只有主流模型的 1/3,看看合不合用。原文稍后读已读值得跟进有用关注 MiniMax
18:14Hailuo AI@Hailuo_AIMiniMax 发布 H3 模型,定位开放权重、通用全模态生成。官方称其达到商用级生成质量,并强调成本效率具有竞争力。H3 支持多种模态的输入与生成,面向开发者开放权重。该模型延续了 MiniMax 在开源路线上的布局。AI模型MiniMaxH3开源模型推荐理由:MiniMax 出了 H3,开放权重还便宜,能做全模态生成,想省成本搞商用的可以看看。原文稍后读已读值得跟进有用关注 MiniMax
16:45Hailuo AI@Hailuo_AI设计师Cia0用MiniMax H3和Midjourney V8.2制作了一个动画UI/UX作品集网站。页面采用十二栏网格布局,左侧五栏留白给主标题,光环动画作为加载器。MiniMax H3在一次生成中同时处理原生音频、屏幕文字和角色锁定,作者认为这一组合比SD2更有优势。整个制作使用了4,367个字符的中文提示词。AI模型MiniMax H3Midjourney视频生成5 个信源在谈事件专题推荐理由:Cia0用MiniMax H3加Midjourney V8.2做了个动画版UI作品集,H3能一次生成音频、文字和角色锁定,比SD2省事多了。原文稍后读已读值得跟进有用关注 MiniMax H3
15:44LovartAI@lovart_aiMiniMax H3 已上线视频平台 Lovart,官方称其为全球排名第二的视频模型。该模型可生成15秒电影级视频,具有流畅且高保真的运动表现。它支持文本、图像、视频和音频四种多模态参考输入,并保持角色、产品、场景和风格的一致性。官方表示,其生产成本低于同类方案的一半,适用于广告、MV 和 TVC 制作。AI模型MiniMaxH3Lovart推荐理由:MiniMax H3 上了 Lovart,15秒电影级视频,成本还不到一半,做广告片和MV的可以试试。原文稍后读已读值得跟进有用关注 MiniMax
15:38IT之家(博客/媒体)Thinking Machines Lab发布Inkling-Small,总参数276B、激活参数12B,规模约为Inkling的四分之一。该模型采用MoE架构,支持音频和图像原生推理、最高1M token上下文。在Humanity's Last Exam基准中,Inkling-Small得分31.6%,高于Inkling的29.7%。模型完整权重已开放,并接入Tinker微调服务。AI模型Inkling-SmallThinking Machines Lab开源模型3 个信源在谈事件专题推荐理由:Inkling-Small四分之一参数就能接近甚至超过原版,权重开源,还能微调,快去玩。原文稍后读已读值得跟进有用关注 Inkling-Small
13:14官方账号arXiv cs.AI@Zongyi Chen, Yu Liang, Jie Lin, Liansheng WangPathVU是一个面向病理图像细粒度多尺度视觉理解的基准,基于23个公共病理数据集构建,包含14个VQA任务、61,673张图像和308,070个样本,覆盖28个器官。该基准通过Region FOV和Slide FOV两种视野,评估模型的区域定位、视觉识别、数量估计、空间推理和上下文不足判断能力。对18个通用、医学和病理专用的多模态大语言模型评测显示,现有模型在细粒度视觉任务上存在明显局限。论文PathVU病理图像多模态推荐理由:PathVU这个新基准测了18个多模态模型,发现它们在病理图上连定位和数数都容易出错,搞医学AI的值得看看。原文稍后读已读值得跟进有用关注 PathVU