09:25Geek@geekbb72°Hugging Face 通过 Inference Endpoints 部署了 DeepSeek-V4-Flash-0731 的免费公共端点,调用 OpenAI 兼容接口 /v1/chat/completions。模型名填 deepseek-ai/DeepSeek-V4-Flash-0731,api_key 填任意非空字符串即可。限流规则为每 IP 约 20 请求突发,之后约 12 请求/分钟补充,超限返回 429。发布者提醒并行 agent 调用没问题,但别做脚本轰炸。AI模型DeepSeek-V4-Flash-0731Hugging Face智能体10 个信源在谈事件专题推荐理由:Hugging Face 免费开放了 DeepSeek-V4-Flash-0731 接口,无需 token,随手就能调,适合测试 agent 并行调用。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Flash-0731
06:03Richard Socher@RichardSocher精选Claude的多数决策依赖细致的成本效益分析。Claude的硬约束则绝对且不可协商,任何操作员或用户都无法解锁。Claude硬约束的运作机制与它所考虑的其他优先级不同。AI模型ClaudeAI安全硬约束推荐理由:Richard Socher在推文中转述,Claude有些规则是死命令,操作员或用户都改不了,跟它平时的权衡式决策完全不一样。原文稍后读已读值得跟进有用关注 Claude
03:42lmarena.ai@lmarena_aiOpenAI 的 GPT-5.6 家族 Sol、Terra、Luna 已在 ChatGPT、Codex 和 API 中开始推出。在 LMArena 全栈代码竞技场中,Sol 以 1638 分排全栈第 3,总榜第 5;Terra 全栈 1579 分列第 10,总榜第 20;Luna 全栈 1568 分列第 14,总榜第 18。Opus 5 (Max) 即将加入全栈榜单。AI模型GPT-5.6OpenAILMArena10 个信源在谈事件专题推荐理由:OpenAI 的 GPT-5.6 三兄弟开测,Sol 全栈第 3,Terra 和 Luna 也进 top20,挑模型看这个。原文稍后读已读值得跟进有用关注 GPT-5.6
03:20官方账号NVIDIA AI@NVIDIAAINVIDIA Research发布空间推理诊断基准Spatial-IQ,将3D物体计数拆分为九项感知与认知子任务。人类在该基准上计数准确率为82.1%,而最好的现成多模态模型仅达17.7%。针对子任务训练后,Qwen2.5-VL-32B的计数准确率从2.9%提升到62.6%。该基准可帮助研究者定位空间推理失败点并验证能力改进。AI模型NVIDIASpatial-IQQwen2.5-VL2 个信源在谈事件专题推荐理由:NVIDIA搞了个Spatial-IQ基准,把数箱子拆成九个子任务,Qwen2.5-VL练完后准确率从2.9%飙到62.6%,但离人类82.1%还远。原文稍后读已读值得跟进有用关注 NVIDIA
03:11lmarena.ai@lmarena_aiThinking Machines 推出新模型 Inkling-Small。Inkling-Small 没有突破性能上限,但紧邻当前最强的几个模型。Thinking Machines 在官网发布了相关对比信息。AI模型Inkling-SmallThinking Machines基准测试4 个信源在谈事件专题推荐理由:Thinking Machines 新出的 Inkling-Small 虽然没登顶,但官方给了它和头部模型的对比图,想了解它大概什么水平可看。原文稍后读已读值得跟进有用关注 Inkling-Small
02:55lmarena.ai@lmarena_ai精选Arena.ai 今日发布 AutoEval,一种基于奖励模型的新评估方法,该模型由数百万条真实 Arena 用户偏好数据校准。AutoEval 与实时人工评估结果高度一致,能把模型评估耗时从数天缩短到数小时。它目前支持 Text、Vision、Image、Code 四个 Arena 榜单。新模型上线后,AutoEval 会直接在排行榜上给出估算分数。AI模型AutoEvalArena.ai模型评估1 个信源在谈事件专题推荐理由:想快速了解新模型水平?Arena 用真实用户偏好做评估,比传统基准快几个数量级,看榜就行。原文稍后读已读值得跟进有用关注 AutoEval
02:53lmarena.ai@lmarena_ai精选Inkling-Small在Text Arena获得约第88名,AutoEval得分1431,开放模型中约第21。它仅用12B激活参数(总276B),比肩Minimax M2.7(1417分,10B激活)、Nemotron 3 Ultra(1426分,55B激活)和DeepSeek V4 Flash(1436分,13B激活)。该分数为AutoEval初步结果,由奖励模型代替人工投票产生。AI模型Inkling-SmallthinkymachinesText Arena4 个信源在谈事件专题推荐理由:Inkling-Small只用12B激活参数就逼近DeepSeek V4 Flash,开放模型里排21名,少算力也能打,关注后续人投排名。原文稍后读已读值得跟进有用关注 Inkling-Small
02:10OpenRouter@OpenRouterAIRunway推出视频生成模型Gen-4.5,主打可控性、电影感和跨镜头一致性。该模型强调精确遵循用户提示,并支持多种生成模式下的高级运动质量。开发者可通过OpenRouter平台直接调用Gen-4.5。官方示例展示了其在保持角色和场景连贯方面的能力。AI模型RunwayGen-4.5OpenRouter推荐理由:Runway 出了 Gen-4.5,视频生成更听指令了,还能保持前后镜头一致,现在 OpenRouter 上就能直接调。原文稍后读已读值得跟进有用关注 Runway
01:55Google Gemini App@GeminiApp72°谷歌发布 Gemini 3.6 Flash 和 3.5 Flash-Lite 升级版。新版本在推理能力和响应速度上均有提升。用户可在 gemini.google 或 App 的模型下拉菜单中切换使用。两个模型目前均已开放体验。AI模型GeminiGemini 3.6 FlashGemini 3.5 Flash-Lite1 个信源在谈事件专题推荐理由:谷歌把 Flash 和 Flash-Lite 都升级了,推理更强速度更快,打开 Gemini 选模型就能试。原文稍后读已读值得跟进有用关注 Gemini
01:26官方账号LangChain@LangChainAILangChain 推出 ReviewBench,一个专注于代码审查场景的新基准。该基准从真实 PR 审查意见出发,将审查中发现的问题整理成具体任务,并转化为基于 Harbor 框架的可复现实验。其目标是模拟开发者在实际代码审查中遇到的典型问题,帮助评估模型在审查场景中的表现。AI模型ReviewBenchLangChainHarbor推荐理由:LangChain 做了个叫 ReviewBench 的基准,专门测代码审查能力,数据来自真实 PR 评论,还能用 Harbor 复现。原文稍后读已读值得跟进有用关注 ReviewBench
01:24elvis@omarsar071°微软提出 Echoverse,把规格说明编译成有状态应用,并用应用自身数据库给任务评分。系统运行共进化循环,把每条已评分的执行轨迹读两遍:一遍修复环境、任务和验证器,一遍作为模型训练信号。浅层合成环境把线上站点准确率从 80.0 降到 75.0,深层环境把它从 80.0 提到 85.0,另一个领域从 48.0 提到 65.0。修复单个环境后,训练出的模型从 16.2% 升到 38.5%;用十二个环境训练,9B 模型在十四个评测分项上从 36.5% 升到 67.1%,与教它的更大前沿模型差距在 14 个百分点以内。团队发布四个环境作为基准,包含应用、种子数据和基于应用数据库的评分器。AI模型EchoverseMicrosoft计算机操作智能体推荐理由:微软 Echoverse 用合成环境训计算机操作智能体,9B 从 36.5% 涨到 67.1%,还开源四个基准。原文稍后读已读值得跟进有用关注 Echoverse
00:49官方账号Sam Altman@sama72°Sam Altman发推称,GPT-5.4 full at xhigh基准得分51,与Luna max持平。GPT-5.4输入/输出价格为$2.50/$15,Luna则为$0.20/$1.20。约四个月后,OpenAI以约十三分之一的token价格提供三月旗舰级智能。AI模型GPT-5.4LunaOpenAI10 个信源在谈事件专题推荐理由:OpenAI拿GPT-5.4对打Luna,同分但价格只要人家的1/13,做应用的成本要崩了。原文稍后读已读值得跟进有用关注 GPT-5.4
00:42官方账号Google AI@GoogleAI76°Google汇总了近期发布,Gemini Robotics 2为机器人带来全身智能。Gemini 3.5 Flash-Lite主打高性价比,面向高速智能体工作流。Gemini 3.6 Flash用更少token实现更快更准的跨任务性能。Gemini 3.5 Flash Cyber专供政府和合作伙伴,用于规模化修复软件漏洞。Nano Banana 2集成到Google Earth,Lyria 3.5驱动Flow Music,Gemini Notebook新增Collections。AI模型GeminiGoogle DeepMindGemini Robotics 25 个信源在谈事件专题推荐理由:Google一口气更新了多个模型,机器人、快模型、修漏洞的,还有能生成地球图片的Nano Banana 2,看看有没有你需要的。原文稍后读已读值得跟进有用关注 Gemini
00:35lmarena.ai@lmarena_ai81°DeepSeek-V4-Flash 已进入 Agent Arena,将在数百万个真实长程智能体任务中接受评测,任务可调用网页搜索、文件系统和终端工具。官方同步开放 V4-Flash API 公测,称其智能体能力大幅升级,基准得分已明显超过 V4-Pro-Preview。新版 API 原生支持 Responses API 格式,并已适配 Codex。该模型还将在 Frontend Code Arena、Text 和 Vision Arena 中评测,具体分数待公布。AI模型DeepSeek-V4-FlashDeepSeek智能体10 个信源在谈事件专题推荐理由:DeepSeek 把 V4-Flash 放进 Agent Arena,API 公测也开了,智能体跑分超过 V4-Pro-Preview,还适配 Codex,想试的可以看看。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Flash
00:23elvis@omarsar0DeepSeek发布V4-Flash-Preview新检查点,官方API进入公开测试阶段。该模型在TerminalBench-2.1上实现20多分跳升,Agent能力大幅增强,整体成绩远超V4-Pro-Preview。API定价为每百万token输入0.14美元、输出0.28美元。V4-Flash原生支持Responses API格式,并已适配Codex。AI模型DeepSeek-V4-FlashDeepSeek智能体10 个信源在谈事件专题推荐理由:DeepSeek把V4-Flash API公测了,输入才0.14刀每百万token,Agent跑分还涨了20多分,想折腾的可以试试。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Flash
23:04官方一手歸藏(guizang.ai)@op7418精选DeepSeek 宣布 V4 Flash 0731 模型已开源。模型权重托管在 Hugging Face 的 deepseek-ai 组织下。该版本属于 Flash 系列,版本号为 0731。开发者可以下载权重进行本地部署或二次开发。AI模型DeepSeekV4 Flash 0731Hugging Face推荐理由:DeepSeek 把 V4 Flash 0731 的开源权重放出来了,想本地跑模型的话直接去 Hugging Face 下载就行。原文稍后读已读值得跟进有用关注 DeepSeek
22:44小互@imxiaohuSeedance 2.5正式发布,单次生成视频最长可达30秒。模型最多支持50个参考素材输入,角色、道具、风格等可一次性提供。官方演示显示,镜头运用、特效与人物表现均为电影级,且一次生成、无分段拼接。Seedance 2.5即将登陆Higgsfield平台,该平台目前提供Seedance 2.0的4K无限量使用。AI模型SeedanceHiggsfield视频生成推荐理由:Seedance 2.5来了,一次生成30秒电影感视频,还能塞50个参考素材,等它上Higgsfield就能玩。原文稍后读已读值得跟进有用关注 Seedance
22:14AK@_akhaliqDeepSeek-V4-Flash-0731 已发布到 Hugging Face。版本号 0731 出现在模型名中。该模型来自 DeepSeek V4 系列。Hugging Face 页面目前已经可以访问。AI模型DeepSeekV4-FlashHugging Face推荐理由:DeepSeek 发了新模型 V4-Flash-0731,已在 Hugging Face 上线,想试的直接去看模型卡下载。原文稍后读已读值得跟进有用关注 DeepSeek
21:38Geek@geekbb72°OpenAI宣布GPT-5.6 Luna降价,但未披露具体幅度。同日,DeepSeek推出V4 Flash正式版。有用户称早上将主力模型换成Luna,中午看到V4 Flash发布后后悔。该用户期待V4 Pro正式版发布时价格再降一档。AI模型GPT-5.6 LunaDeepSeek V4 FlashOpenAI10 个信源在谈事件专题推荐理由:OpenAI刚降价,DeepSeek就发新模型,换模型的速度都赶不上这波价格战。原文稍后读已读值得跟进有用关注 GPT-5.6 Luna
20:19AI Will@FinanceYF5DeepSeek-V4-Flash官方API已进入公开测试阶段。输入每百万Token仅0.28美元,输出价格为0.87美元。其Agent能力大幅升级,基准成绩全面超过V4-Pro-Preview。新版本原生支持Responses API格式,并完全适配Codex。AI模型DeepSeekV4-Flash智能体10 个信源在谈事件专题推荐理由:DeepSeek的V4-Flash刚上线,API便宜到离谱,输入才0.28美元,性能还压过V4-Pro-Preview,搭Agent直接用它。原文稍后读已读值得跟进有用关注 DeepSeek
20:08AI Will@FinanceYF5精选79°DeepSeek V4 Flash 官方API现已开启公测,重点升级Agent能力。Terminal Bench 2.1得分82.7,DeepSWE得分54.4,多项成绩大幅超过V4 Pro Preview。该模型还接近Opus 4.8的表现,并原生支持Responses API格式,现已适配Codex。AI模型DeepSeekV4 Flash智能体推荐理由:DeepSeek V4 Flash 公测了,Agent 跑分比 V4 Pro 高不少,还原生支持 Responses API,玩 Codex 的可以直接试。原文稍后读已读值得跟进有用关注 DeepSeek
19:39Hailuo AI@Hailuo_AI海螺AI官方分享了一段MiniMax H3生成的短视频,主打精准唇形同步。该片段来自用户Aaliya的第二次测试,提示词设定为16:9夜间武侠竹林。画面要求低饱和度冷蓝、墨绿、炭灰配色,并加入浅景深、面部特写等电影化细节。生成结果无字幕、无现代元素,强调拟真影视质感。AI模型MiniMax H3Hailuo AI视频生成5 个信源在谈事件专题推荐理由:MiniMax H3在海螺AI上对口型很准,一段提示词就能生成古风武侠片段,效果自然。原文稍后读已读值得跟进有用关注 MiniMax H3
19:02官方账号阿里通义 Qwen@Alibaba_Qwen精选阿里云推出ASR模型Qwen-Audio-3.0-ASR-Flash,主打上下文一致性和领域术语识别。内部测试中,医疗术语召回率达95.36%,工业术语召回率达93.24%。该模型支持自定义热词,并可将语音润色为结构化文本。同步提供流式与文件转写两个版本。AI模型Qwen-Audio-3.0-ASR-Flash阿里云语音识别1 个信源在谈事件专题推荐理由:语音识别总听错专业词?试试这个新模型,医疗术语召回95.36%,还能自定义热词和输出结构化文本。原文稍后读已读值得跟进有用关注 Qwen-Audio-3.0-ASR-Flash
18:14Hailuo AI@Hailuo_AIMiniMax 发布 H3 模型,定位开放权重、通用全模态生成。官方称其达到商用级生成质量,并强调成本效率具有竞争力。H3 支持多种模态的输入与生成,面向开发者开放权重。该模型延续了 MiniMax 在开源路线上的布局。AI模型MiniMaxH3开源模型推荐理由:MiniMax 出了 H3,开放权重还便宜,能做全模态生成,想省成本搞商用的可以看看。原文稍后读已读值得跟进有用关注 MiniMax
18:08orange.ai@oran_geDeepSeek V4 Flash 已上架 Cola 平台,支持 Token Plan 和积分模型两种计费方式。该模型的智能表现被描述为超过 GLM 5.2,接近 GPT 5.6 Luna。目前用户可通过 colaos.ai 免费体验这一模型。AI模型DeepSeek V4 FlashGLM 5.2GPT 5.6 Luna10 个信源在谈事件专题推荐理由:DeepSeek V4 Flash 在 Cola 上线了,免费就能玩,智能比 GLM 5.2 强,都快赶上 GPT 5.6 Luna了。原文稍后读已读值得跟进有用关注 DeepSeek V4 Flash
17:41向阳乔木@vista8精选DeepSeek-V4-Flash的官方API已进入公开测试。其Agent能力基准分数远超V4-Pro-Preview。该版本原生支持Responses API格式。同时完全适配Codex,开发者可在DeepSeek官方文档查看配置详情。AI模型DeepSeekDeepSeek-V4-FlashCodex10 个信源在谈事件专题推荐理由:DeepSeek把V4-Flash的API放出来了,Agent能力比V4-Pro-Preview还猛,而且直接支持Codex,开发者快去试试。原文稍后读已读值得跟进有用关注 DeepSeek
17:23Hunyuan@TXhunyuan75°腾讯开源翻译模型Hy-MT2自5月发布以来下载量已超70万次。Hy-MT2-1.8B登上Hugging Face趋势榜第一,Hy-MT2-30B-A3B位列第四。目前已有70多个产品和项目完成集成,并支持Apple MLX-LM、Microsoft ONNX Runtime、NVIDIA NeMo等框架。B站直播评论的实时多语言翻译已使用该模型。Hy-MT2-30B-A3B现已提供GGUF格式,便于本地推理。AI模型Hy-MT2腾讯混元机器翻译8 个信源在谈事件专题推荐理由:Hy-MT2是腾讯开源的翻译模型,现在30B版本有GGUF格式,下载就能在本地跑,冲榜第一,试试呗。原文稍后读已读值得跟进有用关注 Hy-MT2
17:14shao__meng@shao__meng71°DeepSeek-V4-Flash-0731 正式发布,官方 API 进入公开测试阶段。相比 V4-Pro-Preview,其 Agent 能力大幅升级,基准成绩全面超越 V4-Pro-Preview 和 GLM-5.2。在 DeepSWE 基准上取得 54.5 分,接近 Claude Opus-4.8 的水平。新版本原生支持 Responses API,并已适配 Codex。官方还预告了 DeepSeek Harness 以及内部基准 DSBench-FullStack 和 DSBench-Hard。AI模型DeepSeek-V4-Flash-0731DeepSeekGLM-5.2推荐理由:DeepSeek 把 V4-Flash 转正了,Agent 跑分超过 GLM-5.2,还适配了 Codex,想用 API 的可以试试。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Flash-0731
16:52Geek@geekbb83°DeepSeek-V4-Flash官方API现已进入公开测试阶段。其在Agent、工具调用、代码生成和数据科学相关基准测试上全面领先V4-Pro-Preview,其中DeepSWE基准的领先幅度尤为明显。V4-Flash原生支持Responses API格式,并已完全适配Codex环境。开发者可查阅官方API文档获取具体配置方法。AI模型DeepSeekV4-Flash智能体10 个信源在谈事件专题推荐理由:DeepSeek把V4-Flash的Agent能力拉满,公测就能用,还直接适配Codex,想试的赶紧去文档看配置。原文稍后读已读值得跟进有用关注 DeepSeek
16:45Hailuo AI@Hailuo_AI设计师Cia0用MiniMax H3和Midjourney V8.2制作了一个动画UI/UX作品集网站。页面采用十二栏网格布局,左侧五栏留白给主标题,光环动画作为加载器。MiniMax H3在一次生成中同时处理原生音频、屏幕文字和角色锁定,作者认为这一组合比SD2更有优势。整个制作使用了4,367个字符的中文提示词。AI模型MiniMax H3Midjourney视频生成5 个信源在谈事件专题推荐理由:Cia0用MiniMax H3加Midjourney V8.2做了个动画版UI作品集,H3能一次生成音频、文字和角色锁定,比SD2省事多了。原文稍后读已读值得跟进有用关注 MiniMax H3
16:44Geek@geekbbDeepSeek-V4-Flash-preview 在模型结构、尺寸不变的情况下,仅重新后训练就超过了 DeepSeek-V4-Pro。geekbb 的推文配图对比了 DeepSeek-V4-Flash-preview 与 DeepSeek-V4-Pro,但未列出任何具体基准名称或分数。目前该结果仅来自社交平台,DeepSeek-V4 系列官方尚未发布确认信息。AI模型DeepSeek-V4-Flash-previewDeepSeek-V4-Pro后训练4 个信源在谈事件专题推荐理由:geekbb 晒图:同 Flash-preview 架构,重训后超 V4-Pro,但没有具体分数。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Flash-preview
16:02宝玉@dotey72°DeepSeek 将 V4-Flash(版本号 0731)从预览升级为正式版 API,总参数 284B、激活参数 13B 的 MoE 架构不变,改动集中在后训练。官方称其在多项 Agent 基准上的成绩大幅超过 V4-Pro-Preview,编程和工具调用能力反超更贵的 Pro 预览版。V4-Flash 原生支持 Responses API 格式,可直接对接 OpenAI Codex,并提供一键配置脚本。API 定价为输入每百万 Token 0.14 美元、输出 0.28 美元,上下文窗口 100 万 Token。AI模型DeepSeekV4-FlashCodex10 个信源在谈事件专题推荐理由:Flash 转正后 Agent 能力反超 Pro 预览版,还原生适配 Codex,不用代理直接切,输入每百万 token 才 0.14 美元。原文稍后读已读值得跟进有用关注 DeepSeek
15:59AI Will@FinanceYF572°有人在 X 上让 Claude 5 Opus 从零生成越野车和泥地赛道,全程不使用任何贴图。车身、轮胎、尘土和环境都由模型直接绘制,没有调用现成素材。这条演示推文附带视频,目前浏览量达 535 次。AI模型Claude 5 Opus游戏图形图像生成推荐理由:有人让Claude 5 Opus零贴图直接画越野车和泥地赛道,连尘土都是生成的,视频看看效果。原文稍后读已读值得跟进有用关注 Claude 5 Opus
15:45官方一手歸藏(guizang.ai)@op741872°DeepSeek 官方发布 DeepSeek-V4-Flash 的官方 API,已进入公开测试阶段。该版本重点强化 Agent 能力,官方宣称其基准得分已远远超过 V4-Pro-Preview。V4-Flash 原生支持 Responses API 格式,并已完全适配 Codex 客户端。具体配置方式见 DeepSeek 官方 API 文档。AI模型DeepSeekDeepSeek-V4-Flash智能体10 个信源在谈事件专题推荐理由:DeepSeek 把 V4-Flash API 放出来公测了,Agent 能力比 V4-Pro-Preview 强不少,还直接支持 Codex,想玩可以去翻官方文档。原文稍后读已读值得跟进有用关注 DeepSeek
15:44LovartAI@lovart_aiMiniMax H3 已上线视频平台 Lovart,官方称其为全球排名第二的视频模型。该模型可生成15秒电影级视频,具有流畅且高保真的运动表现。它支持文本、图像、视频和音频四种多模态参考输入,并保持角色、产品、场景和风格的一致性。官方表示,其生产成本低于同类方案的一半,适用于广告、MV 和 TVC 制作。AI模型MiniMaxH3Lovart推荐理由:MiniMax H3 上了 Lovart,15秒电影级视频,成本还不到一半,做广告片和MV的可以试试。原文稍后读已读值得跟进有用关注 MiniMax
15:40官方账号深度求索 DeepSeek@deepseek_aiDeepSeek-V4-Flash 官方 API 现已进入公开测试版,Agent 能力获得升级。官方基准成绩显示其已远超 V4-Pro-Preview。该 API 原生支持 Responses API 格式,并已完全适配 Codex。具体配置方法见官方文档 api-docs.deepseek.com/quick_start/ag...AI模型DeepSeekV4-FlashCodex10 个信源在谈事件专题推荐理由:DeepSeek把V4-Flash的API开放公测了,Agent能力比V4-Pro-Preview强不少,还直接适配Codex,想试新模型可以去看看。原文稍后读已读值得跟进有用关注 DeepSeek
15:23Geek@geekbbDeepSeek 发布 V4-Flash-0731,属于 V4-Flash 系列的迭代版本。本次更新仅针对 API 接口,未提及模型能力变化。官方称 V4-Pro 正式版将尽快发布。AI模型DeepSeekV4-FlashAPI接口10 个信源在谈事件专题推荐理由:DeepSeek给V4-Flash刷了个小版本,只动了API接口,想等V4-Pro的可以蹲一下。原文稍后读已读值得跟进有用关注 DeepSeek
13:53官方账号Greg Brockman@gdb76°GPT-5.6 Sol 找到了 Maxwell 猜想的反例,证实该猜想错误。这一猜想已存在超过 100 年,反例由 AI 发现后经人类数学家确认,论文已上传至 arXiv(编号 2607.27197)。成果展示了 GPT-5.6 Sol 在数学推理上的具体能力。AI模型GPT-5.6 SolMaxwell conjecture推理模型推荐理由:GPT-5.6 Sol 直接给 Maxwell 猜想找出了反例,人类数学家还验证了,这推理能力真有点吓人。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol
12:29Hailuo AI@Hailuo_AIMiniMax H3 在 Artificial Analysis 视频编辑排行榜位列第一,文本转视频排名第二,图像转视频排名第三。该模型支持输入文本、图像、视频和音频,生成 5-15 秒 24fps 带原生音频的片段,2K 视频定价为每秒 0.13 美元(每分钟 7.80 美元)。其价格低于 Dreamina Seedance 2.0 的每分钟 22.45 美元、HappyHorse-1.1 的 9.90 美元和 Kling 3.0 的 20.16 美元,但高于 Google Gemini Omni Flash 的 6.00 美元。MiniMax 计划以社区许可发布权重,营收低于 2000 万美元的组织可商用,需显著署名。当前该模型已在 Hailuo AI app 和 MiniMax API 提供。AI模型MiniMax H3HailuoArtificial Analysis5 个信源在谈事件专题推荐理由:视频编辑直接登顶的 MiniMax H3,带原生音频,价格不到 Kling 的一半,还说要开源权重,做视频的可以试试。原文稍后读已读值得跟进有用关注 MiniMax H3
12:21lmarena.ai@lmarena_aiMiniMax H3已加入LMSYS视频竞技场,支持文本转视频和图像转视频两种模式,用户可参与投票评测。该模型主打全参考(Omni-Reference)能力、商业级生成效果和性价比,并承诺将开放权重。MiniMax H3现已在HailuoAI.video和MiniMax API上线,基准评分即将公布。AI模型MiniMaxH3HailuoAI推荐理由:MiniMax发了新视频模型H3,能文生视频也能图生视频,你可以在竞技场里直接投票试玩,效果和开源都值得关注。原文稍后读已读值得跟进有用关注 MiniMax