06:54IT之家(博客/媒体)72°谷歌发布 DiffusionGemma,一种基于文本扩散机制的开源 AI 模型,在本地推理速度上比传统自回归模型快 4 倍。该模型通过并行处理所有 token 并逐步去噪生成输出,避免了自回归模型在低带宽环境下的计算浪费。在单块 H100 GPU 上可达每秒 1000 token,DGX Station 上达每秒 2000 token。代码生成和数学推理能力出色,但科学推理等部分基准仍有短板。模型采用 Apache 2.0 开源,可从 Hugging Face 下载。AI模型扩散模型谷歌Gemma6 个信源在谈事件专题推荐理由:本地 AI 推理终于有了速度突破——DiffusionGemma 让低带宽设备也能高效运行,做边缘部署或本地应用的开发者可以直接从 Hugging Face 下载试试。原文稍后读已读值得跟进有用关注 扩散模型
04:44官方账号Simon Willison’s Weblog(博客/媒体)76°Google 去年曾短暂发布实验性的 Gemini Diffusion 模型,如今以开源形式回归,推出 DiffusionGemma-26B-A4B-it 模型,采用 Apache 2 许可证。该模型在 NVIDIA NIM 云 API 上免费托管,生成速度可达 500+ tokens/秒。作者实测生成 2409 tokens 仅需 4.4 秒,性能出色。这是 Google 在扩散模型领域的重要开源动作,为开发者提供了高性能的生成式 AI 选项。AI模型GoogleDiffusionGemma开源/仓库10 个信源在谈事件专题推荐理由:Google 把去年惊艳的扩散模型开源了,做图像/文本生成的开发者可以直接用 NVIDIA 免费 API 体验,速度超 500 tokens/秒,值得立刻上手试。原文稍后读已读值得跟进有用关注 Google
03:39官方账号Decoder@Jonathan Kemper72°Google 发布了 DiffusionGemma,一个 260 亿参数的开源模型。它不采用传统的逐词生成方式,而是通过扩散过程从噪声中生成文本,类似于图像 AI 的工作方式。据 Nvidia 称,该模型在单个 H100 GPU 上每秒可处理约 1000 个 token,速度是同类自回归模型的约 4 倍。但输出质量较低,因此 Google 目前将其定位为面向开发者的实验性工具。AI模型GoogleDiffusionGemma扩散模型10 个信源在谈事件专题推荐理由:DiffusionGemma 为文本生成开辟了新路径,追求推理速度的开发者可以尝试这种非自回归方案,尤其适合对实时性要求高的场景。原文稍后读已读值得跟进有用关注 Google
02:55官方一手Google DeepMind: Blog(博客/媒体)Google DeepMind 推出 DiffusionGemma,一种基于扩散模型的文本生成方法,相比传统自回归模型,生成速度提升 4 倍。该模型在保持生成质量的同时,显著降低了推理延迟,适用于需要快速响应的应用场景。DiffusionGemma 通过并行生成 token 而非逐个生成,实现了速度飞跃。这一进展对实时对话系统、内容生成等场景具有重要意义。AI模型文本生成扩散模型推理加速推荐理由:做文本生成应用的开发者,如果你的产品对延迟敏感,DiffusionGemma 的 4 倍加速值得一试,能直接提升用户体验。原文稍后读已读值得跟进有用关注 文本生成
02:54官方一手marktechpost@Asif Razzaq76°Google DeepMind 推出 DiffusionGemma,一款 26B 参数的混合专家(MoE)开源模型,采用文本扩散技术,在 GPU 上生成速度最高提升 4 倍。该模型在保持生成质量的同时,显著降低了推理延迟,适合对实时性要求高的场景。DiffusionGemma 已开源,开发者可直接下载使用。AI模型DiffusionGemmaGoogle DeepMindMoE推荐理由:做文本生成或实时 AI 应用的开发者,这个模型用扩散方法把生成速度翻了 4 倍,值得下载实测。原文稍后读已读值得跟进有用关注 DiffusionGemma
22:18IT之家(博客/媒体)精选AMD 在 SPEC CPU 2017 基准测试中,以 100kW 机柜功耗为限制,展示了新一代 256 核 EPYC Venice 处理器的性能。以英伟达 88 核 Vera 处理器的得分为 1.0 基准,Intel 128 核至强 6980P 得分为 1.46,上代 192 核 EPYC Turin 得分为 2.37,而 Venice 得分达到 3.30,约为 Vera 的三倍多。单核性能方面,256 核 Venice 相比 Vera 有 27% 优势,但降档至 96 核版本时优势缩至 11%。AMD 强调数据中心客户更关注固定功耗机柜的实际性能,而非单芯片峰值。AI模型AMDVeniceEPYC推荐理由:AMD Venice性能碾压对手原文稍后读已读值得跟进有用关注 AMD
21:51官方账号Decoder@Maximilian Schreiner88°Anthropic推出了Claude Fable 5,这是其新Mythos模型系列的首款产品。该模型在几乎所有基准测试中领先,包括SWE-bench Verified达到95%,但价格是Opus 4.8的两倍,每百万token收费10或50美元。严格的安全过滤器会阻止约9%的请求,并且新的30天数据保留政策甚至适用于零数据保留合同。这标志着Anthropic在追求极致性能的同时,也加强了安全控制和商业化策略。AI模型Claude Fable 5Mythos系列推理模型10 个信源在谈事件专题推荐理由:Claude Fable 5在编程和推理任务上创下新高,但高昂成本和严格过滤让开发者需要权衡。做AI应用或自动化流程的团队,建议先评估预算和合规需求再决定是否接入。原文稍后读已读值得跟进有用关注 Claude Fable 5
16:45官方一手marktechpost@Asif RazzaqAnthropic 推出了 Claude Fable 5 和 Claude Mythos 5 两款新模型,它们基于相同的底层架构,但安全防护级别不同。Fable 5 已全面可用,内置分类器以增强安全性;而 Mythos 5 则通过 Project Glasswing 项目有限开放,移除了网络安全相关的防护措施,面向更高级的用例。这一举措标志着 Anthropic 在模型安全分级上的新尝试,为不同风险承受能力的用户提供差异化选择。AI模型AnthropicClaude模型安全10 个信源在谈事件专题推荐理由:Anthropic 首次推出同一模型的不同安全版本,做安全敏感或高风险 AI 应用的团队可以按需选择,值得关注 Mythos 5 的开放程度。原文稍后读已读值得跟进有用关注 Anthropic
16:25IT之家(博客/媒体)精选72°摩尔线程发布并开源了首个基于国产 GPU 算力底座全链路训练的代码大模型 MusaCoder,包含 9B 和 27B 两个参数规模。该模型专注于 GPU 底层算子生成,可从 PyTorch 标准算子自动生成高性能 CUDA/MUSA 原生 Kernel 代码,降低开发者手写门槛。在 KernelBench 评测中,MusaCoder-27B-RL 以 Overall Pass@8 93.2% 的成绩超越 Claude Opus 4.7、DeepSeek-V4 Pro 等主流模型,性能领先。模型已在 Hugging Face 开源,论文同步发布。AI模型代码大模型GPU 算子开源/仓库推荐理由:国产 GPU 生态终于有了自己的代码大模型,做 GPU 算子开发或国产算力适配的团队可以直接试用,降低底层开发门槛。原文稍后读已读值得跟进有用关注 代码大模型
09:40SuperTechFans(博客/媒体)88°Anthropic推出两款新模型:Fable 5(安全版)和Mythos 5(无安全限制版)。Fable 5在软件工程、知识工作、视觉识别等领域达到最先进水平,可自主完成复杂任务,如一天内完成Stripe代码库迁移(原需团队两个月)。Mythos 5面向网络安全,在药物设计、分子生物学等领域表现超越人类专家。两款模型定价均为每百万输入令牌10美元、输出令牌50美元,比预览版低一半以上。但Fable 5的安全措施过于激进,误判大量正常内容,引发用户不满。AI模型AnthropicFable 5Mythos 510 个信源在谈事件专题推荐理由:Anthropic新模型价格腰斩且能力大幅提升,做复杂自动化或安全研究的团队值得关注;但安全版误判问题严重,实际使用前建议先测试边界。原文稍后读已读值得跟进有用关注 Anthropic
08:12官方账号Simon Willison’s Weblog(博客/媒体)88°Simon Willison 在 Claude Fable 5 发布后第一时间进行了约 5.5 小时的测试。该模型与 Claude Mythos 5 性能相同,但增加了严格的安全护栏,触发时 API 会通知用户并可自动回退到其他模型。Fable 5 拥有 100 万 token 上下文窗口、12.8 万最大输出 token,知识截止于 2026 年 1 月,价格是 Opus 4.8 的两倍。Willison 认为它“感觉很大”,不仅体现在速度和成本上,更在于其知识深度,例如能准确列出他的开源项目。当前挑战已从“模型能做什么”转向“找到它做不了的事”。AI模型Claude Fable 5Claude Mythos 5安全护栏10 个信源在谈事件专题推荐理由:Claude Fable 5 的“大模型感”让开发者重新思考任务边界——如果你经常用 Claude 处理复杂推理或长上下文任务,这个模型值得一试,但要做好预算准备。原文稍后读已读值得跟进有用关注 Claude Fable 5
06:51IT之家(博客/媒体)88°Anthropic 于 6 月 9 日发布 Claude Fable 5 和 Claude Mythos 5 两款 AI 模型,其中 Fable 5 面向普通用户,是当前公开可用能力最强的 Claude 模型,在软件工程、知识工作、视觉和科学研究领域表现卓越,自主运行时间更长。Mythos 5 则通过 Project Glasswing 项目向网络安全和基础设施提供商开放,具备全球最强的网络安全能力,并在药物设计和分子生物学研究中提速约 10 倍。两款模型定价均为每百万输入 10 美元、输出 50 美元,Fable 5 已全面上线,Mythos 5 暂限特定合作伙伴使用。AI模型Claude Fable 5Claude Mythos 5Anthropic10 个信源在谈事件专题推荐理由:Claude 用户终于等来最强公开模型——Fable 5 在长任务和复杂推理上超越 Opus,做软件工程、金融分析或科研的可以直接上手体验。原文稍后读已读值得跟进有用关注 Claude Fable 5
02:33官方账号Decoder@Matthias Bastian88°Anthropic推出了两款新模型Claude Fable 5和Mythos 5,在编程和科学研究方面显著超越当前Opus系列。Fable 5在一天内完成了Stripe的代码迁移任务,而这项工作原本需要一个团队两个月。Mythos 5能自主设计候选药物,但由于其强大的网络攻击能力,目前被限制使用。这些模型展示了AI在复杂任务中的巨大潜力,但也引发了安全担忧。AI模型AnthropicClaude Fable 5Mythos 510 个信源在谈事件专题推荐理由:编程和科研团队将看到AI效率的飞跃——Fable 5一天完成两个月的工作量,值得开发者关注;Mythos 5的自主药物设计能力则让生物医药研究者眼前一亮,但安全限制也提醒我们技术双刃剑的特性。原文稍后读已读值得跟进有用关注 Anthropic
01:24官方一手marktechpost@Asif Razzaq精选Google 发布 Gemini 3.5 Live Translate,一个支持流式语音到语音翻译的音频模型,覆盖 70 多种语言。该模型通过 Gemini Live API 提供给开发者,并集成到 Google Meet 和翻译应用中。它能够连续生成音频,延迟仅为几秒。AI模型Gemini 3.5GoogleGemini Live API推荐理由:70+语言实时语音翻译原文稍后读已读值得跟进有用关注 Gemini 3.5
16:33官方一手Pandaily@contact@pandaily.com (Pandaily)UniSound 发布了其通用基础模型 U2,该模型以效率优先为特色,在保持竞争力的同时将 token 消耗降低了 25%。U2 的推出标志着 UniSound 正式进入中国大模型的第一梯队。该模型通过优化架构和训练策略,实现了更低的推理成本,对于需要大规模部署 LLM 的企业来说是一个重要进展。U2 的发布也反映了中国大模型领域从单纯追求参数规模转向注重实际应用效率的趋势。AI模型UniSoundU2大模型推荐理由:U2 的 25% token 节省直接降低了企业调用大模型的成本,做 AI 应用开发和模型部署的团队值得关注这个效率标杆。原文稍后读已读值得跟进有用关注 UniSound
15:00IT之家(博客/媒体)88°小米 MiMo 与 TileRT 联合发布 MiMo-V2.5-Pro-UltraSpeed 模式,首次在 1 万亿参数模型上实现超过 1000 tokens/s 的输出速度。该模式 API 已上线,定价为原版的 3 倍,但输出速度提升约 10 倍。由于高速推理资源有限,该模式采取申请制限时开放,申请通过的用户可在 2026 年 6 月 9 日至 6 月 23 日期间免费体验 Chat 功能,每日最多 10 次会话,每次最长 30 分钟。这一突破标志着万亿参数模型在实时推理场景中的实用化迈出关键一步。AI模型万亿参数模型推理速度MiMo推荐理由:万亿参数模型首次达到千 tokens/s 输出,做大规模推理或实时 AI 应用的团队可以直接申请体验,看看能否真正落地到生产环境。原文稍后读已读值得跟进有用关注 万亿参数模型
02:22官方账号Decoder@Jonathan Kemper精选72°微软研究院推出Lens,一个仅3.8B参数的文本到图像模型,在基准测试中匹配更大模型,训练成本大幅降低。其关键创新是使用GPT-4.1生成的8亿条详细图像描述,而非模糊的网页替代文本。代码和权重已开源。这表明高质量标注比模型规模更重要。AI模型图像生成微软Lens推荐理由:做图像生成模型训练或研究的团队,可以借鉴Lens用详细标注替代规模扩张的思路,直接复用其开源代码和权重,能大幅降低训练成本。原文稍后读已读值得跟进有用关注 图像生成
00:49官方一手marktechpost@Asif Razzaq精选小米MiMo团队与TileRT发布MiMo-V2.5-Pro-UltraSpeed推理模式。该模式在单个8-GPU普通节点上,使1万亿参数模型MiMo-V2.5-Pro的译码速度超过1000 tokens/秒。这是首次在commodity GPU上实现如此高吞吐量。相比此前方案,速度提升显著。AI模型MiMoTileRTMiMo-V2.5-Pro-UltraSpeed推荐理由:1万亿参数跑出1000t/s原文稍后读已读值得跟进有用关注 MiMo
17:14IT之家(博客/媒体)精选开放媒体联盟AOMedia发布AV2 v1.0.0标准,相比AV1可在相同画质下减少三成带宽需求。新标准增强对AR/VR内容、多画面传输、屏幕内容编码等场景的支持。目前RTX 30/40/50系、RDNA 2/3/4、苹果M3等芯片仅支持AV1,尚未支持AV2硬件加速。参考AV1普及历程,AV2硬件广泛支持预计等到2028年。AI模型AV2AV1AOMedia推荐理由:AV2省带宽三成,2028见原文稍后读已读值得跟进有用关注 AV2
17:03官方一手marktechpost@Asif Razzaq精选微软 AI 发布了其自研语音转文字模型 MAI-Transcribe-1.5,这是该系列的第二代。该模型支持 43 种语言,在 Artificial Analysis 排行榜上词错误率低至 2.4%,在 FLEURS 基准测试中达到最佳精度。它引入了关键词(实体)偏置功能,可针对特定领域术语提升识别准确率。长音频转录速度提升高达 5 倍,1 小时音频可在 15 秒内完成转录。该模型已在 Azure AI Foundry 中正式可用。AI模型语音识别微软MAI-Transcribe-1.5推荐理由:语音转文字场景的开发者终于有了微软官方的强力选项——MAI-Transcribe-1.5 在精度和速度上双双突破,做会议转录、客服质检或多语言内容处理的团队可以直接在 Azure 上试用,省去自建模型的麻烦。原文稍后读已读值得跟进有用关注 语音识别
14:27官方一手marktechpost@Asif Razzaq精选UIUC与Chroma联合推出Harness-1,一个20B参数的检索子智能体,通过强化学习在状态搜索框架中训练。该框架维护候选池、重要性标记的精选集、证据图和验证记录,策略决定搜索、筛选、验证和停止时机。在8个基准测试中,Harness-1平均精选召回率达0.730,领先下一名开源子智能体11.4个百分点,仅次于Opus-4.6。模型权重和框架代码已开源。AI模型Harness-1检索子智能体强化学习推荐理由:Harness-1用强化学习解决了检索子智能体的搜索策略优化问题,做信息检索或RAG系统的开发者可以直接用开源代码复现,效果接近闭源最强模型。原文稍后读已读值得跟进有用关注 Harness-1
09:48官方一手pandaily@contact@pandaily.com (Pandaily)精选小红书(RED)研究团队提出Evolving-RL框架,通过强化学习让AI智能体在经验中自主进化技能,无需额外技能提取模块。该框架使智能体能够动态调整行为策略,适应新任务和环境变化,显著提升在复杂场景下的表现。这一方法为构建更灵活、自适应的AI系统提供了新思路,尤其适用于需要持续学习的应用场景。AI模型强化学习智能体技能进化推荐理由:做AI智能体开发的团队终于有了让模型自主进化的方案——Evolving-RL省去了手动设计技能模块的麻烦,做强化学习或自适应系统的开发者值得深入研究。原文稍后读已读值得跟进有用关注 强化学习
09:44官方一手pandaily@contact@pandaily.com (Pandaily)Harness Engineering 是近期 AI 领域兴起的新概念,旨在通过系统化方法将 AI 模型的能力“驾驭”到实际应用中。它强调在模型训练之外,设计有效的输入输出接口、反馈循环和任务分解策略,以提升 AI 系统的可靠性和实用性。这一范式被认为是对传统“提示工程”的升级,尤其适用于复杂任务和多步骤工作流。该概念由多位 AI 研究者和从业者推动,正在成为行业讨论的焦点。AI模型Harness EngineeringAI 范式提示工程推荐理由:Harness Engineering 解决了 AI 落地中模型能力与真实场景脱节的问题,做 AI 应用开发或系统集成的团队值得关注,它可能改变你设计 AI 工作流的方式。原文稍后读已读值得跟进有用关注 Harness Engineering
19:15官方账号Decoder@Jonathan Kemper78°一款名为 Audio Interaction 的新型开源语音模型发布,它能够持续监听音频流,并每 0.4 秒决定是否说话或保持沉默,无需等待录音结束。该模型支持翻译、转录、聊天以及识别日常噪音(如咳嗽),实现了真正的实时交互。与 GPT-4o 或 Qwen3.5-Omni 不同,它在一个流中处理所有任务。代码、模型权重和下载说明已在 GitHub 上以 Apache 2.0 开源许可证发布,训练数据也将随后提供。AI模型开源/仓库语音模型实时交互推荐理由:这款模型解决了实时语音交互中“等待录音结束”的痛点,做语音助手或实时翻译的开发者可以直接在 GitHub 上试玩,体验每 0.4 秒的决策能力。原文稍后读已读值得跟进有用关注 开源/仓库
15:55官方一手marktechpost@Asif Razzaq精选NVIDIA发布了Nemotron 3.5 ASR,一个600M参数的流式语音识别模型。该模型采用cache-aware架构,可从单个检查点实时转录40种语言-区域。它针对低延迟场景优化,支持多种语言的实时语音转文字。AI模型Nemotron 3.5 ASRNVIDIA语音识别10 个信源在谈事件专题推荐理由:600M模型转40语言实时原文稍后读已读值得跟进有用关注 Nemotron 3.5 ASR
15:24官方账号Decoder@Jonathan Kemper83°阿里巴巴Qwen团队发布Qwen3.7-Plus,这是一个多模态智能体模型,集视觉感知、GUI操作和编码于一体。在演示中,基于该模型的智能体自主开发了一款词汇学习应用,在11小时内通过1000次智能体调用生成了超过10000行代码。该模型在Qwen自己的基准测试中屏幕理解能力领先,但整体性能参差不齐。Qwen3.7-Plus是专有模型,未开源,定价远低于西方前沿模型。AI模型多模态智能体Qwen3.7-Plus1 个信源在谈事件专题推荐理由:阿里将多模态AI推向自主智能体新高度,做GUI自动化或端到端应用开发的团队值得关注——它能自己写代码、操作界面,11小时产出上万行代码,效率惊人。原文稍后读已读值得跟进有用关注 多模态
11:06IT之家(博客/媒体)精选中国科学院海洋研究所发布了“琅琊”2.0,这是全球海洋现象智能预报大模型,在2024年1.0版本基础上,从海洋状态变量预报扩展至复杂海洋现象智能预报。该模型针对台风、降水、风暴潮、海冰等六类现象开发了6个垂直模型,提升了预报速度和精度。例如,台风预报模型可提升24小时路径与强度预报能力,海冰预报模型可实现3公里分辨率下月尺度以上的北极海冰快速预测。相比传统数值模式,智能预报大模型解决了计算成本大、更新频率低的问题,为海洋防灾减灾和航运安全提供科技支撑。AI模型琅琊2.0海洋预报AI大模型推荐理由:海洋预报从数值模式转向AI大模型,精度和速度都大幅提升,做海洋防灾、航运规划或极地研究的团队值得关注,可以直接评估其预报能力。原文稍后读已读值得跟进有用关注 琅琊2.0
09:43官方一手Pandaily@contact@pandaily.com (Pandaily)精选StepFun 最新模型 Step 3.7 Flash 在 Artificial Analysis 基准测试中夺得速度、成本效率和端到端性能三项第一。该模型在 OpenRouter 和 Hugging Face 上获得大量关注,展现出强大的竞争力。这一成绩表明 StepFun 在推理优化和成本控制方面取得了显著突破,为开发者提供了高性价比的 AI 模型选择。AI模型Step 3.7 Flash基准测试推理优化推荐理由:做 AI 应用选型或部署推理服务的团队,Step 3.7 Flash 在速度和成本上的优势值得直接对比测试,可能帮你省下不少预算。原文稍后读已读值得跟进有用关注 Step 3.7 Flash
02:59官方一手marktechpost@Asif Razzaq精选Google DeepMind 推出 Gemma 4 的 QAT(量化感知训练)检查点,包含 Q4_0 格式(4-bit 量化)和新开发的移动格式。与 BF16 版本相比,Q4_0 可将模型内存占用降低约 75%,而移动格式进一步优化至适合手机等设备。这些检查点面向边缘计算场景,平衡了精度和推理速度。AI模型Gemma 4Google DeepMindQAT10 个信源在谈事件专题推荐理由:Gemma 4 量化版来了,内存省 75%原文稍后读已读值得跟进有用关注 Gemma 4
15:42官方一手Pandaily@contact@pandaily.com (Pandaily)精选北京大学研究团队推出EvoPhys-World,号称全球首个以人为中心、场景级、全可控的5D世界模型。该模型基于摩尔线程的国产算力基础设施构建,支持物理交互与动态场景生成。在多个仿真场景中,EvoPhys-World实现了物体物理属性与空间关系的实时推理。其自进化机制可基于交互反馈持续优化模型行为,无需人工标注。AI模型EvoPhys-World北京大学5D世界模型推荐理由:北大开源5D世界模型,物理交互自进化原文稍后读已读值得跟进有用关注 EvoPhys-World
12:52IT之家(博客/媒体)72°马斯克旗下 xAI 通过 API 开放预览版图像转视频模型 grok-imagine-video-1.5-preview,能将单张静态图片扩展为流畅、带电影感的视频片段。用户提供起始图片并用自然语言描述运动方式,即可控制镜头移动、画面节奏、环境氛围与物理效果。该模型最高支持 720p 视频生成,适合概念验证、分镜测试和短内容生产。xAI 还强调其适合制作多镜头序列,用户可先设计画面再逐段动画化并串联成更长的场景。AI模型xAIgrok-imagine-video-1.5-preview图像转视频推荐理由:做短视频、概念设计或分镜测试的创作者,现在可以用一张图生成电影感视频,省去逐帧手绘的麻烦,值得通过 API 试玩。原文稍后读已读值得跟进有用关注 xAI
10:45IT之家(博客/媒体)精选76°深圳河套学院联合哈工大、华为等团队,依托华为昇腾910C国产AI算力集群,成功完成1.6万亿参数大模型DeepSeek-V4-Pro的全参数后训练。这是全球第三方机构首次在国产算力平台上完成如此规模的模型训练,模型算力利用率超过30%,关键训练算子效率提升14%,达到工业级运行标准。该成果证明国产AI芯片已能支撑世界级超大参数模型训练,为国产算力生态积累了重要经验。AI模型华为昇腾910C国产算力万亿参数大模型推荐理由:国产芯片终于能跑万亿参数大模型了,做AI基础设施和模型训练的团队值得关注——这证明昇腾910C已具备工业级训练能力,后续国产替代路径更清晰。原文稍后读已读值得跟进有用关注 华为昇腾910C
09:56官方一手Pandaily@contact@pandaily.com (Pandaily)精选浙江大学与康奈尔大学、新加坡国立大学、西安电子科技大学合作开发视觉推理系统VisualThink-VLA。该系统让机器人直接通过视觉信息推理,无需语言内省,相比文本方法提速22.8倍,同时精度更高。在多个视觉-语言任务上,VisualThink-VLA达到SOTA。AI模型VisualThink-VLAZhejiang University视觉推理推荐理由:机器人用眼睛思考,快22倍原文稍后读已读值得跟进有用关注 VisualThink-VLA
05:48官方一手marktechpost@Asif Razzaq83°NVIDIA 发布了 Nemotron 3 Ultra,一个 550B 总参数(55B 激活)的开放混合专家模型,采用 Mamba-Transformer 混合架构。该模型支持 100 万 token 的上下文窗口,推理吞吐量比同等精度的开放 LLM 高约 6 倍。NVIDIA 同时开源了模型权重、训练数据和配方,遵循 OpenMDW-1.1 许可。这一发布旨在解决长时运行智能体在推理效率和上下文长度上的瓶颈,为 AI 代理和复杂任务自动化提供了更高效的基础模型。AI模型NVIDIANemotron 3 Ultra混合专家模型10 个信源在谈事件专题推荐理由:长时智能体开发者终于有了一个兼顾超长上下文和高推理效率的开放模型——Nemotron 3 Ultra 的 6 倍吞吐量提升能显著降低部署成本,做 Agent 或 RAG 系统的团队值得直接试。原文稍后读已读值得跟进有用关注 NVIDIA
05:27官方账号OpenAI@OpenAI (@OpenAI)OpenAI的研究人员Alex Wei、Hongxun Wu和Wujie Ma在OpenAI播客中分享了一个案例:他们训练的模型发现了一个存在80年的Erdős猜想的反例。这一发现展示了AI模型在数学研究中的潜力,能够协助数学家发现新规律或反例。该事件强调了人机协作在科学探索中的价值,尤其是模型可以处理大量数据并识别人类可能忽略的模式。播客中详细讲述了模型如何通过推理和搜索找到反例,以及数学家如何验证这一结果。AI模型OpenAIErdős猜想数学发现8 个信源在谈事件专题推荐理由:数学家和AI研究者会感兴趣——模型不仅验证了猜想,还主动发现了反例,展示了AI在数学发现中的实际应用。建议点开了解人机协作如何突破传统研究边界。原文稍后读已读值得跟进有用关注 OpenAI
04:32官方一手Hugging Face: Blog(博客/媒体)NVIDIA 推出 Nemotron 3.5 Content Safety,这是一款面向全球企业 AI 的可定制多模态安全模型。它支持文本和图像输入,能够检测有害内容(如仇恨言论、暴力、色情等),并允许企业根据自身政策进行微调。该模型基于 Llama 3.1 架构,提供 8B 和 70B 两种规模,在多个安全基准上表现优异。Nemotron 3.5 旨在帮助企业安全部署生成式 AI,满足不同地区的合规要求。AI模型NVIDIANemotron 3.5内容安全10 个信源在谈事件专题推荐理由:企业部署 AI 最头疼的就是内容安全合规,NVIDIA 这个模型直接让企业按自己的政策微调安全过滤规则,做 AI 应用落地的团队值得关注。原文稍后读已读值得跟进有用关注 NVIDIA
22:32官方一手Hugging Face: Blog(博客/媒体)NVIDIA 发布了 Nemotron 3.5 ASR 模型的微调指南,帮助开发者将通用语音识别模型适配到特定语言、专业领域或口音。该模型基于 Whisper 架构优化,支持低资源语言和噪声环境。指南提供了从数据准备、训练配置到部署的完整流程,并强调使用 LoRA 等高效微调方法降低计算成本。这对于需要高精度语音识别的垂直场景(如医疗、金融、客服)尤其有价值。AI模型语音识别ASRNemotron10 个信源在谈事件专题推荐理由:NVIDIA 把 ASR 微调的门槛降下来了,做语音应用的团队(尤其是非英语场景或专业领域)可以直接参考这套流程,省去大量试错成本。原文稍后读已读值得跟进有用关注 语音识别
16:15官方一手marktechpost@Asif Razzaq精选Miso Labs 发布了 MisoTTS,一个 8B 参数的开源文本转语音模型,专注于情感表达。它采用残差向量量化(RVQ)技术,在不增加参数的情况下扩展声音范围,并能根据文本和音频上下文调整说话人语调。模型架构由 7.7B 主骨干和 300M 深度解码器组成。MisoTTS 的开放权重让开发者和研究者可以自由使用和定制,推动了情感语音合成领域的开源进展。AI模型文本转语音情感合成开源模型推荐理由:MisoTTS 解决了 TTS 模型情感表达不足的痛点,做语音合成、虚拟助手或内容创作的团队可以直接下载权重试用,感受 8B 模型带来的细腻语调变化。原文稍后读已读值得跟进有用关注 文本转语音
16:04IT之家(博客/媒体)精选安全研究员Kasra Rahjerdi搭建了一个故意留有漏洞的图书评论APK,测试多款AI大语言模型的安全推理能力。模型需解包APK并识别暴露的Firebase凭据以绕过API访问数据库。每个模型预算10美元,限时2小时,总花费1500美元。结果显示,GPT-5.5在10次运行中成功7次,每次成功成本9.46美元;DeepSeek V4 Pro成功3次,但每次成功成本仅0.62美元,约为GPT-5.5的十五分之一。Gemini多次在任务早期拒绝继续,而Claude Sonnet 4.6和Opus 4.8各成功2次。该测试揭示了不同模型在安全漏洞利用任务中的性能与成本差异,对批量运行安全工具的团队具有现实意义。AI模型安全测试GPT-5.5DeepSeek V4 Pro推荐理由:安全团队和AI开发者可以直观看到不同模型在真实漏洞利用任务中的性价比——GPT-5.5最可靠但贵,DeepSeek V4 Pro成本极低但成功率有限,做自动化安全测试的团队值得参考这个对比。原文稍后读已读值得跟进有用关注 安全测试
15:24IT之家(博客/媒体)Meta 公司原计划于 4 月发布其闭源 AI 模型 Muse Spark 并同步推出 API,但至今仍未兑现。该模型由 Meta 超级智能实验室开发,内部评测称其可与 OpenAI、Anthropi 竞争,并领先 xAI 的 Grok。然而,由于测试中暴露的漏洞和基础设施扩建需求,发布时间从 4 月推迟至 5 月,再至 6 月。这标志着 Meta 从开源转向闭源路线的关键产品遭遇“难产”,开发者仍无法验证其能力。AI模型MetaMuse Spark闭源模型9 个信源在谈事件专题推荐理由:Meta 闭源转型的关键模型一再跳票,关注 AI 模型竞争格局的开发者值得了解背后的技术挑战和延期原因。原文稍后读已读值得跟进有用关注 Meta