17:56爱范儿@张子豪国产具身智能机器人只用了两只标准夹爪,就实现了更低成本的操作方案。该方案在性能上反超了美国机器人公司 Figure AI。这一成果被业内称为具身智能的「DeepSeek 时刻」。AI模型Figure AIDeepSeek具身智能推荐理由:国产机器人只用两只夹爪就把成本打下来,性能还赢了 Figure AI,看看他们怎么做到的。原文稍后读已读值得跟进有用关注 Figure AI
17:56IT之家(博客/媒体)78°谷歌DeepMind发布大规模多语言手语转文本模型SL2T,Pixel 11系列手机上的Gboard和Live Transcribe应用率先支持美国手语输入。该模型在超过50种手语的10万小时数据上训练,能识别身体多部位同步运动。测试显示,美国手语输入比英语打字更快更自然。模型将手语转为姿势特征点,在设备端完成处理,无需上传原始视频,保护用户隐私。AI模型手语转文本Google DeepMindPixel 114 个信源在谈事件专题推荐理由:谷歌DeepMind把手语转文字做进了Pixel 11,美国手语直接变成文本,比打字还快,而且数据在本地处理,隐私有保障。原文稍后读已读值得跟进有用关注 手语转文本
17:56IT之家(博客/媒体)韩国 Upstage 发布商用大模型 Solar Pro 4,上下文窗口 512K,输出长度 128K token。定价方面,输入每百万 tokens 0.3 美元,缓存读取 0.06 美元,输出 1.2 美元。该模型在 Terminal-Bench v2.1 得分 57,τ³-Banking 得分 23,AA-LCR 得分 71。在 Agent Arena 榜单排名第 44,与 MiniMax M2.7 同级,也是首个登上该榜单的韩国实验室模型。AI模型Solar Pro 4UpstageAgent Arena推荐理由:Upstage 发了主打智能体任务的 Solar Pro 4,定价不高,Agent Arena 排名和 MiniMax M2.7 同级,适合处理长文档和多轮工具调用。原文稍后读已读值得跟进有用关注 Solar Pro 4
17:55爱范儿@彭海星DeepSeek V4 Pro正式版发布,实测性能直逼Fable 5。DeepSeek V4 Pro在AI Agent方向上发力,还藏了一个大招。爱范儿实测显示,DeepSeek V4 Pro在智能体任务中表现抢眼。AI模型DeepSeek V4 ProDeepSeekFable 510 个信源在谈事件专题推荐理由:DeepSeek V4 Pro正式版来了,实测跟Fable 5有得一拼,还藏了个大招,想玩智能体的朋友可以看看。原文稍后读已读值得跟进有用关注 DeepSeek V4 Pro
17:54官方账号Simon Willison’s Weblog(博客/媒体)Simon Willison公开了Claude Opus 5的系统提示词全文。提示词要求Claude准确说明2026年6月12日Anthropic因美国商务部出口管制暂停Claude Fable 5和Mythos 5,并于7月1日恢复访问。系统提示词指示Claude只提供事实、不分享个人观点,并引导用户查阅Anthropic官方声明。由于这些事件发生在Claude训练数据截止之后,提示词专门补充了这段背景信息。AI模型Claude Opus 5Anthropic系统提示词10 个信源在谈事件专题推荐理由:Simon Willison贴出Claude Opus 5系统提示词,看Anthropic怎么让模型谈出口管制,还给了官方声明链接。原文稍后读已读值得跟进有用关注 Claude Opus 5
17:53官方账号Decoder@Matthias BastianxAI 发布 Grok 4.6,在 Artificial Analysis 智能指数上得分 61,与 GPT-5.6 Sol 持平,仅次于 Claude Opus 5。在智能体任务中,Grok 4.6 完成复杂工作流平均约 53 步,而 Claude Opus 5 需要约 103 步。Grok 4.6 的 API 价格比 OpenAI 最强模型低 60% 以上。AI模型Grok 4.6GPT-5.6Claude Opus 510 个信源在谈事件专题推荐理由:xAI 的 Grok 4.6 跑分追平 GPT-5.6,智能体任务比 Claude 更省步数,价格还便宜一大截,想换 API 的可以看看。原文稍后读已读值得跟进有用关注 Grok 4.6
17:48IT之家(博客/媒体)微信团队发布大语言模型 WeLM,核心方向是资源利用效率。WeLM-80B 拥有 800 亿总参数和 30 亿激活参数,已部署在微信原生 AI 助手小微上,支持聊天、搜索和调用小程序服务。WeLM-617B 总参数达 6170 亿、激活参数 230 亿,采用混合专家(MoE)架构,目前正在开发中,面向智能小程序开发和小微工具生成等复杂任务。AI模型WeLM微信腾讯推荐理由:微信自己搞的 WeLM 80B 已经在小微里落地了,617B MoE 版也在路上,做微信生态开发的可以盯一下。原文稍后读已读值得跟进有用关注 WeLM
17:47官方一手marktechpost@Michal SutterSpaceXAI于8月12日发布Grok 4.6,这是基于Grok 4.5的后训练升级而非更大基础模型。Grok 4.6在Artificial Analysis Intelligence Index上以61分追平GPT-5.6 Sol Max,支持500K上下文并新增xhigh推理等级。定价保持每百万token输入2美元、输出6美元。不过在编码基准上仍然落后于竞品。AI模型Grok 4.6SpaceXAIGPT-5.6 Sol Max推荐理由:Grok 4.6来了,500K上下文还加了xhigh推理,跑长任务更稳。编码还是短板,但智能体场景可以试试。原文稍后读已读值得跟进有用关注 Grok 4.6
17:46IT之家(博客/媒体)DeepSeek V4 Pro 正式版于8月13日晚间发布,已更新至API,调用模型名保持不变。新版本增强了Agent能力,支持Responses API和Codex接入。官方评测显示,DeepSeek-V4-Pro-0813在多项测试中接近Fable 5水平,相比预览版能力大幅提升。AI模型DeepSeekDeepSeek V4 Pro智能体10 个信源在谈事件专题推荐理由:DeepSeek V4 Pro 正式版来了,Agent 能力增强,支持 Codex 接入,跑分直逼 Fable 5,用 API 的可以试试。原文稍后读已读值得跟进有用关注 DeepSeek
03:57IT之家(博客/媒体)71°DeepSeek 官网 API 文档的“模型 & 价格”页面新增了 DeepSeek-V4-Pro-0813 模型,该模型支持非思考与思考模式。此前 7 月 31 日,DeepSeek-V4-Flash 正式版 API 上线公测,官方当时表示 V4-Pro 正式版将尽快发布。此次新增的 0813 版本疑似为 V4-Pro 的预览或正式版本。AI模型DeepSeekDeepSeek-V4-ProAPI10 个信源在谈事件专题推荐理由:DeepSeek 悄悄上了个新模型版本,支持思考和普通模式,刚更新了 API 文档,想试的可以看看。原文稍后读已读值得跟进有用关注 DeepSeek
01:57IT之家(博客/媒体)76°SpaceXAI 发布 Grok 4.6,在 Artificial Analysis Intelligence Index 上与 GPT-5.6 Sol 取得相同成绩。该模型在 Grok 4.5 基础上强化长时智能体任务,可处理资料研究、大型代码库和产品构想落地。训练数据包含筛选后的模型生成推理数据与工程数据,并经历比 Grok 4.5 更长的补充训练。Grok 4.6 已上线 Cursor、Grok Build 和 API,每百万输入 Token 定价 2 美元、输出 6 美元,首周两项服务用户获得两倍内含使用额度。AI模型Grok 4.6GPT-5.6 SolSpaceXAI10 个信源在谈事件专题推荐理由:SpaceXAI 的 Grok 4.6 发布,跑分追平 GPT-5.6 Sol,长流程编程和搭应用更强,已上线 Cursor,首周额度翻倍。原文稍后读已读值得跟进有用关注 Grok 4.6
01:28IT之家(博客/媒体)86°阿里云魔搭社区宣布开源Qwen3.8-2.4T-A95B模型权重,总参数2.4T,每个Token激活95B参数。该模型原生支持262,144 Token上下文,可扩展至1,010,000 Token。模型每个MoE层包含512个专家,每个Token选择10个路由专家并激活1个共享专家。官方评测显示,它在PaperBench、IFBench等基准上取得较高成绩,与Opus 4.8、Fable 5、GPT 5.6 Sol相比互有高低。Qwen3.8重点提升编程、办公、科研和长周期Agent任务的端到端完成能力。AI模型Qwen3.8-2.4T-A95BQwen阿里云推荐理由:阿里开源了Qwen3.8-2.4T-A95B,2.4T参数激活95B,原生256K上下文,编程和Agent能力对标GPT 5.6 Sol和Opus 4.8。原文稍后读已读值得跟进有用关注 Qwen3.8-2.4T-A95B
22:29量子位@梦瑶国产具身智能模型在一小时内分拣1816件异形包裹,创下全球新纪录。该模型以30%的成本实现了比Figure AI高45%的分拣效率。其关键在于采用了更聪明的具身大脑,提升了决策与操作能力。这一成果展示了国产具身智能在成本与性能上的双重优势。AI模型具身智能Figure AI分拣机器人推荐理由:国产具身智能一小时拣1816件包裹,成本只有Figure AI的30%,效率还高45%,看看它怎么做到的。原文稍后读已读值得跟进有用关注 具身智能
22:20官方一手Google DeepMind: Blog(博客/媒体)Google DeepMind发布手语转文字模型SL2T,为聋人和听障用户提供新功能。SL2T能将手语实时转换为文本,帮助用户更便捷地沟通。该模型基于深度学习技术,支持多种手语表达。DeepMind表示,SL2T在准确性和响应速度上均有显著提升。这一技术有望改善听障群体的数字体验。AI模型SL2TGoogle DeepMind手语识别推荐理由:Google DeepMind出了个手语转文字模型SL2T,能把手语实时变文字,聋人朋友用起来方便多了。原文稍后读已读值得跟进有用关注 SL2T
20:49官方账号Decoder@Jonathan KemperNvidia正在开发开源权重模型Nemotron 4,目标参数规模达一万亿,旨在与全球最佳免费模型竞争。然而,中国实验室如DeepSeek和Qwen已在更大规模上取得进展。Nemotron 4的发布将加剧开源模型领域的竞争。AI模型Nemotron 4Nvidia万亿参数10 个信源在谈事件专题推荐理由:Nvidia要出万亿参数开源模型了,但中国实验室已经跑在前面,看看这场竞赛怎么打。原文稍后读已读值得跟进有用关注 Nemotron 4
19:37IT之家(博客/媒体)精选73°比亚迪汽车新技术研究院AI团队发布首篇研究论文,提出混合世界模型HyWorldVLA,结合像素级和潜在空间世界建模,采用VLA架构。该模型在NAVSIM v1基准上取得90.59的PDMS评分,刷新历史最佳,在NAVSIM v2上获89.71分。消融实验显示,移除像素级预测PDMS降至87.50,移除潜在空间处理降至89.91。在655个雨雾噪声场景中,模型得分86.87,比最强基线高19分以上。比亚迪还发布了4nm车规级智驾芯片璇玑A3,算力约700TOPS,支持三芯片并联,形成算法到芯片的闭环。AI模型HyWorldVLA比亚迪NAVSIM推荐理由:比亚迪AI团队首秀,HyWorldVLA在自动驾驶基准上拿了第一,还自研了4nm芯片,算法硬件一起搞,想了解比亚迪智驾实力的可以看看。原文稍后读已读值得跟进有用关注 HyWorldVLA
18:28官方账号Decoder@Matthias Bastian精选微软发布MAI Code 1.1 Flash,用于GitHub Copilot,声称比前代节省25%的token,成本降低75%。但在基准测试中,其性能被更便宜的DeepSeek V4 Flash超越。此举符合微软一贯模式:宣传开源AI,却在应用中内置更差的专有模型以保护利润。AI模型MAI CodeDeepSeekGitHub Copilot推荐理由:微软新代码模型被DeepSeek碾压,价格性能都输,想了解Copilot背后模型真实水平的朋友可以看看。原文稍后读已读值得跟进有用关注 MAI Code
17:36IT之家(博客/媒体)精选微软今日推出升级版编程模型 MAI-Code-1.1-Flash,面向 GitHub Copilot 工作负载优化。在 Terminal-Bench 2.1 测试中,该模型表现提升 22%,.NET 相关任务提升 15%。Token 生成速度提升 25%,完成相同任务所需 Token 减少 25%。价格降至初代 MAI-Code-1-Flash 的四分之一,每百万输入 Token 收费 0.20 美元。新模型还新增原生视觉能力,可理解图像内容,现已陆续登陆 VS Code、Visual Studio 等平台。AI模型MAI-Code微软GitHub Copilot推荐理由:微软把编程模型升级了,MAI-Code-1.1-Flash 跑分涨了 22%,价格砍到四分之一,还加了看图能力,用 Copilot 的可以试试。原文稍后读已读值得跟进有用关注 MAI-Code
16:44IT之家(博客/媒体)精选LTX 公司于 8 月 11 日推出 LTX-2.5 视频生成模型,原生集成 ComfyUI,在 2 张英伟达 GB200 配置下生成 10 秒 720P 视频仅需 6.8 秒。LTX-2.5 Fast 版本按每秒 0.09 美元计费,10 秒片段成本 0.90 美元,支持微调且权重开放。年收入低于 1000 万美元的组织可免费使用,更大规模公司需商业授权。模型可通过 Hugging Face、ComfyUI 和 LTX API 获取。AI模型LTX-2.5ComfyUI视频生成推荐理由:LTX 出了新视频模型,6.8 秒就能出 10 秒 720P 视频,还免费给小团队用,想玩视频生成可以试试。原文稍后读已读值得跟进有用关注 LTX-2.5
16:02官方一手marktechpost@Asif Razzaq精选NVIDIA推出开源MoE模型Nemotron 3.5 Lightning,总参数量30B,激活参数仅3B,专为智能体执行层设计。同时发布NeMo Switchyard模型路由器,可将每个执行步骤路由到成本最低且能力足够的模型。该组合旨在降低智能体推理成本,提升执行效率。Nemotron 3.5 Lightning基于开源许可发布,开发者可自由使用。AI模型NemotronNVIDIAMoE10 个信源在谈事件专题推荐理由:NVIDIA开源了30B MoE,激活才3B,跑起来便宜,还配了个路由器帮你省钱,搞智能体的可以看看。原文稍后读已读值得跟进有用关注 Nemotron
09:52IT之家(博客/媒体)英伟达于8月11日发布Nemotron 3.5 Lightning,这是一款拥有300亿参数的MoE开源模型,专为大型多智能体系统设计。相比同类模型,其输出速度最高提升4倍,智能体任务整体完成速度加快30%。该模型支持本地运行于NVIDIA RTX PC、DGX Spark等设备,也可扩展至企业级数据中心和云端环境。开源链接已提供在Hugging Face、ModelScope和OpenRouter等平台。AI模型Nemotron 3.5 Lightning英伟达开源模型10 个信源在谈事件专题推荐理由:英伟达新出的30B开源模型,跑智能体任务比同类快4倍,还能本地跑,搞多智能体开发的可以试试。原文稍后读已读值得跟进有用关注 Nemotron 3.5 Lightning
01:11官方一手Google Blog: AI(博客/媒体)谷歌研究团队在模拟环境中首次展示了AMIE医疗AI系统的实时视频问诊能力。该系统基于大型语言模型,能够与患者进行自然对话,并辅助医生进行临床决策。在初步研究中,AMIE在问诊准确性和患者满意度方面表现出色。该研究为远程医疗和AI辅助诊断提供了新的可能性。AI模型AMIE谷歌医疗AI推荐理由:谷歌的AMIE系统能在视频里跟病人实时对话,模拟问诊,医生和患者评价都不错,想了解AI医疗进展的可以看看。原文稍后读已读值得跟进有用关注 AMIE
00:31techcrunch@Russell Brandom83°Anthropic的一个未发布模型在数学领域最著名的未解问题之一——黎曼猜想上取得了进展。该模型在相关基准测试中表现优于现有模型,尽管未能完全解决猜想,但展示了AI在数学推理方面的潜力。这一成果可能对数学研究产生深远影响。AI模型Anthropic黎曼猜想数学推理9 个信源在谈事件专题推荐理由:Anthropic的新模型在黎曼猜想上取得了进展,虽然没完全解决,但比预期强,值得看看AI在数学上能走多远。原文稍后读已读值得跟进有用关注 Anthropic
00:26官方一手AWS Machine Learning Blog@Koyo Hidaka精选ONESTRUCTION在AWS Generative AI Innovation Center的技术支持下,构建了专为建筑和BIM工作流设计的基础模型Ishigaki-IDS。该模型通过合成数据、三阶段训练流程和可验证奖励机制,在Amazon EC2上完成训练。案例展示了在数据稀缺领域如何利用AWS工具链构建领域专用模型。AI模型Ishigaki-IDSONESTRUCTIONAWS推荐理由:建筑行业缺数据?看ONESTRUCTION怎么用AWS的合成数据和三阶段训练搞出个专用模型,挺有参考价值。原文稍后读已读值得跟进有用关注 Ishigaki-IDS
23:34官方账号Decoder@Matthias Bastian精选Nvidia发布开源权重模型Nemotron 3.5 Lightning,仅36亿活跃参数,在智能指数上与OpenAI的gpt-oss-120b持平,但体积小四倍。该模型每秒处理近670个token,是对比中速度最快的模型。Nvidia此举表明其更注重效率而非模型规模。AI模型Nemotron 3.5 LightningNvidiagpt-oss-120b10 个信源在谈事件专题推荐理由:Nvidia新出的开源模型,36亿参数跑得比1200亿的还快,速度拉满,适合追求低延迟的开发者。原文稍后读已读值得跟进有用关注 Nemotron 3.5 Lightning
22:58IT之家(博客/媒体)72°英伟达正在研发新一代开源 AI 模型系列 Nemotron 4,据 The Information 援引项目参与者消息,其中最大模型预计至少拥有 1 万亿个参数。英伟达生成式 AI 副总裁 Kari Briski 表示,投资 Nemotron 是为了让每家企业、每个国家都能获得前沿开源模型。该模型最早可能在今年秋末准备就绪,但发布日期尚未确定。英伟达还发布了 Nemotron 3.5 Lightning 模型,面向代码审查、工具调用等任务,并推出开源模型路由库 NeMo Switchyard。AI模型Nemotron英伟达开源模型推荐理由:英伟达要出万亿参数开源模型了,直接对标全球顶级,想了解开源模型新格局的可以看看。原文稍后读已读值得跟进有用关注 Nemotron
19:04爱范儿@张子豪爱范儿报道,大模型厂商开始比拼「越狱」能力,即让模型突破自身安全限制。文章指出,通过特定提示词或对抗性输入,模型可能输出违规内容。测试显示,部分模型在越狱攻击下防护较弱。厂商正加强安全训练,但越狱与反越狱的攻防仍在持续。AI模型越狱大模型安全推荐理由:看看各家大模型谁最容易被「骗」出违规内容,安全攻防战比想象中精彩。原文稍后读已读值得跟进有用关注 越狱
19:02IT之家(博客/媒体)88°Anthropic 于 8 月 11 日宣布,未公开的研究版 Claude 在攻克黎曼猜想中取得进展,将临界线上零点比例下界从 41.6% 提升至 67.2%。Claude 在 Claude Code 中自主完成研究,生成 3,100 万个 Token,经历 650 次失败后调集 60 个子级智能体,执行 2,400 条 Shell 命令并编写数百个 Python 脚本。结果经内部数学家莱文特·阿尔波格和拉尔夫·弗曼验证,并由外部专家布赖恩·康雷和丹·戈德斯顿审阅,证明已写成 Lean 可验证形式。Anthropic 公布了论文、过程记录及形式化证明,但未透露多智能体能力是否近期开放。AI模型ClaudeAnthropic黎曼猜想10 个信源在谈事件专题推荐理由:Anthropic 的 Claude 把黎曼猜想零点下界从 41.6% 提到 67.2%,还放出论文和 Lean 证明,数学和 AI 圈都值得看看。原文稍后读已读值得跟进有用关注 Claude
18:01IT之家(博客/媒体)精选蚂蚁百灵在 Hugging Face 开源 Ling-3.0-tiny 模型,总参数 7.9B,每 Token 激活 1.3B 参数,采用混合推理 MoE 架构。该模型将 KDA 和 MLA 按 3:1 比例交替堆叠,包含 128 个路由专家,兼顾上下文处理与计算成本。官方提供 BF16、FP8 和 INT4 权重版本,适配不同平台。在 M4 Pro MacBook 上推理速度约 86-90 Token/s,8K 上下文峰值内存约 8.34 GiB。AI模型Ling-3.0-tiny蚂蚁百灵MoE推荐理由:蚂蚁百灵开源了个轻量推理模型,7.9B 参数但每 Token 只激活 1.3B,Mac mini 上跑得飞快,适合本地部署。原文稍后读已读值得跟进有用关注 Ling-3.0-tiny
17:28IT之家(博客/媒体)精选商汤科技8月11日发布SenseNova 6.8 Flash Lite Preview预览版,上线SenseNova Token Plan。该模型主打轻量敏捷,支持自主规划、持续执行、多Agent协作和动态纠偏,可实现端到端结果交付。模型在数百步长程任务中保持目标稳定,主Agent可调度十余个专业Agent并行处理检索、分析、计算等任务。支持原生多模态融合,能制作动态PPT并操作浏览器完成办公工作。正式版6.8 Flash Lite和性能更强的6.8 Flash将于近期发布。AI模型SenseNova商汤多模态推荐理由:商汤出了个能自己跑完整个流程的轻量模型,你只管给目标,它自己干活,还能做PPT、操作浏览器,想省事的可以试试。原文稍后读已读值得跟进有用关注 SenseNova
16:46官方一手Pandaily@contact@pandaily.com (Pandaily)精选南洋理工大学、北京大学、港科大(广州)与智源研究院联合发布 Omega-0,一种潜在预测世界动作模型,能让机器人同时行走、观察和操作。在 11 项真实家务任务中,单模型成功率达 81.8%,超过 pi-0.5、EgoVLA、GR00T-N1.7 和 psi-0。该模型采用潜在预测机制,提升了对环境变化的响应能力。研究团队强调,Omega-0 在真实家庭场景中的表现优于多个现有基线模型。AI模型Omega-0世界动作模型机器人推荐理由:想了解机器人怎么同时走路干活?Omega-0 在真实家务上做到 81.8% 成功率,比 pi-0.5 等模型都强,值得看看。原文稍后读已读值得跟进有用关注 Omega-0
15:01IT之家(博客/媒体)微软于8月10日推出新一代自研文生图模型 MAI-Image-2.6,在 Arena 文生图排行榜中以 1336 分位列第二,仅次于 OpenAI 的 GPT Image 2(Medium)。相比 2.5 版本,整体 Elo 评分提升 79 分,文本渲染能力单项涨幅达 91 分。模型排名从第十位跃升至第二位,领先 Meta、谷歌和 xAI 等竞品。在 3D 成像与建模类别中,该模型从第六位升至第一位,其他多个细分类别也有显著进步。新模型支持多参考图像融合,并增强语义理解与输出控制能力。AI模型MAI-Image-2.6微软文生图10 个信源在谈事件专题推荐理由:微软新模型直接干到文生图榜第二,文本渲染涨了91分,3D建模还拿了第一,想试的可以去Arena玩。原文稍后读已读值得跟进有用关注 MAI-Image-2.6
14:49官方账号Latent Space (swyx)(博客/媒体)Muse推出Glimmer和Spark两款开源权重模型,主打个人超级智能。Glimmer可在单张RTX 3090上运行,降低了本地部署门槛。Spark定位更高性能,面向更复杂任务。此举被视为美国开源模型阵营的一次小胜。AI模型MuseGlimmerSpark推荐理由:Muse开源了Glimmer和Spark,Glimmer一张3090就能跑,想本地玩大模型的可以看看。原文稍后读已读值得跟进有用关注 Muse
14:40IT之家(博客/媒体)科技媒体 testingcatalog 发现谷歌正酝酿 Gemini 3.7 Flash 模型,其踪迹出现在 Python GenAI SDK 的 GitHub 页面。内部曾尝试添加 gemini-3.7-flash 模型,但因命名错误被拒绝。目前谷歌官方 API 仍以 7 月 21 日发布的 Gemini 3.6 Flash 为主。Flash 系列平均约两个月更新一代,外界推测 3.7 可能处于内部测试阶段,发布时间待官方公告。AI模型Gemini谷歌Gemini 3.7 Flash推荐理由:谷歌 Flash 系列又要换代了,3.6 才出不到一个月,3.7 的踪迹就露出来了,想追新模型的可以提前关注。原文稍后读已读值得跟进有用关注 Gemini
14:33量子位@一水83°Anthropic的未公开Claude模型在黎曼猜想相关问题上创下新纪录,将下界显著推高。该模型在数学推理基准上表现突出,超越了此前的最佳结果。具体提升幅度和基准名称尚未完全公开,但已引发学界关注。这一进展展示了AI在高级数学研究中的潜力。AI模型ClaudeAnthropic黎曼猜想10 个信源在谈事件专题推荐理由:Anthropic偷偷用新模型刷了数学纪录,下界直接拉高,数学和AI圈都该看看。原文稍后读已读值得跟进有用关注 Claude
14:25官方一手marktechpost@Michal SutterwebAI发布了TwIL-LM模型家族,包含1.7B和3B参数版本,能将英文翻译成一阶逻辑并检查结论是否从前提推出。3B模型可在CPU或4GB显存上运行,1.7B模型下载大小为1.06GB。两个版本均采用非商业许可。模型卡显示,头条基准分数属于未发布的检查点,而非Hub上的权重。AI模型TwIL-LMwebAI形式逻辑推荐理由:想本地跑形式逻辑?TwIL-LM 1.7B和3B能翻译英文到一阶逻辑,3B只要4GB显存,但注意基准分数是未发布版本的。原文稍后读已读值得跟进有用关注 TwIL-LM
10:34量子位@允中五大高校联合发布了首份机器人三视角世界模型评测。评测聚焦三视角世界模型的稳定性表现,回答"谁更稳"这一核心问题。五大高校表示榜单将持续更新。AI模型世界模型机器人三视角推荐理由:五大高校做了个机器人三视角世界模型评测榜,谁更稳看榜单就清楚了,之后还会持续更新。原文稍后读已读值得跟进有用关注 世界模型
08:28官方账号Simon Willison’s Weblog(博客/媒体)精选Meta 发布新模型 Muse Glimmer,参数量 30B,采用 Apache 2.0 许可证。它在 DeepSearch QA、MCP-Atlas、τ-Bench 和 SWE-Bench 等基准上实现高成功率,可完成搜索问答、工具调用与代码调试。该模型支持视觉输入,作者用 LM Studio 的 18.16 GB 量化版本实测了代码库问答和图像描述。Muse Glimmer 在 32GB 内存设备上运行后仍留有余量,适合本地部署。AI模型Muse GlimmerMeta开源模型推荐理由:Meta 出了个 30B 开源模型,能自己调工具写代码,还能看图,Apache 2.0 随便用,跑得动。原文稍后读已读值得跟进有用关注 Muse Glimmer
08:01techcrunch@Lucas RopekOpenAI宣布扩大AI网络安全防御项目Daybreak,并同步推出一个经过网络训练的新模型。该项目旨在应对日益增多的AI驱动攻击。此次发布是OpenAI在安全领域的最新布局,新模型将用于辅助防御团队检测和缓解威胁。具体技术细节和基准数据尚未在本次发布中披露。AI模型OpenAIDaybreak网络安全10 个信源在谈事件专题推荐理由:OpenAI把Daybreak项目升级了,还专门训练了个网络模型,想用它对付AI搞出来的攻击,搞安全的可以看看。原文稍后读已读值得跟进有用关注 OpenAI
02:46官方账号Decoder@Matthias Bastian精选Hugging Face与EleutherAI的FineBooks项目测试了14款开源OCR模型,覆盖2000多页历史书籍。表现最好的dots.mocr字符准确率达97.6%,处理每千页成本低于2美元。团队认为该精度已可用于AI训练数据,但尚未达到学术转录标准。AI模型OCRFineBooksHugging Face推荐理由:Hugging Face和EleutherAI测了14款开源OCR,dots.mocr最准,97.6%准确率,每千页不到2美元,处理旧书够用了。原文稍后读已读值得跟进有用关注 OCR