18:04AI产品黄叔@PMbackttfutureGrok 4.6 可通过一行命令接入 WorkBuddy:npx skills add zjp1997720/zhijian-skills --skill workbuddy-cli-model-bridge。安装后输入“把grok 4.6模型桥接到WorkBuddy,走 chat/completions,不要用 Responses 协议”,即可打开 xAI 授权页完成连接。作者使用 X Premium+ 订阅,额度消耗较快,但执行速度明显快于 Codex。技巧Grok 4.6WorkBuddyxAI推荐理由:想用Grok 4.6跑任务?一行命令接进WorkBuddy,实测比Codex快不少,X Premium+用户留意额度。原文稍后读已读值得跟进有用关注 Grok 4.6
18:03IT之家(博客/媒体)75°CoreWeave 首席财务官 Nitin Agrawal 表示,公司已签署合同将英伟达 A100 GPU 出租至 2029 年,该芯片发布于 2020 年。这一期限远超此前市场担心的两三年折旧周期,CoreWeave 称其老一代英伟达芯片资源已基本售罄,股价周三一度上涨 20%。GPU 租赁数据机构 Silicon Data 指出,A100 在 2026 年反弹后租赁价格依然保持良好,保修期通常为五年,损坏可直接更换。旧款芯片可转向推理等低要求任务,英伟达本周还宣布联合 Apollo、BlackRock 等机构,计划调动超过 5000 亿美元投入 AI 基础设施。行业CoreWeaveA100英伟达1 个信源在谈事件专题推荐理由:CoreWeave 用真合同证明 A100 能租到 2029 年,GPU 贬值焦虑可以放一放了。原文稍后读已读值得跟进有用关注 CoreWeave
18:03官方账号Runway ML@runwaymlRunway 宣布 Grok Imagine Image 2.0 上线其平台。该模型是 Runway 当前提供的最新图像生成模型,与平台上其他图像和视频模型并列。用户现在即可通过 Runway 官方链接试用 Grok Imagine Image 2.0。AI模型Grok Imagine Image 2.0Runway图像生成推荐理由:Grok Imagine Image 2.0 现在能在 Runway 直接用了,和顶级图像视频模型放一块,试图像生成又多了个选择。原文稍后读已读值得跟进有用关注 Grok Imagine Image 2.0
18:03Paul Graham@paulgPaul Graham 在 X 发文回应常见疑问:AI 时代标准创业建议几乎全部仍适用。他提到,同一批创业公司之间的建议差异,大于 AI 出现前后的差异。该推文目前获得 7774 次浏览、50 次点赞。行业Paul Graham创业建议AI时代推荐理由:Paul Graham 刚说标准创业建议在 AI 时代依然有效,差别没那么大。想创业的可以先看看这条,判断下要不要调整思路。原文稍后读已读值得跟进有用关注 Paul Graham
18:03idoubi@idoubicc精选DSCode 桌面版正式发布,是一个基于 DeepSeek 的桌面 Agent,底层采用 Pi Agent Toolkit,并以 MIT 协议完全开源。它适配 DeepSeek V4 Pro 和 Flash 模型,针对 1M Context 和前缀缓存做了优化,可显著提高长会话缓存命中率。内置 Plan、会话恢复、Checkpoint/Undo 和后台任务,支持多 Agent 并行及 Git Worktree 隔离。此外还支持 Skills、Hooks 和 MCP,用户可切换 GPT、Claude 等模型,API Key 和配置默认保存在本地。AI产品DSCodeDeepSeek编程助手推荐理由:idoubicc 开源了 DSCode,一个专为 DeepSeek 优化的编程助手,主打便宜、极速、稳定,还能换 GPT 和 Claude,完全免费。原文稍后读已读值得跟进有用关注 DSCode
18:03IT之家(博客/媒体)72°据路透社报道,谷歌联合创始人谢尔盖·布林在4月全体员工大会上敦促Google DeepMind全力投入Gemini模型。Anthropic的Claude Mythos预览版推动竞争,而Gemini新旗舰因编程等领域测试落后,发布推迟两个月。8月5日DeepMind CEO由Demis Hassabis换为Koray Kavukcuoglu,哈萨比斯转任董事长。部分非技术团队将从DeepMind剥离至谷歌公司。行业GeminiDeepMindAnthropic10 个信源在谈事件专题推荐理由:谷歌内部慌了:布林亲自压阵Gemini,还把DeepMind CEO换了。想了解谷歌怎么追Anthropic和OpenAI,这篇讲得透。原文稍后读已读值得跟进有用关注 Gemini
18:03官方账号Simon Willison’s Weblog(博客/媒体)OpenClaw(运行Opus 4.6)对一家澳大利亚健身房预订网站的API进行安全测试,发现取消他人预订的接口没有授权校验。测试者与排位第1的候补者交互,实际成功取消了对方预订,使自己的名次从第4升至第3。该漏洞曝光了服务端对API调用方身份缺乏任何验证的问题。行业OpenClawOpus 4.6AI安全5 个信源在谈事件专题推荐理由:OpenClaw用Opus 4.6实测澳洲健身房API,发现没权限校验,能把别人预订直接取消,还能让自己排队名次提前。安全测试就得这么硬核。原文稍后读已读值得跟进有用关注 OpenClaw
18:02官方账号Simon Willison’s Weblog(博客/媒体)DeepSeek V4 Pro 0813 已通过 OpenRouter 以 API 形式上线,官方没有专门公告页。新模型提供低、中、高三档推理等级,作者测试同一提示词时三档输出差异明显。截至发稿,DeepSeek 未确认是否开放权重,但 4 月的 V4 Pro 和 7 月的 V4 Flash 0731 均已开源,因此概率较高。基准数据先出现在官方微信群,被转载到 Reddit 后因“低质量”删除,现以 ASCII 表格形式流传于 Hacker News。AI模型DeepSeekV4 Pro 0813OpenRouter推荐理由:DeepSeek 新模型只走 API,OpenRouter 上能直接试。三档推理等级画出来的鹈鹕都不一样,想玩可以拿同一道题对比看看。原文稍后读已读值得跟进有用关注 DeepSeek
18:02a16z@a16z72°YC总裁Garry Tan在a16z播客中表示,AI是个人能力的乘数。他认为借助vibe coding和agentic coding,任何个人都能完成两年前甚至九个月前400倍的工作量。他还提到硅谷文化让另类创业者获得许可,AI使小团队能以更少资源做更多事。他对AI原生公司和旧金山未来持乐观态度。行业Garry TanYCvibe coding1 个信源在谈事件专题推荐理由:YC掌门人Garry Tan说单人创业能靠AI放大400倍,想听他怎么聊vibe coding和agentic coding的可以看看。原文稍后读已读值得跟进有用关注 Garry Tan
18:02爱范儿@莫崇宇DeepSeek V4 Pro 正式版发布。该模型在多项核心基准测试中接近 Fable 5 的水平。目前官方尚未公布具体评测数字。更多性能细节有待后续信息披露。AI模型DeepSeekDeepSeek V4 ProFable 510 个信源在谈事件专题推荐理由:DeepSeek 的新旗舰 V4 Pro 上线了,多项测试快赶上 Fable 5,关心模型性能的可以留意。原文稍后读已读值得跟进有用关注 DeepSeek
18:02IT之家(博客/媒体)71°Mistral AI 于8月11日宣布平台将支持第三方开放模型,首个接入的是智谱 GLM-5.2。第三方模型将与第一方模型共享基础设施、区域控制和服务承诺。用户可选择在美国或欧洲区域运行 AI 推理负载,以更好地满足数据跨境合规要求。Mistral 还启动了优先层级公开预览及“欧洲计算单元”联盟计划,用于支持欧洲算力基础设施建设。AI产品Mistral AI智谱GLM-5.2开放模型推荐理由:Mistral AI 把智谱 GLM-5.2 放进自家平台了,还能选美国或欧洲跑推理,欧洲客户合规更省心。原文稍后读已读值得跟进有用关注 Mistral AI
18:02官方账号NVIDIA AI@NVIDIAAI72°NVIDIA今日推出Nemotron 3.5 Lightning模型,并已上线Tinker平台。该模型仅激活3B参数,针对吞吐速度进行优化。它面向对延迟和成本敏感的应用场景,适合高频实时推理任务。用户可在Tinker上直接体验该模型。AI模型NemotronNVIDIATinker10 个信源在谈事件专题推荐理由:NVIDIA出了个轻量级新模型,3B参数跑得快又便宜,延迟敏感场景用得上,Tinker上现在就能玩。原文稍后读已读值得跟进有用关注 Nemotron
18:02IT之家(博客/媒体)路透社与Nikkei Research联合调查显示,超80%的日本公司仅有限使用AI或完全不用。其中60%的受访者表示AI仅在部分部门使用,18%尚未决定引入,6%未考虑使用,仅16%将AI视为不可或缺工具。日本政府报告指出,86.4%的日本本土企业至少有一项任务使用生成式AI,低于中国的98.1%、德国的91.6%和美国的90.9%。调查还发现,4%的公司预计AI预算年增长率超50%,31%尚未决定,但所有受访者均表示不会削减AI支出。行业日本生成式AI路透社推荐理由:路透社刚出的日本企业AI渗透率数据,跟中美德对比差距挺直观,做行业判断可以看看。原文稍后读已读值得跟进有用关注 日本
18:02Genspark@genspark_ai71°Grok 4.6已在Genspark平台上线,用户可在AI Chat、Code Agent和Genspark Claw中直接选用。该模型由xAI推出,专为长时间运行的智能体和编码任务设计。相比Grok 4.5,Grok 4.6在保持相同定价的同时实现了显著性能提升,属于前沿智能水平。用户只需在模型选择器中切换即可使用。AI模型Grok 4.6GensparkxAI1 个信源在谈事件专题推荐理由:Genspark上线了xAI的新模型Grok 4.6,专为长任务智能体和写代码优化,价格不变但比4.5强不少,做Agent开发可以试试。原文稍后读已读值得跟进有用关注 Grok 4.6
18:01官方一手arXiv: DeepSeek@Beichen Huang, Zhenyu Liang, Bowen Zheng, Ran Cheng精选EvoX Genesis 提出以持久递归世界组织软件开发,用 DeepSeek V4 Flash 在 120 小时内构建了约 25 万行 Rust 版 C 编译器,花费仅 44 美元。该编译器通过完整 c-testsuite 及大部分 LLVM 和 Csmith 测试。在 GLM 5.2 生成的另一编译器世界中,即使反复替换开发代理,测试性能仍保持不变。Genesis 还将 13 个 MESA 模块(超 10 万行 Fortran)重写为近 9 万行 Rust,六个数值工作负载中位数加速达 1.55 至 6.87 倍。论文EvoX GenesisDeepSeek V4 FlashGLM 5.26 个信源在谈事件专题推荐理由:EvoX Genesis 用持久项目代替持久智能体,DeepSeek V4 Flash 花 44 美元写了能过测试的 C 编译器,MESA 提速 6.87 倍。原文稍后读已读值得跟进有用关注 EvoX Genesis
18:01官方账号arXiv cs.AI@AmirHossein Eshghi, Hamid Saadatfar, Seyyed Ali Hoseini, AmirMohsen Eshghi, Siavash Arjomand Bigdel该综述聚焦类激活映射(CAM)这一可解释视觉技术家族,梳理了自2016年首个CAM提出以来的57篇方法论文。文中按归因机制、架构依赖和评估目标构建分类体系,涵盖梯度法、无梯度评分、高分辨率上采样、弱监督定位、Transformer token归因以及基于CLIP、DINO、SAM的方法。综述指出研究趋势正从单层低分辨率类别分数解释转向多层、概率化、token感知和基础模型感知的比较式解释。评估协议仍碎片化,忠实度、定位、鲁棒性、计算成本和人类信任缺乏统一标准。论文CAM类激活映射可解释性推荐理由:想系统搞懂CAM方法演进,这篇57篇论文的综述把梯度法、Transformer归因、CLIP/DINO/SAM时代的新做法都梳理清楚了,还指出了各方法留下的坑。原文稍后读已读值得跟进有用关注 CAM
18:01IT之家(博客/媒体)英特尔将公开发行约2.105亿股普通股,发行价每股95美元,总募资规模扩大至200亿美元。CEO陈立武及一名家庭成员同意以发行价认购1200万美元股票,这是他第二次自费增持。此次增发是英特尔自1971年上市以来最大规模单次股权融资,扣除费用后净筹资约197亿美元。资金将用于AI芯片产品线迭代量产和IDM 2.0晶圆代工业务扩张,公司2026年第二季度营收161亿美元,同比增长25%。行业英特尔陈立武AI芯片推荐理由:英特尔搞了笔200亿美元大融资,CEO陈立武自己掏了1200万美元跟投,这是它上市以来最大一次增发,钱主要砸AI芯片和代工。原文稍后读已读值得跟进有用关注 英特尔
18:01官方账号arXiv cs.AI@Yan Deng, Fei XuDreamFly 是基于 Dream-VLA 的扩散式航空视觉语言导航框架。它引入因果对齐历史记忆,仅使用当前决策前的观测增强视觉表征,避免未来信息泄漏。导航采用 receding-horizon 扩散规划,预测 K 步动作块但只执行第一步,实现 plan-K、execute-one 策略。LiteStop 在初始全掩码状态直接从动作 logits 估计停止概率,将终止判断与动作生成解耦。在 OpenFly 基准上,DreamFly 在 test-seen/test-unseen 上分别取得 32.04%/29.46% SR 和 28.22%/23.54% SPL,并达到最低导航误差。AI模型DreamFlyDream-VLAOpenFly推荐理由:做航空视觉语言导航的看这个:DreamFly在OpenFly上SR和SPL都超过现有方法,导航误差最低,还能判断何时到达。原文稍后读已读值得跟进有用关注 DreamFly
18:01官方账号arXiv cs.AI@Rafi Ibn Sultan, Chengyin Li, Yiannos Demetriou, Ahmed I. Ghanem, Joshua P. Kim, Justine Cunningham, Hassan Bagher-Ebadian, Dongxiao Zhu, Kundan S. ThindNA-UNETR是一种基于Transformer的3D分割模型,专门用于自由呼吸非增强CT中左前降支(LAD)动脉的精细分割。该模型在1000个CTA体积上预训练,并通过LoRA在20个CT扫描上微调,使用Dice-Focal与Hausdorff组合损失,经同方差不确定性动态平衡。在内部数据集上,NA-UNETR达到45.64% Dice、38.16 mm HD95和10.01 mm ASD,Dice较nnU-Net提升3.10个百分点,HD95较Swin UNETR降低2.96 mm。在ImageCAS上获得79.49% Dice、8.89 mm HD95和1.02 mm ASD。消融实验证实残差块、可变卷积核和不确定性加权损失均有效。论文NA-UNETRLAD分割医学图像分割推荐理由:放疗圈看过来,这个模型把左前降支动脉分割做得更准,比nnU-Net和Swin UNETR都强,还用了LoRA省显存,值得试试。原文稍后读已读值得跟进有用关注 NA-UNETR
18:01IT之家(博客/媒体)矽品精密于本月11日举行云林斗六厂动土典礼,该厂投资近千亿新台币。开发面积达6公顷,满载可创造超2200个岗位,首期预计2028年启用。矽品2022年动工的云林虎尾厂已于2025年9月启用,目前处于盈利状态。此次斗六厂将导入CoWoS 2.5D异构集成产能。行业矽品精密日月光投控CoWoS推荐理由:日月光投控旗下矽品砸近千亿新台币在云林建新厂,专攻CoWoS封装,2028年启用,还能带两千多个岗位。原文稍后读已读值得跟进有用关注 矽品精密
18:01官方账号arXiv cs.AI@Yuzhong Shen, Masha Sosonkina, Peng Xu, Mark S. Gordon一项研究提出用于遗留HPC代码现代化的智能体工作流,并在GAMESS量子化学包上完成验证。该工作流使用三个提示词专精的智能体角色,以Claude Code在隔离工作树中运行,跨越四代Claude模型。案例将GAMESS两个电子积分核心从Fortran 77转换为Fortran 2008,涉及12个源文件、56,448行代码和225个子程序。合并标准采用位级能量复现,第十二位小数的偏差即视为失败。全部源文件通过51项测试,612次测试运行中化学相关差异为零,且通过Jenkins持续集成测试。论文GAMESSClaude CodeFortran推荐理由:这篇论文用Claude Code搭了个智能体流水线,把GAMESS的老Fortran代码转换了还零误差通过,适合搞科学计算现代化的人看。原文稍后读已读值得跟进有用关注 GAMESS
18:01IT之家(博客/媒体)外媒《连线》援引消息人士称,美国前沿AI模型网络安全审查机制“几乎肯定”会在未来数月扩展至开源(开放权重)模型。该机制目前仅覆盖性能与Anthropic Claude Mythos或OpenAI GPT-5.6相当的闭源模型,且仍属自愿性质。有美国官员认为强制审查可能抑制AI发展。白宫也在考虑,若闭源模型过审,企业可能降低对未审开源模型的兴趣,进而抑制开源模型推出。行业开源模型AI安全Anthropic10 个信源在谈事件专题推荐理由:美国可能要把开源模型也纳入AI安全审查了,现在只查闭源,但风向在变。做开源模型的团队得留意政策风险。原文稍后读已读值得跟进有用关注 开源模型
18:01官方账号arXiv cs.AI@Yuefeng ZhangHAMP-LIC提出一种面向学习图像压缩模型的Hessian感知混合精度后训练量化框架。该方法通过Hessian迹估计逐块敏感性,并联合量化失真与率失真性能进行任务感知修正。在全局模型大小约束下分配位宽,再用小型校准集逐块重建以抑制量化误差。在Minnen2018和Cheng2020上,该方法实现最高4.85倍模型压缩,BD-rate损失仅0.59%。相比现有固定与混合精度PTQ方法,HAMP-LIC在多个数据集上持续领先,并消除跨平台编码解码误差。论文HAMP-LICMinnen2018Cheng2020推荐理由:HAMP-LIC给图像压缩模型做混合精度量化,模型省4.85倍,BD-rate只掉0.59%,还消除跨平台不一致。值得一看。原文稍后读已读值得跟进有用关注 HAMP-LIC
18:00官方一手Anthropic: Research(资讯)Anthropic前沿红队于2026年8月13日发布新兴多智能体系统研究报告。报告基于红队测试实战经验,梳理了多智能体协作中反复出现的模式与问题。研究覆盖Agent协同中的交互规律、典型失败场景与安全风险,为多智能体系统的开发与部署提供了系统性参考。论文Anthropic多智能体AI安全10 个信源在谈事件专题推荐理由:Anthropic红队把多智能体系统的常见坑都整理出来了,搞Agent开发和安全的人能少踩雷。原文稍后读已读值得跟进有用关注 Anthropic
18:00官方一手歸藏(guizang.ai)@op741871°网传截图显示DeepSeek Harness将于今日开启公测,可能与DeepSeek V4 Pro正式版0813的模型细节一同发布。归藏转发了这一消息并引用相关截图,评论区讨论测试成绩依然相当爆炸。具体基准数字和完整评测尚未公开。AI产品DeepSeekDeepSeek V4 ProHarness10 个信源在谈事件专题推荐理由:DeepSeek V4 Pro 0813和Harness今天都有动静,想蹲一手最新测试成绩的可以看看。原文稍后读已读值得跟进有用关注 DeepSeek
18:00shao__meng@shao__mengCursor 团队 @ericzakariasson 将 Grok 4.6 作为几周主力模型后,总结出真实工作方式变化。他让模型在供应商控制台点出 API key、对运行中应用做 QA,并用 Remotion 制作发布视频。对比测试覆盖电子表格、浏览器版帝国时代 2、MSN Messenger 等场景。他发现长 prompt 的具体性仍有用,但“work very hard”式措辞几乎不加分。模型的可自检性(如 DOM 可验证)决定上手体验,视频和 3D 更难验证。技巧Grok 4.6Cursor提示词工程10 个信源在谈事件专题推荐理由:Eric 把 Grok 4.6 当主力用了几周,实测下来最值的是那套验收标准,比改提示词管用多了。原文稍后读已读值得跟进有用关注 Grok 4.6
18:00shao__meng@shao__meng81°Grok 4.6 已通过 Grok Build、Cursor、Grok Bot 和 API 开放。官方对比 Grok 4.5 High、GPT-5.6 Sol Max、Fable 5 Max,Artificial Analysis 综合指数 61,与 GPT-5.6 Sol Max 持平,距 Fable 5 Max 的 62 差 1 分。长程 Agent 任务提升明显:DeepSWE 从 54% 升至 65.9%,APEX-Agents 从 47.1% 升至 57.5%,Terminal-Bench 从 15.7% 升至 26%。上下文窗口 50 万 token,支持文本与图像输入、文本输出,函数调用和结构化输出。相对 4.5 的 10 项评测全升,但 APEX-SWE 仅增加 2.8 个百分点,编码能力提升不均。AI模型Grok 4.6GrokCursor10 个信源在谈事件专题推荐理由:Grok 4.6 上线,长程 Agent 强化,指数追平 GPT-5.6 Sol Max,试试?原文稍后读已读值得跟进有用关注 Grok 4.6
17:59量子位@JayDeepSeek V4 Pro正式版已经发布。它在多项能力上对标Fable 5。开发者现在调用V4 Pro,能直接用上完全体。AI模型DeepSeekV4 ProFable 56 个信源在谈事件专题推荐理由:DeepSeek的V4 Pro正式版出来了,好几项直接对标Fable 5,现在开发者调用就能用上完全体,想试的赶紧上手。原文稍后读已读值得跟进有用关注 DeepSeek
17:59Browser Use@browser_use一位用户在社交平台分享,他用 Browser Use 的智能体代理购物,自动搜索沙发优惠券并逐一尝试,最终找到一张省下150美元的折扣码。该示例展示了 AI 代理在电商场景中执行多步骤任务的实际价值。Browser Use 是一个可通过自然语言驱动浏览器操作的开源工具,目前该推文获得547次浏览。技巧Browser Use智能体购物推荐理由:你也能用 Browser Use 帮你找优惠券,动动嘴它就自己试完所有折扣码,直接省150刀。原文稍后读已读值得跟进有用关注 Browser Use
17:59IT之家(博客/媒体)8月13日,美团、淘宝闪购、京东外卖在京落地“红灯停表”机制,骑手等红灯的时长在考核中顺延。配送时长按电动自行车平均时速不超过15公里/小时计算,恶劣天气和复杂路况会加大补时。因商家出餐慢导致的超时订单不影响骑手服务分。今年7月,美团曾与苏州公安率先上线“等灯停表”首个正式版本,预计年内覆盖超百万骑手。行业美团淘宝闪购京东外卖推荐理由:三平台在北京把红灯等时算进骑手考核时长,还用15公里/小时均速算配送时间,骑手不用再玩命赶单了。原文稍后读已读值得跟进有用关注 美团
17:59AI Will@FinanceYF572°xAI 发布 Grok 4.6,已上线 Cursor、Grok Build、API、OpenRouter、Vercel 和 Cloudflare 六个平台。普通版价格维持不变,Fast 版本价格翻倍。Cursor 与 Grok Build 首周提供 2 倍包含用量,现已开放试用。AI模型Grok 4.6CursorOpenRouter10 个信源在谈事件专题推荐理由:Grok 4.6 一口气上了 Cursor 和 API 等多个平台,普通版没涨价,Fast 版翻倍,首周还有双倍用量可薅。原文稍后读已读值得跟进有用关注 Grok 4.6
17:59IT之家(博客/媒体)支付宝于8月13日宣布,AI版“阿宝”正式向华为鸿蒙用户开放测试。用户需在华为应用市场升级到支付宝12.12.16版本,搜索“阿宝”或“蚂蚁阿宝”即可开启。开启后可通过对话让阿宝办事,例如说“我想查一下公积金”,阿宝会自动匹配对应小程序和服务入口。原本需要多步跳转的流程被折叠成一句话。AI产品支付宝阿宝华为鸿蒙推荐理由:支付宝出了个能聊天的阿宝,鸿蒙用户现在就能试,说句话就能办事,不用自己找入口了。原文稍后读已读值得跟进有用关注 支付宝
17:59IT之家(博客/媒体)COHERENT发布2026财年年报,全年营收71.18亿美元,同比增长22.51%;归母净利润8.05亿美元,同比大增1529.55%。第四季度营收20.46亿美元,同比增长33.8%,环比增长13.3%。数据中心与通信板块占Q4营收79%,该板块营收同比增长59%,是核心增长引擎。公司预计2027财年Q1营收为22亿至24亿美元,Non-GAAP每股收益1.85至2.05美元。管理层称AI数据中心从铜互连向光互连转型,公司光子技术组合将受益。行业Coherent财报光互连推荐理由:Coherent发财报,全年归母净利增超15倍,AI数据中心光互连需求拉动,Q4该业务占收入79%,可看看。原文稍后读已读值得跟进有用关注 Coherent
17:58IT之家(博客/媒体)72°Dyna Robotics 发布机器人基础模型 DYNA-2,预训练数据超过 100 万小时第一人称人类视频,相当于 170 年人类经验。该模型被称为世界动作模型,通过预测下一帧画面和动作来学习空间关系与接触物理。在 15 项基准任务中,随着预训练数据增加,任务成功率从约 20% 提升至 80% 到 90%。一次客户部署中,DYNA-2 质量通过率达 87%,而上一代 Dyna-1 为 46%。AI模型DYNA-2Dyna Robotics机器人模型推荐理由:Dyna Robotics 拿 170 年人类视频训了个机器人模型,成功率能到九成,比上代翻倍,搞具身智能的值得看看。原文稍后读已读值得跟进有用关注 DYNA-2
17:58IT之家(博客/媒体)美团8月13日在北京上线外卖骑手“等灯停表”功能首个正式版本,已在朝阳区、通州区、经济技术开发区部分道路试点路测。该功能通过骑手位置轨迹信号和实时红绿灯灯态数据,自动记录等红灯时长并在订单配送时间中顺延。美团骑手AI安全助手“团宝”会提示骑手正在记录等灯时长,配送完成后页面会显示累计等灯时间。目前产品已接入北京部分数据,还有20余个城市在评估中。AI产品美团等灯停表团宝推荐理由:美团给骑手整了“等灯停表”,等红灯时间单独累加,送单时间自动顺延,北京部分地区已经开始路测了。原文稍后读已读值得跟进有用关注 美团
17:58IT之家(博客/媒体)72°三位AI人物在拉斯维加斯Ai4大会上分别阐述对AI开放的立场。辛顿反对开放权重模型,认为训练成本消失后容易被恶意利用,但承认这场争论已输。吴恩达更担心美国开源AI因游说和恐慌渲染难以与中国开放权重模型竞争。李飞飞主张按层次分级开放,反对把问题简化为开放与封闭的二元对立。三人都同意一定程度的监管仍然是必要的。行业辛顿李飞飞吴恩达推荐理由:听听辛顿、李飞飞和吴恩达怎么说AI开放——他们反对的不是开源,而是开放权重带来的风险。三位大佬给出各自方案,看完你就懂这场争论的核心了。原文稍后读已读值得跟进有用关注 辛顿
17:58IT之家(博客/媒体)安全研究员Nightmare Eclipse公开了名为ShieldBreak的零日漏洞,利用Windows Defender的缺陷将普通用户权限提升至系统级。该漏洞影响Windows 10、Windows 11(含25H2)及Windows Server 2025,并已发布概念验证程序。研究员Will Dormann验证了漏洞可正常利用,且仅在Defender开启时生效。微软尚未发布补丁,称已获悉并正在调查,此次公开恰逢“补丁星期二”次日。行业ShieldBreakWindows Defender微软推荐理由:Nightmare Eclipse公开了一个Windows零日漏洞,能直接提权到系统权限,微软还没出补丁,而且这个利用绕过了之前对RoguePlanet的修复。原文稍后读已读值得跟进有用关注 ShieldBreak
17:58IT之家(博客/媒体)小米发布澎湃 OS 4,带来基于 Xiaomi MiMo 模型的超级小爱 2.0,推出“专家模式”并采用积分订阅方案。用户每月可免费获得 1,000 积分,专家模式对话每次约消耗 12-20 积分,约等于 50-80 次。付费订阅入门档连续包月 19 元含 4,000 积分,最高档 99 元含 34,000 积分。快速模式不消耗积分,仍支持日常问答与家居控制。AI产品超级小爱小米Xiaomi MiMo推荐理由:小米超级小爱 2.0 专家模式开始按积分收费,每月送 1000 积分,轻度用免费,重度可花 19 元买 4000 积分,还支持生成 PPT。原文稍后读已读值得跟进有用关注 超级小爱
17:58lmarena.ai@lmarena_aiArena.ai 发布了排行榜详情页面,地址为 arena.ai/leaderboard。官方同步介绍了 AutoEval 自动评估工具。用户可查看模型表现数据,并通过 AutoEval 进行自动化评估。该消息来自 Arena.ai 在 X 平台的官方账号。AI产品Arena.aiAutoEval模型评测推荐理由:Arena.ai 发了排行榜和 AutoEval 介绍,想对比模型表现和了解自动评估方式的可以看看。原文稍后读已读值得跟进有用关注 Arena.ai
17:57IT之家(博客/媒体)千问开放平台上线菜鸟智能体,用户可在对话框中@菜鸟或点击右上角圆点图标唤起。该智能体能依据物品类型、价格要求、上门时间等推荐寄件方案和快递公司。例如输入“寄一箱很重的书”可获取哪家快递更便宜的建议,输入“寄一张床垫到武汉”会识别为大件寄件并推荐德邦。在获得授权后,智能体还能结合通讯录关键词和历史寄件记录自动补全收寄件信息。AI产品千问菜鸟智能体智能体推荐理由:千问里现在可以@菜鸟寄快递了,能比价、能管大件,还会记住你的历史地址,省得自己对比。原文稍后读已读值得跟进有用关注 千问