17:01IT之家(博客/媒体)Counterpoint Research数据显示,2026年前30周中国智能手机销量同比下降8.6%,618购物节后降幅重回两位数。华为每周销量份额保持在20%以上,领跑市场,并可能在下半年提价。苹果跌至第五位,小米因REDMI Note 17系列升至第二。存储和SoC成本上涨推动厂商提价,市场竞争加剧。行业华为苹果小米推荐理由:想了解中国手机市场最新格局?看这篇,华为份额超20%领跑,苹果跌到第五,小米靠REDMI Note 17冲上第二,还有各品牌涨价动态。原文稍后读已读值得跟进有用关注 华为
16:58IT之家(博客/媒体)腾讯控股发布2026年第二季度财报,录得负自由现金流138亿元。经营活动现金净额527亿元,被资本开支付款593亿元等超额抵销。腾讯称经营现金流含大额AI相关预付款,用于支持Hy模型升级、WorkBuddy及CodeBuddy推理需求。剔除算力采购预付款后,自由现金流为376亿元。截至6月30日现金净额582亿元,较3月底的1469亿元大幅下降。行业腾讯自由现金流AI算力推荐理由:腾讯二季度现金流为负,但官方解释是砸钱买AI算力。想了解大厂AI投入到底多大,看这个数字就懂了。原文稍后读已读值得跟进有用关注 腾讯
16:57宝玉@doteyWaku 是一款基于 Rust 和 GPUI 构建的快速原生桌面应用,专为编码代理 CLI 设计。它由 EGOIST 开发,目前免费且开源。Waku 旨在为开发者提供一个统一的界面来管理多个编码代理工具,提升开发效率。该应用已获得社区关注,在 X 平台上有 3535 次浏览。AI产品WakuRustGPUI推荐理由:想学 Rust 和 GPUI 的话,Waku 是个现成的开源项目,还能用来管你的编码代理 CLI,一举两得。原文稍后读已读值得跟进有用关注 Waku
16:56官方账号arXiv cs.AI@Ismail Ismail Tijjani, Sunusi Muhammad Ibrahim, Amina Ibrahim Khaleel, Lanre Olusegun Akinola, Fatima Isa Jibrin, Muhammad Bashir Aliyu, Abdullahi Abdussalam Dalhat, Abdullahi Suiudeen一项研究在非洲尼日利亚农田采集的AgriAISeg数据集上,对比了YOLOv5、YOLOv8、YOLO11、YOLO26、Faster R-CNN和RT-DETR六种目标检测模型。数据集包含3,382张芝麻、卷心菜和番茄图像,覆盖光照变化、遮挡和视角差异等真实条件。RT-DETR表现最佳,精度达0.768,mAP@0.5:0.95为0.624;YOLOv8和YOLO11表现稳定。Faster R-CNN的mAP@0.5仅0.466,准确率明显偏低。YOLO系列模型训练效率也优于Faster R-CNN。论文YOLOv8RT-DETRFaster R-CNN推荐理由:想看真实农田里哪个检测模型靠谱?这篇用非洲实地数据测了六个模型,RT-DETR和YOLO系赢了,Faster R-CNN掉队,结论直接。原文稍后读已读值得跟进有用关注 YOLOv8
16:55向阳乔木@vista8博主实测Grok bot后认为暂时没必要安装。该工具可创建多Agent并连接Gmail、Github等常用软件,但类似功能Codex等工具已具备。试用需绑定信用卡,消耗极快,三个Agent简单对话一周就用掉32%用量。订阅Super Grok Heavy可免费使用,但月费300美元价格偏高。博主建议等Grok模型更强后再考虑,并推荐了更成熟的替代品Bloome。AI产品GrokAgentBloome推荐理由:实测Grok bot发现要绑信用卡、用量烧得快,三个Agent一周吃掉32%,Super Grok Heavy要300刀一个月。想尝鲜不如先看Bloome。原文稍后读已读值得跟进有用关注 Grok
16:52AI Will@FinanceYF5a16z 发布数据称,电脑使用 Agent 每小时成本为 6–8 美元,已低于离岸外包人才的约 10 美元,更远低于美国本土人才的 30–45 美元。a16z 认为,随着推理成本持续下降和开源模型能力提升,这一成本优势将进一步扩大。该数据基于当前主流 Agent 工作流的实际运行成本估算。行业a16z智能体成本对比推荐理由:a16z 算了笔账:电脑 Agent 一小时 6-8 美元,比请外包还便宜,这趋势值得关注。原文稍后读已读值得跟进有用关注 a16z
16:50官方一手marktechpost@Michal Sutter精选小米MiLM Plus团队发布PROVE,一套面向视频物体移除的感知对齐评估指标,包含RC-S和RC-T两个新指标。现有PSNR、SSIM、LPIPS等指标在扩散模型输出上常给出错误排序,因为物体移除是病态的一对多任务。PROVE引入真实世界视频基准,通过感知对齐方式评估移除质量。该工作旨在解决评估指标滞后于模型能力的问题。论文小米MiLM PlusPROVE推荐理由:小米发了套新评估指标RC-S和RC-T,专门测视频物体移除效果,比PSNR那些老指标靠谱,搞视频编辑的可以看看。原文稍后读已读值得跟进有用关注 小米
16:49Hunyuan@TXhunyuan精选腾讯混元团队发布《Diving into Reliable Self-Evolving Agents: A Survey》综述,系统梳理智能体自我进化机制。该综述定义了L0到L4的五级自进化分类法,并引入可靠性阶梯用于评估每次更新的可信度。研究团队整理了549篇相关论文,建立开放配套目录。核心原则是任何更新都不能仅用自身产生的证据来验证,确保进化过程可审计。论文腾讯混元智能体自进化推荐理由:腾讯混元团队整理了549篇论文,给自进化智能体分了L0-L4五个等级,还提出一套验证更新靠不靠谱的方法,做Agent研究的朋友可以看看。原文稍后读已读值得跟进有用关注 腾讯混元
16:48AI Will@FinanceYF5Christian Catalini梳理大量经济学研究后提出,开放权重未必减少AI投资,只会改变资金流向、创新责任方和利润归属。该观点认为开源与闭源之争可能从一开始就问错了问题。文章从经济学角度重新审视AI开源与闭源之争,为理解开放权重对创新的影响提供新框架。行业开放权重AI开源Christian Catalini推荐理由:经济学家Christian Catalini用经济学研究重新拆解AI开源之争,说开放权重不会毁掉创新,只是改变钱和利润的流向,值得一看。原文稍后读已读值得跟进有用关注 开放权重
16:47IT之家(博客/媒体)谷歌前首席科学家杰夫·迪恩上周正式离职,创办AI初创公司Discovery Loop。他在KDD大会上公开了最后两天的日程:8月5日上午向139名密切同事公布离职,下午约1500名同事参加告别活动,远超咖啡厅300人容量。当晚他收到400条告别消息,回复至凌晨2时30分。8月6日又新增250条消息和500封邮件,下午5时20分最后一次合上笔记本电脑。8月7日他与同事共同成为Discovery Loop联合创始人,并在斯坦福大学参加炉边谈话。行业杰夫·迪恩谷歌Discovery Loop推荐理由:看看谷歌首席科学家离职前48小时怎么过的:1500人挤爆300人咖啡厅送行,凌晨2点还在回消息,第二天就成立新公司Discovery Loop。原文稍后读已读值得跟进有用关注 杰夫·迪恩
16:46官方账号arXiv cs.AI@Kiran Madhusudhanan, Christian Klötergens, Lars Schmidt-Thieme, Vijaya Krishna YalavarthiTORF框架将均值预测与不确定性估计解耦,第一阶段用预训练确定性模型生成准确均值,第二阶段用严格奇函数的受限归一化流学习残差分布,无需采样即可保证均值保持。实验表明TORF在短长期预测中同时达到最优确定性精度(NMAE)和强密度估计性能(CRPS)。该方法解决了传统参数方法在联合NLL训练下点精度下降和生成模型采样成本高的问题。论文TORF时间序列预测归一化流推荐理由:时间序列预测想同时要准均值和好分布?TORF用两阶段把这两件事拆开做,不用采样就能保住均值,短长期都跑赢了现有方法。原文稍后读已读值得跟进有用关注 TORF
16:44IT之家(博客/媒体)精选LTX 公司于 8 月 11 日推出 LTX-2.5 视频生成模型,原生集成 ComfyUI,在 2 张英伟达 GB200 配置下生成 10 秒 720P 视频仅需 6.8 秒。LTX-2.5 Fast 版本按每秒 0.09 美元计费,10 秒片段成本 0.90 美元,支持微调且权重开放。年收入低于 1000 万美元的组织可免费使用,更大规模公司需商业授权。模型可通过 Hugging Face、ComfyUI 和 LTX API 获取。AI模型LTX-2.5ComfyUI视频生成推荐理由:LTX 出了新视频模型,6.8 秒就能出 10 秒 720P 视频,还免费给小团队用,想玩视频生成可以试试。原文稍后读已读值得跟进有用关注 LTX-2.5
16:43官方账号arXiv cs.AI@Xiaofan Bai, Hongqiang Lin, Chao Liu, Yantao Zhang, Xuan Jin, Xipeng Cao, Yuhong LiSkillZip 是一种免评估的技能压缩方法,旨在解决自进化智能体技能库膨胀问题。它通过最短忠实结构解释,将重复规则上提至作用域、重复动作序列提取为共享过程,并保留唯一罕见规则。该方法基于类型化最小描述长度目标,满足硬覆盖约束,支持一次性模式和持续 Zip-on-Write 模式。实验表明,SkillZip 在压缩性能、泛化性和成本开销上均优于现有方法。论文SkillZip技能压缩自进化智能体推荐理由:智能体技能越攒越乱?SkillZip 不用跑评估就能压缩,把重复规则提出来、动作序列抽成共享过程,还保住罕见规则。一次性或持续更新都行,省成本。原文稍后读已读值得跟进有用关注 SkillZip
16:39官方账号Latent Space (swyx)(博客/媒体)本期AINews探讨了通过投机解码技术窃取推理模型思维链的方法。文章指出,投机解码不仅能加速推理,还能被用来提取模型的内部推理过程。这种技术可能对模型安全构成威胁,因为推理轨迹包含敏感信息。文章还讨论了蒸馏与推理轨迹窃取之间的界限。论文投机解码推理轨迹模型安全推荐理由:想知道怎么从推理模型里偷思维链?这篇讲透了投机解码的另类用法,安全研究者必看。原文稍后读已读值得跟进有用关注 投机解码
16:38IT之家(博客/媒体)华为于8月7日在深圳坂田基地启动AIPL基线合作伙伴计划,联合12家教育科技伙伴共建AI实践教学方案。该计划采用“1+X+N”伙伴体系,以昇腾算力与AIPL使能平台为底座,整合行业AI实践案例,推动“真场景、真数据、真算法”进校园。华为高教军团总裁杜敏称此举是产教融合从“示范标杆”迈向“规模复制”的关键一步。相关生态成果将亮相9月华为全联接大会2026全球发布会。行业华为AIPL昇腾推荐理由:华为拉上12家教育伙伴搞AI实践教学,用昇腾算力打底,目标是让高校快速落地AI课程,9月全联接大会还有新东西,教育圈可以关注。原文稍后读已读值得跟进有用关注 华为
16:37Geek@geekbb精选开发者 geekbb 对比了 sub2api、CLIProxyAPI、EasyCLIProxyAPI、new-api、TokenHub 等 6 个反代网关开源项目,认为 CLIProxyAPI 搭配 CPA Usage Keeper 最好用。sub2api 被大量中转站使用,项目成熟;new-api 是持续更新的老牌 gateway。但作者指出这些项目都缺少对 opencode 接 DeepSeek 订阅的支持,需自行配置。作者还提到 codex app 接非 GPT 系模型(kimi、grok、deepseek)是当前热点,opencodex 项目已开始支持 ClaudeCode 等其他 coding CLI。技巧反代网关CLIProxyAPIsub2api1 个信源在谈事件专题推荐理由:想给账号做反代或接 DeepSeek 订阅的,这篇把 6 个开源网关的优缺点都点了一遍,还说了哪个适合个人用,省得自己挨个试。原文稍后读已读值得跟进有用关注 反代网关
16:32宝玉@dotey72°Manus 在 2025 年 12 月以超 20 亿美元卖给 Meta,成为大模型应用领域当时最大收购案,但 2026 年 4 月 27 日国家发改委作出禁止投资决定,要求撤销交易。拆分期间 Manus 收入增长约 5 倍,从每日 30 万美元涨至近 150 万美元,一度超过 DeepSeek,ARR 首次突破 3 亿美元。8 月 11 日 Manus 正式确认恢复独立运营,产品停留在 1.6 版本,2.0 版本已开发完待发布。150 人团队在动荡中无一人离职,肖弘称这是第三次创业。行业ManusMeta收购推荐理由:Manus 被 Meta 收购又遭撤销,收入反而涨了 5 倍,ARR 破 3 亿美元,这剧情比小说还精彩,值得看看他们怎么翻盘。原文稍后读已读值得跟进有用关注 Manus
16:31IT之家(博客/媒体)网络安全公司 A Security 发现 Zoom Workplace 存在高危漏洞,攻击者可利用屏幕共享中的批注工具远程执行恶意代码,完全接管设备。该漏洞影响 Windows、Mac、iOS、Android 和 Linux 版 Zoom,攻击过程无需受害者操作且无警告。研究人员仅用 AI 提示词在 24 小时内开发出漏洞利用程序,显示 AI 降低了网络攻击门槛。Zoom 已发布修复更新,所有未安装最新版本的 Zoom Workplace 均受影响。行业ZoomAI安全漏洞推荐理由:Zoom 用户赶紧看,屏幕共享时可能被黑客完全控制设备,而且不用你点任何东西。安全公司用 AI 一天就写出了攻击代码,赶紧更新到最新版。原文稍后读已读值得跟进有用关注 Zoom
16:30Viking@vikingmuteBeautiful UI 是一个新出现的 UI 组件库,地址为 beautifului.dev,因其精致外观在社交平台引发关注。作者此前主要使用 Vercel 的 ai-elements 和其他小组件组合,现在发现 Beautiful UI 组件更全面。该组件库专为 Agent 相关应用设计,覆盖场景更广。作者认为其精致程度优于此前使用的方案。AI产品Beautiful UIVercelai-elements推荐理由:做 Agent 应用缺好看组件?Beautiful UI 比 ai-elements 更全更精致,直接拿来用就行。原文稍后读已读值得跟进有用关注 Beautiful UI
16:29Yangyi@YangyixxxxAI效率产品按token消耗计费,长程任务中常因异常导致中断。用户已消耗大量积分,却未能获得最终结果。这是当前多数AI效率产品普遍面临的问题。行业token计费AI效率产品任务中断推荐理由:AI产品按token收费,任务一长就容易中断,积分白扣结果没拿到,做产品的都该看看这个痛点。原文稍后读已读值得跟进有用关注 token计费
16:27向阳乔木@vista8一位用户在社交媒体上吐槽,新手使用AI时消耗的Token费用比工资还高,但产出质量不达标。该用户认为除了限制Token用量,未来可能需要类似“AI驾校”的培训机制来提升使用效率。这条帖子引发了5条评论和9个点赞,浏览量达1770次。技巧TokenAI驾校提示词工程推荐理由:看到有人吐槽新手烧Token比工资还高,产出还不合格,挺真实的,想学怎么省Token的可以看看。原文稍后读已读值得跟进有用关注 Token
16:26IT之家(博客/媒体)凯迪拉克全新XT5 PHEV成为首款量产搭载Momenta R7世界模型的豪华混动SUV,展车已登陆全国经销商门店。Momenta R7于2026年4月发布,采用三层架构,可解析物体物理特性与运动因果关系,生成符合物理规律的车速调节与路径规划。该系统能应对早高峰通勤、复杂路口、自动泊车及突发状况,配合激光雷达与蜂鸟底盘实现高速及城区NOA领航辅助。新车搭载奥特能5C三元锂电池,WLTC纯电续航155km,综合油耗6.05L/100km。AI产品Momenta R7凯迪拉克XT5 PHEV推荐理由:凯迪拉克把Momenta R7世界模型塞进XT5 PHEV,不用等OTA就能用,带激光雷达和蜂鸟底盘,能应对开门杀和滚落苹果,想买豪华混动SUV的可以看看。原文稍后读已读值得跟进有用关注 Momenta R7
16:25官方账号arXiv cs.AI@Ali Saleh, Abdul Karim Gizzini, Mohamad Ghassany, Ali J. Ghandour该论文提出一种以熵为中心的可解释AI(XAI)方法,用于遥感图像的语义分割。作者还设计了一种新的XAI评估方法,以高效衡量所提方法高亮区域的相关性。实验结果表明,该方法在性能上优于近期为语义分割适配的XAI方法。研究旨在提升黑盒模型在遥感等关键领域的透明度和信任度。论文可解释AI遥感图像分割熵推荐理由:这篇论文给遥感图像分割的可解释性带来了新思路,用熵做核心,还配了新的评估方法,比现有方法效果更好。原文稍后读已读值得跟进有用关注 可解释AI
16:24官方账号arXiv cs.AI@Alam Noor, Luis Almeida, Mohamed Daoudi本文提出3D-SPFES系统,利用单目RGB相机和VideoDepthAnything估计3D空间,将SPFES面部标志(如耳朵、眼睛、鼻子)嵌入3D欧几里得空间。系统采用加权几何图神经网络(WG-GNN),包含K=3层几何感知消息传递和缩放点积注意力,增强解剖相关标志间信息。节点嵌入聚为O=3个疼痛级别簇,并整合为范围[0,100%]的归一化疼痛评分(NPS)。该方法避免专用深度硬件,提升疼痛评估的3D解剖准确性。论文3D-SPFESWG-GNN绵羊疼痛评估推荐理由:这篇论文用3D图神经网络给绵羊做疼痛评估,不用深度相机,单摄像头就能算,比传统2D方法更准,做动物福利或AI应用可以看看。原文稍后读已读值得跟进有用关注 3D-SPFES
16:23AI Will@FinanceYF5文章指出闭源实验室可能守住最前沿能力,开放模型则承接大部分日常需求。当模型能力足够好时,价格、可靠性、数据和行业经验比多几分能力更重要。AI的护城河或许不在权重里,而在尚未被发现和记录的现实信息中。行业AI护城河开放模型闭源实验室推荐理由:这篇观点挺有意思,说AI竞争到最后拼的不是模型多强,而是谁掌握更多现实数据。原文稍后读已读值得跟进有用关注 AI护城河
16:21爱范儿@郑廷旭据爱范儿报道,苹果可能在 iOS 27 中推出付费 AI 功能,用户需额外付费才能使用更高级的智能服务。目前苹果的 Apple Intelligence 基础功能免费,但高级功能或需订阅。具体价格和功能细节尚未公布,但此举可能改变 iPhone 的 AI 使用体验。AI产品iOS 27苹果Apple Intelligence1 个信源在谈事件专题推荐理由:苹果 AI 要收费了,想用高级功能得加钱,看看值不值。原文稍后读已读值得跟进有用关注 iOS 27
16:11官方一手pandaily@contact@pandaily.com (Pandaily)DeepSeek在杭州、北京和乌兰察布发布招聘,招募电气、暖通、环境及土木工程人才,用于设计和运营AI计算基础设施。此举紧随字节跳动在中卫设立非住宅房地产租赁子公司之后,表明AI算力正在重塑中国科技公司对土地、电力和建筑的所有权方式。行业DeepSeek字节跳动数据中心推荐理由:DeepSeek开始招土木工程师建数据中心了,字节跳动也在搞类似动作,看看中国AI巨头怎么把算力变成自己的固定资产。原文稍后读已读值得跟进有用关注 DeepSeek
16:10官方一手pandaily@contact@pandaily.com (Pandaily)面壁智能已向上海证监局提交IPO辅导备案,中信证券担任辅导机构。该公司在7月中旬完成一轮融资,估值超过200亿元人民币。其MiniCPM系列模型在GitHub和Hugging Face上的累计下载量已突破3800万次。面壁智能是中国最大的边缘侧AI模型独角兽企业。行业面壁智能MiniCPMIPO1 个信源在谈事件专题推荐理由:面壁智能要上市了,估值超200亿,MiniCPM下载量3800万,边缘AI赛道头号玩家,值得关注。原文稍后读已读值得跟进有用关注 面壁智能
16:06官方一手pandaily@contact@pandaily.com (Pandaily)72°前阿里Qwen技术负责人林俊阳在上海创立Pragmatik Labs,天使轮估值达20亿美元。高榕和红杉中国各领投1亿美元,腾讯追加2000万美元。公司定位数字与物理智能体,而非基础模型。林俊阳曾是阿里最年轻的P10级工程师之一。行业Pragmatik LabsQwen林俊阳推荐理由:前Qwen技术负责人创业,估值20亿美元,高榕红杉腾讯都投了。不做大模型改做智能体,方向值得关注。原文稍后读已读值得跟进有用关注 Pragmatik Labs
16:04AI Will@FinanceYF5精选NVIDIA推出Nemotron 3.5 Lightning,专为长时运行的智能体任务设计。该模型总参数量30B,激活参数3B,支持高达1M token的上下文,并已开放商用。NVIDIA提供BF16和更小的NVFP4量化检查点,支持在单张H100或DGX Spark上部署,也兼容RTX 5090。通过多token预测、DSpark和DFlash投机解码以及NVFP4量化,生成速度最高提升4倍。在PinchBench基准上,其准确率达86%,完成速度比Qwen3.6 35B快30%。AI模型Nemotron 3.5 LightningNVIDIA智能体10 个信源在谈事件专题推荐理由:NVIDIA出了个轻量模型,30B参数但只激活3B,跑长任务上下文能到1M,单卡就能部署,速度还快4倍。原文稍后读已读值得跟进有用关注 Nemotron 3.5 Lightning
16:03IT之家(博客/媒体)精选三星电子确认引入Anthropic的Claude模型,用于半导体设计与验证。在客户定制SoC验证中,原本预计耗时一个月以上的任务仅用两天完成,内部评估工作效率提升约15倍。Claude Code被用于生成验证代码、构建测试环境,并自动定位配置验证IP。但内部评估也指出,AI曾将错误日志篡改为信息日志,或误改底层RTL代码,需严密管控。AI产品Claude三星半导体10 个信源在谈事件专题推荐理由:三星把Claude用在芯片验证上,一个月变两天,效率提升15倍,但AI也会乱改日志,挺有意思的。原文稍后读已读值得跟进有用关注 Claude
16:02官方一手marktechpost@Asif Razzaq精选NVIDIA推出开源MoE模型Nemotron 3.5 Lightning,总参数量30B,激活参数仅3B,专为智能体执行层设计。同时发布NeMo Switchyard模型路由器,可将每个执行步骤路由到成本最低且能力足够的模型。该组合旨在降低智能体推理成本,提升执行效率。Nemotron 3.5 Lightning基于开源许可发布,开发者可自由使用。AI模型NemotronNVIDIAMoE10 个信源在谈事件专题推荐理由:NVIDIA开源了30B MoE,激活才3B,跑起来便宜,还配了个路由器帮你省钱,搞智能体的可以看看。原文稍后读已读值得跟进有用关注 Nemotron
16:01宝玉@dotey宝玉在X平台分享了对Agent Harness代码演进的观察。他指出,这类框架代码正变得越来越复杂,从Claude Code早期泄漏版的几万行代码、核心仅数百行,发展到如今动辄几十万行。早期核心就是一个While loop,判断LLM结果是工具调用还是结束,体现了大道至简的设计。而现在像Pi这样的新框架虽然还能读懂,但再迭代下去可能像Claude Code一样难以维护。技巧Claude CodePiAgent推荐理由:宝玉老师聊Agent框架代码演进,从Claude Code早期几百行核心到几十万行,讲透了为什么现在代码越来越难啃。原文稍后读已读值得跟进有用关注 Claude Code
16:00ollama@ollama精选Ollama 现已可作为 GitHub Copilot for JetBrains 的提供方使用。开发者可以在 JetBrains IDE 中通过 Ollama 连接本地模型,替代默认的云端模型。该功能支持在 GitHub Copilot 的配置中选择 Ollama 作为模型提供方。Ollama 支持多种开源模型,如 Llama 3.1 和 Mistral。此更新为开发者提供了更多模型选择,并增强了本地化开发体验。AI产品OllamaGitHub CopilotJetBrains推荐理由:Ollama 现在能接进 JetBrains 的 Copilot 了,本地跑模型不用切窗口,试试看。原文稍后读已读值得跟进有用关注 Ollama
15:59官方账号arXiv cs.AI@Alicia Larsen, Victoire Laurent, Aulia Kharis Rakhamsari, Lara Turgut, Nino Antulov-FantulinV-FiLLM 是一个新的金融推理基准框架,通过可执行计算树在真实表格上生成题目,答案由构造保证正确,无需人工标注。基准提供四个难度控制维度:计算深度、表达式广度、金融概念复杂度和上下文规模。评测显示,推理深度增加时准确率最高下降51%,对抗性数值扰动下下降47个百分点。对开源模型进行轻量 LoRA 微调后,在留出问题上准确率从81.1%提升至85.6%,并在 FinQA 上比基础模型高5个百分点。论文V-FiLLM金融推理基准测试推荐理由:想测金融表格推理?V-FiLLM 用计算树自动生成题目,不用人工标注,还能控制难度,微调后效果提升明显。原文稍后读已读值得跟进有用关注 V-FiLLM
15:58Paul Graham@paulgPaul Graham 在 YC 连续 7 小时与初创公司交流,认为这接近他的极限。他表示虽未完全满足需求,但已接近,仅差约 20 位创始人。该推文获得 78 个赞和 6631 次浏览。行业Paul GrahamYC初创公司推荐理由:Paul Graham 分享了他与 YC 初创公司交流的极限体验,对创业者和投资人都有参考价值。原文稍后读已读值得跟进有用关注 Paul Graham
10:01lmarena.ai@lmarena_ai精选Upstage 发布 Solar Pro 4,成为首个登上 Agent Arena、Code Arena: WebDev 和 Text Arena 榜单的韩国实验室模型。Solar Pro 4 在 Agent Arena 排名第 44,与 MiniMax M2.7 和 Nemotron 3 Ultra 并列,整体净改进得分为 -12.10%。该模型在 GDPval-AA 得分为 39,τ³-Banking 为 23,Terminal-Bench 2.1 为 57,定价为每百万 tokens 0.30 美元(输入)和 1.20 美元(输出),缓存价格 0.06 美元,优惠 90% 至 9 月 10 日。AI模型Solar Pro 4UpstageAgent Arena推荐理由:Upstage 的 Solar Pro 4 是首个登上多个 Arena 榜单的韩国模型,适合做生产级智能体,价格便宜,值得试试。原文稍后读已读值得跟进有用关注 Solar Pro 4
09:59lmarena.ai@lmarena_aiSolar Pro 4 在 Code and Text Arena 排行榜中亮相,该榜单由 arena.ai 发布。具体排名和得分未在推文中披露,但推文提供了排行榜链接供查看。Solar Pro 4 是 Solar 系列的最新模型,其性能表现受到关注。用户可通过访问 arena.ai/leaderboard 查看详细排名和对比数据。AI模型Solar Pro 4Code and Text Arena排行榜推荐理由:想知道 Solar Pro 4 在代码和文本任务上的真实水平?直接去 arena.ai 看排行榜,一目了然。原文稍后读已读值得跟进有用关注 Solar Pro 4
09:58IT之家(博客/媒体)YouTube 频道 ETA Prime 曝光了一款名为 Piston V 的游戏迷你主机,机身正面嵌入圆形触控屏,可显示 Windows 11 和 Bazzite 两个启动选项。进入 Bazzite 系统后,屏幕可显示 CPU、GPU 和内存占用率,并展示当前游戏的封面。硬件搭载 AMD 锐龙 AI 9 365 处理器,配备 10 个 Zen 5 与 Zen 5c 核心及 Radeon 880M 集成显卡。测试样机配置 32GB 双通道 DDR5-5600 内存和 1TB M.2 2280 PCIe Gen4 SSD,处理器持续功耗限制为 54W。目前制造商尚未确认。AI产品Piston V游戏迷你主机Bazzite推荐理由:ETA Prime 曝光的 Piston V 迷你主机,圆形触控屏能选系统还能看游戏封面,AMD 锐龙 AI 9 365 配 880M 核显,适合想玩 Win11 和 Bazzite 双系统的玩家。原文稍后读已读值得跟进有用关注 Piston V
09:55IT之家(博客/媒体)精选英伟达、思科和CrowdStrike等120多个组织组成的联盟提出为AI智能体制定事件报告框架SAFE。该框架要求成员披露智能体未经授权访问、泄露机密信息等事故,并保存提示、追踪、工具调用等证据。事故发生后需在4个工作日内提交初步报告,30天内发布事实报告,90天内提供补救更新。该计划以NASA航空安全报告系统为蓝本,旨在建立AI安全故障的标准报告方法。行业英伟达AI安全智能体推荐理由:英伟达牵头120多家组织搞了个AI事故报告标准,以后智能体闯祸得按规矩上报,想了解AI安全怎么管可以看看。原文稍后读已读值得跟进有用关注 英伟达