7月15日
05:49
05:49官方账号Meta AI@AIatMeta
72°
Meta AI 提交其推理与多模态模型参加了亚洲物理奥林匹克(APhO)理论考试。该模型取得满分 30/30 的成绩,与排名前三的学生选手并列。APhO 委员会允许该模型参赛,展示其在复杂物理推理任务上的能力。

推荐理由:Meta 的模型在物理奥赛里拿了满分,和前三名人类选手并列,看看AI的理科能力有多强。
05:21
04:01
04:01官方账号Perplexity@perplexity_ai
精选
Perplexity AI 宣布开源其内部基准测试 WANDR,该基准用于评估计算机在深度与广度研究能力上的表现。WANDR 最初是为构建 Perplexity Computer 而开发的。开源后,开发者可利用此基准测试自己的模型或系统。目前该基准已发布在 research.perplexity.ai 上。
推荐理由:Perplexity AI 把他们自己用来测试 AI 研究深度的工具 WANDR 开源了,想测测自家模型的研究能力可以用它。
03:56
03:56官方账号Perplexity@perplexity_ai
WANDR不再使用预定义的黄金解决方案来评分,而是动态重新抓取每个引用的页面。它逐条核对每个声明与引证证据的一致性。这种方法适用于需要处理随时间变化事实的任务。

推荐理由:Perplexity AI 搞了个新评估方式 WANDR,不用固定答案打分,而是实时对证据,适合处理时效性事实。
03:55
03:55官方账号Perplexity@perplexity_ai
精选
Perplexity AI 引入了软分数(soft scores)和硬分数(hard scores)两种评估机制,软分数允许部分正确给分,硬分数要求成员完全正确。相关基准任务和评估工具已开源至 GitHub。这套方法为细粒度评估提供了新思路。
推荐理由:Perplexity AI 搞了个新评估方法,软硬分数区别很清晰,基准和工具都开源了,做评测的可以看看。
03:33
03:04
02:16
01:27
01:27官方账号NVIDIA AI@NVIDIAAI
精选
零样本模型漏检了一个可见交通信号。用 LoRA 对 Cosmos 3 Nano 进行后训练后,WTS 验证准确率从 54.41% 提升到 87.14%。结合 NVIDIA TAO AutoML,准确率进一步达到 93.35%。整个微调流程在一天内完成。
事件专题

推荐理由:NVIDIA 用 LoRA 微调小模型 Cosmos 3 Nano 做交通信号识别,准确率从 54% 蹿到 93%,一天内搞定,效果很猛。
00:55
00:35
00:35官方账号NVIDIA AI@NVIDIAAI
精选
NVIDIA 展示一个编码智能体,利用 NeMo RL 和 NeMo Gym 框架,在有限时间内自主构建训练环境并指导 Qwen3-VL-2B 视觉模型学习数彩色星星。模型准确率从 25% 跃升至 96.9%。智能体还能主动提出下一项实验方案,研究员全程仅进行方向性指导。
事件专题

推荐理由:NVIDIA 让智能体自己搭环境教模型,Qwen3-VL-2B 准确率从 25% 飙到 96.9%,还能自动想下一步实验,挺有意思。
7月14日
23:42
23:42Fireworks AI@FireworksAI_HQ
精选76°
LangChain 与 NVIDIA 合作推出 Deep Agents,基于 Nemotron 3 Ultra 开放模型。该智能体成本仅为封闭模型的十分之一。用户可在 Fireworks 上运行,并进行后训练定制化。最终得到专属的专用智能体。
事件专题

推荐理由:LangChain 和 NVIDIA 搞了个开放智能体,成本是封闭模型的1/10,还能自己后训练定制,挺实用的。
18:12
18:07
17:28
17:28小互@imxiaohu
推文比较了三个 Claude 模型的人格特征。Sonnet 4.6 偏顺从、温暖、简洁。Opus 4.6 偏严格、顺从、简洁。Opus 4.7 偏谨慎、深度,更常挑战错误假设并主动指出风险。详细报告来自 best.xiaohu.ai。
事件专题

推荐理由:想了解Claude不同版本的个性差异?这篇文直接对比了Sonnet 4.6、Opus 4.6和Opus 4.7的回复风格,帮你选更合适的模型。
16:05
16:05官方一手Pandaily@contact@pandaily.com (Pandaily)
72°
北京大学与中国科学院联合团队在《科学》发表40nm相变忆阻器神经动力学芯片,实现2.12ms计算延迟。该芯片在脑皮层重建任务上性能超越NVIDIA A100 GPU达50至478倍。研究展示了忆阻器在类脑计算中的巨大潜力。
事件专题

推荐理由:北大和中科院发了款新芯片,算脑皮层比A100快最多478倍,还上了《科学》封面。
15:31
15:31官方一手marktechpost@Asif Razzaq
精选
Mistral AI发布了Robostral Navigate,一个8B参数具身导航模型。该模型仅用单RGB摄像头即可根据自然语言指令引导机器人,无需LiDAR或深度传感器。在R2R-CE验证集未见过场景上,借助pointing方法、prefix-caching训练和CISPO在线强化学习,成功率达到了76.6%。
推荐理由:Mistral AI这个8B模型Robostral Navigate挺有意思,只用普通摄像头就能让机器人听懂指令找路,R2R-CE上76.6%成功率,省了激光雷达的钱。

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。