7月3日
10:21
10:12
10:12AI Will@FinanceYF5
用户让Claude Fable 5一次性生成一个最好的游戏。5小时后,它制作出完整的水墨风Roguelike《墨守》。游戏的美术、音乐、Boss战均为AI自动生成,并自带自我测试功能。该案例展示了Claude Fable 5在独立游戏开发中的强大能力。
事件专题

推荐理由:有个狠人用Claude Fable 5花了5小时就搞出一个完整的水墨风Roguelike游戏《墨守》。美术音乐Boss全自动,还能自我测试,太顶了。
08:57
08:57向阳乔木@vista8
精选
Google 发布了两个新的 Gemini 媒体模型:Nano Banana 2 Lite 和 Gemini Omni Flash。这两个模型均可在 Gemini 应用和 API 中使用。在 API 中,Nano Banana 2 Lite 能在 4 秒内生成图片,价格约为 1 美元 30 张 1K 分辨率图片。Gemini Omni Flash 的定价为 0.10 美元/秒。
事件专题

推荐理由:Google 发了两个新 Gemini 媒体模型,Nano Banana 2 Lite 生成图片只要 4 秒,1 美元能买 30 张;Omni Flash 按秒收费 0.1 美元,适合实时处理。
08:10
08:10lmarena.ai@lmarena_ai
Arena平台启动Claude Fable 5的Battle Mode和Agent Mode测试,覆盖文本、图像等多模态输入。用户可参与投票,直接影响最终排行榜分数。排行榜结果即将在arena.ai公布。该测试用于评估模型的多模态能力和智能体行为。
事件专题

推荐理由:Arena开始让大家测Claude Fable 5了,有Battle和Agent两种模式,你还能投票影响排名,快去试试。
08:08
04:03
04:03Stanford AI Lab@StanfordAILab
精选
斯坦福AI实验室提出Freeform Preference Learning方法,让标注者用自然语言描述轨迹的偏好轴(如速度、精度、子任务完成度),而非仅做单一整体偏好选择。该方法学习基于这些轴的奖励函数,能提取更优策略。论文arXiv:2606.32027和博客已公开。
推荐理由:斯坦福团队发了个新方法,让标注者用自然语言描述偏好,比单一打分更精确,机器人策略能学到更多结构信息。
04:01
04:01The Rundown AI@therundownai
精选
Mira Murati的Thinking Machines Lab与全球最大对冲基金Bridgewater合作,测试AI用于投资新闻筛选。GPT、Claude、Gemini在六项过滤测试中平均准确率约50%。专家投资者编写提示词后准确率升至74-76%,但仍低于80%的信任阈值。通过TML的Tinker API微调开放权重模型,准确率达到84.7%,错误率比最佳前沿模型降低29.8%,且每任务成本仅为前者的1/13.8。
事件专题

推荐理由:Mira Murati团队和桥水基金一起搞了个AI筛选新闻的实验,先用GPT、Claude只有50%准确率,专家写提示词到75%还是不够,最后微调模型干到了84.7%,成本还低了13倍多。
01:23
01:23官方账号SiliconFlowAI@siliconflowai
GLM-5.2通过SiliconFlow API和OpenCode集成,开发者反馈其性能达到Opus级别但成本显著降低。处理混乱数据表格、分析图表并生成报告的能力被重点展示。SiliconFlow举办排行榜活动,前72小时参与者可进入早鸟奖励池。

推荐理由:GLM-5.2在SiliconFlow上用OpenCode跑,效果媲美Opus但便宜很多,开发者实测能处理数据表格直接出报告,还能参加排行榜拿奖励。
00:41
00:25
00:25lmarena.ai@lmarena_ai
Claude Sonnet 5 (Thinking) 在 Text Arena 中整体文本排名第32位。在专家级提示(Expert-level prompts)上,Sonnet 5 超越了上一代版本4.6。在数学、写作、文学与语言、生命/物理/社会科学类别中表现稳定,但大多数其他类别的排名出现下降。
事件专题

推荐理由:想对比 Claude Sonnet 5 和 4.6 的文本能力?这份分析告诉你它在专家级提示上更强,但其他类别反而差了。
7月2日
23:29
23:29官方账号LMSYS Org (SGLang)@lmsysorg
76°
NVIDIA推出Qwen3.6-27B-NVFP4模型,采用4位浮点量化,模型大小仅为BF16版本的约1/2.5。该模型在MMLU Pro基准上达到86.3分,与FP8版本性能几乎无损。上下文长度完整保留262K。SGLang已提供Day-0支持,并附带cookbook。
事件专题

推荐理由:NVIDIA新出的Qwen3.6-27B模型,4位量化体积小很多但精度没怎么降,SGLang直接就能用,可以去试试。
20:29
20:29官方账号vLLM@vllm_project
72°
Qwen3.6-27B-NVFP4模型在vLLM上可用,针对NVIDIA Blackwell GPU优化。该检查点将GPU内存需求降低约2.5倍。模型拥有27B参数,采用混合注意力机制。在MMLU Pro上得分86.3,GPQA Diamond上得分85.5。仅支持vLLM作为运行时引擎。
事件专题

推荐理由:Qwen3.6-27B-NVFP4来了!在Blackwell上内存减半,MMLU Pro 86.3分,用vLLM就能跑,开源模型本地AI更省显存。
15:20
14:00
14:00AI Will@FinanceYF5
73°
Google Research 发布了 TabFM,一个专门针对表格数据的基础模型。该模型支持零样本预测,无需训练、调参或特征工程。TabFM 直接输出预测结果,大幅降低使用门槛。目前该推文获得 388 次查看。
事件专题

推荐理由:如果你厌倦了 XGBoost 调参,TabFM 不用训练直接预测,省时省力,适合表格数据任务。
13:58
13:58AI Will@FinanceYF5
精选
该架构通过交替行列注意力机制同时学习表格中行与列的关系,解决了行列无序问题。采用先压缩每行为向量再进行上下文学习的方式提升计算效率。专门为表格数据重新设计,而非直接套用通用大语言模型。
推荐理由:专门为表格数据设计的架构,用交替行列注意力处理无序,还压缩行向量做上下文学习,比硬套LLM聪明多了。
13:57
09:17
09:17elvis@omarsar0
GLM-5.2、Fugu Ultra、Fable 5 三个模型在同一个 one-shot prompt 下进行了生成效果对比。作者认为最后一个模型 Fable 5 表现最佳。该测试未提供具体基准分数或评测指标。
事件专题

推荐理由:博主 omarsar0 用同一个 prompt 对比了 GLM-5.2、Fugu Ultra、Fable 5,他最喜欢 Fable 5 的生成结果,你可以看看三个模型的差异。
09:12
09:12Notion@NotionHQ
Notion在X上宣布,Claude Fable 5模型已正式集成到Notion中。该模型专为最复杂的自定义智能体和自动化工作而设计,在Notion内部基准测试中创下了多步骤任务的新高。目前面向Biz和Ent计划用户开放。
事件专题

推荐理由:Notion 把 Claude Fable 5 放进来了,专治复杂多步骤任务,比之前更强的推理和智能体能力。
08:19
08:19eric zakariasson@ericzakariasson
Claude Fable 5 模型现已重新在 Cursor 中可用。该模型在 CursorBench 基准测试中排名第一,超过所有其他模型。不过其每次任务成本也是最高的。开发者可再次在 Cursor 中选择并使用 Fable 5。
事件专题

推荐理由:Cursor 里又能用 Claude Fable 5 了,它在 CursorBench 上排第一,就是有点贵,适合追求极致效果的场景。
06:20
05:47
05:47Fireworks AI@FireworksAI_HQ
GLM 5.2 模型已在 Microsoft Foundry 平台上线。通过 Fireworks AI 的 FireConnect 功能,开发者能使用 Foundry PTUs 将 GLM 路由到 Codex、OpenCode 或 Pi 等工具。该集成旨在帮助团队从零重建工作流并加速开发。开发者现可立即开始使用。
事件专题

推荐理由:Fireworks AI 在微软 Foundry 上推出了 GLM 5.2,还支持用 FireConnect 路由到 Codex、OpenCode,搞工作流开发能快不少,试试呗。

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。