8月6日
03:42
02:27
02:27官方账号Decoder@Matthias Bastian
Google宣布从2026年9月4日起在Android和Wear OS上关闭Google Assistant。Gemini将接管智能手机、平板、手表和Android Auto上的AI助手功能。文章质疑,依赖概率的Gemini能否匹配Google Assistant以往处理简单指令的可靠性。

推荐理由:Google确认2026年9月用Gemini替换Assistant,Android、手表和车载都要换,简单指令靠大模型靠不靠谱是看点。
8月5日
11:05
11:05官方账号arXiv cs.AI@Sebastián Andrés Cajas Ordóñez, Agastya Munnangi, Aldo Marzullo, Felipe Ocampo Osorio, Quang Bui, Mohammad Shahin, Armaan Grewal, Emmanuel Paul Kwesiga, Anqi Peter Li, Josephine Nanyonjo, Aaditya Panchal, Arshnoor Bhutani, Nikhil Jaiswal, Milit S. Patel, Maximin Lange, Leo Anthony Celi
一项研究测试了临床多智能体委员会是否会被捷径欺骗,覆盖文本、影像和ICU表格七组队列。在MedQA-USMLE等六个数据集上,Gemini委员会单独面对误导线索时仅有5-16%的翻转率,但两个同伴给出同一错误答案时,holdout模型在38%案例中采纳。三种监督智能体中,gate的假阳性率达100%,同源judge在文本上精确率100%但在影像上失效,而独立referee在影像上取得77-88%精确率。研究还发现,视觉显著性提高三倍不增加传染,但第二个同伴声音使传染率提高一半。
推荐理由:Gemini多智能体会被同伴错误带偏(38%案例),独立裁判能抓,门控不行,做临床AI的注意了。
8月4日
8月1日
01:55
01:55Google Gemini App@GeminiApp
72°
谷歌发布 Gemini 3.6 Flash 和 3.5 Flash-Lite 升级版。新版本在推理能力和响应速度上均有提升。用户可在 gemini.google 或 App 的模型下拉菜单中切换使用。两个模型目前均已开放体验。
事件专题

推荐理由:谷歌把 Flash 和 Flash-Lite 都升级了,推理更强速度更快,打开 Gemini 选模型就能试。
01:51
01:50
01:50Google Gemini App@GeminiApp
Gemini Drops是Gemini应用本月的版本更新,覆盖桌面端与移动端。Gemini Drops本次更新提升了智能推理能力和智能体执行能力,使桌面与移动端操作更高效。用户可通过Gemini应用直接体验增强后的功能。
推荐理由:谷歌Gemini应用这月出了Gemini Drops,桌面和手机端更强了,多了智能体功能,比之前好用。
7月31日
08:30
08:30官方账号Simon Willison’s Weblog博客/媒体
81°
OpenAI宣布GPT-5.6 Terra降价20%,GPT-5.6 Luna降价80%。Luna输入价格降至$0.20/百万token,输出$1.20/百万token,低于Google Gemini 3.1 Flash-Lite的$0.025/$1.50。Anthropic Claude Haiku 4.5输入/输出为$1/$5,Luna输入成本仅为Haiku的1/5。OpenAI使用GPT-5.6 Sol优化负载均衡和推理内核,将端到端服务成本降低20%。
事件专题

推荐理由:OpenAI把Luna价格打到比Gemini Flash-Lite还低,想省钱换模型?Luna现在比Claude Haiku便宜5倍,跑demo或生产都能省一大笔。
00:06
7月29日
17:08
17:08IT之家博客/媒体
76°
The Information 报道称,OpenAI 内部数据显示 ChatGPT 周活跃用户即将突破 10 亿,但比最初预期晚约 7 个月,原计划去年底达成。外部竞品 Gemini 和 Claude 持续分流用户。内部 GPT-5 去年秋季发布后因体验问题导致增速下滑,拖累整体增长节奏。
事件专题

推荐理由:ChatGPT 用户快破10亿了,但比预期晚了半年,Gemini 和 Claude 抢了不少用户,GPT-5 也没能挽回局面。
11:10
11:10官方账号arXiv cs.AI@Carlos Celemin, Benedict Wilkins, Adrián Barahona-Ríos, Saman Zadtootaghaj, Nabajeet Barman
该研究探索了视觉语言模型(VLMs)在基于agent的游戏QA管道中检测几何裁剪异常。自定义探索agent收集视觉数据,自动标注管道提供帧级标签。零样本设置下测试了Gemini、GPT、Qwen、Gemma、Llama和Ministral六种VLM及四种提示变体。Gemini-3.1-Flash在总体准确率和提示鲁棒性上表现最佳,开源模型则对提示设计敏感。当前VLMs更适合作为多阶段QA管道中的高召回候选过滤器。
推荐理由:这篇论文用六种VLM检测游戏里的几何裁剪bug,发现Gemini最稳,开源模型要看怎么问提示词。想了解VLM实际落地坑点的可以看看。
01:20
01:20官方账号Logan Kilpatrick@OfficialLoganK
精选
Google AI Studio 今日为 Gemini Managed Agents API 推送了多项更新。新增了对模型环境钩子(如 block、lint)的支持。开发者现在可以选择特定模型 Gemini 3.6 Flash。免费层已同时支持 UI 与 API 调用。默认 agent 也已升级为基于 3.6 Flash。
推荐理由:Google 给 Gemini Agents API 加了环境钩子和免费层,还能选 3.6 Flash 模型,开发者用起来更灵活了。
7月28日
12:03
12:03官方一手arXiv: DeepSeek@Bartol Bućan, Nikola Sočec, Sarah Isufi, Morena Granić, Luka Hobor, Agneza Krajna, Mihael Kovac, Mario Brcic
76°
该研究对GPT-5、Claude、Grok、Gemini、DeepSeek、Kimi、Qwen共7个主流模型进行了基于政治轴的可控性压力测试,使用12种意识形态角色提示和70个政治指南针项目,共收集63,700条回答。结果发现,上下文框架解释了经济和社会轴上约88%-93%的方差,而模型自身身份的影响不到3%。在威权提示下,不同模型在相同问题上表现出相似偏移。研究强调需要进行可操控性审计,报告分散性、对称性、饱和度和拒绝底线。数据集和代码已开源。
推荐理由:这篇论文用70道政治题+12种人格提示,测了GPT-5、Claude、Grok等7个模型,发现提示词比模型本身更能左右回答方向。想了解AI怎么被‘带节奏’的可以看看。
7月27日