#Gemini
Perceptron发了Egocentric API,能把机器人视频拆成最小动作单元并追踪每根手指,比基于Gemini的方案还要准。训练机器人手部操作就靠它了。
Google DeepMind出了个新技能,让Gemini学会跟古希腊拉丁文对话。历史学家不用学古典语言,用英语提问就能分析文本,比传统方法方便多了。
三星要出 AI 眼镜了,外观像 Ray-Ban,内置 Gemini,还能自动变色镜片,想尝鲜可以关注。
Google 发了两个新 Gemini 媒体模型,Nano Banana 2 Lite 生成图片只要 4 秒,1 美元能买 30 张;Omni Flash 按秒收费 0.1 美元,适合实时处理。
CharacterAI把ChatGPT和Gemini按在地上摩擦,用户黏性这么高却赚不到钱,最后卖身了。看看数据你就知道为啥。
谷歌给 Omni Flash 加了个视频编辑技能,一行命令就能让 Agent 做视频,支持文本、图片、首帧三种输入,还能对话式编辑,挺实用的。
谷歌因为算力不够直接限制Meta用Gemini,搞得Meta内部项目延期,员工都得省着点用token,大厂也缺算力啊。
有人让Claude、GPT-5、Gemini玩《文明VI》,结果Claude造核弹炸了法国却还是输了,暴露了AI在复杂决策中根本的感知和执行缺陷,比单纯比分数有意思多了。
这篇论文用Facet-Probe测试了18个主流多模态大模型,发现它们对输入顺序都很敏感,最好的模型也错13.4%,提醒我们模型可靠性还不是想象中那么好。
谷歌的Gemini 3.5 Pro要拖到7月了,DeepMind的人还在往外跑,Anthropic趁机挖人。现在Gemini在排行榜上被Claude和ChatGPT甩开,看看这个局面多尴尬。
谷歌又走了两位Gemini大将,加上诺奖得主John Jumper,全都跳去了Anthropic和OpenAI,AI人才战越来越激烈了。
Google 出了Gemini Interactions API 的官方 Skill,装上后你的编码代理一个提示就能自动迁移 API,支持 Claude Code、Cursor 等。
Google 上线了 Interactions API,一个 API 就能调用 Gemini 模型和智能体,还有沙箱、图像音乐生成,异步运行很简单。
谷歌和诺基亚用Gemini做了六个电信运维智能体,能自动定位故障、推荐修复步骤,还支持自然语言生成仪表盘。运营商玩家可以看看怎么省钱提效。
Transformer论文作者Noam Shazeer从Google跳到OpenAI了,他去年刚从Character.AI回归Google,这次跳槽节奏很快。
谷歌新Home音箱搭载Gemini助手,能理解复杂指令和改口,比之前的Assistant聪明多了,还只要100美元。