这篇研究把多模态 AI 直接放进医学生的 OSCE 临床考试里做评分,不是事后回溯验证,而是前瞻性真实部署,做医学教育的人可以看看他们怎么落地的。
#多模态
GPT-6 终于全量推送到 ChatGPT 了,还带了个 Intelligent UI,能把讲不懂的概念做成互动界面,可以直接上手试试。
ChatGPT 现在能用图表、表单甚至可点的按钮来回答问题了,跟着 GPT-6 一起全量上线,界面交互变化挺大。
OpenAI 把新版 GPT-6 推给全部 ChatGPT 用户了,这次不只是文本,还做了不少底层基建改造,撑得起 12 亿用户。
Liquid AI 开源了两款不吐文字只给结构化判断的小模型,3B 版读图文、600M 版还能读音频,一次前向就出结果,适合做实时决策。
有人拿 OpenAI 的 Decisions API 做了个手势识别 demo,视频里精度和速度都吊打他之前的 Jev 版本,玩多模态的可以看看怎么实现的。
OpenAI 给 GPT-6 加了 Intelligent UI,ChatGPT 回复里能直接出图表、表单、计算器甚至小游戏,改个参数结果跟着变,免费和 Plus 用户都能用。
微软把自家的 130B 编程模型塞进 Windows 11,3-bit 量化后小了 80%,还能看图写代码,Copilot 用户值得关注。
Fish Audio 新出的 Drama 3,用大白话就能指挥配音的情绪和节奏,一句台词中间变情绪也不用重录,API 里能直接试。
Perplexity 把两个嵌入模型开源了,9B 做索引、0.6B 能跑在手机上,PDF 不用 OCR 直接搜,成绩还挺好。
Perplexity 开源了两个 late-interaction 嵌入模型,文本图像网页一个空间里查,做 RAG 的可以上手试试。
Google DeepMind 出了 Nano Banana 2.1,画图前会先搜 Google Image Search 核对真实信息,画出来的东西更不容易走样。
Google 把语音助手那套转写接力砍掉了,Gemini 3.8 Live 一个模型直接听直接答,还便宜到每小时 0.84 美元。
OpenAI 出了个新 API,专门干打分和分类的活,比 Responses API 快十倍,价格也便宜,做内容审核的可以看看。
Mistral 的新模型 Mistral Large 4 在 WebDev 榜单一口气从130名冲到45名,价格只有 Claude Opus 4.8 的六分之一,10月底还会开源权重,可以蹲一下。
Google DeepMind 把多模态嵌入模型压缩到手机能跑的体积了,纯文本只占约 191MB 内存,还能搜代码和音视频,做端侧 RAG 的可以看看。
Google 开源了个 7.4 亿参数的嵌入模型,一句话就能在手机上搜照片视频和录音,还不用联网,免费商用,做本地搜索的可以去试试。
iOS 27.2 第二个公测版来了,健康 App 加了长寿评估,Siri 一下多会五种语言,FaceTime 还能群聊开双镜头,想尝鲜的可以试试。
谷歌的图像模型 Nano Banana 2.1 上线了,局部改图不用整张重画,人物多图还能保持长一个样,开发者拿 gemini-nano-banana-2.1 就能调,最高出 4K 图。
Google 把 270M 参数的多模态 embedding 模型开源了,手机离线就能搜相册、搜语音,不用传云端,隐私党可以试试。
Kevin Weil 在 X 上聊 OpenAI 这次数学方向发布,有人用 GPT 6 Pro 统计近三年数学发现,81% 来自这次放出的 math 仓库,看看吧。
Google 给 Gemini Live 加了 Guided Vision,Android 9 以上就能用,和残障社区一起做的,适合日常场景。
Google 给 Gemini App 加了 Guided Vision,能帮人找东西、读小字、描述周围环境,对老人和视障用户挺实用。