#多模态
StepFun 的 Step 5 Preview 限时免费,600B 参数还能看图,得分和 GPT-6 Luna 打平,可以先去试试再决定要不要付费。
Google 一口气发了好几样:SynthID 检测工具全球能用了,Nano Banana 2.1 修图能只改局部,EmbeddingGemma 2 还能在手机上跑多模态嵌入,做开发的可以看看。
日本游戏公司 Mynet 的 CTO 亲测后选了 Qwen,说它对日语写作的结构和语感把握得好,想了解 Qwen 日语能力的话可以看看。
天文学家拿 Anthropic 的 Claude Science 干了件实在活:AI 自己下数据、校准、补洞,画出首张全天紫外图,偏差约 10%。
豆包工作加了画布功能,素材和成果摊在一张画布上随便对比编辑,还配了豆包 2.1 Lite 和 Seedream 5.0 Flash 两个新模型,做 PPT 和生图都更省额度。
Liquid AI 把决策模型做小做快了,d1-3B 单次判断 8 毫秒,d1-omni-600M 还能听语音,权重已放出可自己微调部署。
Claude 出了两个新东西:Dashboards 接数仓就能聊天出看板,Motion 能把图表报告直接编成 MP4 动画,做汇报的可以试试。
阿里云在 Apsara 大会上讲了 Qwen3.8-Max 和 Qwen-Audio-3.1-Realtime 怎么做任务规划和执行,做 Agent 的可以看看完整视频。
Mistral 上了个 1T 参数的大家伙,激活只有 49B,Agent Arena 排名升了 11 位,10 月底开源,可以等等看。
Joma Tech 恶搞了 OpenAI 的 GPT-6 广告,把 GPT-6 拍成会洗碗还能解千禧年难题,连 OpenAI 官号都转发了,挺有意思的一条。
这篇论文做反欺诈的同学可以看看:Evi-VN 不再造新检测器,而是专门修正各种 GNN 都会误判的那批难样本,还用上了文本、图像、音频证据。
MiniMax 的设计工具上了 Opus 5.5,生图配音生视频都能干,Claude 被封号的朋友可以看看这个替代方案。
Anthropic 和 Runway 联手了:Claude Motion 能把数据做成动画讲解,再丢进 Runway 生成视频,做演示的人可以试试。
Google 把 SynthID 检测工具开放成免费网站了,图片、视频、音频都能传上去查是不是 AI 做的,遇到可疑素材可以先验一下。
GPT-6 的聊天回复不再只有文字,图表、地图、按钮都能直接生成在对话里,免费用户也能用,网页搜索响应还快了 44%。
Google 把图像生成和编辑塞进一个模型,价格砍半还上榜 AA 榜第 4,做图成本党可以直接换。
Nvidia 的 Long-WAM 把机器人模型的上下文拉到 19.2 秒,RoboCasa GR-1 成功率直接从 63.3% 涨到 78.7%,做机器人方向的可以看看。
OpenAI 说 GPT-6 的 Intelligent UI 会支持印尼语,能直接在 ChatGPT 里生成图表和交互内容,对印尼用户挺实用。
OpenAI 给 12 亿 ChatGPT 用户上了 Intelligent UI,回答直接变成可点的图形、地图和小工具,配合 GPT-6 一起看。
Musk 说 Grok 要按任务自动挑最合适的模型,连 Claude Opus 5.5 都接入,多模型路由这个思路值得玩味。
日本PFN出了个31B翻译模型,53种语言,日语基准分超OpenAI的GPT-6.1 Sol,价格还便宜很多。
NVIDIA 这篇论文发现 Claude、Gemini、Qwen 这些模型一旦接上工具,挡有害请求的能力就掉最多近七成,做智能体安全评测的得看看。
Liquid AI开源了两款小尺寸决策模型,最小只有600M还支持多模态,在边缘设备上几十毫秒就能出结果,做端侧Agent的可以试试。
GPT-6 正式全量推送了,回复里能直接生成按钮、图表和小工具,跟 GPT-5.6 的纯文本对比差别很明显,可以上手试试
有人实测了 GPT 的 IntelligentUI,提问时它会自动判断用图表或界面来回答,不再只会打字聊天,视频里能看到实际效果。
一篇很实在的参赛报告:LoRA 微调 Whisper 搞定阿拉伯语多方言和码切换识别,还公开了八个没做成的方向,做 ASR 的可以看看。
ChatGPT 全量用户都能用上 GPT-6 了,还能通过可交互的界面学东西,比如官方演示的边点边学打麻将,值得升级体验一下。