#多模态
Pika Labs刚推出Soundtrack音频模型,能给视频加原生音乐和音效,价格比其他产品便宜20倍,creators测试后很惊艳。
Alibaba_Qwen发布了Qwen3.8-27B,单提示就能生成惊艳效果,对比Gemini-3.7-flash表现更好,还能在本地3090显卡上运行。
想测多模态模型在拥挤场景里会不会张冠李戴?这个新基准InstaBind-Lite能精准量化,开源模型错绑率近20%,比想象中严重。
Moonshot AI 出了个新测试 PerceptionBench,专门查 AI 的“眼神”。结果最强模型 GPT-5.6 Sol 准确率也不到 60%,而且很多错是从看图时就错了。
Kimi K3 写的 App,拍冰箱就出菜谱,还能自己跑起来,快去 fridgechef.qtkiwi.com 试试!
这个科学智能体模型能处理多模态数据,397B 版在时间序列预测上很强,还有个 4B 小模型能直接把生物任务分数拉高,适合搞科研的人看看。
OpenRouter给Gemini 3.7 Flash额外五折,8月27号截止。多模态和智能体任务,这价很香。
谷歌新出的Gemini 3.7 Flash,编码和智能体分数提升明显,输入每百万token只要0.75美元,划算,但只走API。
Gemini 3.7 Flash 现在也能处理图片和 PDF 了,跑智能体还能配合 Ori Harness 用,OpenRouter 上就能试。
Runway 出了个 Scene Fixer,能把不搭的 AI 片段统一起来,只修有问题的部分,其他帧和音频都不动。
千问开源的多模态插件集,用 MCP 把读图、看视频、3D 建模塞进任意 Agent,纯文本 Agent 直接升级,想给 Agent 加眼睛的可以试试。