想看最强的AI在实时观察任务上有多弱吗?ActiveVision让GPT-5.5和Claude Fable 5原形毕露,人类碾压它们。
#多模态
这篇论文给VLM配了三种看图工具(表格、图表、放大),再用GRPO训练工具使用策略,比普通prompt和RL方法更准,适合处理科学图表验证。
这篇论文提出了HCIG和GCCN,在MMSD和MultiBully上分别达到85.74%和69.62%准确率,比传统融合方法更善于捕捉图文矛盾。
想用 AI 管理整个科研流程?SciForge 把论文、代码、数据整合成可追溯的工作状态,还帮你做基因发现和蛋白质设计,开源可玩。
阿里刚发的 HappyOyster 1.0,能根据一句话或一张图生成实时可探索的 3D 世界,还能像导演一样用文字操控剧情,支持 1 分钟以上互动,挺有新意的。
荣耀新系统AgenticOS,8月Robot Phone首发有机械云台,支持多智能体协同,试试看。
Think Machines的Inkling模型很特别,总参数975B但只激活41B,还有1M上下文和多种模态支持,值得上手试试。
英伟达开源微调工具 AutoModel 现在也能调图像视频模型了,提供现成 LoRA 脚本,省去写分布式训练的麻烦。
阿里发了 Wan-Streamer v0.2,视频电话延迟才 550ms,画质从模糊到高清,还能边听边看边回应,挺有意思。
Kimi 新模型 K3 跑分赢了 Opus 4.8 和 GPT-5.5,2.8 万亿参数还带百万上下文,解码快到飞起,技术细节值得细看。
谷歌给 Vids 加了数字分身,上传自拍和录音就能生成自己出镜的 AI 视频,还能用 Gemini Omni 改背景调光线,比 HeyGen 更方便。
新基准 MM-IssueLoc 专门测模型到底有没有用截图这类视觉证据,而不是全靠文本猜。当前最强系统得分才三十多,说明视觉定位远没解决。
这篇论文用49道题测了Gemini、GPT-4等6个模型对科学图表的理解力,发现Gemini最强但人类平均还是更高,开源模型差距明显,想了解模型真实视觉推理能力可以一读。
Inkling 是 Thinking Machines Lab 的新多模态 MoE 模型,同时支持文本、图像、音频输入,还能控制推理计算量,效率很高。
Kimi搞了个2.8万亿参数的开源模型K3,性能追平GPT-5.6 Sol和Claude Fable 5,不过价格也上去了,中国AI要涨钱了。
Meta 新模型 Muse Spark 1.1 上架 OpenRouter,输入才 $1.25/M,还支持多模态,做智能体很划算,美国开发者快试试。
Thinking Machines 出的 Inkling 开放权重模型在多模态推理和多个基准上表现不错,是美国目前排名最高的开放模型,不妨试试它的推理效果。