Moonshot AI 开源了 Kimi-K3,2.8T 参数的大模型,在推理和代理基准上很强,但显存要求高,适合有硬件或想评估部署成本的人看看。
#多模态
Anthropic 出了 Opus 5,接近 Fable 5 的能力但便宜一半,agent 编程和知识工作更强,快去 Poe 试试。
Kimi K3在Fireworks上刚上线,3万亿参数、1M上下文、原生视觉,性能不输Opus但便宜好几倍,做高性价比推理就选它。
Kimi 新旗舰 K3 登上 Ollama,2.8T MoE 超强视觉理解,还能直接配合 Claude Code 用,性能提升 2.5 倍每单位计算。
Fireworks 上了首个3万亿参数的开放模型 Kimi K3,百万上下文加视觉,推理不输闭源,还零数据保留,上手试试。
小米的MiMo-V2.5模型全球调用量冲到第一,一周用了10.5万亿Token,超过了其他国内大模型,说明它实际用的人真多。
Induction Labs 搞了个新套路:不用动作标签,只看视频就能学会模拟桌面、跳棋和台球物理。106B 参数的 MoE 模型,一次预训练就够了。
Vivix这个新模型单卡就能每秒生成上万视频token,做实时互动视频、多模态聊天特别带劲,比之前那些慢吞吞的方案强多了。
Anthropic 的 Claude Opus 5 性能接近 Fable 5 还便宜一半,能自己写代码做 3D 重建,很强。
亚马逊把 Alexa+ 升级成能帮你订餐叫车买菜的智能管家,还能看图和写东西,和第三方服务直接打通,比以前的语音助手强多了。
阿里云把数据库升级成专门给智能体用的Agentic Database,用多模态记忆和全链路监控,让AI跑得更稳更高效。
想用强化学习训练自己的 Claude Code 智能体?OpenForgeRL 让你在真实 harness 和环境中端到端训练,ClawEval 和 GUI 基准上表现不错,而且开源可用。
这篇论文搞了个VLM-IE3D,让普通视觉语言模型看RGB视频就能学会3D空间感,不用额外3D设备,而且好几个3D任务都做得更好。
Black Forest Labs的Flux 3能生成带声音的视频,最长20秒,性能还略超Seedance 2.0,他们想搞世界模型,值得关注。