全部动态
月之暗面新发的 Kimi K3 在知识工作跑分上干掉了 GPT-5.6 Sol,只输给 Claude Fable 5,看参数和表现都很猛。
Together Compute 下了个对比,Kimi 和 GPT 在修 bug 上各有绝活,组合用比单干划算得多。
Fireworks 用1000个智能体任务实测了 Kimi K3 和 Fable,发现按任务路由能省50倍成本,还能保持93%准确率。K3 在安全和长循环上更强。
想知道 GPT 5.6 SOL 和 Kimi K3 在视频生成上有多大差别?同一个提示词,两个 AI 导演各拍一版,看完你就懂了。
杨植麟从Transformer-XL、XLNet到Kimi K3,只用16个专家就做到1M上下文,值得看看他的思路。
Inkling是当前美国最强的开源模型,在Agent Arena排第9,擅长处理复杂工作流和CLI错误恢复,但用户反馈一般,你可以试试看它是否适合你。
Kimi K3在投资研究上直接干翻了GPT-5.5和OPUS-4.8,时间判断和证据边界控制尤其强,已经在AlphaEngine上用了,搞金融研究的可以试试。
阿里巴巴要开源一个2.4万亿参数的Qwen3.8,预览版已经能用了,据说只比Fable 5差一点,和Kimi K3直接对标,想试试大模型的可以关注。
这周模型圈太热闹了,DeepSeek V4、GLM 5.2 刚发,Kimi K3 和 Qwen 3.8 又来了,还有 Claude 和 GPT 对标,开源 SOTA 随时变天。
中国开源模型Kimi K3编码能力比Claude和GPT还强,价格却便宜好几倍,做长上下文编程选它准没错。
SpaceXAI 的 Grok 4.5 用 $0.31 就干到一流水平,比 Claude 便宜 9 倍,token 还省 6 倍,省钱党可以关注。
SpaceXAI 的 Grok 4.5 用 1.5T 参数就挑战了 2.8T 的 Kimi K3,成本还低 3 倍,看看参数效率和成本怎么平衡的。