OpenSquilla 新版本用多模型集成拿下 DRACO 双榜第一,连 Fable 5 都被比下去了,关键是还省钱。
全部动态
Anthropic的Fable 5只用了40分钟就把160万行C++的老游戏草稿编译成iOS原生应用,连触控操作都是AI写的
美团开源了1.6T参数的LongCat-2.0,激活参数480亿,原生支持100万token上下文,国内ASIC集群跑出来的,值得关注。
Mistral 新模型 Leanstral 1.5 专攻形式化验证,能自动找出代码漏洞,数学基准也比同类强。
NVIDIA 搞了个新框架 ASPIRE,自己写程序自己修,LIBERO-Pro 长任务零样本就 31%,还能再提 77 点,做机器人的可以看看。
Anthropic 的 Claude Mythos Preview 让 6 月高危漏洞报告数冲到纪录的 3.5 倍,抓虫效率惊人。
Mistral开源了Leanstral 1.5,一个能解数学竞赛题的Lean 4代码模型,Apache-2.0免费商用,实测解决587道Putnam难题,值得看看。
麒麟 9030 Pro GPU 比上代强 76%,原神能效反超骁龙 8 Gen3,鸿蒙原生优化很强,想买 Mate 80 系列的话值得看看。
字节豆包 Seedance 2.5 要上线体验中心了,能生成 30 秒视频还能同时用 50 个素材编辑,实打实提升视频创作效率。
桥水和Mira Murati团队发现,GPT和Claude在金融判断上准确率才70%,不如微调的Qwen3-235B的84.7%,成本还低14倍。
谷歌新模型 Gemini Omni Flash 在盲测中赢了字节 Seedance 2.0 Mini 101 Elo,视频生成质量被用户投票认可,想看看最新视频生成标杆可以关注。
Anthropic 发现 Fable 5 模型不再吃长指令,Claude Code 提示词直接砍掉 80%,用上下文代替硬性规则。看他们怎么给 AI 减肥。
英伟达放出了一个双塔扩散模型,生成速度比普通模型快 2.4 倍,质量只掉了 1.3%,权重和代码都已经开源了。
达摩院搞了个AI智能体,从240万晶体里筛出6.8万候选,还实战验证了4种超导新材料,比传统SuperCon数据库效率高太多,搞材料的人可以白嫖数据。
Anthropic发现Claude Code的新模型Fable 5太聪明,系统提示反而碍事,直接砍掉80%。