全部动态
Stanford 联合 Terminal-Bench 团队搞了个科研智能体榜单,70 个真实科研任务里 GPT-6 Astra 拿 63% 排第一,开源模型才 10%,差距很直观。
Justin Johnson 讲了 World Labs 怎么生成能反复进入的 3D 世界,跟一般视频生成不一样,还能用来训机器人。
OpenAI 把 GPT-6 Astra 的能力下放到 Sol 和 Luna 两个便宜模型,Luna 编码榜涨了 74 分,API 价格还砍了一半,跑批量任务可以看看。
有人把多个模型混着调用,30 个智能体任务测下来追平 GPT-6 Astra,成本只要 1/3,混合路由这事有数据了。
写老代码的人该看看:Factory 的 Legacy-Bench 进了 Fireworks 的指数,专门测模型会不会修祖传代码。
AMD 拿 1000 多张 MI355X 跑 MXFP8 预训练,还会讲 TorchAO 和 TorchTitan 的具体调优细节,搞训练的可以听听。
OpenCode 里能免费用一周的神秘模型 Space Bunny,看图就能写代码,做 3D 原型还自己开浏览器检查效果,搞前端和创意编程的可以试试。
做 FLUX 的 Black Forest Labs 跑去做机器人了,70 亿参数就在 RoboLab-120 刷了纪录,还开源,搞机器人的可以看看。
Odyssey 的 Agora-2 能在一个共享实时世界里同时模拟 20 个人和 AI 智能体,还显式追踪彼此影响,比单智能体模拟更贴近真实多人博弈场景。
博主 berryxia 爆料 Google 这几天可能放出 Nano Banana 2.5,还吐槽它只敢发 flash 和 Lite,不敢上 Pro 版。
Cline 里免费用 Gemini 3.8 Flash,1M 上下文加 291 tok/s,跑分还压过 GPT-5.6 Luna 和 DeepSeek v4.1 Flash,写代码可以直接试。
Odyssey 出的 Agora-2 能让 20 个人和智能体进同一个实时模拟环境,可以拿来训练机器人或研究智能体合谋,预览版已经能玩。
做自定义 harness 的可以看看 CLM-8B,比 Jev 快 9 倍,DeepSWE 跑到 81.6%,代码和模型都开源了。
Xiaomi 新发的 MiMo-V2.6-Pro 在 AA 指数上拿到 46 分,只差 GPT-5.6 一分,成本却只要零头,权重还是 MIT 开源的。
Latent.Space 访了 Jev 的创造者,聊这个专门在软件里做可靠决策的模型为什么故意不走聊天路线,还吐槽公开基准,观点挺反主流的。
有人拿 DeepSeek V4.1 Flash 和 Space Bunny Alpha 现场比拼,让两个模型各自写一个网页版 Minecraft,前者能跑能挖,后者地面还有破洞,结果一目了然。
有人专门做了个家具组装基准,测模型空间推理,10个月分数从28%飙到80%,连以前模型搞不定的活也开始拿下了。
Kimi K3 在 TPU 上跑到 709 tokens/s,比 GB200 还快,92 个 MoE 层塞进一个 Pallas kernel,做法挺巧,做推理的可以看看。
Anthropic 的 Opus 5.5 在编程智能体评测拿第一,三项基准都涨了,价格还降了 20%,不过每任务要烧 13 美元 tokens,用前算算账。
蚂蚁 inclusionAI 开源了个专做 UI 和海报的文生图模型,6B 参数还支持透明背景,设计出图可以试试。
Anthropic 让 950 个 Claude 智能体跑了 21 小时,在 20 万个 DNA 样本里找到一个类似 CRISPR 的新酶系统 ART,张锋也点了头。
Sonnet 5.5 被偷跑测试了:100 万 tokens 上下文,价格直接对标 GPT-6-Sol,想换模型的可以盯一下。
Google 的 TTS 模型又更新了,发音准确率登顶,多语言表现也不错,做语音相关的可以看看价格和速度对比。
Google DeepMind 主管透露 Gemini 4 已进后训练阶段,打算比年底更早放出早期版本再快速迭代,想追新模型的朋友可以盯一下时间线。
用 vLLM 做 RL 训练的老大难——训练和推理数值对不上,这次在 AMD MI300X 上真做到了逐位一致,做 RL 的都该看看。
Anthropic 公布 Claude 主导文献综述和实验设计,发现疑似新基因编辑机制,Dario 亲自在联合国安理会讲了这事。
OpenAI 新出的 GPT-6 Sol 和 Luna 被拿来做法律场景实测了,Sol 抓合同变更、Luna 管细节核查,做法律 AI 的可以看看成绩。
语音合成圈的榜单更新了,Gemini 3.8 Flash TTS 发音准确率干到 89.5%,不过序列和术语两项分别被 SpaceXAI 和 Qwen 的模型拿走,各家各有强项。
The Information 传 Gemini 4 快训练完了,发布可能比年底早很多,盯着 OpenAI 的朋友可以留意下 Google 这边的时间线。
有人拿牛顿摆实测了 GLM-5.3 和 OpenRouter 上的神秘新模型,物理模拟谁更靠谱一看便知,还有难倒两个模型的翻车场景。
Anthropic 让 950 个 agent 跑了 21 小时,真在病毒数据里找出一个 CRISPR 类似结构,Amodei 说这就是 AI 治病的第一步。
Claude Opus 5.5 拿下 58 分登顶,但 $0.13 的 MiMo-V2.6-Pro 得分 46,性价比党可以直接看这张图选模型。
仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档