事件专题 ·多源确认

Beam 被指是 DeepSeek V3 的等算力复现:23B 参数 × 23.8T tokens

一条推文算了一笔账:Beam 用 23B 参数训练 23.8T tokens,与 DeepSeek V3 的 37B 参数 × 14.8T tokens 总 FLOPs 几乎相同,比值约 0.9996,相当于两年后的 iso-FLOP 复现。作者同时指出 Beam 并未复现 V3 的训练效率,认为在精细量化下单张 H100 的效果可超过 NVL72 中的一张 GB300。

当前结论

有人算出 Beam 和 DeepSeek V3 总训练算力几乎一模一样,等于是两年后的复现,但效率差挺远,评论区还挺热闹。

4 个信源53° AI 热度最后更新 2026/10/6 01:22:06

证据链

4 个信源

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。