Harvey在招人组建自己的模型训练团队,要把法律AI做到模型层,已有数千GPU和独特后训练数据,能提升开源模型到前沿水平,适合想做大型模型训练的AI研究员。
#模型训练
美团搞了个1.6万亿参数的大模型LongCat-2.0,全程用国产芯片,没碰Nvidia,性能还很强。想看看中国芯片能不能撑起大模型?这篇聊得清楚。
有个开发者自己写了一套代码,把M4芯片的AI训练能力全开出来了,不用苹果官方工具,跑到了15.8TFLOPS。想用iPad或Mac训练模型的人可以看看。
NVIDIA 与 Think Machines 的合作意味着更强大的算力支持,做模型训练和定制 AI 的团队可以关注这一进展,看看能否利用其平台加速自己的项目。
Hugging Face 将存储与训练无缝集成,管理模型和数据集的团队可以直接在平台上完成从存储到训练的全流程,省去多平台切换的麻烦。
做模型训练或理解 scaling law 的团队值得一读——这篇论文把大模型涌现能力的机制讲清楚了,不是玄学而是容量与干扰的数学问题。
这件事暴露了 AI 大模型训练中数据来源的灰色操作,做模型训练的团队和关注 AI 伦理的读者值得一看——它直接关系到训练数据的合规性和行业竞争规则。
国产芯片终于能跑万亿参数大模型了,做AI基础设施和模型训练的团队值得关注——这证明昇腾910C已具备工业级训练能力,后续国产替代路径更清晰。
Ethan He 把模型训练和交互设计的底层逻辑讲透了,做模型训练或产品设计的开发者看完会有启发,特别是关于迭代速度和交互未来的观点值得反复琢磨。
苏炜杰是统计学界顶级奖项得主,他的加入意味着OpenAI在模型训练和隐私保护方向持续加码,做AI基础研究和数据安全的从业者值得关注这位新成员的动向。
Cursor 用 RL 训练模型而非提示工程,给 AI 产品团队一个关键信号:2027 年后,训练自己的模型才是护城河。做 AI 应用开发的建议点开,看看他们怎么和 Fireworks 合作跑 RL 滚动。
Hugging Face 这个开源智能体把 ML 研究全流程自动化了,做实验的团队可以直接用它跑论文复现和模型训练,省掉大量手动调参和写脚本的时间。