研究用贝叶斯模型评估 DeepSeek-R1-Distill 系列:规模越大能力越强但效率不变
这篇用分层贝叶斯方法量化了 DeepSeek-R1-Distill 系列的推理能力与 token 消耗,结论是加大模型只提升能力不提升效率,做选型或研究 scaling 的朋友可以看看。
这篇用分层贝叶斯方法量化了 DeepSeek-R1-Distill 系列的推理能力与 token 消耗,结论是加大模型只提升能力不提升效率,做选型或研究 scaling 的朋友可以看看。
想用24GB显卡跑本地模型?这篇文章直接对比了6款主流开源LLM,告诉你选哪个干哪种活,省得自己试。