至知研究院提出大模型可解释性新路线:拆权重,数据成本不到1%
精选理由
至知研究院的新方法拆权重就能解释大模型,数据成本不到1%,比训练替代网络省太多了。
至知研究院提出大模型可解释性新路线:拆权重,数据成本不到1%。该路线无需训练替代网络,数据成本依旧低于1%。它直接通过权重分解来理解模型,数据开销控制在1%以内。
原文 · 量子位
理解大模型,无需再训练一个替代网络
至知研究院的新方法拆权重就能解释大模型,数据成本不到1%,比训练替代网络省太多了。
至知研究院提出大模型可解释性新路线:拆权重,数据成本不到1%。该路线无需训练替代网络,数据成本依旧低于1%。它直接通过权重分解来理解模型,数据开销控制在1%以内。
理解大模型,无需再训练一个替代网络
OpenAI 把 722 篇论文全放出来了,就是那个 372 个数学结果的说法,平均每个只用了 ChatGPT Pro 3 小时算力,可以自己去翻原始材料。
OpenAI 把一个没发布的模型的数学作业晒出来了:722 篇论文、372 组结果,每题烧 3 小时 Pro 算力,看看推理模型解题水平到哪了。
Underdog AI 把 Qwen3.8-27B 压到 2-bit,只有 7.89GB 还能跑工具调用,日常推理比原版还强,本机部署党可以试试。
DeepMind 的 Pushmeet Kohli 和 Biohub 的 Sal Candido 聊 AlphaFold 没解决的部分,做生物 AI 的值得听听他们的判断。