Skip to content

原文链接:https://mp.weixin.qq.com/s/7tO4V2m9dLcNOrJclKWDww 作者:丿世外逃猿(大米淘天) 本文获原作者授权转载


搞了半年 AI,我才发现连「权重」是什么都不懂。大佬忽略。

背景:我为什么会去了解权重

最近国外围绕开源模型的一轮讨论里,英伟达黄仁勋、OpenAI、Anthropic(A 社)都反复提到一个词——开源权重

这个词我其实早就眼熟,训练、部署、微调的文章里到处都是,但我从没真正搞清楚它指什么。

我之前的误解很具体:参数量不就是 356B、2T 这种数字吗?一个规模指标,它凭什么能被「开源」?一个数字开源出去有什么意义?

直到认真查了一轮才明白,我把两件事搞混了:参数量是规模,权重是内容。

权重到底是什么

权重是模型训练结束后得到的一堆实数(浮点数),写在模型文件里(.safetensors / .gguf / .bin),运行时整体加载进 GPU 显存,推理就是拿输入和这堆数做乘加运算。它不是物理硬件参数,也不是纯概念词,是实打实的数据。

具体例子:

  • 一个 7B 模型,B 是 Billion(十亿),指约 70 亿个参数(参数 = 权重 + 偏置,权重占绝对大头)。也就是这个模型里有约 70 亿个实数。
  • 每个权重值用 fp16 存储占 2 字节,所以 7B 模型文件约 14GB;量化到 4 比特,文件压到 4GB 出头,但它还是 7B 模型——权重数量没变,只是每个数存得糙了。这就是同一个 7B 模型有 14GB 和 4GB 两个版本的原因。
  • 回到最初困惑:356B、2T 是参数量级(告诉你模型有多大),「开源权重」是把那几千亿个训练好的具体值交给你。数字本身开源没意义,值开源才有意义

训练时这些数是拿海量数据一遍遍调出来的;训练完推理时固定不动,除非再微调、蒸馏或量化。

现在所谓开源模型的现状:到底几个是真开源

类别开放范围代表模型
真·开源(全开放)权重 + 训练代码 + 训练数据 + 训练日志,可完整复现OLMo 系列(Allen AI)、BLOOM(BigScience)、Pythia(EleutherAI)
只开放权重仅训练好的参数文件,代码/数据不给Llama(Meta)、DeepSeekQwen(阿里)、Gemma(Google)、Mistral
闭源(仅 API)权重都不给,只能远程调用GPT 系列(OpenAI)、Claude(Anthropic)

结论:标榜「开源」的模型里,真正全开源的是极少数,绝大多数只是开放了训练好的权重。开放权重模型,权重就是你下载下来那坨以 GB 计的实数文件。

免责声明:本文为个人学习笔记,非专业论文。各模型开放范围基于公开资料整理,厂商政策会变动,具体以官方发布为准。如有错漏欢迎指正。