原文链接:https://mp.weixin.qq.com/s/7tO4V2m9dLcNOrJclKWDww 作者:丿世外逃猿(大米淘天) 本文获原作者授权转载
搞了半年 AI,我才发现连「权重」是什么都不懂。大佬忽略。
背景:我为什么会去了解权重
最近国外围绕开源模型的一轮讨论里,英伟达黄仁勋、OpenAI、Anthropic(A 社)都反复提到一个词——开源权重。
这个词我其实早就眼熟,训练、部署、微调的文章里到处都是,但我从没真正搞清楚它指什么。
我之前的误解很具体:参数量不就是 356B、2T 这种数字吗?一个规模指标,它凭什么能被「开源」?一个数字开源出去有什么意义?
直到认真查了一轮才明白,我把两件事搞混了:参数量是规模,权重是内容。
权重到底是什么
权重是模型训练结束后得到的一堆实数(浮点数),写在模型文件里(.safetensors / .gguf / .bin),运行时整体加载进 GPU 显存,推理就是拿输入和这堆数做乘加运算。它不是物理硬件参数,也不是纯概念词,是实打实的数据。
具体例子:
- 一个 7B 模型,B 是 Billion(十亿),指约 70 亿个参数(参数 = 权重 + 偏置,权重占绝对大头)。也就是这个模型里有约 70 亿个实数。
- 每个权重值用 fp16 存储占 2 字节,所以 7B 模型文件约 14GB;量化到 4 比特,文件压到 4GB 出头,但它还是 7B 模型——权重数量没变,只是每个数存得糙了。这就是同一个 7B 模型有 14GB 和 4GB 两个版本的原因。
- 回到最初困惑:356B、2T 是参数量级(告诉你模型有多大),「开源权重」是把那几千亿个训练好的具体值交给你。数字本身开源没意义,值开源才有意义。
训练时这些数是拿海量数据一遍遍调出来的;训练完推理时固定不动,除非再微调、蒸馏或量化。
现在所谓开源模型的现状:到底几个是真开源
| 类别 | 开放范围 | 代表模型 |
|---|---|---|
| 真·开源(全开放) | 权重 + 训练代码 + 训练数据 + 训练日志,可完整复现 | OLMo 系列(Allen AI)、BLOOM(BigScience)、Pythia(EleutherAI) |
| 只开放权重 | 仅训练好的参数文件,代码/数据不给 | Llama(Meta)、DeepSeek、Qwen(阿里)、Gemma(Google)、Mistral |
| 闭源(仅 API) | 权重都不给,只能远程调用 | GPT 系列(OpenAI)、Claude(Anthropic) |
结论:标榜「开源」的模型里,真正全开源的是极少数,绝大多数只是开放了训练好的权重。开放权重模型,权重就是你下载下来那坨以 GB 计的实数文件。
免责声明:本文为个人学习笔记,非专业论文。各模型开放范围基于公开资料整理,厂商政策会变动,具体以官方发布为准。如有错漏欢迎指正。