大模型7B、70B里的B是什么,参数越大越好吗?
#上集讲到翠花想本地部署AI大模型,结果被我泼了冷水——他的电脑跑不动。临走时他问了一个问题:"那7B、13B、70B到底是什么意思?为什么数字越大越厉害?"这个问题问到了点子上,今天专门讲。
(大模型到底是什么、里面有什么参数,之前写过一篇,没看过的可以先去翻一下《什么是AI,什么是大模型,它是怎么工作的》。这篇重点讲:参数为什么有大小之分,是不是越大越聪明。)
上集说完算力和Token的事,翠花没死心。
第二天他又来找我,手里拿着手机,屏幕上是一篇介绍开源大模型的文章。
“你看,这里写着7B、13B、34B、70B,还有671B的,数字差这么多,是不是671B的那个最厉害?”
我说你先别急,我先问你一个问题。
“你知道大模型里面的’参数’到底是什么吗?”

参数到底是什么
简单说:参数就是模型里面的"旋钮",训练的过程就是把这些旋钮调到最合适的数值。
调好了,输入一个问题,模型就能输出一个合理的回答。参数越多,能调的旋钮越多,能表达的关系就越复杂。
具体原理之前那篇讲大模型结构的文章里写过,不重复了。

为什么参数越多越聪明
参数越多,模型能"记住"和"理解"的东西就越多——这个直觉是对的,但有几个重要的限制条件。

看完这张图你应该就明白了:参数多有帮助,但不是唯一因素。
那7B、13B这些数字到底怎么来的
很简单——就是参数的数量,单位是B,十亿(Billions)。
7B就是70亿个参数,70B就是700亿个参数。
这些参数保存在模型文件里,所以模型文件也特别大——7B模型大概14G,70B模型大概140G。
具体对应关系看这张图:
回到翠花的问题:671B是不是最厉害
翠花听完,指着手机上的文章问我:“那DeepSeek那个671B的,是不是最厉害的?”
我说,看你怎么定义"厉害"。
如果比聪明程度,671B确实很强,理解能力、推理能力、知识覆盖面,都比小模型好。
但问题是——你跑得动吗?
671B的模型,光把模型加载到显存里,就需要几百G显存。个人电脑基本不可能本地部署,得用云服务器,而且是很贵的那种。
所以对普通人来说,"厉害"不只是看参数——还得看你能不能用得上。
一个用不了的671B模型,再厉害也跟你没关系。
下期预告
翠花最后又问了一个问题:“那这些参数,训练的时候到底是怎么学出来的?模型是怎么从一堆乱码,变成能聊天的AI的?”
这个问题更大。
训练一个大模型,到底要经过哪些步骤,喂多少数据,烧多少钱?
下期讲。
关注小虾,一起成长,一起进化
更多推荐
所有评论(0)