#上集讲到翠花想本地部署AI大模型,结果被我泼了冷水——他的电脑跑不动。临走时他问了一个问题:"那7B、13B、70B到底是什么意思?为什么数字越大越厉害?"这个问题问到了点子上,今天专门讲。

(大模型到底是什么、里面有什么参数,之前写过一篇,没看过的可以先去翻一下《什么是AI,什么是大模型,它是怎么工作的》。这篇重点讲:参数为什么有大小之分,是不是越大越聪明。)


上集说完算力和Token的事,翠花没死心。

第二天他又来找我,手里拿着手机,屏幕上是一篇介绍开源大模型的文章。

“你看,这里写着7B、13B、34B、70B,还有671B的,数字差这么多,是不是671B的那个最厉害?”

我说你先别急,我先问你一个问题。

“你知道大模型里面的’参数’到底是什么吗?”

在这里插入图片描述


参数到底是什么

简单说:参数就是模型里面的"旋钮",训练的过程就是把这些旋钮调到最合适的数值。

调好了,输入一个问题,模型就能输出一个合理的回答。参数越多,能调的旋钮越多,能表达的关系就越复杂。

具体原理之前那篇讲大模型结构的文章里写过,不重复了。

在这里插入图片描述


为什么参数越多越聪明

参数越多,模型能"记住"和"理解"的东西就越多——这个直觉是对的,但有几个重要的限制条件。

在这里插入图片描述

看完这张图你应该就明白了:参数多有帮助,但不是唯一因素。


那7B、13B这些数字到底怎么来的

很简单——就是参数的数量,单位是B,十亿(Billions)。

7B就是70亿个参数,70B就是700亿个参数。

这些参数保存在模型文件里,所以模型文件也特别大——7B模型大概14G,70B模型大概140G。

具体对应关系看这张图:
在这里插入图片描述


回到翠花的问题:671B是不是最厉害

翠花听完,指着手机上的文章问我:“那DeepSeek那个671B的,是不是最厉害的?”

我说,看你怎么定义"厉害"。

如果比聪明程度,671B确实很强,理解能力、推理能力、知识覆盖面,都比小模型好。

但问题是——你跑得动吗?

671B的模型,光把模型加载到显存里,就需要几百G显存。个人电脑基本不可能本地部署,得用云服务器,而且是很贵的那种。
在这里插入图片描述

所以对普通人来说,"厉害"不只是看参数——还得看你能不能用得上。

一个用不了的671B模型,再厉害也跟你没关系。


下期预告

翠花最后又问了一个问题:“那这些参数,训练的时候到底是怎么学出来的?模型是怎么从一堆乱码,变成能聊天的AI的?”

这个问题更大。

训练一个大模型,到底要经过哪些步骤,喂多少数据,烧多少钱?

下期讲。


关注小虾,一起成长,一起进化
在这里插入图片描述

Logo

脑启社区是一个专注类脑智能领域的开发者社区。欢迎加入社区,共建类脑智能生态。社区为开发者提供了丰富的开源类脑工具软件、类脑算法模型及数据集、类脑知识库、类脑技术培训课程以及类脑应用案例等资源。

更多推荐