前言:你有过使用搜索引擎搜索问题却找不到有效信息的时候吗?

    大多数开发人员在遇到报错的时候第一步去看我们的控制台的报错,有些报错追溯到了源码,我们一般看不懂,这个时候会根据控制台的报错信息去检索,搜索出的结果有很多干扰信息,我们的做饭一般是点击每一个与这个搜索结果相关的内容寻找有效的解决方案。这种方式的确可以帮助我们解决大部分问题,但是在效率方面对比我们的大模型来说,是相对较低的。

    这时候引入大模型,大模型并不是利用搜索引起去搜索,而是利用其自身的知识或者是外部的搜索工具尽可能准确的找出正确答案解决问题,其背后的逻辑是怎样的,是本篇文章主要介绍的。

    目录:大模型的演变、大模型的使用与训练、大模型的特点与分类、大模型的工作流程、大模型的应用

大模型的演变

    大模型的前身是AI,即人工智能。人工智能是一个广泛设计计算机科学、数据分析、统计学、机器工程、语言学、神经科学、数学和心理学等多个学科的领域。人工智能按照技术实现的不同可被划分为多个子领域,各个子领域之间往往相互关联和影响。

   2021年斯坦福大学的研究团队发表了关于基础模型(大模型)的论文,它是一类具有大量参数能在极为广泛的数据上进行训练,并适用于多种任务和应用的预训练深度学习模型。

   2022年11月,OpenAI公司发布了ChatGPT——一种现金的人工智能语言模型,转为对话交互而设计。具有强大的自然语言理解和生产能力,可以完成论文撰写,邮件,文章、翻译、代码等任务。

    2023年3月,国内厂商纷纷发布自主研发的大预言模型产品,百度发布文言一心、阿里巴巴研发的通文千问进行内测;华为盘古大模型、科大讯飞1+N认知大模型。

  2023年8月,阿里巴巴集团发布通义千网系列开元大模型,其升级版本具备自然语言理解,文本生产,音频理解,工具使用,角色扮演等能力。

大模型训练的阶段:

预训练、SFT(监督微调)以及RLHF(基于人类反馈的强化学习)

    预训练:预训练的过程类似于从婴儿成长为中学生的阶段,在这个阶段我们会学习各种各样的知识,我们的语言习惯,知识体系等重要部分都会形成,对于大模型来说,在这个阶段它会学习各种不同种类的语料,学习到语言的一般知识。这个阶段并没有学会怎样去领会人类的意图,通常这个时候它不会给出令人满意的答案,这时候需要使用SFT(监督微调)

   SFT(监督微调)在这个阶段大模型可以学习各种人类的对话语料,甚至是非常专业的垂直领域知识,在监督微调过程后,它可以按照人类的意图去回答专业领域的问题。这时候的模型已经可以按照人类的意图去完成基本的对话功能,但是它的回答可能并不符合人类的偏好,输出的不是人类需要的最优解,这时候需要对模型进行RLHF(基于人类反馈的强化学习).

   RLHF(基于人类反馈的强化学习),在此阶段,大模型会针对同一个问题进行多次回答,人类会对这个回答打分,大模型会在次阶段学习如何输出分数最高的回答,使得回答更符合人类的偏好。

大模型的特点和分类

大模型的特点

    大模型的特点主要分为4个方面,规模和参数量大、适应性和灵活性强、广泛数据集的预训练、计算资源需求大。

1、规模和参数量大:大模型通过其庞大的规模,一般拥有数亿到数千亿级别的参数数量来捕获复杂的数据模式,使得它们能够足够理解和生成丰富的信息。不管我们问大模型怎样的问题,它都能回复一个相关的答案。

2、适应性和灵活性强:模型具有很强的适应性和灵活性,能够通过微调或少样本学习高效的迁移到各个下游任务,有很强的跨域能力。比如公司的财报,人工整理是速度很慢的,但是我们可以通过大模型来进行高效率生成。

3、广泛数据集的预训练:大模型使用大量多样化的数据进行预训练,以学习广泛的知识表示,能够掌握语言、图像等数据的通用特征。

4、计算资源需求大:巨大的模型规模带来了高昂的计算和资源需求,包括但不限于数据存储、训练时间、能量消耗和硬件设施。



大模型的分类
大语言模型(LLM)

多模态模型

   大语言模型专注于自然语言处理(NLP)旨在处理语言、文章、对话等自然语言文本。它们一般基于深度学习架构,结果大规模文本数据集训练而成,能够捕捉语言的复杂性,包括语法、语义、语境以及蕴含的社会知识。语言大模型典型应用包括文本生成、问答系统、文本分类、机器翻译、对话系统等。如GPT系列、谷歌推出的大模型Bard、阿里云推出的通义千问等。

   多模态模型能够同时处理和理解来自不同感知通道的数据,并在这些模态之间建立关联和交互。它们能够整合不同类型的输入信息,进行跨模态推理、生成和理解任务。多模态大模型的应用涵盖视觉问答、图像描述生成、跨模态检索、多媒体内容理解等领域。

大模型的工作流程

    对大模型的AI流出发,当我们有对应的输入,我们做一个怎样的输出。第一个是分词化和词表映射,第二个是文本生成过程。

     分词化:是自然语言处理中的重要概念,是将段落和句子分割成更小的分词的过程,将一个句子分解成更小的,独立的部分可以帮助计算机理解句子的各个部分,以及他们在文章中的作用,这对于大量上下文的分析尤其重要,分词化有不同的粒度。

分词化粒度:






    每一个Token都会通过预先设置好的词表,映射为一个token id ,一句话最终会被表示为一个元素为token id的列表,供计算机进行下一步处理。

   大语言模型的工作是根据给定的文本预测下一个token,我们的输入看似是在对大模型提问,但实际是给了大模型一串提示文本,让它可以对后续的文本进行推理。

    大语言模型的推理过程不是一步到位的,当大模型进行推理时,它会基于现有的token,根据概率最大原则预测出下一个最优可能的token,将预测的token加入到输入序列中,并将更新后的序列继续输入大模型用来预测下一个token,这个过程叫做自回归,直到输出特殊的token,专门用来控制推理结束或输出长度达到阈值。

大模型的应用:

    通义千问是阿里巴巴超大规模语言模型,能帮你写文案、代码、解答问题,提升工作效率,满足个性化创作需求,甚至还能进行互动。







































 

Logo

脑启社区是一个专注类脑智能领域的开发者社区。欢迎加入社区,共建类脑智能生态。社区为开发者提供了丰富的开源类脑工具软件、类脑算法模型及数据集、类脑知识库、类脑技术培训课程以及类脑应用案例等资源。

更多推荐