随着AI技术发展,大模型成为科技竞争新高地、产业新赛道、经济新引擎,我国视其为国家战略,出台政策扶持。大模型广泛应用,推动科技革命与产业变革,面临发展挑战需各界努力。
2023年大模型爆发,变革生产生活,国产大模型崛起。大模型与传统行业融合,提升产业效率;赋能金融、医疗等,助力新质生产力发展。大模型需政策法规保障,促进健康发展,服务各行业,注入发展新动能。
2024年,多重因素推动大模型发展,政府支持、用户需求增长、科技投入增加。面临算力分散、结构最优疑问、数据稀缺等挑战。趋势上,基础模型训练公司或减少,更多公司寻找应用场景。v
1.2.1 Transformer 架构Transformer 架构是目前语言大模型采用的主流架构,于 2017 年由 Google提出,其主要思想是通过自注意力机制获取输入序列的全局信息,并将这些信息通过网络层进行传递,Transformer 架构的优势在于特征提取能力和并行计算效率。

自注意力机制作为 Transformer 模型的核心组件,其允许模型在处理序列数据时,对每个词位置的输入进行加权求和,得到一个全局的上下文表示。在计算自注意力时,模型首先将输入序列进行线性变换,得到 Q(查询)、K(键)和 V(值)三个向量。
为提高模型的表达能力,Transformer模型采用了多头自注意力机制,这意味着模型在同一时间关注来自不同表示子空间的注意力信息。多头自注意力的实现方法是将输入序列分成多个组,每个组使用一个独立的权重矩阵进行线性变换,并计算自注意力。最终,自注意力的输出被拼接起来,并通过一个线性层得到最终的输出表示。
1.2.2 AI 语言大模型关键技术AI 语言大模型关键技术主要涉及基于人类反馈强化学习、指令微调、模型提示等相关技术。
基于人类反馈强化学习(Reinforcement Learning from Human Feedback,RLHF),是指将人类标注者引入到大模型的学习过程中,训练与人类偏好对齐的奖励模型,进而有效指导语言大模型的训练,使得模型能够更好地遵循用户意图,生成符合用户偏好的内容。
1)训练监督策略模型:使用监督学习或无监督学习的方法,对一个预训练的语言模型进行训练,通过给予特定奖励或惩罚引导 AI 模型的行为,使其能够根据给定的输入预测输出或行为。
2)训练奖励模型:让标记员参与提供有关模型输出结果的反馈,九游娱乐 中国官方网站对模型生成的多个输出或行为的质量或正确性进行排名或评分,这些反馈被转换为奖励信号,用于后续的强化学习过程。
3)采用近端策略优化进行强化学习:先通过监督学习策略生成近端策略优化(PPO)模型,经过奖励机制反馈最优结果后,再将结果用于优化和迭代 PPO模型参数。具体而言,在 PPO 模型训练过程中,智能系统通过尝试不同的行为,并根据每个行为获得的奖励来评估其质量,智能系统逐步改进行为策略。

2.1 AI 大模型主要特征AI 大模型具有泛化性(知识迁移到新领域)、通用性(不局限于特定领域)以及涌现性(产生预料之外的新能力)特征。

按照部署方式划分,AI 大模型主要分为云侧大模型和端侧大模型两类。云侧大模型由于部署在云端,其拥有更大的参数规模、更多的算力资源以及海量的数据存储需求等特点;端侧大模型通常部署在手机、PC 等终端上,具有参数规模小、本地化运行、隐私保护强等特点。具体而言,
云侧大模型分为通用大模型和行业大模型;端侧大模型主要有手机大模型、PC 大模型。从云侧大模型来看,通用大模型具有适用性广泛的特征,其训练数据涵盖多个领域,能够处理各种类型的任务,普适性较强。行业大模型具有专业性强的特点,针对特定行业(如金融、医疗、政务等)的需求进行模型训练,因而对特定领域具有更深的业务理解和场景应用能力。从端侧大模型来看,手机和 PC 大模型由于直接部署在设备终端,让用户体验到更加个性化和便捷的智能体验。
当前,我国 AI 大模型产业呈现蓬勃发展的态势。伴随多家科技厂商推出的AI 大模型落地商用,各类通用、行业以及端侧大模型已在多个领域取得了显著的成果,如在金融、医疗、政务等领域,AI 大模型已成为提升服务质量和效率的重要手段。


2.3 中国 AI 通用大模型典型案例案例一:科大讯飞—讯飞星火认知大模型
讯飞星火认知大模型V3.5提升三大能力:人机交互更智能,知识学习与内容创作更丰富,数智化生产力显著增强。人机交互上,V3.5在语义理解、指令跟随、情绪感知及拟人合成方面均有优异表现。知识学习与内容创作上,通过要素抽取、问题生成等底层能力提升,丰富智能体应用。数智化生产力方面,模型在逻辑推理、时空推理、数学能力、代码能力及多模态能力上均有显著进步。

大模型应用方面,七大能力升级赋能多场景:情感分析、文本摘要提升语言理解能力;讯飞智文实现文档、PPT一键生成;知识问答覆盖生活、医学、政策等领域;逻辑推理包括思维推理和科学推理;数学能力解决多种数学问题;代码能力支持智能代码生成、错误定位及测试数据生成;多模态能力实现图片描述、问答及音视频生成。