在过往三年连续围绕整个前沿科技来提供年度科技趋势参考后,今年聚焦在了AI。
过去,AI是前沿科技主轴上的⼀⽀核⼼技术。现如今,AI正在吞噬整个世界、整个
尽管有诸多类⽐,如⼀开始类⽐互联⽹⾰命,到后来类⽐电⼒(第⼆次⼯业)⾰命,
所以不论如何,可⻅AI正在展开的冲击、带来的影响⼒是如何全⾯⼜深刻,甚⾄⼀
AI当然不是科幻,AI⾸先是⼀⻔科学,其次是⼀项⼯程,最后正在变成⼀种⼯业。
这就意味着AI不仅可以观测、可以学习,还能预测——或者更准确来说,我们就是
站在新进展新信息的最前沿,站在产学研交汇地带,把正在从学术研究进⼊产业变
在今年,我们还通过更具规模的数据统计,在AI应⽤的创新创业和投资⽅⾯,也提
总之,希望这份年度趋势,能够对你在岁末年初了解时代技术进展提供最直接
的帮助。⾝处技术⼤航海时代,即便你未能出海探索,也希望你能感知到潮⽔涌动
趋势⼆ScalingLaw泛化:推理能⼒成皇冠明珠,倒逼计算和数据变⾰/10
趋势七AI产品趋势:多模态上⻢,Agent席卷⼀切,⾼度个性化呼之欲出/50
构的核⼼——它允许模型进⾏并⾏计算,在序列中⾮线性地直接捕捉任意两个位置之间的关联权重,⼤幅提⾼模型能
⼒上限。但另⼀⽅⾯,这也使模型的算⼒需求、计算复杂性和消耗资源成本都随参数增加呈指数级增⻓,在⼤规模任
图:Transformer模型架构,⾕歌、多伦多⼤学涌现,世界范围内的学者从多个⽅向努⼒,试图在保留
来越需要新的突破,以构建强⼤且⾼效的新⼀代基础⼤模型。强⼤意味着卓越的性能、泛化能⼒和抵抗
幻觉能⼒;⾼效则指低成本、⾼效率和低能耗。只有具备这两⼤特质,⼈⼯智能才能真正成为⽔和电⼀
这些新兴⼤模型架构不仅在性能上可以与Transformer模型竞争,还在内存效率和可扩展性上展现出优势。梅花创
投杨颜媛表⽰,部分新架构更易于进⾏并⾏计算,能够充分利⽤现代硬件的并⾏计算能⼒,提⾼训练和推理的速度。
它们的出现,为AI领域带来了新的活⼒,也为未来的研究和应⽤开辟了新的可能性。随着这些模型的不断发展和优
化,我们有理由相信,⼤模型创新架构将在AI未来发展中扮演越来越重要的⻆⾊。
循环神经⽹络(RNN)通过循环⽅式处理序列数据,能够对过去的输⼊保留记忆,但存在难以并⾏化的问题,
Transformer架构的诞⽣最早就是为弥补这⼀缺陷。但仍有很多学者认为,RNN的潜⼒还远未达到天花板,在
Transformer架构越来越受到诟病的今天,RNN凭借其独特优势再度获得了越来越多学者的探索创新。
⽬前这⼀路径的架构创新主要使⽤循环神经⽹络(RNN)替代⾃注意⼒机制,通过循环⽅式处理序列数据,使模型
我相信RNN是正确的,但现在的RNN远远没有做到它真正的⽔平,它的上限其实是⾮常⾼的,现在我们
还远远没有到那个地步,还有很多空间。因为RNN更接近⼈脑和宇宙的运作⽅式。例如,在物理上,宇
宙的下⼀状态只与上⼀状态有关,这是所谓的locality和causality,量⼦场论遵循这⼀原则。
在实现⾼效推理、节省存储开销的同时保持模型的⾼性能。这使得RWKV可以“像Transformer⼀样”进⾏并⾏训练,
•TokenShift:tokenshift在时间混合计算中,通过对当前和前⼀输⼊的线性组合进⾏线性投影,⽣成⽤于时间混
•WKV运算符:WKV运算符利⽤时间衰减因⼦对权重进⾏更新,使得每个时间步的输出依赖于之前所有时间步的信
息,从⽽保留了RNN的记忆能⼒,这种设计使得RWKV模型在保持较低计算复杂度的同时,能有效捕捉序列数据中
•输出⻔控:RWKV通过在时间混合和通道混合块中使⽤sigmoid函数对接收向量进⾏⻔控,控制信息的流动和记忆
更新,确保在每个时间步只传递和处理相关信息,从⽽减少梯度消失和爆炸问题,增强了模型的稳定性和训练效
过循环或卷积运算实现⾼效计算,使得计算开销与序列图:RWKV内部架构图,彭博等
2023年12⽉,Mamba架构⾸次被提出,引⼊了选择性状态空间模型,实现了对输⼊数据的有选择性处理。这种选
择机制使得模型能够根据当前输⼊的token决定哪些信息是重要的,忽略不相关的信息,提升模型处理⻓序列的能⼒
Mamba的核⼼在于其硬件感知算法,利⽤现代硬件(如GPU)的内存层次结构,通过扫描⽽⾮卷积计算模型,减少
不同级别GPU内存间的IO访问,提⾼计算效率。此外,Mamba简化了深度序列模型设计,⽆需注意⼒机制或多层感
今年5⽉,Mamba-2发布,提出了状态空间对偶(SSD)框架,揭⽰了状态空间模型与结构化掩码注意⼒之间的联系。
Mamba-2的核⼼层通过引⼊新的SSD算法,在训练效率上提升了2-8倍,同时保持了与Transformer在语⾔建模⽅⾯
层次化卷积模型,以UniRepLKNet为代表,是⼀种⻓卷积架构,其核⼼在于使⽤与输⼊序列⻓度相当或接近的滤波
器(核)来捕捉序列数据中的⻓距离依赖关系。这种设计使得模型在处理输⼊时能够考虑到更远的历史信息,有效处
⼤核卷积的独特优势在于不依赖深度堆叠即可获得⼤感受野,避免了深度增加带来的边际递减问题。UniRepLKNet提
出了⼀种膨胀重参数块(DilatedReparamBlock),即通过使⽤多个膨胀⼩核卷积层来增强⼀个⼤核卷积层,从⽽在
膨胀重参数块使⽤膨胀的⼩核卷积层来增强⾮膨胀的⼤核层。这样的膨胀层相当于具有更⼤稀疏核的⾮膨胀卷积层,
RetNet的设计突破了所谓的“不可能三⻆”,在保持训练并⾏性的同时,实现了低成本部署以及良好性能。
RetNet作为全新的神经⽹络架构,使⽤多尺度保持(Retention)机制替代了标准的⾃注意⼒机制。与标准⾃注意⼒
•引⼊位置相关的指数衰减项取代softmax:这⼀改进简化了计算过程,并使得前步信息以衰减的形式得以保留,
•引⼊复数空间表达位置信息:这⼀⽅法取代了传统的绝对或相对位置编码,使得模型更容易转换为递归形式,增
•使⽤多尺度的衰减率:保持机制采⽤了多尺度的衰减率,使RetNet能够更灵活地处理不同⻓度的序列,提升了模
会影响输出和反向梯度,从⽽在保持模型性能的同时,提⾼了计算的稳定性和效率
•分块递归:即并⾏表⽰和递归表⽰的混合形式,将输⼊序列划分为块,在块内按照并⾏表⽰进⾏计算,在块间遵循
RetNet的实验结果表明,它在语⾔建模任务上达到了与Transformer相当的性能,同时在推理速度和内存占⽤⽅⾯显
架构的新型神经⽹络设计。受⽣物神经系统启发,LNN通过使⽤更少的神经元和创新的数学公式,实现了与传统深度
•⾼效内存使⽤:LFM的核⼼优势在于其⾼效的内存使⽤和强⼤的推理能⼒,这使得它在处理⼤量顺序数据时表现
出⾊。与传统的基于Transformer的模型相⽐,LFM在处理⻓输⼊时内存使⽤量显著减少,这是因为LFM能够更有
•多模态能⼒:LFM模型能够处理包括视频、⾳频、⽂本、时间序列和信号在内的多种类型的数据
•⾃适应能⼒:LFM还具有⾃适应能⼒,可以根据特定的硬件平台或参数要求进⾏⾃动优化
•结构化操作单元:这些单元是模型的基本组成部分,属于⼀个全新的设计空间。LFM的设计允许模型在扩展、推
这些加速涌现的创新架构多是在不同程度保留Transformer架构优势基础上,结合循环神经⽹络(RNN)、状态空间
序列模型(SSM)、卷积模型(CNN)以及液体神经⽹络(LNN)等思想所做出的创新发展,这使得不同架构之间的
界限越来越模糊,呈现出⽇益明显的混合(Hybrid)趋势,更多性能领先的创新架构具备“博采众家之⻓”的特点。
同时,⽬前⼤多数创新架构虽然能够在⼀些⼩规模性能测试中实现与传统Tranformer架构同等甚⾄更优越的性能,
2020年,伴随着GPT-3问世,第⼀代ScalingLaw指引我们在参数量、数据集和计算量之间寻找模型性能的最优解;
2024年,拥有强⼤推理能⼒的o1让我们对⼤模型的要求从迅速⽣成与训练结果,转向在推理过程中进⾏更深度的思考。
最初,我们对Scalinglaw的关注局限于对参数量的思考,甚⾄引发了对其失效的担忧;但全新的scalinglaw从狭窄具
体的指代衍⽣到宽泛的概念,并引发了我们对万卡集群、合成数据和计算资源最优分配的多重关注。
我们对ScalingLaw及其泛化在当前AI时代下的关注可被归纳为以下⼏点:
•新时代的ScalingLaw出现,⼤模型的发展将追求更⾼的推理能⼒,资源向Post-training和推理算⼒倾斜。
1.AI模型的性能强烈依赖于规模,主要和参数量N、数据集⼤⼩D和训练计算量C有
总结到,他们发现损失函数(loss)随着模型⼤⼩、数据集⼤⼩和训练使⽤的计算量⽽呈幂律变化。⽽模型的性能在
2020年惊艳亮相的GPT-3是⼀个175B参数的⼤模型,⽽今天我们讨论的模型参数量已经是万亿级别。EPOCHAI维护
着⼀个从20世纪50年代就开始监测AI和机器学习模型的数据库,他们发现从2010年到2024年5⽉,⽤于训练模型的计
算量每年增⻓4-5倍,⽽过去10年间语⾔模型的性能提升中约有三分之⼆是由于模型规模的增加。
例如GPT-4需要使⽤2.5万张英伟达A100GPU,并⾏训练100天的左右时间,在此期间要处理13万亿个token,并且涉
及⼤约1.76万亿个参数。可以预⻅的是为了追求更极致的性能和解决更多问题,在参数量的增加和计算需求的增⻓下,
•万卡集群:由⼀万张及以上的加速卡(如GPU、TPU或其他专⽤AI加速芯⽚)组成的⾼性能计算系统
•⾼性能⽹络:⽹络需要⽀持⾼带宽、低延迟的数据传输,确保集群中的计算节点能够⾼效地通信和协作
中国联通研究院夏璠表⽰,⾼性能⽹络基础设施对于⽀持⼤规模AI应⽤⾄关重要。随着数据量的增加和AI应⽤的扩展,
对⽹络带宽和延迟的要求也越来越⾼。这种集群将充分整合⾼性能GPU计算、⾼性能RDMA⽹络、⾼性能并⾏⽂件存
储、智算平台等关键技术,将底层基础设施整合成为⼀台超级计算机,以千亿级甚⾄万亿级参数规模的⼤模型训练。
尽管万卡集群必然会强调对加速卡的需求,我们在技术上关注的却应该是集群的互联。从千卡到万卡,单卡性能下降
8%左右,⽬前全球范围内已经有企业开始追求「10万卡」以上的集群规模,在万卡到10万卡的难关中,如何能保持
集群的线性度、稳定性,同时保证调度的效率,是下⼀步所有AI玩家将持续关注的重点。
同样,在ScalingLaw中数据集的规模和表现也会改变模型的性能。现有的开源⼤模型在⽅法、架构层⾯开源的同时,
•统计分布:分析真实数据以确定其潜在的统计分布,例如正态分布、指数分布或卡⽅分布。然后从这些已识别分布
•深度学习:使⽤深度学习的⽅式⽣成⾼质量的合成数据集。这些⽅法通常⽤于更复杂的数据类型,例如图像或时间
但合成数据是否是应对数据危机的最佳解药仍值得商榷。⾸先,真实数据永远存在相当多的离群值和异常值,合成数
据⽣成算法很少能重现它们。其次,合成数据的引⼊可能导致模型在训练过程中出现过拟合,从⽽影响其在现实世界
的⼀次实验,使⽤合成数据9次迭代后就会让模型原地「崩溃」。更吸引⼈眼球的结果来⾃Dohmatob,Elvis等的实验
结果StrongModelCollapse,他们发现即使合成数据仅仅占到总数据集的最⼩部分,甚⾄是1%的⽐例,仍然可能导
⽬前⽣成和使⽤合成数据的⽅法在不同模型中都处在探索阶段,我们将持续关注这⼀议题的最终结果。
2.全新的ScalingLaw,赋予模型的推理时间越多,模型的推理能⼒越强
尽管没有披露具体的训练⽅法,但其原理是基于强化学习的内化思维链学习,通过思维链式的问题拆解,使得模型可
这⼏年,我们确实观测到规模的增加带来了基本的推理能⼒,但这种推理的效果是相对有限的,⽽o1所完成的,是让
模型在作答前进⾏“停下来思考”,这⼀过程需要更多的计算资源,因此被称为“推理时计算”。
停下来思考这⼀状态的实现,正是我们⼀直想教会模型的模式,即更直接地进⾏推理。
o1⼤幅度增强了⼤模型的逻辑推理能⼒,使⼤模型从系统1提升到系统2,⼤幅度加速AIAgent
benchmark上已经超过⼈类PhD⽔平。推理能⼒⼤幅提升可以显著减少幻觉,提⾼Agent类⼈
⼤语⾔模型的推理能⼒通常涉及到⼏种不同的技术或概念,包括思维链(ChainofThought,CoT)、思维树(Tree
•思维链(ChainofThought,CoT):模仿了⼈类解决问题时的思维过程,即先分析问题,然后逐步推理,最后
•思维树(TreeofThought,ToT):更为结构化的推理⽅法,它将问题分解为多个分⽀,每个分⽀代表⼀个可能
•思维图(MapofThought,MoT):视觉化⼯具,⽤来表⽰不同概念、事实和推理步骤之间的联系
从前的预训练遵循⼀个已经被深刻理解的法则:你在预训练模型上投⼊的计算资源和数据越多,它的表现就越好。
新的模型想要提升能⼒,除了在预训练阶段,还可以在后训练阶段,通过提升强化学习(ReinforcementLearning)
o1激发了当前时代的⼤模型开发者对提升⼤模型数学和推理能⼒的兴趣,这很⼤程度上就意味着扩⼤后训练的规模。
最近的研究使⽤了不同的⽅法把结果的奖励信号传递到⼤模型的各个推理过程中:
Intelligence其中,Apple为RLHF阶段引⼊两种新⽅法:①与iTeC⼀起进⾏拒绝采样微调,⽬的是训练、优化奖励模型;
②镜像下降与RLHF结合,这被认为是⽐PPO(近端策略优化)更有效的⽅法
Llama3.1MetaAI认为RL算法(如带有PPO的RLHF)稳定性差、扩展难度⼤,但他们在DPO后仍开发了奖励模型,
2阶段后训练⽅法:①SFT,提⾼模型在预设场景中的响应准确性;②DPO,使模型与⼈类偏好保持⼀致
拒绝采样似乎已成为后训练阶段的常⻅做法,但现阶段并没有在选择DPO或RLHF⽅⾯达成共识。然⽽强化学习的思路
模仿学习+强化学习成为典型AI模型发展路径范式。本质上是数据的稀缺与否及质量⾼低的问题,数据多
就优先模仿学习,数据少就优先强化学习(可⾃我产⽣数据),最终是综合两种类型的算法技术以产⽣更
如今,我们意识到RLHF起的作⽤远超已经IFT(InstructionFine-Tuning),需要将更多的预算放在后训练阶段上。
随着我们对⼤模型推理能⼒的更⾼追求,和对后训练阶段的更多投⼊,未来有可能推理端的算⼒将会超过训练端。
尽管当前推理算⼒还没有超过训练算⼒,但推理成本已经超过了训练成本。毕竟训练成本是⼀次性成本,⽽推理需求
明势创投表⽰,在⼤规模部署AI服务的背景下,推理成本成为主要开⽀来源,市场对降低推理成本的需求强烈。
2024年深圳市虚拟电厂建设潜力分析:空调和电动汽车专题-自然资源保护协会.
[桂林]2025年广西桂林医学院附属医院护理人员招聘50人笔试历年典型考点(频考版试卷)附带答案详解.
[河北]2024年河北体育学院招聘人事代理工作人员7人笔试历年典型考点(频考版试卷)附带答案详解.
[毕节]2023年浙江省人民医院毕节医院剩余岗位人才引进笔试历年典型考点(频考版试卷)附带答案详解.
[榆林]2023年陕西榆林市定边县自主临聘医学卫生类专业技术人员50人笔试历年典型考点(频考版试卷).
[毕节]2024年贵州毕节市七星关区教育局考调25人笔试历年典型考点(频考版试卷)附带答案详解.
[桂林]2024年广西桂林市中医医院人才招聘笔试历年典型考点(频考版试卷)附带答案详解.
[毕节]2023年贵州毕节幼儿师范高等专科学校人才引进笔试历年典型考点(频考版试卷)附带答案详解.
[梧州]2024年广西梧州职业学院招聘55人笔试历年典型考点(频考版试卷)附带答案详解.
[济宁]2024年山东济宁微山县事业单位招聘工作人员(教育类)笔试历年典型考点(频考版试卷)附带答案.
[柳州]2023年广西柳州市环境卫生管理处招聘笔试历年典型考点(频考版试卷)附带答案详解.
苏教版四年级上册数学四年级上册数学第四单元《统计表和条形统计图(一)》专项练习(含答案).
温州市普通高中2025届高三第一次适应性考试(一模) 数学试卷(含答案详解)原卷.
2023-2024学年浙江省金华市武义、永康、磐安县九年级(上)期末科学试卷.
原创力文档创建于2008年,本站为文档C2C交易模式,即用户上传的文档直接分享给其他用户(可、阅读),本站只是中间服务平台,本站所有文档所得的收益归上传人所有。原创力文档是网络服务平台方,若您的权利被侵害,请发链接和相关诉求至 电线) ,上传者九游app娱乐 9游娱乐官网