2.2.2盘古5.0赋能华为小艺再次升级,丰富行业应用亮相本次WAIC9
2.3.1通用大模型快速迭代,首发toC可控人物视频生成模型Vimi11
表3:OpenCompass多模态大模型评测月度榜单(截止2024年6月26日)5
2024年7月4日~7月7日,2024世界人工智能大会(WAIC2024)举办。本次大会
重点围绕AI核心技术、智能终端、应用赋能三大板块,聚焦大模型、算力、机器人、自动
驾驶等领域,集中展示了一批“人工智能+”创新应用成果。在大模型及行业应用领域方面,
此次包含金山办公、科大讯飞在内的多家上市公司,以及百川智能、智谱AI等厂商均展示
了生成式AI领域的最新成果。我们认为随着底层通用模型的持续迭代,以及各厂商在细分
金山办公政务办公模型1.0WPSAI2.0快手快意大模型系列可灵、可图等
科大讯飞星火大模型4.0企业智能体、讯飞晓医等摩尔线程——全栈AI产品和万卡集群解决方案
商汤日日新5.5商汤绝影、Vimi云知声山海大模型医疗、交通、智能座舱等应用
汉王科技天地大模型古汉语、办公、能源等行业应用合合信息——AI文档解析引擎
华为云盘古大模型能源、办公、金融等行业应用阶跃星辰Step系列大模型跃问、冒泡鸭等
腾讯混元大模型腾讯元宝、腾讯云境等蜜度蜜巢政务大模型3.0政务热线综合智能平台
出门问问UCLAI大模型序列猴子、魔音工坊等面壁智能CPM大模型大模型工具集MobileCPM
星环科技无涯大模型无涯问知、·AIInfra工具集等澜舟科技孟子大模型澜舟智库、澜舟智会等
软通动力天璇行业大模型天坊工业互联AI平台等MiniMaxabab系列模型海螺AI、Glow等
云天励飞天书大模型“深目”AI模盒等端侧应用联汇科技OmDet大模型多模态智能体OmAgent
资料来源:中新网、东方财富、飞象网、金融界、新浪财经、网易新闻,浙商证券研究所
近期OpenAI宣布终止对中国提供服务,有望加速国产AI生态构建。6月25日凌晨,
多个用户收到OpenAI通知,自今年7月9日起,OpenAI将开始阻止来自非支持国家和地
区的API(应用程序接口)服务。目前OpenAI共支持161个国家和地区,不包括中国内地
和中国香港。OpenAI向中国API用户表示,将采取措施,以阻止来自不再支持的国家和地
国产大模型性能持续提升,多模态能力不断迭代下有望加速渗透各类应用场景。根据
OpenCompass2.0大语言模型月度榜单(2024年5月)数据,目前国内外大语言模型在综合
千问Max、智谱GLM-4等模型均进入榜单前十名,在大语言模型能力方面国内厂商正在不
明显,但是根据OpenCompass的月度测评榜单,近期国产大模型多模态能力持续提升,目
前国内云从科技、智谱AI、阶跃星辰等厂商的多模态大模型也已进入前十序列,国产多模
结合本次WAIC各参展厂商的大模型及商业化产品,以及国产底层大模型能力的持续
迭代,我们认为未来国产AI+行业应用有望加速迎来“百花齐放”局面,商业空间有望加
2024年6月27日,科大讯飞正式发布基于全国产算力平台训练的星火大模型V4.0。
星火V4.0大模型在文本生成、语言理解、知识问答等领域核心能力实现全面升级,除代码
星火V4.0模型多模态能力显著提升。在复杂版面的全要素解析、融合篇章语义的文字
识别、专业领域的符号识别等能力上,星火大模型V4.0表现持续升级并且在测评中超过5
图1:讯飞星火V4.0模型核心能力对标GPT-4Turbo图2:星火V4.0模型多模态能力显著提升
资料来源:公司官方微信号,浙商证券研究所资料来源:公司官方微信号,浙商证券研究所
星火4.0赋能行业大模型加速迭代,医疗、教育垂类模型能力再次升级。随着讯飞星火
4.0大模型的发布,星火医疗大模型也再次升级,目前在医学相关的知识问答、复杂的语义
理解、专业文书生成,还是诊断治疗以及多轮对话的各项指标上,已实现对最新的GPT-4
Turbo模型的超越;而在教育领域,星火大模型面向教育复杂场景的图文识别效果进一步提
图3:星火医疗大模型各项指标优于GPT-4Turbo图4:星火4.0大模型教育场景能力对标GPT-4o
资料来源:公司官方微信号,浙商证券研究所资料来源:公司官方微信号,浙商证券研究所
讯飞发布智能体平台,赋能企业构建岗位专属助手。科大讯飞发布的星火企业智能平台,
并推出了首批32个企业从生产、科研、办公到管理中特别需要的相关智能体,如商机、销
售、客服、科技情报以及编程等。讯飞星火的代码智能体可在代码生成、架构设计、问答、
测试、数据库优化以及审核6个场景上赋能企业用户。代码在科大讯飞内部的采纳率从去年
10月份的30%,增长至目前的52%,单元测试行覆盖率从30%提到50%。
图:大模型赋能企业“人工智能”行动的两种方式图:星火赋能企业打造专属大模型
资料来源:公司官方微信号,浙商证券研究所资料来源:公司官方微信号,浙商证券研究所
AI大模型医疗、教育领域垂类应用加速渗透。在医疗领域,公司于去年10月推出的个
人健康助手讯飞晓医APP现在已经累计1200万次,用户好评率达98.8%。目前讯飞晓
医APP可以帮助用户自主诊断1600种常见疾病,可识别2800种以上的常见药品,理解26
万个药品相互作用,并且能够理解和分析6000种以上常见的检验。目前讯飞晓医APP
可实现将个性化的电子病历检查以及过去问诊情况,在个人健康空间保存,在看病、用
资料来源:公司官方微信号,浙商证券研究所资料来源:公司官方微信号,浙商证券研究所
在教育领域,星火渗透至教师批改阅卷场景,AI+教育产品应用矩阵进一步完善。伴随
着星火大模型V4.0的发布,公司推出了星火智能批阅机的软硬件一体化解决方案,可进行
自动批改,并通过批改自动分析全班学习情况,给出分析。根据公司给出的数据,星火智能
批阅机可将原来90分钟的作业批改时间缩短至5分钟,60分钟的学情统计时间可以缩短至
2024年6月21日,在华为开发者大会2024(HDC2024)上,华为正式发布盘古大模
型5.0版本。盘古大模型5.0系列在全系列、多模态、强思维三个方面进行了全面升级,标
志着华为云在人工智能领域再次迈出了坚实的步伐。在模型全系列方面,盘古大模型5.0包
括十亿级、百亿级、千亿级、万亿级等不同参数规模,提供盘古自然语言大模型、多模态
(3)盘古U系列:有1350亿参数和2300亿参数两种,适用于处理复杂任务,可以成
(4)盘古S系列:万亿级参数,可以处理跨领域多任务,够能帮助企业更好地在全场
华为云发布具身智能大模型,推动人形机器人技术再升级。华为云在HDC2024上正式
推出了盘古具身智能大模型,会上搭载盘古能力的人形机器人也同步亮相。盘古大模型能够
让机器人完成10步以上的复杂任务规划,并且在任务执行中实现多场景泛化和多任务处理。
同时盘古大模型还能生成机器人需要的训练视频,让机器人更快地学习各种复杂场景。
大模型的多模态能力以及思维能力的快速提升,使机器人能够模拟人类常识进行逻辑推
理,并在现实环境中高效精准地执行任务,从而有效解决了复杂环境感知与物理空间认知的
难题。通过集成多场景泛化和多任务处理能力,盘古大模型有望赋予机器人适应性和灵活性,
在盘古大模型5.0加持下,华为推出了全新的小艺助手并且更加智能化,更加流畅,同
时也变得更加地人性化。华为小艺能够根据外面的天气情况制定用户的个人出行方式,而且
能通过不断地学习,变得更加适合用户使用习惯。除此之外,华为云盘古大模型过去一年中,
已在30多个行业、400多个场景中落地,覆盖到政务、金融、制造、医药研发、煤矿、钢
盘古大模型5.0亮相WAIC2024,持续重塑千行万业。在自动驾驶领域,盘古大模型
5.0通过创新的可控时空生成技术,结合场景视频生成、4DBEV视频生成、自动驾驶仿真
库及路网信息,能更好地理解物理规律,大规模生成和实际场景相一致的驾驶视频数据,还
可以灵活增加控制条件,生成不同路况、不同光照、不同天气的训练视频数据,加速自动驾
在钢铁领域,盘古大模型能够对热轧生产线的最优参数进行预测。在切换钢板生产规格
时,操作工人往往需要对模型参数进行调整优化,盘古大模型可实现此过程耗时由一周时间
缩短至仅4小时,提效显著。在实际生产中,在上海宝武钢铁热轧生产线中,基于盘古大模
型,精轧宽展预测精度较传统模型提高5%以上,钢板成材率提升0.5%,预计每年可以多产
钢板2万余吨,年收益达9000余万元。未来盘古大模型还将应用于高炉场景,对炉温、铁
在铁路领域,高铁巡检机器人搭载盘古大模型后,可精准识别动车零部件的变形、异物、
松动、丢失等3.2万个故障检测项点,覆盖8大类、350多种复杂故障,不仅提升高铁运营
在媒体内容生产和应用领域,盘古大模型能够将实拍视频快速转换成特定风格的动漫,
并保持角色样貌特征前后一致,舞蹈、武打等大运动轨迹也能确保合理一致的视觉效果,制
作周期从月级缩短到天级,大大提升制作效率,作品一次拍摄多元化制作,实现价值最大化。
商汤于WAIC2024发布“日日新5o”模型,交互体验对标GPT-4o,有望实现全新AI
交互模式。商汤通过整合跨模态信息,基于声音、文本、图像和视频等多种形式,国内首个
所见即所得模型“日日新5o”带来一种全新的AI交互模式,即实时的流式多模态交互。
商汤底层通用基础大模型迭代至“日日新5.5”,基础大模型综合性能较“日日新5.0”
平均提升30%,在数学推理、英文能力和指令跟随等能力明显增强,交互效果和多项核心
指标实现对标GPT-4o。“日日新5.5”采用混合端云协同专家架构,最大限度发挥云边端协
同,降低推理成本,模型训练基于超过10TBtokens高质量训练数据,包括大量合成的思维
商汤加速推进B端用户生态构建。为了让更多企业用户低门槛接入并使用“日日新”
大模型体系的强大能力,商汤于近期推出了“大模型0元Go”计划。凡是“日日新”的新注
册用户,都可获得涉及调用、迁徙、训练等多项免费服务大礼包。同时,商汤还将免费赠送
5000万Tokens包,并且派出专属搬家顾问,帮助OpenAI用户实现零服务成本迁移。
公司推出首个面向C端用户的可控人物视频生成大模型Vimi。Vimi基于商汤日日新大
模型的能力,仅通过一张任意风格的照片就能生成和目标动作一致的人物类视频,并支持多
据商汤介绍,与图片表情控制类技术只能控制头部表情动作不同,Vimi不但可以实现
精准的人物表情控制,还可实现在半身区域内控制照片中人物的自然肢体变化,并自动生成
与人物相符的头发、服饰及背景九游娱乐 中国官方网站变化。同时光影变化也能做到合理生成,让人物动作和视觉
效果流畅自然,画面和谐唯美。更重要的是,Vimi具备极强的稳定性,可稳定生成长达1
分钟的单镜头人物类视频,画面效果不会随着时间的变化而劣化或失真,真正满足娱乐互动
本届WAIC大会上,商汤发布基于全新发布的商汤“日日新5.5”原生多模态大模型打
造的智能驾驶和智能座舱产品。商汤绝影展示了可解释、可交互的自动驾驶大模型DriveAGI,
同时还发布了行业首个车载生成式交互界面“随心界面”(FlexInterface)、“随意操控”
在本届WAIC上,商汤绝影在行业率先实现原生多模态大模型的车端部署,并对外展
示了在3个不同算力平台上运行2.1B或8B端侧多模态大模型的适配能力。商汤绝影车载
端侧8B多模态模型可以实现首包延迟低至300毫秒以内,推理速度达到40Tokens/秒。而商
汤绝影自研的首个应用于驾驶决策规划的智驾大模型——DriveAGI,增强了端到端系统的可
解释性,不仅让车辆能够更像人一样理解复杂的现实世界,洞察各类交通参与者的行为动机,
快速学习各种交通规则,掌握瞬息万变的道路信息,还能向用户解释驾驶决策的推理过程。
目前,商汤绝影DriveAGI智驾大模型能在无限宽标识的道路上,安全顺利穿过两个石
墩形成的狭窄通道;它还能准确辨识并理解包括公交车道、潮汐车道及施工车道等各类交通
标识,并自主进行变道或规避,甚至当后方有救护车接近时,DriveAGI会进行思考推理,
图:商汤绝影在行业率先实现原生多模态大模型的车端部署图:商汤绝影车载端侧多模态模型性能行业领先
在本届WAIC上,商汤绝影正式发布行业首个生成式交互界面产品“随心界面”
彻底改变用户与车载系统的交互方式。FlexInterface在大模型解析用户需求的基础上,结合
设计系统的框架和范式,实现高度动态和个性化的界面生成。无论是天气、时间、节日、纪
念日,还是周围环境变化,FlexInterface均能自动变换界面风格,提供最佳用户体验。
AgentFlow通过大模型的推理能力,模拟人类点击操作,实现对APP和网站的直接操
作。用户只需使用自然语言,就能让AI自主选择多个工具完成复杂任务,无需主机厂进行
额外的研发适配。这种能力不仅提升了操作的便捷性,还极大地扩展了车载系统的功能范围。
在现场演示中,用户通过FlexInterface生成了一个“欧洲杯”风格的主题,大模型自动生成
具备欧洲杯元素的中控屏幕桌面和图标,同时,用户还能通过AgentFlow随时播放欧洲杯或
本次WAIC2024上,阶跃星辰发布三款Step系列通用大模型产品,分别是Step-2万
亿参数语言大模型正式版、Step-1.5V多模态大模型、Step-1X图像生成大模型。公司最新
发布的Step-2万亿参数语言大模型正式版,采用了创新的MoE混合专家模型架构。同时,
基于阶跃星辰行业领先的系统能力,Step-2大幅提升了训练效率,在数学、逻辑、编程、知
识、创作、多轮对话等方面体感全面逼近GPT-4,企业和开发者可以通过阶跃星辰开放平台
新升级的Step-1.5V千亿参数多模态大模型,在图像感知和理解能力上全面提升,并具
备出色的视频理解能力。模型能准确地识别视频中的物体、人物和环境,并理解视频的整体
保险行业推进高质量普惠保险体系建设,为社会稳定与经济发展保驾护航.
低利率下的资产配置系列八:存款从“搬家”到“回家”,居民配置什么资产?.
白酒行业24Q2业绩前瞻%262024半年度策略:Q2控速不改全年,穿越周期谋划长远.
2023-2024年知识考核草坪园艺师二级真题与答案(答案在末尾).
(正式版)D-L∕T 996-2019 火力发电厂汽轮机控制系统技术条件.
原创力文档创建于2008年,本站为文档C2C交易模式,即用户上传的文档直接分享给其他用户(可、阅读),本站只是中间服务平台,本站所有文档所得的收益归上传人所有。原创力文档是网络服务平台方,若您的权利被侵害,请发链接和相关诉求至 电线) ,上传者