开栏的话
上海正在加快向具有全球影响力的科技创新中心进军。
提升关键核心技术竞争力、打造产业高质量发展新动能是强化科创策源功能的题中应有之义,可以为上海建设具有全球影响力的科创中心提供强大引擎。
即日起,在上海市科委指导下,本报推出“科技元实力·创新源动力”主题宣传活动,围绕区块链、Web3.0、数据技术、人工智能等重点方向,全景展现上海汇聚要素的向心磁场和产业应用的广阔空间,进一步激发内生动力,为上海推进具有全球影响力的科创中心建设书写生动注脚。
以“科技,创造可持续未来”为主题,第二届外滩大会将于9月7日至9日,在上海世博园召开。外滩大会是上海金融科技创新的新名片,也是观察上海以及全球科技创新的重要窗口。
外滩大会组委会表示,本届大会包括人工智能与大模型、创新产业实践、人文特色、数据技术、展会与集市五大亮点,设1场主论坛、36场见解论坛、8000平方米科技展区、3000平方米绿色集市和“明日之城”数字空间展区。一场科技盛宴即将来袭。
以“科技,创造可持续未来”为主题的2023inclusion外滩大会即将在上海召开,届时将重点关注大模型技术在产业的落地和数据技术的未来探索。上海知名AI企业达观数据在今年发布国产“曹植”大语言模型,并将在外滩大会的科技人才招聘会上开放多个科技人才岗位的招募。达观数据董事长兼CEO陈运文表示:“大模型应用将走向垂直化发展,高质量的数据也会成为最核心的竞争力。”
扎根智能文本分析的垂直赛道
“作为建安七子之一,曹植不仅能七步成诗,还写下了《洛神赋》,这是我国古代文学作品中的经典长文。”7月7日,曹植大模型发布会上,陈运文坦言,曹植大模型的特长就是文档资料智能化的分析和写作。
目前,国内正面临着“百模大战”,有数据显示,全国有至少130家公司研究大模型产品,其中做通用大模型的有78家,做垂直大模型的有52家,而曹植大模型是国内首个垂直行业专用的自主可控的GPT大语言模型,从诞生之日起立足于垂直领域,借助公司在自然语言处理(NLP)、光学字符识别(OCR)、机器人流程自动化(RPA)、知识图谱等技术优势,可完成多类型、复杂结构的长文本写作,自动起草多种类型的文档,未来将实现多模态内容生成,如长文档中的表格、图表、图片等。
由于选择了“长文本”赛道的应用落地,曹植大模型的呈现形式不是一问一答的简单短文本生成,而是完成复杂结构的长文本写作,自动起草多种类型的文档,同时具有自动排版、智能纠错、文本润色、自动生成摘要等特色功能,还支持数十种语言的写作和实时翻译。
这也是国内大规模语言模型中首批可落地的产业应用级模型,目前已在金融领域AIGC多场景投入应用。基于“曹植”系统,曹植大模型进一步夯实了达观数据产业应用智能化基座,全面增强AI全产品矩阵能力。
达观数据还敏锐地观察到大模型落地过程中的“痛点”。“一些企业在部署大模型的时候,不仅需要专门的技术人员调试,还会担心数据的保密性,同时还无法买到合适足量的GPU芯片。” 陈运文表示,达观数据推出的私有化曹植大模型一体机,不仅内置曹植大模型,支持三方开源模型库,可在企业内部一键部署大模型应用,能同时为多种垂直大模型业务提供服务。此外,大模型一体机还提供了英伟达A100、华为昇腾、燧原云燧等国内外主流GPU,从芯片、操作系统、AI软件平台、算法、数据等多维度满足大模型应用需求。
高质量数据是大模型训练的关键
当前,大模型正进入高速发展期。近几日,国内首批大模型正式获批面向用户开放,OpenAI也宣布提供ChatGPT企业版,争取更多商用市场。但是大模型在落地应用中仍然面临不小的瓶颈。
陈运文表示,大语言模型虽然有非常强大的语言理解能力,但会产生“幻觉”,偏好“一本正经地胡说八道”。“一旦真实性和准确性不足,模型就无法保证回复结果的真实性,从而给出错误的结果。”他指出,在专业领域,所有数据都必须非常严谨准确,大模型必须解决这一矛盾。
同时,大模型的偏好性也会带来合规性的难题。陈运文表示,大模型训练文本选择如果有偏向性,经过训练的大模型也会产生不同的“三观”,给出带有偏向性的结论。据了解,曹植大模型采用混合训练数据的方案,即包括50%高质量的各行各业混合语料和50%垂直专用语料,能兼容大模型的通用基座能力和垂直行业的专业能力。
“在大模型的文本训练中,论文、报告、新闻、书籍等各类文档资料是主要的训练数据。”陈运文认为,高质量的数据将会成为最核心的竞争力。
无论是数据获取还是模型训练,人才都会成为高质量大模型发展的主要竞争力。“我们很期待能在外滩大会的科创人才招聘会上寻觅到优质的数据技术人才。”陈运文表示,达观数据作为中国智能文本处理领军企业,也将参加本届外滩大会的科技人才招聘会,届时将开放多个科技人才岗位的招募,包括自然语言处理、文本智能处理以及目前大热的大模型领域等相关技术与研发人才。