21世纪经济报道记者白杨 北京报道
10月26日,腾讯宣布混元大模型迎来升级,将正式对外开放“文生图”功能。腾讯表示,升级后的腾讯混元中文能力已整体超过GPT3.5。
今年9月,腾讯混元大模型正式亮相。根据当时披露的信息,腾讯混元大模型是由腾讯全链路自研的通用大语言模型,拥有超千亿参数规模,预训练语料超2万亿tokens。而在此次升级后,腾讯混元大模型加入了对图像的处理能力,也意味着模态进一步丰富。
文生图是AIGC领域的核心技术之一,也是体现通用大模型能力的试金石,对模型算法、训练平台、算力设施都有较高的要求。
据悉,大模型文生图的难点体现在对提示词的语义理解、生成内容的合理性以及生成图片的效果。针对这三个技术难点,腾讯通过专项技术研究,提出了一系列原创算法,来保证生成图片的可用性和画质。
比如在语义理解方面,腾讯混元采用了中英文双语细粒度的模型,并通过优化算法提升了模型对细节的感知能力与生成效果,有效避免多文化差异下的理解错误。
在内容合理性方面,AI生成人体结构和手部经常容易变形。混元文生图则通过增强算法模型的图像二维空间位置感知能力,将人体骨架和人手结构等先验信息引入到生成过程中,让生成的图像结构更合理,减少错误率。
而在画面质感方面,混元文生图则基于多模型融合的方法,提升生成质感。数据显示,经过模型算法的优化之后,混元文生图的人像模型,包含发丝、皱纹等细节的效果提升了30%,场景模型,包含草木、波纹等细节的效果提升了25%。
目前,腾讯混元文生图能力已经被用于素材创作、商品合成、游戏出图等多项业务中。此外,在广告业务下的多轮测评中,腾讯混元文生图的案例优秀率和广告主采纳率分别达到86%和26%。
除了文生图能力,这次升级中腾讯混元大模型的代码和数学能力也得到提升。腾讯方面表示,经过对32种主流语言代码文件、各类计算机书籍和博客的学习增训,腾讯混元代码处理水平提升超过20%。
现在,腾讯内部有多个开发平台接入了腾讯混元大模型,工程师们已经在使用腾讯混元来进行代码生成、代码补全、代码漏洞检测和修复、表格数据处理、数据库查询等工作。
实际上,自腾讯混元大模型亮相之后,腾讯也在积极推动其在公司内部及外部的落地。官方数据显示,截至目前,有超过180个腾讯内部业务已接入腾讯混元,包括腾讯会议、腾讯文档、企业微信、腾讯广告和微信搜一搜等。
在外部,则有来自零售、教育、金融、医疗、传媒、交通、政务等多个行业的客户,通过腾讯云调用腾讯混元大模型API,应用领域涉及智能问答、内容创作、数据分析、代码助手等多个场景。
腾讯表示,大模型多模态交互能力是通往通用人工智能的必由之路,也是不断扩充大模型能力象限的一个重要方向。现在,腾讯混元大模型正在不断强化图片、视频、音频等各类模态的处理能力,相关成果也将很快面向外界推出。
更多内容请下载21财经APP