腾讯混元大模型接入180个内部业务，正式开放“文生图”功能

2023-10-27 17:25:00发布来源：多知网作者：Penny

　　多知网10月27日消息，腾讯混元大模型10月26日全新升级，正式对外开放“文生图”功能。腾讯表示，升级后的腾讯混元中文效果整体超过GPT3.5，代码能力大幅提升20%。

　　相比其他大模型，腾讯混元的文生图应用着力于人像真实感、场景真实感，同时，在中国风景、动漫游戏等场景等生成上有优势。

　　腾讯数据显示，腾讯混元文生图能力，目前已经被用于素材创作，商品合成，游戏出图等多项业务中，此外在广告业务下的多轮测评中，腾讯混元文生图的案例优秀率和广告主采纳率分别达到86%和26%。

　　过去一个月，腾讯混元大模型不仅各项能力均有升级，代码、数学能力也大幅提升。

　　经过对32种主流语言代码文件、各类计算机书籍和博客的学习增训，腾讯混元代码处理水平提升超过20%，代码处理效果胜出ChatGPT 6.34%，在HumanEval公开测试集指标上全面超过Starcoder、Codellama等业界头部开源代码大模型。

　　只需输入简单的指令如“帮我用前端语言实现一个贪吃蛇”，腾讯混元便能自动生成可运行的代码，快速制作出一个贪吃蛇小游戏。此外，腾讯混元还支持Python、C++、Java、Javascript等多种语言的指令生成，比如输入“用Python画红色的心形线”，腾讯混元会提供代码库选择、安装命令、绘制代码等具体操作步骤的指引。

　　腾讯内部目前已经有多个开发平台接入了腾讯混元大模型，工程师们可以使用腾讯混元来进行代码生成、代码补全、代码漏洞检测和修复、表格数据处理、数据库查询等工作。

　　比如，在IDE编程场景中，腾讯工蜂Copilot通过接入混元大模型，可根据注释生成对应代码，或基于上下文智能补全代码，提高了编程效率。混元大模型还可以帮助用户进行代码漏洞检测和修复，保障软件开发过程中的安全性。

　　目前，超过180个腾讯内部业务已接入腾讯混元，包括腾讯会议、腾讯文档、企业微信、腾讯广告和微信搜一搜等。服务公司外部零售、教育、金融、医疗、传媒、交通、政务等多个行业客户。

　　据腾讯介绍，大模型文生图的难点体现在对提示词的语义理解，生成内容的合理性以及生成图片的效果，针对这三个技术难点，腾讯进行了专项的技术研究，提出了一系列原创算法，来保证生成图片的可用性和画质。

　　1、在语义理解方面，腾讯混元采用了中英文双语细粒度的模型，模型同时建模中英文实现双语理解，而不是通过翻译，通过优化算法提升了模型对细节的感知能力与生成效果，有效避免多文化差异下的理解错误。

　　2、在内容合理性方面，AI生成人体结构和手部经常容易变形。混元文生图通过增强算法模型的图像二维空间位置感知能力，并讲人体骨架和人手结构等先验信息引入到生成过程中，让生成的图像结构更合理，减少错误率。

　　3、在画面质感方面，混元文生图基于多模型融合的方法，提升生成质感。经过模型算法的优化之后，混元文生图的人像模型，包含发丝、皱纹等细节的效果提升了30%，场景模型，包含草木、波纹等细节的效果提升了25%。

　　在图像生成上，腾讯还给出了prompt，比如你想生成一张更接近真人感的照片，或接近实拍的图片。请使用“生成一张XX的图片”或者“生成一张XX的照片”，并加上“真实感”或“摄影风”等描述效果会更好。

　　如果想要特定风格的图片，建议在提示词中加入该风格的描述，如油画风、赛博朋克风、水墨画风格、像素风、日漫动画风、儿童画等，或者使用灵感发现中的特定风格，这样会更接近需求。

　　如果想要的画面进行尽可能详细的描述，并建议多次调整你的提示词，比如“生成一副照片：亚洲女子，魅力，长发，戴墨镜，站在长城上，背景有红叶”、“画一幅亚洲女生的画，黑色与绿色相间的中短发，卡通人像，迪士尼风，民俗肖像，宁静脸孔”。

　　腾讯混元生成图片的部分案例：

　　1)真实感人像

　　生成可爱的亚洲 4 岁女孩穿着棉质连衣裙，大眼睛，古代中国，摄影风格，汉服

　　2)平面场景

　　画一幅画：小企鹅在树下行走，突然一个苹果从树上掉下

　　03)3D氛围感场景

　　生成一张赛博朋克风格的图片：一只立体的猫穿着赛博朋克风的衣服，周围是灯红酒绿的城市场景，潮湿的地面上反映了城市的倒影

　　04)古诗词

　　帮我生成一张图片：空山新雨后，天气晚来秋，水墨风格

商学院

Open Talk

腾讯混元大模型接入180个内部业务，正式开放“文生图”功能

相关阅读