IT之家 10 月 26 日消息,据“鹅厂技术派”消息,腾讯混元大模型近日迎来全新升级,并正式对外开放“文生图”功能。官方宣称,升级后的腾讯混元中文效果整体超过 GPT3.5,代码能力大幅提升 20%,达到业界领先水平。
据介绍,大模型文生图的难点体现在对提示词的语义理解,生成内容的合理性以及生成图片的效果,针对这三个技术难点,腾讯进行了专项的技术研究,提出了一系列原创算法:
在语义理解方面,腾讯混元采用了中英文双语细粒度的模型,模型同时建模中英文实现双语理解,而不是通过翻译,通过优化算法提升了模型对细节的感知能力与生成效果,有效避免多文化差异下的理解错误。
在内容合理性方面,AI 生成人体结构和手部经常容易变形。混元文生图通过增强算法模型的图像二维空间位置感知能力,并将人体骨架和人手结构等先验信息引入到生成过程中,让生成的图像结构更合理,减少错误率。
在画面质感方面,混元文生图基于多模型融合的方法,提升生成质感。经过模型算法的优化之后,混元文生图的人像模型,包含发丝、皱纹等细节的效果提升了 30%,场景模型,包含草木、波纹等细节的效果提升了 25%。
如果用户想生成一张更接近真人感的照片,或接近实拍的图片,可以加上“真实感”或“摄影风”等描述;如果用户想要特定风格的图片,建议在提示词中加入该风格的描述,如油画风、赛博朋克风等。此外,用户还可以对画面进行尽可能详细地描述,以获得满意的效果。
据介绍,腾讯内部目前已经有多个开发平台接入了腾讯混元大模型,已有超过 180 个内部业务接入混元,包括腾讯会议、腾讯文档、企业微信、腾讯广告和微信搜一搜等。
近日,有IT之家网友反馈已经通过混元大模型内测审核,并分享了相关操作页面。从截图中可以看到,混元大模型支持制定面试大纲、旅行计划、PPT 大纲、健身计划等功能,分为工作、编程、营销、生活等选项。
此外,混元大模型还支持 AI 对话功能,已经通过的内测申请的用户可以尝鲜一下。
IT之家附更多生成图:
广告声明:文内含有的对外跳转链接(包括不限于超链接、二维码、口令等形式),用于传递更多信息,节省甄选时间,结果仅供参考,IT之家所有文章均包含本声明。