一张图 + 一句话实现任意角色场景姿势，腾讯混元宣布开源定制化图像生成插件 InstantCharacter

2025/4/18 19:26:20 来源：IT之家作者：汪淼责编：汪淼

评论：

感谢IT之家网友 Alive1 的线索投递！

IT之家 4 月 18 日消息，腾讯混元今日宣布开源定制化图像生成插件 InstantCharacter，并实现了对开源文生图模型 Flux 的兼容。

腾讯官方介绍称，通过这个插件，在大模型中，只需要一张图加一句话，就可以让任何角色以你想要的姿势出现在任何地方。

输入原始图片
+ prompt ：a rabbit is in the kitchen holding a spoon and drinking soup
就能得到下面的图：
+prompt：a rabbit in the city,cyberpunk
就可以得到：

角色一致性是多轮文生图场景中的一大难题。InstantCharacter 的优势在于可以确保角色在不同场景中的一致性和真实性、画质和精度高，同时具有灵活的文本编辑性，用户可以根据需要灵活切换任意场景，让人物生成任意动作。

其在角色一致性和图像生成的精确度上号称超过了此前业界的相关技术，能够处理多种风格和复杂度的图像。

通过这个插件，内容创作者可以让生成的角色保持高度一致，能够更高效地创作出符合其需求的视觉作品，可以用于连环画、影片创作等场景。

实际的测评中，开源的 InstantCharacter 实现的效果媲美 GPT 4o 等模型。

从技术上看，现有基于学习的方法主要依赖于 U-Net 架构，但在泛化能力和图像质量上存在局限性，而基于优化的方法则需要针对特定主体进行微调，这不可避免地降低了文本可控性。

为了解决这些挑战，InstantCharacter 利用 DiT 模型构建了一个创新的框架。框架引入了一个可扩展的适配器（adapter），采用多个 transformer encoder，能够有效处理开放域的角色特征，并与现代扩散变换器的潜在空间无缝交互。这种设计使得系统能够灵活适应不同的角色特征。

同时，为了有效训练框架，腾讯混元团队还构建了一个包含千万级样本的大规模角色数据集。数据集被系统地组织为成对（多视角角色）和非成对（文本-图像组合）子集。这种双数据结构使得身份一致性和文本可编辑性能够通过不同的学习路径同时优化。

IT之家附项目相关链接：

项目官网：https://instantcharacter.github.io/
代码：https://github.com/Tencent/InstantCharacter
Hugging Face Demo：https://huggingface.co/spaces/InstantX/InstantCharacter
论文：https://arxiv.org/abs/2504.12395

广告声明：文内含有的对外跳转链接（包括不限于超链接、二维码、口令等形式），用于传递更多信息，节省甄选时间，结果仅供参考，IT之家所有文章均包含本声明。

下载IT之家APP，签到赚金币兑豪礼

一张图 + 一句话实现任意角色场景姿势，腾讯混元宣布开源定制化图像生成插件 InstantCharacter

相关文章