一张图 + 一句话实现任意角色场景姿势，腾讯混元宣布开源定制化图像生成插件 InstantCharacter

IT之家 04月18日 19:38

../../../zaker_core/zaker_tpl_static/wap/tpl_guoji1.html

腾讯混元发布了开源定制化图像生成插件InstantCharacter，该插件兼容开源文生图模型Flux。通过输入图片和文字描述，用户可以控制角色在不同场景中的姿态和位置。InstantCharacter在角色一致性、图像质量和精度上表现出色，能够处理多种风格和复杂度的图像，适用于连环画、影片创作等领域。该技术基于DiT模型构建，并引入可扩展的适配器，结合千万级样本的大规模角色数据集，实现了身份一致性和文本可编辑性的优化，效果媲美GPT 4o等模型。

🖼️ InstantCharacter通过输入原始图片和文字描述（prompt），可以让任何角色以用户想要的姿势出现在任何地方，实现角色在不同场景中的一致性与真实性。

✨ 该插件在角色一致性和图像生成的精确度上超越了现有技术，能够处理多种风格和复杂度的图像，适用于连环画、影片创作等场景。

💡 InstantCharacter基于DiT模型构建，引入可扩展的适配器，采用多个transformer encoder，有效处理开放域的角色特征，并与现代扩散变换器的潜在空间无缝交互。

📚 为了有效训练框架，腾讯混元团队构建了一个包含千万级样本的大规模角色数据集，数据集被系统地组织为成对（多视角角色）和非成对（文本-图像组合）子集，优化了身份一致性和文本可编辑性。

IT之家 4 月 18 日消息，腾讯混元今日宣布开源定制化图像生成插件 InstantCharacter，并实现了对开源文生图模型 Flux 的兼容。

腾讯官方介绍称，通过这个插件，在大模型中，只需要一张图加一句话，就可以让任何角色以你想要的姿势出现在任何地方。

输入原始图片
+ prompt ：a rabbit is in the kitchen holding a spoon and drinking soup
就能得到下面的图：
+prompt：a rabbit in the city,cyberpunk
就可以得到：

角色一致性是多轮文生图场景中的一大难题。InstantCharacter 的优势在于可以确保角色在不同场景中的一致性和真实性、画质和精度高，同时具有灵活的文本编辑性，用户可以根据需要灵活切换任意场景，让人物生成任意动作。

其在角色一致性和图像生成的精确度上号称超过了此前业界的相关技术，能够处理多种风格和复杂度的图像。

通过这个插件，内容创作者可以让生成的角色保持高度一致，能够更高效地创作出符合其需求的视觉作品，可以用于连环画、影片创作等场景。

实际的测评中，开源的 InstantCharacter 实现的效果媲美 GPT 4o 等模型。

从技术上看，现有基于学习的方法主要依赖于 U-Net 架构，但在泛化能力和图像质量上存在局限性，而基于优化的方法则需要针对特定主体进行微调，这不可避免地降低了文本可控性。

为了解决这些挑战，InstantCharacter 利用 DiT 模型构建了一个创新的框架。框架引入了一个可扩展的适配器（adapter），采用多个 transformer encoder，能够有效处理开放域的角色特征，并与现代扩散变换器的潜在空间无缝交互。这种设计使得系统能够灵活适应不同的角色特征。

同时，为了有效训练框架，腾讯混元团队还构建了一个包含千万级样本的大规模角色数据集。数据集被系统地组织为成对（多视角角色）和非成对（文本-图像组合）子集。这种双数据结构使得身份一致性和文本可编辑性能够通过不同的学习路径同时优化。

代码：https://github.com/Tencent/InstantCharacter

Hugging Face Demo：https://huggingface.co/spaces/InstantX/InstantCharacter

论文：https://arxiv.org/abs/2504.12395

Fish AI Reader

FishAI

联系邮箱 441953276@qq.com

相关标签