新闻详情

新闻详情

首页 / 资讯中心 / 详情

(论文速读)HIFI-INPAINT:基于参考的高保真修复以生成保持细节的人类产品图像

发布时间:2026/9/29 3:08:18来源:尧图网络
(论文速读)HIFI-INPAINT:基于参考的高保真修复以生成保持细节的人类产品图像
论文题目HiFi-Inpaint: Towards High-Fidelity Reference-Based Inpainting for Generating Detail-Preserving Human-Product Images基于参考的高保真修复以生成保持细节的人类产品图像会议CVPR 2026 -ByteDance摘要人的产品形象展示了人与产品的融合在广告、电子商务和数字营销中发挥着至关重要的作用。生成此类图像的根本挑战在于确保产品细节的高保真保存。在现有的范例中基于参考的修复通过利用产品参考图像来指导修复过程提供了一种有针对性的解决方案。然而局限性仍然存在于三个关键方面缺乏多样化的大规模培训数据当前模型难以专注于产品细节保存以及无法进行粗略监督以实现精确指导。为了解决这些问题我们提出了一种新的基于参考的高保真修复框架HiFi-InPaint该框架专为生成人类产品图像而定制。HIFI-INPaint引入了共享增强注意力(SEA)来改进细粒度的产品功能和细节感知丢失(DAL)以使用高频地图实施精确的像素级监控。此外我们还构建了一个新的数据集HP-Image-40K其样本来自自合成数据并经过自动过滤处理。实验结果表明HiFi-Inaint达到了最先进的性能提供了保持细节的人类产品图像。Project Page: https://correr-zhou.github.io/HiFi-InpaintHiFi-Inpaint面向高保真人物-产品图像生成的参考图像修复框架一、研究背景与问题动机在广告、电商、数字营销领域人物-产品图像Human-Product Images——即展示人物与产品融合场景的图像——有着极其广泛的应用需求。手工拍摄和制作此类图像成本高昂利用生成模型自动生成高质量人物-产品图像既能大幅降低人工成本又能提升规模化部署的一致性。然而这一任务的核心挑战在于如何高保真地保留产品的细粒度细节包括产品的形状、颜色、纹理、图案以及瓶身上的品牌文字、Logo、标签等关键信息。即便是细微的不准确也会动摇消费者的信任削弱商业传播效果。 此处配Figure 1HiFi-Inpaint 生成效果展示图左列为产品参考图右列为生成的人物-产品图现有方法的三大局限现有的图像生成和编辑范式在此任务上均存在明显不足主要体现在以下三个层面局限一缺乏大规模多样化训练数据收集真实世界的人物-产品图像对既耗时又费力现有工作缺乏足够多样化的训练数据严重制约了模型的泛化能力。局限二现有模型难以聚焦产品细节保留图像定制方法如 DreamBooth和文本驱动编辑方法通常以自由形式操作全局或高层语义难以稳健保留产品的细粒度特征。参考图像修复Reference-based Inpainting方法虽然提供了更结构化的特征整合机制但扩散模型的去噪过程天然倾向于对内容进行平均或幻觉化导致纹理、形状和品牌元素出现不一致——这对高保真需求而言是不可接受的。局限三粗粒度监督无法提供精确引导现有方法通常依赖隐空间的 MSE 损失进行训练监督。这种隐层级监督关注全局语义和整体一致性但对于像素级的高频细节文字笔画、Logo 纹理、图案边缘缺乏足够精确的约束导致模型在这类细节上的重建能力不足。二、HiFi-Inpaint 方法总览针对上述三大局限本文提出HiFi-Inpaint——一个高保真参考图像修复框架专为生成细节保留的人物-产品图像而设计。框架以文本提示 T、遮罩人物图和产品参考图作为输入生成将产品无缝融合到人物图像遮罩区域的结果图。HiFi-Inpaint 的三个核心贡献如下贡献类型解决的问题HP-Image-40K 数据集数据缺乏大规模多样化训练数据共享增强注意力SEA模型架构模型难以捕捉细粒度产品特征细节感知损失DAL训练策略粗粒度隐空间监督无法引导精确细节重建此处配Figure 2HiFi-Inpaint 整体框架图包含数据集构建流程、SEA 模块示意和 DAL 示意三、核心组件详解3.1 HP-Image-40K 数据集构建为从根本上解决训练数据不足的问题本文设计了一套四步自动化数据合成与过滤流水线最终构建出包含40,000 高质量样本的 HP-Image-40K 数据集几乎无需人工干预。第一步双联画合成Diptych Synthesis利用 FLUX.1-Dev 生成双联画格式图像提示模板设计为A diptych. left: [产品描述] right: [人物与产品描述]左侧为单独的产品图右侧为预期的人物-产品图FLUX.1-Dev 的概念一致性能力保证了两侧产品的语义对齐。第二步双联画分割Diptych Segmentation对双联画图像应用 Sobel 滤波器精确定位左右两侧的垂直分界线将其分割为独立的产品图和人物-产品图用于后续过滤。第三步语义过滤Semantic Filtering利用 YOLOv8 定位人物-产品图中的产品区域裁剪后计算其与产品参考图的CLIP 相似度仅保留相似度高的样本对确保两侧产品高度一致。第四步文字过滤Textual Filtering产品上的文字品牌名、标签、成分表等是最关键也最难保留的细节之一。使用InternVL分别提取产品图和人物-产品图上的文字内容计算字符串重叠度仅保留文字一致性高的样本对从源头保证文字保真度。经过上述四步处理每个最终样本包含文本提示 T由 InternVL 描述目标图生成、遮罩人物图遮罩产品区域得到、产品参考图以及目标人物-产品图。Figure 7HP-Image-40K 遮罩面积比直方图Figure 8产品类别词云图数据集统计HP-Image-40K 涵盖多样化的遮罩面积比从小型局部产品到大型显著产品产品类别丰富包括瓶装、容器、罐装、管装、分配器等详见词云为模型跨场景泛化提供了坚实基础。3.2 高频图引导的 DiT 框架HiFi-Inpaint 以FLUX.1-Dev采用 MMDiT 架构作为基础模型并在其上引入了高频图引导机制。高频提取High-Frequency Extraction对产品图及目标图中的产品区域采用频域滤波方法提取高频细节图对输入图像 I 计算离散傅里叶变换DFT零频率平移到中心构建高通掩码中心半径 r 内置零抑制低频分量应用掩码逆变换并取幅度响应归一化得到高频图 I与 Canny 边缘检测相比该方法通过响应特定频率来突出产品文字和 Logo 等关键元素而不会引入大量背景边缘杂波。 此处配Figure 3与 Canny 算法的高频提取对比图令牌合并机制Token Merging Mechanism在 MMDiT 训练中将遮罩人物图、产品参考图和加噪的目标图的 VAE 编码令牌拼接形成联合视觉令牌同时将替换为其高频图生成高频视觉令牌序列高频视觉令牌专门用于驱动下一节介绍的 SEA 模块。3.3 共享增强注意力Shared Enhancement Attention, SEASEA 是本文在模型架构层面最核心的创新其设计目标是将产品图像的高频细节信息显式注入到遮罩区域的视觉特征精化过程中。对每个双流视觉 DiT 块SEA 将原始前向过程修改为其中各项含义如下是高频视觉令牌经过与原始分支参数共享的 DiT 块后的输出无需额外参数是可学习的加权因子相比固定为1效果更佳避免视觉伪影和区域冲突是基于下采样遮罩区域的注意力掩码操作防止无关区域对原始分支产生干扰 此处配Figure 4固定权重与可学习权重的 SEA 对比图SEA 设计的优雅之处在于参数共享机制使模型极为紧凑——整个 SEA 对每个 DiT 块仅引入一个额外标量参数却能有效整合高频细节与全局上下文信息显著提升模型对细粒度产品特征的捕捉和保留能力。3.4 细节感知训练策略细节感知损失Detail-Aware Loss, DAL为弥补隐空间 MSE 损失在精细细节监督上的不足本文在像素空间引入高频监督损失其中为预测图为真实图M 为遮罩区域为高频提取算子。该损失的监督聚焦于遮罩区域内的高频分量——正是那些文字笔画、Logo 纹理、产品图案等最难重建的细节信息。总体损失将 DAL 与隐空间 MSE 损失组合两种监督信号形成互补保障全局语义和整体一致性精化遮罩区域内的细粒度局部细节。模型使用流匹配Flow Matching进行训练。四、实验设置基础模型FLUX.1-Dev采用 LoRA 微调秩256缩放因子 $\alpha256$。训练数据HP-Image-40K40,000 合成样本 约 14,000 样本的内部数据集共同支撑模型训练。训练配置学习率 5×10⁻⁵batch size24训练 10,000 步图像分辨率 1024×576 像素。测试集合成测试集从 HP-Image-40K 中划分出 1,000 样本不参与训练真实世界测试集来自公开互联网图像的内部数据集包含 2,000 个样本场景复杂度显著更高对比方法Paint-by-Example、ACE、Insert Anything、FLUX.1-Kontext-DevFLUX-Kontext评价指标三个维度文本对齐CLIP-T视觉一致性CLIP-I、DINO、SSIM、SSIM-HF对生成图像应用高通滤波后再计算 SSIM专门评估细节保留能力生成质量LAION-Aes、Q-Align-IQ五、实验结果与分析5.1 合成数据集定量对比此处配Table 1合成测试集上各方法的全量化对比7项指标HiFi-Inpaint 在合成测试集上实现全面领先视觉一致性全面最优CLIP-I95.0%第二名 Insert Anything 94.1%、DINO91.9%第二名 ACE 90.7%、SSIM63.4%第二名 Insert Anything 62.1%、SSIM-HF42.9%第二名 Insert Anything 40.0%尤其是代表细节保留专项能力的 SSIM-HF 领先优势明显。文本对齐CLIP-T达36.1%与最优的 FLUX-Kontext36.6%仅差 0.5 个百分点但 FLUX-Kontext 的视觉一致性极差CLIP-I 仅 82.5%、DINO 仅 63.1%说明其以牺牲参考忠实度换取文本对齐。生成质量方面Q-Align-IQ 达4.36最优LAION-Aes 达 4.40第二FLUX-Kontext 4.54 第一但后者整体视觉一致性最差分数意义有限。各方法主要问题归纳FLUX-Kontext频繁生成孤立产品图而非将其融合到人物图中即便修复成功也难以保留高频细节ACE产品形状保留尚可但难以重建小字符和精细 LogoInsert Anything细节保留好于 ACE但遮罩区域较小时容易引入伪影Paint-by-Example整体性能最弱视觉一致性指标明显落后5.2 真实世界数据集定量对比 此处配Table 4真实世界测试集上各方法的全量化对比真实世界测试集场景更加复杂多样的光照、姿态、产品外观HiFi-Inpaint 仍保持视觉一致性最优CLIP-T29.7%最优CLIP-I86.8%最优ACE 80.1%Insert Anything 83.1%FLUX-Kontext 仅 59.9%DINO79.8%最优SSIM60.5%最优SSIM-HF44.1%最优超越合成集上的 42.9%体现出强泛化能力在生成质量指标LAION-Aes 4.27Q-Align-IQ 3.29上排名第三略低于最优基线但视觉一致性的大幅领先充分说明了 HiFi-Inpaint 在真实场景下的综合优势。5.3 定性对比 此处配Figure 5合成数据上的定性对比红框标注关键差异区域 此处配Figure 9真实世界数据上的定性对比视觉对比充分印证了定量结论HiFi-Inpaint 能够生成产品与背景无缝融合的自然图像文字、图案和品牌元素忠实保留在遮罩区域较小的挑战场景下HiFi-Inpaint 依然保持结构完整性和高频细节而其他方法容易产生伪影或细节丢失真实世界数据上HiFi-Inpaint 在光照变化、姿态差异较大时仍能产生干净自然的合成效果5.4 用户研究 此处配Table 3用户研究投票率对比招募31 名志愿者评估 11 组生成图像从文本对齐、视觉一致性、生成质量三个维度各选最优。HiFi-Inpaint三项均位居第一文本对齐36.4%Insert Anything 24.9%ACE 20.3%FLUX-Kontext 18.4%视觉一致性41.5%Insert Anything 21.0%ACE 19.6%FLUX-Kontext 17.9%生成质量39.5%ACE 22.7%Insert Anything 21.6%FLUX-Kontext 16.2%用户研究结果与自动化指标高度一致进一步验证了 HiFi-Inpaint 的综合优越性。5.5 消融实验 此处配Table 2五组消融方案的定量对比实验设计了五个消融方案方案 E 为完整 HiFi-Inpaint方案合成数据DALSEAA✗✗✗B✓✗✗C✓✓✗D✓✗✓E完整✓✓✓HP-Image-40K 数据集的贡献方案 A vs B 加入合成数据后CLIP-I 从 91.8% 提升至94.5%DINO 从 85.4% 提升至89.9%文本对齐和视觉一致性均显著改善证明数据质量对模型性能的根本性作用。DAL 的贡献方案 B vs C 加入 DAL 后SSIM-HF 从 41.2% 提升至41.8%DINO 从 89.9% 提升至 90.7%视觉对比显示模型重建文字和精细图案的能力明显增强。不加 DAL 时模型会产生模糊或语义不完整的产品渲染结果。SEA 的贡献方案 C vs E 加入 SEA 后所有指标进一步全面提升SSIM-HF 从 41.8% 提升至42.9%CLIP-I 从 94.6% 提升至95.0%DINO 从 90.7% 提升至91.9%。视觉结果显示 SEA 带来了更精确的细节和图案对齐。 此处配Figure 6消融定性对比图对比完整方法、w/o SEA、w/o SEA DAL 的视觉效果Figure 10附录中的更多消融定性结果三个组件缺一不可共同作用方能达到最优效果合成数据提供学习基础DAL 增强像素级细节监督SEA 从特征层面显式注入高频产品信息。5.6 泛化性分析 此处配Figure 11泛化性分析图包含无人物户外、无人物室内、全身视图、产品干扰、风格迁移五类挑战场景论文进一步在超出标准修复条件的挑战场景下评估了 HiFi-Inpaint无人物场景户外/室内背景产品仍能自然融入场景全身人物视图大幅姿态变化产品整合依然连贯遮罩区域存在产品干扰不影响目标产品的正确生成风格迁移场景如卡通风格背景模型能够适应不同的视觉风格分布即便在分布外场景下HiFi-Inpaint 也能产生上下文感知的合理补全结果展现出较强的泛化潜力。六、结论与展望HiFi-Inpaint 从数据、模型、训练三个维度系统性地解决了高保真人物-产品图像生成的核心挑战HP-Image-40K通过自动化四步流水线构建了大规模高质量训练数据彻底消除数据瓶颈SEA利用参数共享的双流 DiT 块和可学习加权将高频产品特征显式注入遮罩区域的特征精化过程仅引入极少额外参数DAL将监督信号从隐空间延伸至像素级高频域直接约束最难重建的细节分量在合成和真实世界测试集上HiFi-Inpaint 在视觉一致性CLIP-I、DINO、SSIM、SSIM-HF和生成质量Q-Align-IQ方面均取得最优成绩用户研究三项第一充分验证了方法的有效性。未来展望作者指出将致力于提升生成图像的多样性和真实感并将方法扩展至视频生成领域为视频电商等更丰富的应用场景提供支持。
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

MCP搭建全指南:用TaoToken统一Key打通mcp server与openwebui 2026/9/29 5:51:25

MCP搭建全指南:用TaoToken统一Key打通mcp server与openwebui

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
OctaFuse网关2.11.0升级:流式优化、折扣策略与错误契约 2026/9/29 5:51:25

OctaFuse网关2.11.0升级:流式优化、折扣策略与错误契约

2.11.0这个版本我是在线上环境灰度了两周之后才敢来写这篇东西的。OctaFuse Gateway作为我们团队统一管理所有LLM调用的入口,每次升级都牵连着十几个业务方的调用链,而这次一口气上线了流式请求优化、用户折扣策略、错误契约升级三个大改动,坦…

阅读更多 →
Fable 5 与 GPT-5.6 Sol 实战经验分享:什么任务该用哪个——用 TaoToken 统一 Key 更高效地花你的 token 2026/9/29 5:51:25

Fable 5 与 GPT-5.6 Sol 实战经验分享:什么任务该用哪个——用 TaoToken 统一 Key 更高效地花你的 token

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
EDSR图像超分模型深度解析:原理、复现与踩坑指南 2026/9/29 5:51:18

EDSR图像超分模型深度解析:原理、复现与踩坑指南

1. 超分问题的本质和一个反直觉的结论做图像超分(Super-Resolution,以下简称SR)这几年,我最大的感受是:这个领域入门门槛不高,但真正能把效果做扎实、把模型训稳的人不多。EDSR(Enhanced Deep S…

阅读更多 →
从信息洪流到结构化认知:AI日报自动化生产系统搭建实战 2026/9/29 5:51:12

从信息洪流到结构化认知:AI日报自动化生产系统搭建实战

1. 一份AI日报的诞生:从信息洪流到结构化认知每天早上七点半,我习惯性地打开自己搭建的AI日报工作流,看着过去24小时里散落在全球各个角落的AI动态被自动抓取、清洗、归类、摘要,最终汇聚成一份不到三千字的结构化文档。这个过程从…

阅读更多 →
FastLED 测试与编译命令实战指南:Bash 包装脚本、挂起检测与多构建模式 2026/9/29 5:51:12

FastLED 测试与编译命令实战指南:Bash 包装脚本、挂起检测与多构建模式

嵌入式物联网硬件开发驱动开发 【免费下载链接】FastLED The FastLED library for colored LED animation on Arduino. Please direct questions/requests for help to the FastLED Reddit community: http://fastled.io/r Wed like to use github "issues" just for…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉