声音引导的语义图像操作

Nov, 2021

Sound-Guided Semantic Image Manipulation

Seung Hyun Lee, Wonseok Roh, Wonmin Byeon, Sang Ho Yoon, Chan Young Kim...

TL;DR该论文提出了一种将声音直接编码成多模态（图像 - 文本）嵌入空间并从该空间中操纵图像的框架，该方法使用音频编码器从音频输入中生成潜在的表示，并基于对齐的嵌入使用直接潜在优化方法进行声音引导的图像操纵，实验证明该方法在零样本音频分类和语义级图像分类上优于其他文本和声音引导的最新方法。

Abstract

The recent success of the generative model shows that leveraging the multi-modal embedding space can manipulate an image using text information. However, manipulating an image with other sources rather than text, such as sound, is not easy due to the dynamic characteristics of the sour

multi-modal embedding space sound-guided image manipulation audio encoder latent optimization method semantic-level image classification

发现论文，激发创造

声音引导下的语义视频生成

本文提出了一种利用多模态（声音 - 图像 - 文本）嵌入空间生成逼真视频的框架，通过将声音和 StyleGAN 潜空间相结合生成一个语义上和声音一致的视频，并且在视频质量和编辑方面超过了现有的最先进方法。

Apr, 2022

对齐，自适应和注入：音频引导的统一图像生成

本文提出了一个统一框架 ——Align, Adapt, and Inject (AAI)，用于基于声音进行图像生成、编辑和风格化。其方法将输入的声音转换成一个声音令牌，并利用现有强大的扩散式 T2I 模型，从而实现了方便而经济的声音引导的图像生成、编辑和风格化。实验表明，AAI 方法优于其他最先进的文本和声音引导方法。

Jun, 2023

音频到视觉潜在对齐的声音转视觉场景生成

本文提出了一种通过声音生成场景图像的方法，采用了深度学习等技术，结合声音定位和跨模态信息对齐来提高图像生成质量，并在相关数据集上得到了较好结果。

Mar, 2023

语音与图像的深度多模态语义嵌入

本文提出了一种模型，其将图像和相关的口头描述作为输入，并找到两种模态之间的对应关系。使用一对卷积神经网络在单词级别模拟视觉对象和语音信号，并采用嵌入和对准模型将两个网络联系在一起，以学习跨两种模态的联合语义空间，最终在 Flickr8k 数据集上使用图像搜索和注释任务评估了我们的模型。

Nov, 2015

T-VSL: 混合环境下的文本引导视听源定位

我们提出了一种利用 Tri-modal joint embedding 模型通过文本模态作为中间特征引导，在多源混合中分离语义音视源对应关系的 T-VSL 框架，该方法在训练期间通过预测混合中声音实体的类来引导细粒度的音视源对应关系的分离，展现了在测试期间对未见过的类别具有有希望的零 - shot 迁移能力。在 MUSIC、VGGSound 和 VGGSound-Instruments 数据集上的大量实验证明了该方法相对于最先进方法的显著性能提升。

Apr, 2024

基于视觉语音的大规模表征学习

这篇论文描述了一种可扩展的方法来自动生成不同的音频来为图像提供字幕，并且通过使用双编码器来对音频和图像进行编码，使用掩码边界软最大损失对这些模型进行微调，并在 Flickr8k 音频字幕语料库上实现了最新的结果。

Sep, 2019

面部图像生成和操作的开放式文本引导实现

该研究提出了一种统一框架来生成和处理面部图像，基于预训练的 GAN 模型，使用两种新颖的策略，直接优化潜在空间的潜在编码以获取多模式输入的图像生成和操纵，并提出了一个大型数据集 Multi-Modal CelebA-HQ。

Apr, 2021

基于文本的任意声音分离

本研究提出了一种方法，通过结合两种模型，即 SoundWords 和 SoundFilter 模型，以在共享的文本 - 音频表示法中定义的调节向量为基础，将目标声音源从单通道混合中分离出来，并证明了此多模式训练方法可以提高 SoundFilter 的性能。

Apr, 2022

发出声音的物体

本文提出了一种利用未标记视频进行跨模态自监督学习的网络架构，实现音频和视觉之间的信息检索和图像中声音对象的准确定位，同时探究了基于 AVC 任务的网络架构设计方法，并与此相关的数据准备问题进行了讨论。

Dec, 2017

学习三模态嵌入用于零样本声景映射

我们的研究主要关注声音景观映射的任务，利用先进的模型对地理位置的语音、语音的文本描述以及其拍摄地的航拍图像进行编码，构建了三种模态的共享嵌入空间，从而可以根据文本或音频查询构建任何地理区域的声音景观地图。在 SoundingEarth 数据集上，我们的方法明显优于现有最先进方法，在图像到音频的召回率改善了从 0.256 提高到 0.450。我们的代码可在此链接中找到。

Sep, 2023