Aller au contenu principal
Accès ouvert déclaré 2025 dissertation

Application of counterfactual reasoning in multi-modal dialogue generation

0Citations signalées, ce qui n’est pas une note de qualité
0Institutions déclarées
0Pays d’affiliation déclarés

Le résumé fourni par la source

Recent advancements in diffusion models have significantly improved text-to-image generation, enabling the synthesis of highly realistic images. However, existing text-to-image diffusion models still frequently struggle to accurately interpret and follow complex textual prompts. Rather than solely relying on enhancing diffusion models' textual understanding capabilities, it is more efficient to provide these models with refined, structured inputs. This motivates the integration of large language models (LLMs) into multimodal dialogue-based image generation. Pre-trained LLMs excel at accurately comprehending textual prompts, and compared to the conventional single-round generation by diffusion models, a multi-round conversational approach enables users to better achieve their desired outcomes. Inspired by the concept of counterfactual reasoning, this study systematically explores methods to reduce misleading information from user instructions and mitigate linguistic biases in the image generation process. To this end, we propose Counterfactual Multimodal Dialogue system based on Diffusion model (CMDD), a novel multimodal dialogue framework grounded in the principles of counterfactual reasoning. The proposed method does not require any additional parameter tuning or model optimization, yet significantly enhances the accuracy of generated images compared to baseline diffusion models.

Ce résumé expose les affirmations des auteurs. BNTIC ne l’interprète pas comme une validation indépendante des résultats.

Le contrôle bibliographique ouvert

DOI retrouvé dans Crossref DOI retrouvé ; titre concordant.

Titre Crossref
Application of counterfactual reasoning in multi-modal dialogue generation
Date Crossref
03/11/2025
Éditeur
Nanyang Technological University
Type
dissertation

Ce recoupement confirme des métadonnées liées au DOI. Il ne confirme ni la méthode ni les conclusions de l’étude, et il ne compte pas comme une seconde source scientifique indépendante.

Les sujets associés

Multimodal Machine Learning ApplicationsGenerative Adversarial Networks and Image SynthesisTopic Modeling

BNTIC News n’est pas le producteur de ces données. Les publications sont interrogées à la demande dans Crossref, OpenAIRE, DOAJ, Europe PMC, HAL, DataCite, AfricArXiv, ROR et la Banque mondiale, sans clé d’accès. OpenAlex reste optionnel. Aucun service payant n’est nécessaire et aucune donnée externe n’est enregistrée en base. Consulter les sources et leurs limites.