ARTICLE DETAIL

资讯详情

深耕商务建站与企业官网运营的一线实战洞察。

MMaDA-Parallel: Multimodal Large Diffusion Language Models for Thinking-Aware Editing and Generation

MMaDA-Parallel: Multimodal Large Diffusion Language Models for Thinking-Aware Editing and Generation 文章核心总结与创新点主要内容该研究聚焦思维感知型多模态生成的核心问题——现有序列自回归模型因误差传播导致性能下降,提出ParaBench基准用于评估文本-图像对齐质量,进而设计MMaDA-Parallel并行多模态扩散框架,通过双向跨模态交互和轨迹级强化学习(ParaRL),解决推理与生成的对齐问题,在复杂图像编辑和生成任务中实现性能提升。核心创新点ParaBench基准:首个同时评估文本推理质量、图像生成质量及跨模态对齐的基准,含300个挑战性提示(200个编辑任务、100个生成任务),覆盖空间、时间、因果等多类推理场景。并行多模态扩散框架:突破序列生成限制,文本与图像在整个去噪过程中同步生成,通过双向注意力实现实时交互,避免误差累积。ParaRL强化学习:轨迹级优化策略,在去噪每一步施加语义奖励,而非仅优化最终输出,强化跨模态一致性。数据构建方案:通过VLM为图像编辑/生成数据生成推理轨迹,构建含15万样本的四元组训练集(输入图像、指令、推理轨迹、输出图像),支撑监督微调。翻译部分(Markdown格式)Abstract思维感知型生成旨在提升复杂任务性能,但我们发现现有序列自回归方法存在一个关键失效模
返回列表
PREV
查看更多资讯
NEXT
返回资讯列表