新闻详情

新闻详情

首页 / 资讯中心 / 详情

为什么Meta做文生图不用Diffusion模型?深扒Muse架构设计

发布时间:2026/9/28 18:52:45来源:尧图网络
为什么Meta做文生图不用Diffusion模型?深扒Muse架构设计
为什么Meta做文生图不用Diffusion模型深扒Muse架构设计现在提到AI画图大家脑子里蹦出来的基本都是 Stable Diffusion 或者 Midjourney。这些基于 Diffusion扩散技术的模型生成质量确实好但都有个祖传痛点——太慢了。扩散模型本质上是一个从随机噪声中一步步“去噪”的过程。就像画家在一块满是污渍的画布上一点点擦拭、上色你需要等它经历几十甚至上百步的迭代图片才能清晰起来。这种顺序执行的马尔可夫链机制直接锁死了它的生成速度上限。但Meta偏不走这条路。他们推出的 Muse 模型完全抛弃了 Diffusion转头用上了 Masked Generative Transformer掩码生成 Transformer。结果生成速度直接快了好几倍。作为后端或AI方向的开发我们平时天天跟各种架构打交道今天就来拆解一下Muse 凭什么能用 Transformer 在图像生成领域破局。怎么把图像塞进 Transformer我们要用 Transformer 处理文本通常是先把句子切成一个个 Token。但图像是一大块连续的像素这怎么弄答案是 VQGAN。Muse 利用这种矢量量化自编码器把连续的图像像素压缩、映射成一个个离散的“视觉 Token”。你可以理解为它把一张复杂的图片翻译成了一本由特殊“词汇”组成的二维字典。这不仅大幅降低了计算维度也让 Transformer 处理图像有了发力点。抛弃自回归选择掩码预测既然有了离散的视觉 Token最直观的想法就是像 GPT 生成文本那样从左到右、从上到下一个个预测。比如 Google 的 Parti 就是这么干的。但这种自回归Autoregressive模式同样有顺序依赖速度快不起来。Muse 选择的是类似 BERT 的 Masked Generative Transformer 架构。它的任务不再是“填空题”。在训练阶段Muse 会随机把图片中的部分视觉 Token 遮住Mask然后让模型根据没遮住的部分和文本提示词把遮住的部分猜出来。速度飙升的秘密并行解码真正让 Muse 速度起飞的是它在推理生成阶段的并行解码Parallel Decoding机制。想象一下从零生成一张图片的场景一开始整张画布全是 [MASK]遮罩。模型把文本提示词和这块全白的画布输入 Transformer一口气并行预测所有位置的视觉 Token。一把预测肯定有准有不准。模型会根据各个 Token 预测的置信度保留那些非常确定的比如轮廓、大色块把不确定的重新盖上 [MASK]。将更新后的画布再次输入模型预测剩余的 [MASK]循环几轮。传统的扩散模型需要一步步去噪而 Muse 通过这种策略只需迭代 10 到 24 步就能完成全图生成。因为每次迭代都是大规模并行预测多个 Token整体生成时间被极大地压缩了。附赠的超能力天生支持图像编辑这种“填空题”式的掩码架构还带来了一个附赠的巨大优势。平时用 Stable Diffusion 做图像局部修改Inpainting通常需要引入额外的控制网或者做微调。但在 Muse 这里局部修改根本就是它的本职工作。你只需要把图片里想改的地方直接打上 [MASK]输入新的提示词模型就会自动填补这块区域并且能完美融合周围的图像上下文。不需要任何微调开箱即用。总结Meta 绕开了拥挤的 Diffusion 赛道用离散化 Token Masked Transformer 证明了不依靠连续去噪也能搞定高质量的图像生成。在技术选型时这种思路很值得借鉴。当我们面对一个看起来必须顺序执行的复杂耗时任务时能不能像 Muse 一样先把它离散化、拆解成多个块然后通过并行预测和置信度筛选把线性的长任务压缩成几次高并发的批量处理这也许是比单纯优化某个算法实现更能带来指数级收益的架构级破局。
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

OpenMausBot语音模式:如何让AI Bot开口回话,甚至接打语音电话 2026/9/28 21:10:28

OpenMausBot语音模式:如何让AI Bot开口回话,甚至接打语音电话

OpenMausBot语音模式:如何让AI Bot开口回话,甚至接打语音电话 【免费下载链接】OpenMausBot Open Source Alternative to Grok Bot with a virtual machine that bots can use 项目地址: https://gitcode.com/gh_mirrors/op/OpenMausBot OpenMaus…

阅读更多 →
面试官:换个 embedding 模型,为什么知识库突然答不准了? 2026/9/28 21:10:28

面试官:换个 embedding 模型,为什么知识库突然答不准了?

假设面试官问我:“客服知识库换了一个 embedding 模型,接口不报错,回答却开始跑偏。你先查什么?” 我可能先想,调提示词,增加召回条数,再换个重排模型。 他补了一句:“文档还是旧模…

阅读更多 →
你的目标是嵌入式开发 2026/9/28 21:10:08

你的目标是嵌入式开发

你好,王**,很高兴认识你。真的是一眨眼么,也不一定,毕业两年了对吧。为啥要学C语言呢?在原公司待着做一辈子的机械设计师不也是挺好的么?可靠的发展路线和依旧低微的工资是吧。对了,你是打算三个…

阅读更多 →
200美金/月的ChatGPT Pro真的值吗? 2026/9/28 21:10:08

200美金/月的ChatGPT Pro真的值吗?

200 美金一个月的 ChatGPT Pro,我觉得最容易让人产生误判的地方,就是很多人会下意识拿它和 Plus 比“回答质量”。如果只是问问题、改改文章、翻译、偶尔让 ChatGPT 帮忙分析一下东西,那 Pro 很难给你一种“贵了十倍,所以聪明了十…

阅读更多 →
Eclipse Mosquitto 的 Snap 包安装、测试与配置完整指南 2026/9/28 21:10:08

Eclipse Mosquitto 的 Snap 包安装、测试与配置完整指南

物联网消息队列后端 【免费下载链接】mosquitto Eclipse Mosquitto - An open source MQTT broker 项目地址: https://gitcode.com/gh_mirrors/mosquit/mosquitto 点击查看 免费下载 Snap 是 Linux 发行版上分发与运行 Mosquitto MQTT 代理(broker&…

阅读更多 →
关于Java的初步认识以及与C语言的比较 2026/9/28 21:10:08

关于Java的初步认识以及与C语言的比较

前言Java 是一门面向对象、跨平台、安全稳定的高级编程语言,由 Sun Microsystems(后被 Oracle 收购)于 1995 年推出,凭借 “一次编写,到处运行” 的特性,成为企业级开发、移动开发、后端服务等领域的主流语…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉