小贴士:按下Ctrl+D 或 ⌘+D,一键收藏本站,方便下次快速访问!

DeepFloyd Lab

一种新颖、先进的开源文本到图像模型

我们介绍的 DeepFloyd IF 是一种新颖、先进的开源文本到图像模型,具有高度的逼真性和语言理解能力。DeepFloyd IF 是一个模块,由一个冻结文本编码器和三个级联像素扩散模块组成:一个基本模型,根据文本提示生成 64×64 px 的图像;两个超分辨率模型,分别用于生成分辨率不断提高的图像:256×256 px 和 1024×1024 px。该模型的所有阶段都使用基于 T5 变换器的冻结文本编码器来提取文本嵌入,然后将其输入到具有交叉注意力和注意力池增强功能的 UNet 架构中。结果是一个高效的模型,其性能超过了目前最先进的模型,在 COCO 数据集上获得了 6.66 分的零镜头 FID 分数。我们的工作强调了大型 UNet 架构在级联扩散模型第一阶段的潜力,并描绘了文本到图像合成的美好前景。

上月数据概览

月访问量4.75亿对比上月
-5.57%
月PV28.97亿
平均访问时长394秒跳出率36.20%人均访问页面数6
月活1.19亿月活(去重)9189.46万人均访问次数4.00

热门国家/地区访客分布

国家流量占比月访问量人均访问时长人均访问页数跳出率
洪都拉斯
1.45%
-33.75%
283秒332.22%
亚美尼亚
0.65%
0.00%
0秒1100.00%
黑山
8.30%
2426.39%
892秒427.82%
南非
6.42%
-89.63%
0秒122.76%
捷克
5.51%
19.12%
14秒163.58%