Qwen(通义千问)发布用于改写提示词的模型 Qwen-Image-2.1-PE-T2I
2026 年 9 月 20 日,模型 Qwen/Qwen-Image-2.1-PE-T2I 在 HuggingFace 上发布。这不是图像生成器,而是用于准备提示词的辅助模型:它接收任意语言的简短描述,并将其转换为详细的英文提示词,同时给出主模型 Qwen-Image-2.1 的推荐宽高比。
该方法的原理。示意图根据这篇简讯绘制。
Switch to the English version? It is the same page at the same address, with a language prefix.
Other languages: Русский
Test-time guidance 改善 image-to-3D 模型在部分观测下的几何研究人员提出了一种免训练方法,可在生成阶段考虑物体的部分几何观测,而无需微调模型。该方法在论文 Guiding Image-to-3D Generation with Test-Time Partial Ob 中描述
流式说话头像:作者分离音频与渲染以加速生成arXiv 上发表了论文 Decoupled Self-Forcing Distillation for Streaming Talking Head Generation。作者提出,对于流式说话头像生成,不将音频直接与视频的每个像素绑定,而是在低维空间中进行条件融合。
HunyuanVideo(混元视频)获得近无损质量的 5—7 倍加速生成方法研究人员推出了 LinCa——一种通过可学习特征缓存与分量分解来加速扩散模型的方法。LinCa 不再对所有特征采用统一的预测策略,而是将可缓存特征分解为子