Qwen-Image-2.1 已在 HuggingFace 发布:基于 7B 模型的图像生成与编辑
HuggingFace 上发布了模型 unsloth/Qwen-Image-2.1 —— 一款用于文本生成图像和编辑的统一模型。发布日期为 2026 年 9 月 23 日。该模型支持最多 10 张参考图像、通过蒙版和标注进行局部编辑、生成透明 RGBA 图像,以及从照片中提取对象。
方法的结构。示意图根据本简讯绘制。
Switch to the English version? It is the same page at the same address, with a language prefix.
Other languages: Русский
Latent-to-4D 直接从视频潜变量生成4D场景,无需中间RGB步骤论文《Beyond Pixels: From Video Priors to 4D Worlds》的作者提出了 Latent-to-4D 方法,该方法跳过了 RGB 视频重建阶段,直接从视频模型的最终去噪潜变量预测动态 3D 场景。该方法基于
Agnes-AI 发布 33 亿参数的开放预览模型 Agnes-3.0-FlashHuggingFace 上发布了任务为 text-generation 的模型 Agnes-AI/Agnes-3.0-Flash。这是 Agnes 3.0 Flash 的开放预览检查点,作者将其与 production/API 版本区分开来:开放模型的上下文为 262 144 个 token,而 A…
音视频生成获得兼顾音画同步的加速方法论文《Efficient Audio-Visual Generation via Synchrony-Aware Cross-Modal Sparse Attention》的作者提出了一种加速推理的方法,适用于同时生成视频和音频的模型。他们发现,双向 cross-attenti
VA-Judger:用于视频与音频联合生成的奖励模型研究人员推出了 VA-Judger —— 用于视频与音频联合生成系统后训练的奖励模型,以及包含 10.3 千对成对比较的数据集 VAPref-10K 和基准 VA-Judger-Bench。该工作于 2026 年 8 月 19 日发布。