SupraLabs 发布紧凑型 text-to-image 模型 Supra2-IMG
HuggingFace 上发布了模型 SupraLabs/Supra2-IMG —— 一个用于根据文本描述生成图像的 diffusion transformer。作者称其极小:约 1 亿参数,从零开始在合成数据上训练,输出分辨率为 256x256。
该方法的构造。示意图根据这篇简讯绘制。
Switch to the English version? It is the same page at the same address, with a language prefix.
Other languages: Русский
LeFlow 通过生成式潜在先验将 world models 中的规划速度提升一个数量级研究人员推出了 LeFlow——一种将 latent world models 中的迭代轨迹优化替换为生成式规划的方法。LeFlow 不再为每一对“状态—目标”从头运行优化器,而是学习
Test-time guidance 改善 image-to-3D 模型在部分观测下的几何研究人员提出了一种免训练方法,可在生成阶段考虑物体的部分几何观测,而无需微调模型。该方法在论文 Guiding Image-to-3D Generation with Test-Time Partial Ob 中描述
微软发布 VibeVoice-ASR-Streaming-7B 用于流式语音识别2026年9月2日,HuggingFace 上发布了模型 microsoft/VibeVoice-ASR-Streaming-7B,任务为 automatic-speech-recognition。该模型可转录流式语音,识别每位说话者所说的内容,支持自定义
MoE-JEPA 以专家混合增强 V-JEPA,用于合成图像检测研究人员提出了 MoE-JEPA——一种基于 V-JEPA 2、加入 Residual Mixture-of-Experts 和独立噪声分析分支的架构,用于识别生成和伪造图像。该工作于 2026 年 9 月 15 日发表