Cloudflare 发布 clef 模型,用于根据问题选项方案做出决策
2026 年 9 月 30 日,HuggingFace 上出现了一个名为 Cloudflare/clef 的模型,任务类型为 image-text-to-text。该模型接收文本、JSON、图像或视频形式的状态,并针对 schema 中每个问题的每个允许选项返回概率——不进行自由文本生成,也不解析输出。上线头几天,该模型就获得了 5416 次下载和 1528 个「喜欢」标记。
该方法的原理。示意图根据这篇简讯绘制。
Switch to the English version? It is the same page at the same address, with a language prefix.
Other languages: Русский
音视频生成获得兼顾音画同步的加速方法论文《Efficient Audio-Visual Generation via Synchrony-Aware Cross-Modal Sparse Attention》的作者提出了一种加速推理的方法,适用于同时生成视频和音频的模型。他们发现,双向 cross-attenti
Token Radius Attention 无需微调即可加速扩散 Transformer 中的视频生成北京大学的研究人员提出了 Token Radius Attention (TRA)——一种在 Video Diffusion Transformers 中减少计算量的方法,无需重新训练模型。该论文于 2026 年 8 月 3 日发布在 arXiv 上。A
DSAQuant 提出考虑去噪阶段的视频扩散量化方法arXiv 论文作者指出,常规的 quantization-aware training 会破坏视频模型的细节和锐度,尽管整体构图和运动得以保留。原因在于量化未区分去噪阶段:早期步骤
Cube-Splat 发布开源全景 Gaussian Splatting SLAMarXiv 上发布了 Cube-Splat 的研究成果——一种基于 3D Gaussian Splatting 的全景 360 度图像同步定位与建图(SLAM)方法。作者将每个全景帧拆分为由清晰面组成的立方体贴图