APPLE STARFLOW · NORMALIZING-FLOW GENERATION
STARFlow:Apple 以 normalizing flow 替代扩散模型的路线
扩散模型主导着图像生成,但 Apple 的 STARFlow 路线表明自回归 normalizing flow(TARFlow)可以扩展到高分辨率图像、视频,最终成为一个既能理解也能生成图像与文本的单一模型。Flow 提供精确似然与便于缓存的自回归采样。
STARFlow 与扩散、flow matching 的区别
扩散与 flow matching 模型通过多步学习去噪或把噪声搬运到数据。normalizing flow 是用精确最大似然训练的可逆网络;采样只需一次确定性的逆向前传。STARFlow 通过在潜空间工作并堆叠自回归 Transformer flow 块实现规模化,代价是模型设计更复杂,而不是采样步数更多。
STARFlow2 与统一多模态模型
STARFlow2 在同一因果掩码下,通过残差跳连把冻结的预训练 VLM 流与 TARFlow 流交错。语言侧保留理解能力,flow 侧负责生成图像;由于两者共享 KV 缓存,交错生成文字和图片时不需要重新编码之前的输出。
应该部署到端侧吗?
暂时不必。它们仍是研究规模的生成模型;请把本页当作论文、代码与术语的参考,而不是部署指南。目前可在端侧运行的视觉模型请使用 FastVLM、MobileCLIP2 或 Depth Pro。
常见问题
有 STARFlow 的在线 Demo 吗?
本站没有。这种规模的图像生成需要服务器 GPU,与 FastVLM.net 的端侧定位不符。官方样例与 checkpoint 请关注 GitHub 仓库。