Skip to content

APPLE STARFLOW · NORMALIZING-FLOW GENERATION

STARFlow:拡散モデルに代わる Apple の正規化フロー

画像生成は拡散モデルが主流ですが、Apple の STARFlow 系列は自己回帰正規化フロー(TARFlow)が高解像度画像、次に動画、最終的に画像とテキストを理解し生成する単一モデルへスケールできることを示しています。フローは厳密な尤度とキャッシュに優しい自己回帰サンプリングを提供します。

STARFlow と拡散・フローマッチングの違い

拡散モデルとフローマッチングは多段階でノイズ除去やノイズからデータへの輸送を学習します。正規化フローは厳密な最尤で学習する可逆ネットワークで、サンプリングは逆変換の1回の決定的パスです。STARFlow は潜在空間で動作し自己回帰 Transformer フローブロックを積むことでスケールします。トレードオフはサンプリング回数ではなくモデル設計の複雑さです。

STARFlow2 と統合マルチモーダルモデル

STARFlow2 は凍結した事前学習 VLM ストリームと TARFlow ストリームを、単一の因果マスクの下で残差スキップ接続により交互に組み合わせます。言語側は理解能力を保ち、フロー側が画像を生成します。両者が KV キャッシュを共有するため、交互のテキスト・画像生成で以前の出力を再エンコードする必要がありません。

オンデバイスに導入すべき?

まだ早いです。これらは研究規模の生成モデルであり、このページは導入ガイドではなく論文、コード、用語のリファレンスとして扱ってください。現在オンデバイスで動く視覚モデルには FastVLM、MobileCLIP2、Depth Pro を使用してください。

よくある質問

STARFlow のデモはありますか?

本サイトにはありません。この規模の画像生成にはサーバー GPU が必要で、FastVLM.net のオンデバイス方針と合いません。公式サンプルとチェックポイントは GitHub リポジトリを参照してください。