Skip to content

FASTVLM 模型

FastVLM-1.5B

官方 checkpoint 概览、公开基准分数与实用起点。

均衡之选Balanced

官方中等规模版本,在 Apple 公布的每项评测中都高于 0.5B,同时明显小于 7B。

适合场景
均衡的本地推理与 Apple Silicon 开发
支持路径
Python · Apple Silicon · Workstation
Checkpoint
apple/FastVLM-1.5B
前往 Hugging Face 下载
下载命令
python -m pip install huggingface_hub
hf download apple/FastVLM-1.5B

FastVLM Stage3 1.5B 是什么?

FastVLM Stage3 1.5B 是在 Apple 论文所述的额外指令微调阶段之后得到的 1.5B 版本。Stage3 表示训练阶段,1.5B 表示模型规模;它并不是一个独立的安装软件包。

  • Stage2:视觉指令微调。Apple 提供这个阶段的 checkpoint。
  • Stage3:在 Stage2 基础上,用包含推理示例的高质量指令数据进一步微调。Apple 也提供这个阶段的 checkpoint。

按运行环境选择模型文件

运行环境模型文件下一步
原始 PyTorch 仓库Stage3 PyTorch ZIP下载 checkpoint ↗解压后通过 predict.py 运行。
Apple Silicon 官方应用Stage3 Apple Silicon ZIP · LLM int8下载 checkpoint ↗使用应用下载脚本,将文件放入正确目录。
Hugging Face Transformers使用 Transformers 指南指定的兼容 checkpoint。Hugging Face 仓库与 Apple ZIP 不可直接互换。按照完整的图片输入到回答示例操作。

在 Mac 或 iPhone 运行 Stage3 1.5B

Apple 应用 README 要求 macOS 15.2+ 或 iOS 18.2+。安装 Xcode 并选择兼容的运行目标。以下命令从仓库根目录执行;首次下载前请确保模型目录为空。

Apple Silicon · Stage3 1.5B
git clone https://github.com/apple-aiml-research/ml-fastvlm.git
cd ml-fastvlm
chmod +x app/get_pretrained_mlx_model.sh
app/get_pretrained_mlx_model.sh --model 1.5b --dest app/FastVLM/model
open app/FastVLM/FastVLM.xcodeproj

在 Xcode 构建并运行,选择图片或摄像头输入,再提出简短问题。成功运行后会看到回答和应用测得的 TTFT。具体文字随图片和问题而变化。

需要多少内存?

不同运行方式没有统一、已验证的最低内存要求。精度、图片分辨率、模型缓冲和生成长度都会影响内存峰值。int8 描述导出的语言模型权重精度,不等于整个应用占用。1.5B 无法加载时先试 0.5B;比较速度时保持图片、问题一致,并区分冷启动与热运行。

首次运行失败时

  • 找不到模型:确认下载已完成,文件位于 app/FastVLM/model,再进行构建。
  • 内存不足:关闭其他占用 GPU 的程序、缩短输出,或换用 0.5B。
  • 格式不匹配:官方应用使用 Apple Silicon 导出文件;predict.py 使用原始 PyTorch checkpoint。
完整 Python / Transformers 指南 →

来源核对日期:2026-09-12 · Paper · Model Zoo · App README

公开基准分数

分数来自 Apple FastVLM 模型卡。分数越高越好;只应在同一基准行内比较。

基准FastVLM-1.5B
AI2D77.4
ScienceQA94.4
MMMU37.8
VQAv279.1
ChartQA80.1
TextVQA70.4
InfoVQA59.7
DocVQA88.3
OCRBench70.2
RealWorldQA61.2
SeedBench-Img74.2

建议的下一步

  • 阅读 Apple AMLR 模型许可与模型卡。
  • 根据实际文件和精度估算硬件需求。
  • 先使用具有代表性的图片与提示词集合。
  • 在目标设备上测量首次加载、热启动延迟、内存和输出质量。
打开实现指南