均衡之选Balanced
官方中等规模版本,在 Apple 公布的每项评测中都高于 0.5B,同时明显小于 7B。
- 适合场景
- 均衡的本地推理与 Apple Silicon 开发
- 支持路径
- Python · Apple Silicon · Workstation
- Checkpoint
- apple/FastVLM-1.5B
FASTVLM 模型
官方 checkpoint 概览、公开基准分数与实用起点。
官方中等规模版本,在 Apple 公布的每项评测中都高于 0.5B,同时明显小于 7B。
python -m pip install huggingface_hub
hf download apple/FastVLM-1.5B FastVLM Stage3 1.5B 是在 Apple 论文所述的额外指令微调阶段之后得到的 1.5B 版本。Stage3 表示训练阶段,1.5B 表示模型规模;它并不是一个独立的安装软件包。
| 运行环境 | 模型文件 | 下一步 |
|---|---|---|
| 原始 PyTorch 仓库 | Stage3 PyTorch ZIP下载 checkpoint ↗ | 解压后通过 predict.py 运行。 |
| Apple Silicon 官方应用 | Stage3 Apple Silicon ZIP · LLM int8下载 checkpoint ↗ | 使用应用下载脚本,将文件放入正确目录。 |
| Hugging Face Transformers | 使用 Transformers 指南指定的兼容 checkpoint。Hugging Face 仓库与 Apple ZIP 不可直接互换。 | 按照完整的图片输入到回答示例操作。 |
Apple 应用 README 要求 macOS 15.2+ 或 iOS 18.2+。安装 Xcode 并选择兼容的运行目标。以下命令从仓库根目录执行;首次下载前请确保模型目录为空。
git clone https://github.com/apple-aiml-research/ml-fastvlm.git
cd ml-fastvlm
chmod +x app/get_pretrained_mlx_model.sh
app/get_pretrained_mlx_model.sh --model 1.5b --dest app/FastVLM/model
open app/FastVLM/FastVLM.xcodeproj 在 Xcode 构建并运行,选择图片或摄像头输入,再提出简短问题。成功运行后会看到回答和应用测得的 TTFT。具体文字随图片和问题而变化。
不同运行方式没有统一、已验证的最低内存要求。精度、图片分辨率、模型缓冲和生成长度都会影响内存峰值。int8 描述导出的语言模型权重精度,不等于整个应用占用。1.5B 无法加载时先试 0.5B;比较速度时保持图片、问题一致,并区分冷启动与热运行。
来源核对日期:2026-09-12 · Paper · Model Zoo · App README
分数来自 Apple FastVLM 模型卡。分数越高越好;只应在同一基准行内比较。
| 基准 | FastVLM-1.5B |
|---|---|
| AI2D | 77.4 |
| ScienceQA | 94.4 |
| MMMU | 37.8 |
| VQAv2 | 79.1 |
| ChartQA | 80.1 |
| TextVQA | 70.4 |
| InfoVQA | 59.7 |
| DocVQA | 88.3 |
| OCRBench | 70.2 |
| RealWorldQA | 61.2 |
| SeedBench-Img | 74.2 |