APPLE AIMV2 · MULTIMODAL AUTOREGRESSIVE VISION ENCODERS
AIMv2:Apple 面向多模态模型的开放视觉编码器
AIMv2 让视觉 Transformer 以自回归方式同时重建图像块与文本 token。Apple 报告其在大多数多模态理解基准上优于 CLIP 与 SigLIP,同时保持易于训练与扩展。checkpoint 开放,参考代码支持 PyTorch、JAX 与 MLX。
AIMv2 对端侧视觉的意义
VLM 的上限取决于视觉编码器。AIMv2 提供训练配方简单、分辨率多样的编码器系列:手机级骨干可选 0.3B,文档密集任务可选 2.7B 原生分辨率版本。FastVLM 使用自己的 FastViTHD 编码器;当你自行构建多模态模型时,AIMv2 是通用的替代选择。
用 Transformers 提取图像向量
Hugging Face checkpoint 可通过 AutoModel 与 trust_remote_code 加载。对 token 特征做均值池化即可得到每张图片一个向量,用于相似检索、聚类或作为小型分类器的输入。
from PIL import Image
from transformers import AutoImageProcessor, AutoModel
model_id = "apple/aimv2-large-patch14-224" # 0.3B; also 224/336/448, -native and -lit variants
processor = AutoImageProcessor.from_pretrained(model_id)
model = AutoModel.from_pretrained(model_id, trust_remote_code=True).eval()
inputs = processor(images=Image.open("photo.jpg").convert("RGB"), return_tensors="pt")
features = model(**inputs).last_hidden_state # (1, tokens, hidden)
embedding = features.mean(dim=1) # one pooled vector per image Apple Silicon 上的 MLX
官方 ml-aim 包通过 MLX 后端提供同样的 checkpoint,是在没有 CUDA 的 Mac 上实验的最快方式。请以所安装版本的仓库 README 为准确认具体 API。
pip install "git+https://github.com/apple/ml-aim.git#subdirectory=aim-v2"
# Python
from aim.v2.utils import load_pretrained
model = load_pretrained("aimv2-large-patch14-224", backend="mlx") # or "torch" / "jax" AIMv2、MobileCLIP2 与 SigLIP 的区别
MobileCLIP2 是为低延迟调优的对比式图文模型,适合手机上的零样本分类与检索(也用于本站的浏览器工具)。SigLIP 是许多 VLM 内部常见的对比式编码器。AIMv2 以生成式目标和更大规模面向编码器角色,是训练自有 VLM 时更适合微调的选择。
常见问题
AIMv2 能在浏览器运行吗?
核对时尚无维护中的 Transformers.js 移植版。本站的浏览器相似度工具使用 MobileCLIP-S0;AIMv2 更适合通过 Python 或 MLX 使用。
应该从哪个规模开始?
aimv2-large-patch14-224(0.3B)是实用的默认选择。文字密集的图片可换用 336/448 像素或原生分辨率版本;只有在算力充足时才考虑 1.2B–2.7B。