SmolVLA: Efficient Vision-Language-Action Model trained on Lerobot Community Data
Hugging Face 发布开源、紧凑的 450M 视觉-语言-动作模型 SmolVLA,仅用 lerobot 标签下的社区开源数据预训练,在 LIBERO、Meta-World 仿真和 SO100/SO101 真实任务上超过更大 VLA 及 ACT 等基线。
Hugging Face 发布开源、紧凑的 450M 视觉-语言-动作模型 SmolVLA,仅用 lerobot 标签下的社区开源数据预训练,在 LIBERO、Meta-World 仿真和 SO100/SO101 真实任务上超过更大 VLA 及 ACT 等基线。