云服务器训练教程
1. 概述
本文档介绍如何在 AutoDL 等 GPU 云平台租用实例、配置 LeRobot 训练环境并进行模型训练。具体平台可自行选择,这里以 AutoDL 为例。官方文档参考:AutoDL 官方文档。
示例场景:Lerobot 采集 10 条训练数据,使用 ACT 模型 + RTX 5090 训练,训练用时约 2 小时。
2. 云服务器租赁
AutoDL 官网 注册账号后,根据个人数据集大小和训练模型选择合适的 GPU。
各地区之间没有本质差别,哪里有卡就选哪个区。一般情况下 GPU 数量选 1 即可。

选择镜像:推荐选择社区镜像中的 lerobot 镜像。


也可以选择基础镜像(PyTorch 2.7.0 + CUDA 12.8),然后创建并开机。

3. 云服务器登录
建议先选择**"无卡模式"**启动虚拟机,这样可以节省费用。无卡模式下,虽然没有 GPU 资源,但仍然可以进行代码上传、环境配置等操作。

在 AutoDL 中可以直接点击 JupyterLab 进入终端页面,也可以选择 SSH 登录:
ssh -p <端口号> <用户名>@<主机IP>
4. 训练准备
4.1 官方学术资源加速
source /etc/network_turbo4.2 下载代码
/root/autodl-tmp 盘在关机 15 天后会被清空,但读写速度较快,可以把代码 clone 到此目录。也可以直接在 /root 下 clone。
git clone https://github.com/JoyandAI/lerobot.git /autodl-tmp
4.3 安装 FileZilla(传文件工具)
- Windows / macOS:从官网下载安装包安装
- Linux:
sudo apt install filezilla安装完后终端输入 filezilla 打开。
4.4 环境配置
在 FileZilla 中:
- 点击左上角 文件 (File) → 站点管理器 (Site Manager) → 新站点 (New Site)
- 协议选择 SFTP,用户名填写
root - 其余根据个人服务器情况填写
4.5 上传数据
在 /root/.cache/huggingface/ 下创建项目名称的文件夹(如 lerobot,xlerobot 同理),将训练数据放入对应文件夹。本地文件夹可以直接拖拽上传到 FileZilla 中。
5. 训练模型
conda activate lerobot
cd /root/autodl.tmp
pip install -e .
cd ./src将 ${HF_USER} 替换为你的数据集名称。policy.type 为可选模型,建议选择 ACT。默认配置下 batch_size=32,step=100000。
python -m lerobot.scripts.train \
--dataset.repo_id=${HF_USER}/so101_test \
--policy.type=act \
--output_dir=outputs/train/act_so101_test \
--job_name=act_so101_test \
--policy.device=cuda \
--policy.push_to_hub=false \
--wandb.enable=false
训练过程中可以通过 AutoPanel 查看 GPU 使用情况和性能监控。训练完成后记得将模型文件下载到本地。
6. 其他可选策略
有些模型需要单独安装依赖,在 ../lerobot 目录下执行:
| 策略 | 说明 | 安装命令 |
|---|---|---|
| act | Action Chunking Transformers | 无需额外安装 |
| diffusion | Diffusion Policy | 无需额外安装 |
| tdmpc | TDMPC Policy | 无需额外安装 |
| vqbet | VQ-BeT | 无需额外安装 |
| smolvla | SmolVLA | pip install -e ".[smolvla]" |
| pi0 | Vision-Language-Action Flow Model | pip install -e ".[pi]" |
| pi0-fast | pi0 快速版 | pip install -e ".[pi]" |
| sac | Soft Actor-Critic | 无需额外安装 |
| reward_classifier | 奖励分类器 | 无需额外安装 |