知识库/参考文档/云服务器训练教程

云服务器训练教程

1. 概述

本文档介绍如何在 AutoDL 等 GPU 云平台租用实例、配置 LeRobot 训练环境并进行模型训练。具体平台可自行选择,这里以 AutoDL 为例。官方文档参考:AutoDL 官方文档

示例场景:Lerobot 采集 10 条训练数据,使用 ACT 模型 + RTX 5090 训练,训练用时约 2 小时。


2. 云服务器租赁

AutoDL 官网 注册账号后,根据个人数据集大小和训练模型选择合适的 GPU。

各地区之间没有本质差别,哪里有卡就选哪个区。一般情况下 GPU 数量选 1 即可。

img

选择镜像:推荐选择社区镜像中的 lerobot 镜像。

img

img

也可以选择基础镜像(PyTorch 2.7.0 + CUDA 12.8),然后创建并开机。

img


3. 云服务器登录

建议先选择**"无卡模式"**启动虚拟机,这样可以节省费用。无卡模式下,虽然没有 GPU 资源,但仍然可以进行代码上传、环境配置等操作。

img

在 AutoDL 中可以直接点击 JupyterLab 进入终端页面,也可以选择 SSH 登录:

shell
ssh -p <端口> <用户>@<主机IP>

img


4. 训练准备

4.1 官方学术资源加速

shell
source /etc/network_turbo

4.2 下载代码

/root/autodl-tmp 盘在关机 15 天后会被清空,但读写速度较快,可以把代码 clone 到此目录。也可以直接在 /root 下 clone。

bash
git clone https://github.com/JoyandAI/lerobot.git /autodl-tmp

img

4.3 安装 FileZilla(传文件工具)

FileZilla 官网

  • Windows / macOS:从官网下载安装包安装
  • Linux
shell
sudo apt install filezilla

安装完后终端输入 filezilla 打开。

4.4 环境配置

在 FileZilla 中:

  1. 点击左上角 文件 (File) → 站点管理器 (Site Manager) → 新站点 (New Site)
  2. 协议选择 SFTP,用户名填写 root
  3. 其余根据个人服务器情况填写

4.5 上传数据

/root/.cache/huggingface/ 下创建项目名称的文件夹(如 lerobot,xlerobot 同理),将训练数据放入对应文件夹。本地文件夹可以直接拖拽上传到 FileZilla 中。


5. 训练模型

shell
conda activate lerobot
cd /root/autodl.tmp
pip install -e .
cd ./src

${HF_USER} 替换为你的数据集名称。policy.type 为可选模型,建议选择 ACT。默认配置下 batch_size=32step=100000

bash
python -m lerobot.scripts.train \
  --dataset.repo_id=${HF_USER}/so101_test \
  --policy.type=act \
  --output_dir=outputs/train/act_so101_test \
  --job_name=act_so101_test \
  --policy.device=cuda \
  --policy.push_to_hub=false \
  --wandb.enable=false

img

训练过程中可以通过 AutoPanel 查看 GPU 使用情况和性能监控。训练完成后记得将模型文件下载到本地。


6. 其他可选策略

有些模型需要单独安装依赖,在 ../lerobot 目录下执行:

策略 说明 安装命令
act Action Chunking Transformers 无需额外安装
diffusion Diffusion Policy 无需额外安装
tdmpc TDMPC Policy 无需额外安装
vqbet VQ-BeT 无需额外安装
smolvla SmolVLA pip install -e ".[smolvla]"
pi0 Vision-Language-Action Flow Model pip install -e ".[pi]"
pi0-fast pi0 快速版 pip install -e ".[pi]"
sac Soft Actor-Critic 无需额外安装
reward_classifier 奖励分类器 无需额外安装