Zum Hauptinhalt springen

Cloud-Speicher für Data Scientists — Trainingsdaten und Modelle mit RcloneView verwalten

· 4 Minuten Lesezeit
Alex
Principal Engineer

Data Scientists bewegen täglich Gigabytes an Daten — RcloneView bietet eine Multi-Cloud-GUI zur Verwaltung von Trainingsdatensätzen, Modell-Checkpoints und Experiment-Ausgaben über S3, Google Drive und mehr.

Machine-Learning-Workflows erzeugen enorme Datenmengen: Rohdatensätze, die Hunderte von Gigabytes umfassen können, vorverarbeitete Feature-Stores, trainierte Modell-Checkpoints und Experimentprotokolle, die langfristig archiviert werden müssen. Diese zwischen lokalen Rechnern, Cloud-Objektspeicher und gemeinsamen Team-Laufwerken zu verschieben, ist zeitaufwendig und riskant, wenn Übertragungen unbemerkt fehlschlagen. RcloneView bietet Data-Science-Teams einen visuellen Dateimanager, der über 90 Cloud-Anbieter aus einem einzigen Fenster unter Windows, macOS und Linux abdeckt.

Vorschau der RcloneView-App

Alle Clouds an einem Ort verwalten & synchronisieren

RcloneView ist eine plattformübergreifende GUI für rclone. Vergleichen Sie Ordner, übertragen oder synchronisieren Sie Dateien und automatisieren Sie Multi-Cloud-Workflows mit einer klaren, visuellen Oberfläche.

  • Ein-Klick-Jobs: Kopieren · Synchronisieren · Vergleichen
  • Zeitpläne & Verlauf für zuverlässige Automatisierung
  • Funktioniert mit Google Drive, OneDrive, Dropbox, S3, WebDAV, SFTP und mehr
WindowsmacOSLinux
Kostenlos loslegen →

Kernfunktionen kostenlos. Plus-Automatisierungen verfügbar.

Verbinden Sie all Ihre Speicher in einer Ansicht

ML-Pipelines erstrecken sich oft gleichzeitig über mehrere Speichersysteme: einen Amazon-S3-Bucket für Trainingsläufe und Modell-Artefakte, ein gemeinsames Google Drive für Team-Datensätze, ein lokales NAS für die Rohdatenerfassung und vielleicht einen Backblaze-B2-Bucket für kosteneffiziente Langzeitarchivierung. Mit RcloneView können Sie jedes dieser Systeme als benannten Remote hinzufügen und in nebeneinander angeordneten Explorer-Fenstern öffnen — ziehen Sie Dateien per Drag-and-drop zwischen Anbietern und überwachen Sie Übertragungen, ohne zwischen Browser-Tabs oder CLI-Sitzungen zu wechseln.

RcloneView verwaltet über 90 Cloud-Anbieter — S3, Google Drive, Backblaze B2 und mehr — aus einem einzigen Fenster, kostenlos zum Synchronisieren und Vergleichen mit der FREE-Lizenz.

Dragging training data files between cloud storage providers in RcloneView

Ein Computer-Vision-Team, das 200 GB annotierter Bilder verarbeitet, kann sein gemeinsames Annotations-Laufwerk und seinen S3-Trainings-Bucket gleichzeitig verbinden und dann nur neue Batches kopieren, indem es beide Fenster durchsucht und geänderte Verzeichnisse auswählt. Auch öffentliche Datensätze, die über institutionelles WebDAV oder Google Drive geteilt werden, funktionieren als Remotes und stehen in derselben Sitzung neben privaten S3-Buckets zur Verfügung.

Große Modelldateien mit Live-Übertragungsüberwachung übertragen

Das Hochladen einer 15-GB-Checkpoint-Datei oder die Synchronisation eines mehrteiligen Datensatzes zu S3 erfordert zuverlässiges Feedback. Der Transferring-Tab von RcloneView zeigt für jeden aktiven Job Geschwindigkeit, übertragene Bytes und Dateianzahl pro Übertragung. Die konfigurierbare Multi-Thread-Übertragungseinstellung teilt Uploads großer Dateien in parallele Streams auf, was Uploads zu S3-kompatiblen Anbietern wie Wasabi oder Cloudflare R2, bei denen sich der Overhead pro Datei schnell summiert, deutlich beschleunigen kann.

Live transfer monitoring for large ML dataset uploads in RcloneView

Wird eine Übertragung durch eine Netzwerkstörung oder ein VPN-Timeout unterbrochen, setzt ein erneuter Sync-Job dort fort, wo er abgebrochen wurde: RcloneView überspringt bereits übertragene Dateien und setzt mit dem Rest fort. Bei Datensätzen im Terabyte-Bereich vermeidet dies, Stunden mit redundanten Wiederholungsversuchen zu verschwenden.

Datensatzintegrität mit Ordnervergleich prüfen

Nachdem eine Vorverarbeitungspipeline einen lokalen Datensatz verändert oder erweitert hat, kann die Bestätigung, dass das Cloud-Backup den aktuellen Zustand widerspiegelt, bevor Trainingsläufe gestartet werden, wertvolle GPU-Zeit sparen. Die Folder-Compare-Ansicht von RcloneView zeigt Unterschiede zwischen zwei beliebigen Ordnern — lokal oder Cloud — nebeneinander an und identifiziert Dateien, die nur links, nur rechts vorhanden sind oder unterschiedliche Größen haben.

Folder comparison view showing dataset differences between local disk and S3 storage

Für Data Scientists dient dies als Sanity-Check vor dem Training: Überprüfen Sie, ob das Cloud-Trainingsverzeichnis der erwarteten lokalen Baseline entspricht, bevor Sie GPU-Budget einsetzen. Als unterschiedlich markierte Dateien können einzeln kopiert werden, um Abweichungen zu beheben. Aktivieren Sie die Checksummenprüfung in Sync-Jobs, um Beschädigungen zu erkennen, die ein reiner Größenvergleich übersehen würde.

Datensatz-Backups mit geplanter Synchronisation automatisieren

Datenerfassungspipelines, die kontinuierlich laufen, profitieren von automatischen Cloud-Backups, die keinen manuellen Auslöser benötigen. Mit einer PLUS-Lizenz löst der Crontab-artige Scheduler von RcloneView Sync-Jobs in festgelegten Intervallen aus — nächtlich nach Abschluss einer Pipeline oder stündlich während aktiver Erfassungsfenster. Die Funktion 1:N-Synchronisation spiegelt ein Quellverzeichnis gleichzeitig auf mehrere Ziele, sodass ein einzelner Rohdaten-Ordner in einem einzigen Job-Durchlauf sowohl auf S3 als auch auf Google Drive gesichert werden kann.

Running an automated dataset backup job in RcloneView

Mit Filterregeln in Schritt 3 des Sync-Assistenten können Sie temporäre Dateien, Checkpoint-Zwischenstände und Cache-Verzeichnisse ausschließen, die in einem sauberen Backup nichts zu suchen haben — so bleiben die Speicherkosten niedrig, ohne dass eigene Skripte geschrieben werden müssen.

Erste Schritte

  1. Laden Sie RcloneView herunter von rcloneview.com.
  2. Fügen Sie Ihren S3-Bucket (Amazon S3, Wasabi, Cloudflare R2) über Remote-Tab > New Remote als Remote hinzu.
  3. Fügen Sie Google Drive oder einen anderen Kollaborationsspeicher als zweiten Remote in derselben Sitzung hinzu.
  4. Erstellen Sie Sync-Jobs von lokalen Datenverzeichnissen zu Cloud-Zielen — verwenden Sie Filterregeln in Schritt 3, um temporäre Dateien und Pipeline-Cache-Verzeichnisse auszuschließen.

Die Datensätze, Checkpoints und Experiment-Ausgaben Ihres Teams werden navigierbar und zuverlässig gesichert, ohne dass jedes Teammitglied über Kommandozeilen-Kenntnisse verfügen muss.


Verwandte Anleitungen:

Unterstützte Cloud-Anbieter

Local Files
WebDAV
FTP
SFTP
HTTP
SMB / CIFS
Google Drive
Google Photos
Google Cloud Storage
OneDrive
Dropbox
Box
MS Azure Blob
MS File Storage
S3 Compatible
Amazon S3
pCloud
Wasabi
Mega
Backblaze B2
Cloudflare R2
Alibaba OSS
Ceph
Swift (OpenStack)
IBM Cloud Object Storage
Oracle Cloud Object Storage
IDrive e2
MinIO
Storj
DigitalOcean Spaces