Saltar al contenido principal

Gestiona el almacenamiento HDFS — Sincroniza y respalda archivos con RcloneView

· 5 min de lectura
Kai
Junior Engineer

Los clústeres de Hadoop almacenan años de datos procesados, pero mover esos datos entre el almacenamiento on-prem y la nube suele implicar recurrir a scripts y herramientas de línea de comandos — RcloneView le da a HDFS un hogar visual en su lugar.

Hadoop Distributed File System (HDFS) es la capa de almacenamiento detrás de innumerables pipelines de big data on-premise, pero no viene con una forma amigable de inspeccionar, transferir o archivar esos datos fuera del ecosistema Hadoop. RcloneView se conecta a HDFS como un remoto basado en protocolo, junto con SFTP, FTP y WebDAV, de modo que un ingeniero de datos puede explorar el contenido del clúster en un explorador de archivos familiar y mover conjuntos de datos hacia y desde el almacenamiento en la nube sin escribir un job de distcp ni un script personalizado. Funciona igual en Windows, macOS y Linux, algo que importa cuando tu equipo de datos no trabaja todo en el mismo sistema operativo.

Vista previa de la aplicación RcloneView

Gestiona y sincroniza todas tus nubes en un solo lugar

RcloneView es una GUI multiplataforma para rclone. Compara carpetas, transfiere o sincroniza archivos y automatiza flujos de trabajo multinube con una interfaz visual y limpia.

  • Trabajos con un clic: Copiar · Sincronizar · Comparar
  • Programadores e historial para una automatización fiable
  • Funciona con Google Drive, OneDrive, Dropbox, S3, WebDAV, SFTP y más
WindowsmacOSLinux
Empieza gratis →

Funciones principales gratis. Automatizaciones disponibles con Plus.

Agregar un clúster HDFS como remoto

HDFS forma parte de la categoría de almacenamiento basada en protocolo de RcloneView, configurada a través del mismo asistente de Nuevo Remoto que se usa para las conexiones SFTP y WebDAV. Una vez agregado el clúster, aparece como su propia pestaña en el panel del Explorador, con el árbol de carpetas estándar, la lista de archivos y la vista de miniaturas disponibles para explorar los conjuntos de datos almacenados en los namenodes del clúster. Las operaciones del menú contextual —copiar, descargar, renombrar, Obtener tamaño— funcionan exactamente igual que en cualquier otro remoto, lo que significa que los ingenieros que no se sienten cómodos con los comandos hadoop fs igualmente pueden auditar lo que realmente está en HDFS.

Adding an HDFS remote in RcloneView's New Remote wizard

RcloneView monta Y sincroniza más de 90 proveedores desde una sola ventana, así que la misma sesión que explora HDFS puede tener un Google Drive, un bucket de S3 o un disco local abierto en un panel adyacente para comparación directa.

Conectar el almacenamiento on-prem con el almacenamiento de objetos en la nube

El motivo más común para conectar HDFS a RcloneView es mover datos fríos o procesados fuera de un clúster costoso y con capacidad limitada, hacia un almacenamiento en la nube más económico para retención a largo plazo. Un trabajo de sincronización en un solo sentido con la dirección "Modificar solo el destino" copia la salida de HDFS —conjuntos de datos procesados, artefactos de entrenamiento de modelos, archivos de logs— a un bucket de S3, Azure Blob o Backblaze B2 sin tocar el origen. Las opciones de filtrado en el Paso 3 del asistente de sincronización te permiten limitar el trabajo a tipos de archivo específicos o excluir los archivos intermedios _SUCCESS y temporales que dejan los jobs de Hadoop, de modo que el bucket de destino solo contenga lo que realmente vale la pena conservar.

Syncing HDFS cluster data to cloud object storage in RcloneView

Para conjuntos de datos grandes, ajustar el número de transferencias de archivos y el número de transferencias multihilo en Configuración avanzada ayuda a saturar el ancho de banda disponible entre el clúster y el destino, mientras que mantener moderado el número de verificadores de igualdad evita generar una carga de lectura innecesaria en el namenode durante la fase de comparación.

Programar trabajos de archivado recurrentes

Los pipelines de datos rara vez se ejecutan una sola vez. Los usuarios con licencia PLUS pueden adjuntar una programación tipo crontab a un trabajo de sincronización de HDFS para que la salida recién generada se replique automáticamente al almacenamiento en la nube después de cada ejecución por lotes, en lugar de depender de que alguien recuerde iniciar una transferencia manual. El Historial de trabajos registra entonces cada ejecución —estado, tamaño transferido, duración— brindando al equipo un rastro de auditoría que muestra exactamente cuándo salió cada conjunto de datos del clúster y dónde terminó.

Scheduling a recurring HDFS to cloud storage sync job in RcloneView

Primeros pasos

  1. Descarga RcloneView desde rcloneview.com.
  2. Agrega tu clúster HDFS como un nuevo remoto usando la opción de almacenamiento basada en protocolo.
  3. Explora el clúster en el panel del Explorador para confirmar que los conjuntos de datos y los permisos se ven correctos.
  4. Configura un trabajo de sincronización en un solo sentido hacia tu destino de archivado en la nube, con filtros para excluir archivos temporales.

Llevar HDFS a la misma ventana que tus remotos en la nube convierte un proceso de exportación con scripts y propenso a errores en un trabajo repetible que puedes monitorear y programar.


Guías relacionadas:

Proveedores de nube compatibles

Local Files
WebDAV
FTP
SFTP
HTTP
SMB / CIFS
Google Drive
Google Photos
Google Cloud Storage
OneDrive
Dropbox
Box
MS Azure Blob
MS File Storage
S3 Compatible
Amazon S3
pCloud
Wasabi
Mega
Backblaze B2
Cloudflare R2
Alibaba OSS
Ceph
Swift (OpenStack)
IBM Cloud Object Storage
Oracle Cloud Object Storage
IDrive e2
MinIO
Storj
DigitalOcean Spaces