使用 RcloneView 免 CLI 在 Google Cloud Storage 與 AWS S3 之間傳輸檔案
在 Google Cloud Storage 與 AWS S3 之間管理資料,通常意味著要同時操作 gsutil、aws cli 和自訂腳本。RcloneView 讓您透過視覺化介面完成這一切——只需幾分鐘即可在 GCS 與 S3 之間瀏覽、比較、同步及排程傳輸。
多雲已是大多數工程團隊的現實。您的 ML 訓練資料存放在 GCS 儲存桶(bucket)中,正式環境的資產放在 S3 上,總有人得負責讓兩者保持同步。傳統做法——使用 gsutil 和 aws cli 撰寫 shell 腳本——雖然可行,但脆弱、難以監控,而且非工程師根本無法管理。
RcloneView 原生連接 GCS 與 S3,提供統一的 GUI,讓您在這兩大雲端平台之間瀏覽、傳輸、比較並自動化資料移動。

在同一處管理與同步所有雲端
RcloneView 是 rclone 的跨平台 GUI。透過清爽的視覺化介面比較資料夾、傳輸或同步檔案,並自動化多雲工作流程。
- 一鍵作業:複製 · 同步 · 比較
- 排程器與歷史記錄,打造可靠的自動化
- 支援 Google Drive、OneDrive、Dropbox、S3、WebDAV、SFTP 等
核心功能免費。Plus 提供自動化功能。
為何要在 GCS 與 S3 之間移動資料?
團隊在 Google Cloud Storage 與 AWS S3 之間傳輸資料,通常出於以下幾個常見原因:
多雲備援 — 將關鍵資料同時儲存在兩大主要供應商,可防範供應商層級的中斷及廠商鎖定風險。若其中一朵雲端發生故障,仍可從另一朵存取資料。
成本優化 — GCS 與 S3 在儲存、出站流量(egress)及操作方面的定價各不相同。將冷資料移至對您的使用模式來說較便宜的供應商,可節省可觀費用。
跨平台工作流程 — 您的資料科學團隊使用 GCP(BigQuery、Vertex AI),但正式環境基礎架構運行於 AWS 上。資料需要在兩者之間流動。
遷移 — 若要在不停機的情況下從 GCP 遷移至 AWS(或反之),需要可靠且可續傳的傳輸機制。
合規與資料落地 — 某些法規要求資料副本存放於特定區域或供應商。
設定 GCS 與 S3 遠端
新增 Google Cloud Storage
- 打開 RcloneView,點選 Add Remote。
- 從供應商清單中選擇 Google Cloud Storage。
- 選擇您的驗證方式:
- Service Account JSON — 建議用於伺服器對伺服器的傳輸。上傳您的服務帳戶金鑰檔。
- OAuth(瀏覽器登入) — 適合個人 GCP 帳戶。請參閱 OAuth 登入指南。
- 若系統提示,請設定您的 project ID 及預設的 bucket location。
- 儲存此遠端——您的 GCS 儲存桶即可瀏覽。
新增 AWS S3
- 再次點選 Add Remote。
- 從供應商清單中選擇 Amazon S3。
- 輸入您的 Access Key ID 與 Secret Access Key。
- 選擇您的 region 與 endpoint。
- 儲存——您的 S3 儲存桶即會出現在 Explorer 中。
有關 S3 的詳細設定,請參閱 AWS S3 連線指南。
並排瀏覽 GCS 與 S3
一旦兩個遠端都連接完成,即可在 RcloneView 的雙欄式 Explorer 中開啟它們。左側為 GCS 儲存桶,右側為 S3 儲存桶(或相反)。您可以:
- 同時瀏覽兩側的儲存桶與資料夾。
- 檢視檔案大小、日期與數量,掌握哪些資料位於何處。
- 拖放檔案,直接從 GCS 傳到 S3——或使用內建的複製/移動指令。
這種並排檢視讓您無需在 GCP 主控台與 AWS 主控台之間切換,就能即時掌握兩朵雲端的狀況。
傳輸情境
情境一:一次性遷移(GCS → S3)
為進行平台遷移,將所有資料從 GCS 移至 S3:
- 建立一個 Copy 工作:
- 來源:GCS 遠端 → 選擇您的儲存桶
- 目的地:S3 遠端 → 選擇目標儲存桶
- 配置以達到最高速度:
- 平行傳輸數:8–16(GCS 與 S3 都能良好處理高度平行化)
- 區塊大小:大型檔案建議 64MB–128MB
- 啟用
--fast-list旗標以加快目錄列表速度
- 執行工作並即時監控進度。
對於大型遷移,可多次執行 Copy 工作。首次完整複製後,後續執行只會傳輸新增或變更的檔案——即使中斷也能安全地續傳。
情境二:持續同步(雙向)
讓 GCS 儲存桶與 S3 儲存桶持續保持同步:
- 建立一個 Sync 工作(GCS → S3)作為主要方向。
- 使用 Job Scheduling 排程每小時或每日執行一次。
- 若需要雙向同步,新增反方向的 Sync 工作(S3 → GCS)。
- 使用 Batch Jobs(v1.3)依序執行兩個方向。
情境三:選擇性跨雲備份
僅將特定資料備份至另一朵雲端:
- 使用 Filter Rules 來包含/排除特定檔案類型或資料夾。
- 範例:僅同步
*.parquet與*.csv檔案(ML 資料集) - 範例:排除
tmp/與logs/目錄
- 範例:僅同步
- 建立套用這些篩選條件的排程 Copy 工作。
比較 GCS 與 S3 內容
在傳輸前後,使用 Folder Comparison 驗證兩個儲存桶是否包含相同資料:
- 僅存在於 GCS 的檔案 — 以醒目方式標示,便於識別。
- 僅存在於 S3 的檔案 — 顯示目的地存在但來源沒有的檔案。
- 不同的檔案 — 名稱相同但大小或校驗碼不同的檔案。
- 完全相同的檔案 — 確認在兩朵雲端上皆相符。
這對於遷移驗證極具價值:在複製了數 TB 資料之後,您可以證明每個檔案都完整無損地送達。
優化傳輸速度
GCS 與 S3 都是高效能的物件儲存服務,因此您可以放心地全力推動傳輸:
| 設定 | 建議值 | 原因 |
|---|---|---|
| 平行傳輸數 | 8–16 | 兩家供應商都能良好處理並行請求 |
| 區塊大小 | 64MB–128MB | 降低大型檔案的 API 負擔 |
| Checkers | 16–32 | 加快大型目錄的比對階段速度 |
| 緩衝區大小 | 128MB | 平滑化雲端區域之間的網路延遲 |
| Fast-list | 啟用 | 大幅減少目錄列表所需的 API 呼叫次數 |
跨區域注意事項
若您的 GCS 儲存桶位於 us-central1,而 S3 儲存桶位於 eu-west-1,資料就必須跨越網際網路在區域之間傳輸。為求最佳效能:
- 盡可能讓來源與目的地位於同一地理區域。
- 在離峰時段執行傳輸,以避免網路壅塞。
- 監控出站流量(egress)費用——GCS 與 S3 皆會針對離開其網路的資料收費。
自動化 GCS ↔ S3 工作流程
每日資料管線
設定每晚執行一次的排程工作:
- 將新的 ML 訓練資料從 GCS 同步至 S3,供 AWS 上的訓練工作使用。
- 將結果從 S3 複製回 GCS,供 BigQuery 分析使用。
- 管線完成時,透過 Slack 收到通知。
災難復原複製
在 GCS 中維護一份 S3 關鍵資料的即時副本(或反之):
- 建立一個從主要儲存桶到 DR 儲存桶的 Sync 工作。
- 每小時排程一次,以達成低於 1 小時的 RPO(Recovery Point Objective,復原點目標)。
- 使用 checksum verification 確保資料完整性。
基於成本的分層儲存
將資料移至存取模式較便宜的供應商:
- 經常存取的資料 → 保留在最接近運算資源的供應商。
- 冷資料/封存資料 → 根據定價,移至 GCS Nearline/Coldline 或 S3 Glacier。
- 排程定期的分層作業,持續優化成本。