Template Dekompresi Massal File Cloud Storage

Template Bulk Decompress Cloud Storage Files adalah pipeline batch yang mendekompresi file di Cloud Storage ke lokasi tertentu. Fungsi ini berguna saat Anda ingin menggunakan data terkompresi guna meminimalkan biaya bandwidth jaringan selama migrasi, tetapi ingin memaksimalkan kecepatan pemrosesan analisis dengan mengoperasikan data yang tidak terkompresi setelah migrasi. Pipeline secara otomatis menangani beberapa mode kompresi selama satu kali proses dan menentukan mode dekompresi yang akan digunakan berdasarkan ekstensi file (.bzip2, .deflate, .gz, .zip).

Persyaratan pipeline

  • File yang akan didekompresi harus dalam salah satu format berikut: Bzip2, Deflate, Gzip, Zip.
  • Sebelum menjalankan pipeline, direktori output harus sudah dibuat.

Parameter template

Parameter Deskripsi
inputFilePattern Pola file input yang akan dibaca. Misalnya, gs://bucket-name/compressed/*.gz.
outputDirectory Lokasi output yang akan ditulisi. Misalnya, gs://bucket-name/decompressed.
outputFailureFile File output log error yang akan digunakan untuk kegagalan penulisan yang terjadi selama proses dekompresi. Misalnya, gs://bucket-name/decompressed/failed.csv. Jika tidak ada kegagalan, file tetap dibuat, tetapi akan kosong. Isi file dalam format CSV (Nama File, Error) dan terdiri dari satu baris untuk setiap file yang gagal didekompresi.

Menjalankan template

Konsol

  1. Buka halaman Dataflow Create job from template.
  2. Buka Membuat tugas dari template
  3. Di kolom Nama tugas, masukkan nama tugas yang unik.
  4. Opsional: Untuk Endpoint regional, pilih nilai dari menu drop-down. Region default-nya adalah us-central1.

    Untuk mengetahui daftar region tempat Anda dapat menjalankan tugas Dataflow, lihat Lokasi Dataflow.

  5. Dari menu drop-down Template Dataflow, pilih the Bulk Decompress Files on Cloud Storage template.
  6. Di kolom parameter yang disediakan, masukkan nilai parameter Anda.
  7. Klik Run job.

gcloud

Di shell atau terminal Anda, jalankan template:

gcloud dataflow jobs run JOB_NAME \
    --gcs-location gs://dataflow-templates-REGION_NAME/VERSION/Bulk_Decompress_GCS_Files \
    --region REGION_NAME \
    --parameters \
inputFilePattern=gs://BUCKET_NAME/compressed/*.gz,\
outputDirectory=gs://BUCKET_NAME/decompressed,\
outputFailureFile=OUTPUT_FAILURE_FILE_PATH

Ganti kode berikut:

  • JOB_NAME: nama tugas unik pilihan Anda
  • REGION_NAME: region tempat Anda ingin men-deploy tugas Dataflow—misalnya, us-central1
  • VERSION: versi template yang ingin Anda gunakan

    Anda dapat menggunakan nilai berikut:

  • BUCKET_NAME: nama bucket Cloud Storage Anda
  • OUTPUT_FAILURE_FILE_PATH: pilihan jalur Anda ke file yang berisi informasi kegagalan

API

Untuk menjalankan template menggunakan REST API, kirim permintaan HTTP POST. Untuk mengetahui informasi selengkapnya tentang API dan cakupan otorisasinya, lihat projects.templates.launch.

POST https://dataflow.googleapis.com/v1b3/projects/PROJECT_ID/locations/LOCATION/templates:launch?gcsPath=gs://dataflow-templates-LOCATION/VERSION/Bulk_Decompress_GCS_Files
{
   "jobName": "JOB_NAME",
   "parameters": {
       "inputFilePattern": "gs://BUCKET_NAME/compressed/*.gz",
       "outputDirectory": "gs://BUCKET_NAME/decompressed",
       "outputFailureFile": "OUTPUT_FAILURE_FILE_PATH"
   },
   "environment": { "zone": "us-central1-f" }
}

Ganti kode berikut:

  • PROJECT_ID: ID Google Cloud project tempat Anda ingin menjalankan tugas Dataflow
  • JOB_NAME: nama tugas unik pilihan Anda
  • LOCATION: region tempat Anda ingin men-deploy tugas Dataflow—misalnya, us-central1
  • VERSION: versi template yang ingin Anda gunakan

    Anda dapat menggunakan nilai berikut:

  • BUCKET_NAME: nama bucket Cloud Storage Anda
  • OUTPUT_FAILURE_FILE_PATH: pilihan jalur Anda ke file yang berisi informasi kegagalan

Langkah berikutnya