Google Data Fusion で Amazon Athena に連携した ETL プロセスを作成

Jerod Johnson
Jerod Johnson
Senior Technology Evangelist
CData JDBC Driver を Google Data Fusion にロードし、Amazon Athena のデータ にリアルタイムでアクセスできる ETL プロセスを作成します。

Google Data Fusion を使用すると、セルフサービス型のデータ連携を行い、異なるデータソースを統合できます。CData JDBC Driver for Amazon Athena をアップロードすることで、Google Data Fusion のパイプライン内から Amazon Athena のデータ にリアルタイムでアクセスできるようになります。CData JDBC Driver を使用すると、Amazon Athena のデータ を Google Data Fusion でネイティブにサポートされている任意のデータソースにパイプできますが、この記事では、Amazon Athena から Google BigQuery へデータをパイプする方法を説明します。

Amazon Athena データ連携について

CData は、Amazon Athena のライブデータにアクセスし、統合するための最も簡単な方法を提供します。お客様は CData の接続機能を以下の目的で使用しています:

  • IAM 認証情報、アクセスキー、インスタンスプロファイルなど、さまざまな方法で安全に認証できます。多様なセキュリティニーズに対応し、認証プロセスを簡素化します。
  • 詳細なエラーメッセージにより、セットアップを効率化し、問題を迅速に解決できます。
  • サーバーサイドでのクエリ実行により、パフォーマンスを向上させ、クライアントリソースへの負荷を最小限に抑えます。

ユーザーは、Tableau、Power BI、Excel などの分析ツールと Athena を統合し、お気に入りのツールから詳細な分析を行うことができます。

CData を使用した Amazon Athena のユニークなユースケースについては、ブログ記事をご覧ください:https://jp.cdata.com/blog/amazon-athena-use-cases


はじめに


CData JDBC Driver for Amazon Athena を Google Data Fusion にアップロード

CData JDBC Driver for Amazon Athena を Google Data Fusion インスタンスにアップロードして、Amazon Athena のデータ にリアルタイムでアクセスしましょう。Google Data Fusion では JDBC ドライバーの命名規則に制限があるため、JAR ファイルを driver-version.jar という形式に合わせてコピーまたはリネームしてください。例:cdataamazonathena-2020.jar

  1. Google Data Fusion インスタンスを開きます
  2. をクリックしてエンティティを追加し、ドライバーをアップロードします
  3. "Upload driver" タブで、リネームした JAR ファイルをドラッグまたは参照します。
  4. "Driver configuration" タブで以下を設定します:
    • Name: ドライバーの名前(cdata.jdbc.amazonathena)を作成し、メモしておきます
    • Class name: JDBC クラス名を設定します:(cdata.jdbc.amazonathena.AmazonAthenaDriver)
  5. "Finish" をクリックします

Google Data Fusion で Amazon Athena のデータ に接続

JDBC Driver をアップロードしたら、Google Data Fusion のパイプラインで Amazon Athena のデータ にリアルタイムでアクセスできます。

  1. Pipeline Studio に移動して、新しいパイプラインを作成します
  2. "Source" オプションから "Database" をクリックして、JDBC Driver 用のソースを追加します
  3. Database ソースの "Properties" をクリックしてプロパティを編集します

    NOTE:Google Data Fusion で JDBC Driver を使用するには、ライセンス(製品版またはトライアル)とランタイムキー(RTK)が必要です。ライセンス(またはトライアル)の取得については、CData までお問い合わせください。

    • Label を設定します
    • Reference Name を将来の参照用の値に設定します(例:cdata-amazonathena)
    • Plugin Type を "jdbc" に設定します
    • Connection String を Amazon Athena の JDBC URL に設定します。例:

      jdbc:amazonathena:RTK=5246...;AccessKey='a123';SecretKey='s123';Region='IRELAND';Database='sampledb';S3StagingDirectory='s3://bucket/staging/';

      Amazon Athena 接続プロパティの取得・設定方法

      それでは、早速Athena に接続していきましょう。

      データに接続するには、以下の接続パラメータを指定します。

      • DataSource:接続するAmazon Athena データソース。
      • Database:接続するAmazon Athena データベース。
      • AWSRegion:Amazon Athena データがホストされているリージョン。
      • S3StagingDirectory:クエリの結果を保存するS3 フォルダ。

      Database またはDataSource が設定されていない場合、CData 製品はAmazon Athena の利用可能なデータソースからすべてのデータベースのリスト化を試みます。そのため、両方のプロパティを設定することでCData 製品のパフォーマンスが向上します。

      Amazon Athena の認証設定

      CData 製品は幅広い認証オプションに対応しています。詳しくはヘルプドキュメントの「はじめに」を参照してみてください。

      AWS キーを取得

      IAM ユーザーの認証情報を取得するには、以下のステップお試しください。

      1. IAM コンソールにサインインします。
      2. ナビゲーションペインでユーザーを選択します。
      3. ユーザーのアクセスキーを作成または管理するには、ユーザーを選択してからセキュリティ認証情報タブに移動します。

      AWS ルートアカウントの資格情報を取得するには、以下のステップをお試しください。

      1. ルートアカウントの認証情報を使用してAWS 管理コンソールにサインインします。
      2. アカウント名または番号を選択します。
      3. 表示されたメニューでMy Security Credentials を選択します。
      4. ルートアカウントのアクセスキーを管理または作成するには、Continue to Security Credentials をクリックし、[Access Keys]セクションを展開します。

      その他の認証オプションについては、ヘルプドキュメントの「Amazon Athena への認証」を参照してください。

      ビルトイン接続文字列デザイナー

      JDBC URL の作成には、Amazon Athena JDBC Driver に組み込まれている接続文字列デザイナーを使用できます。JAR ファイルをダブルクリックするか、コマンドラインから JAR ファイルを実行してください。

            java -jar cdata.jdbc.amazonathena.jar
            

      接続プロパティを入力し、接続文字列をクリップボードにコピーします。

    • Import Query を Amazon Athena から取得したいデータを抽出する SQL クエリに設定します。例:
      SELECT * FROM Customers
  4. "Sink" タブから、同期先シンクを追加します(この例では Google BigQuery を使用します)
  5. BigQuery シンクの "Properties" をクリックしてプロパティを編集します
    • Label を設定します
    • Reference Name を amazonathena-bigquery のような値に設定します
    • Project ID を特定の Google BigQuery プロジェクト ID に設定します(またはデフォルトの "auto-detect" のままにします)
    • Dataset を特定の Google BigQuery データセットに設定します
    • Table を Amazon Athena のデータ を挿入するテーブル名に設定します

Source と Sink を設定すると、Amazon Athena のデータ を Google BigQuery にパイプする準備が整います。パイプラインを保存してデプロイしてください。パイプラインを実行すると、Google Data Fusion が Amazon Athena からリアルタイムデータをリクエストし、Google BigQuery にインポートします。

これはシンプルなパイプラインの例ですが、変換、分析、条件などを使用してより複雑な Amazon Athena パイプラインを作成できます。CData JDBC Driver for Amazon Athena の 30日間の無償トライアルをダウンロードして、今すぐ Google Data Fusion で Amazon Athena のデータ をリアルタイムで活用しましょう。

はじめる準備はできましたか?

Amazon Athena Driver の無料トライアルをダウンロードしてお試しください:

 ダウンロード

詳細:

Amazon Athena Icon Amazon Athena JDBC Driver お問い合わせ

Amazon Athena 連携のパワフルなJava アプリケーションを素早く作成して配布。