JDBC で Databricks データソースから Informatica マッピングを作成

Jerod Johnson
Jerod Johnson
Senior Technology Evangelist
標準の JDBC 接続プロセスを使用して、Informatica で Databricks データオブジェクトを作成します。JAR をコピーして接続するだけです。

Informatica は、データの転送と変換を行う強力でエレガントな手段を提供します。CData JDBC Driver for Databricks を使用することで、業界で実績のある標準に基づいたドライバーにアクセスでき、Informatica の強力なデータ転送および操作機能とシームレスに統合できます。このチュートリアルでは、Informatica PowerCenter で Databricks のデータ を転送および参照する方法を説明します。

Databricks データ連携について

CData を使用すれば、Databricks のライブデータへのアクセスと統合がこれまでになく簡単になります。お客様は CData の接続機能を以下の目的で利用しています:

  • Runtime バージョン 9.1 - 13.X から Pro および Classic Databricks SQL バージョンまで、すべてのバージョンの Databricks にアクセスできます。
  • あらゆるホスティングソリューションとの互換性により、お好みの環境で Databricks を使用し続けることができます。
  • パーソナルアクセストークン、Azure サービスプリンシパル、Azure AD など、さまざまな方法で安全に認証できます。
  • Databricks ファイルシステム、Azure Blob ストレージ、AWS S3 ストレージを使用して Databricks にデータをアップロードできます。

多くのお客様が、さまざまなシステムから Databricks データレイクハウスにデータを移行するために CData のソリューションを使用していますが、ライブ接続ソリューションを使用して、データベースと Databricks 間の接続をフェデレートしているお客様も多数います。これらのお客様は、SQL Server リンクサーバーまたは Polybase を使用して、既存の RDBMS 内から Databricks へのライブアクセスを実現しています。

一般的な Databricks のユースケースと CData のソリューションがデータの問題解決にどのように役立つかについては、ブログをご覧ください:What is Databricks Used For? 6 Use Cases


はじめに


ドライバーのデプロイ

ドライバーを Informatica PowerCenter サーバーにデプロイするには、インストールディレクトリの lib サブフォルダにある CData JAR ファイルと .lic ファイルを、次のフォルダにコピーします:Informatica インストールディレクトリ\services\shared\jars\thirdparty。

Developer ツールで Databricks のデータ を使用するには、インストールディレクトリの lib サブフォルダにある CData JAR ファイルと .lic ファイルを、次のフォルダにコピーする必要があります:

  • Informatica インストールディレクトリ\client\externaljdbcjars
  • Informatica インストールディレクトリ\externaljdbcjars

JDBC 接続の作成

Informatica Developer から接続するには、次の手順に従います:

  1. Connection Explorer ペインで、ドメインを右クリックし、Create a Connection をクリックします。
  2. 表示される New Database Connection ウィザードで、接続の名前と ID を入力し、Type メニューで JDBC を選択します。
  3. JDBC Driver Class Name プロパティに、次のように入力します:
    cdata.jdbc.databricks.DatabricksDriver
  4. Connection String プロパティに、Databricks の接続プロパティを使用して JDBC URL を入力します。

    Databricks 接続プロパティの取得・設定方法

    Databricks クラスターに接続するには、以下のプロパティを設定します。

    • Database:Databricks データベース名。
    • Server:Databricks クラスターのサーバーのホスト名
    • HTTPPath:Databricks クラスターのHTTP パス。
    • Token:個人用アクセストークン。この値は、Databricks インスタンスのユーザー設定ページに移動してアクセストークンタブを選択することで取得できます。
    Databricks インスタンスで必要な値は、クラスターに移動して目的のクラスターを選択し、Advanced Options の下にあるJDBC/ODBC タブを選択することで見つけることができます。

    Databricks への認証

    CData は、次の認証スキームをサポートしています。

    • 個人用アクセストークン
    • Microsoft Entra ID(Azure AD)
    • Azure サービスプリンシパル
    • OAuthU2M
    • OAuthM2M

    個人用アクセストークン

    認証するには、次を設定します。

    • AuthSchemePersonalAccessToken
    • Token:Databricks サーバーへの接続に使用するトークン。Databricks インスタンスのユーザー設定ページに移動してアクセストークンタブを選択することで取得できます。

    その他の認証方法については、ヘルプドキュメント の「はじめに」セクションを参照してください。

    組み込みの接続文字列デザイナー

    JDBC URL の構築には、Databricks JDBC Driver に組み込まれている接続文字列デザイナーを使用できます。JAR ファイルをダブルクリックするか、コマンドラインから JAR ファイルを実行します。

    java -jar cdata.jdbc.databricks.jar
    

    接続プロパティを入力し、接続文字列をクリップボードにコピーします。

    一般的な接続文字列は次のとおりです:

    jdbc:databricks:Server=127.0.0.1;HTTPPath=MyHTTPPath;User=MyUser;Token=MyToken;

Databricks テーブルの参照

ドライバー JAR をクラスパスに追加し、JDBC 接続を作成したら、Informatica で Databricks エンティティにアクセスできます。Databricks に接続してテーブルを参照するには、次の手順に従います:

  1. リポジトリに接続します。
  2. Connection Explorer で、接続を右クリックし、Connect をクリックします。
  3. Show Default Schema Only オプションのチェックを外します。

これで、Data Viewer で Databricks テーブルを参照できます。テーブルのノードを右クリックし、Open をクリックします。Data Viewer ビューで、Run をクリックします。

Databricks データオブジェクトの作成

プロジェクトに Databricks テーブルを追加するには、次の手順に従います:

  1. Databricks でテーブルを選択し、テーブルを右クリックして Add to Project をクリックします。
  2. 表示されるダイアログで、各リソースに対してデータオブジェクトを作成するオプションを選択します。
  3. Select Location ダイアログで、プロジェクトを選択します。

    マッピングの作成

    マッピングに Databricks ソースを追加するには、次の手順に従います:

    1. Object Explorer で、プロジェクトを右クリックし、New -> Mapping をクリックします。
    2. Databricks 接続のノードを展開し、テーブルのデータオブジェクトをエディターにドラッグします。
    3. 表示されるダイアログで、Read オプションを選択します。

    Databricks カラムをフラットファイルにマッピングするには、次の手順に従います:

    1. Object Explorer で、プロジェクトを右クリックし、New -> Data Object をクリックします。
    2. Flat File Data Object -> Create as Empty -> Fixed Width を選択します。
    3. Databricks オブジェクトのプロパティで、必要な行を選択し、右クリックして copy をクリックします。フラットファイルのプロパティに行を貼り付けます。
    4. フラットファイルデータオブジェクトをマッピングにドラッグします。表示されるダイアログで、Write オプションを選択します。
    5. クリック&ドラッグでカラムを接続します。

    Databricks のデータ を転送するには、ワークスペース内で右クリックし、Run Mapping をクリックします。

はじめる準備はできましたか?

Databricks Driver の無料トライアルをダウンロードしてお試しください:

 ダウンロード

詳細:

Databricks Icon Databricks JDBC Driver お問い合わせ

Databricks 連携のパワフルなJava アプリケーションを素早く作成して配布。