Ga naar de inhoud
R Roesli.
Ga terug
azure-databricks

Azure Databricks Unity Catalog-data in Fabric gebruiken met shortcuts

Spiegel Azure Databricks Unity Catalog-metadata naar Fabric en ontsluit governed tabellen via OneLake-shortcuts in een Lakehouse.

Als governed data al in Azure Databricks Unity Catalog staat, is iedere tabel naar een ander lake kopiëren niet de enige optie.

Fabric kan een Mirrored Azure Databricks catalog maken. Die ontdekt Unity Catalog-metadata en maakt Databricks-type shortcuts voor geselecteerde tabellen. Een Fabric Lakehouse kan die tabellen daarna ontsluiten via OneLake-shortcuts.

De flow

Azure Databricks Unity Catalog
        |
        v
Mirrored Azure Databricks catalog in Fabric
        |
        +--> SQL analytics endpoint
        |
        v
OneLake shortcuts in a Fabric Lakehouse
        |
        +--> Spark notebook
        +--> Direct Lake or semantic model

De validatieworkspace was blog_databricks_shortcuts. Deze bevatte een sales_lakehouse en SQL analytics endpoint op actieve trial capacity.

Vereisten

Je hebt nodig:

  1. een Azure Databricks-workspace met Unity Catalog;
  2. external data access ingeschakeld op de metastore;
  3. EXTERNAL USE SCHEMA op de schema’s waartoe Fabric toegang moet krijgen;
  4. een Fabric-workspace met capacity; en
  5. permission om mirrored items, connections en shortcuts te maken.

De Databricks-connection ondersteunt Organizational account- en Service principal authentication.

1. Maak de mirrored catalog

In blog_databricks_shortcuts:

  1. selecteer New item;
  2. selecteer Mirrored Azure Databricks catalog;
  3. maak of selecteer de Databricks-connection;
  4. kies de catalog, schema’s en tabellen;
  5. laat Automatically sync future catalog changes for the selected schema ingeschakeld, tenzij je een vaste allowlist nodig hebt; en
  6. maak het item.

Fabric maakt een catalog item, shortcuts voor geselecteerde tabellen en een SQL analytics endpoint. Lege schema’s worden niet getoond.

2. Controleer met SQL

Open het SQL analytics endpoint van het mirrored item en voer uit:

select top (100)
    *
from [sales].[orders];

Gebruik de namen uit je Unity Catalog-selectie. Ontbreekt het object, controleer dan eerst de Databricks-identity en Unity Catalog-privileges.

3. Maak een Lakehouse-shortcut

Maak of open:

sales_lakehouse

In Lakehouse Explorer:

  1. selecteer New shortcut;
  2. kies Microsoft OneLake;
  3. selecteer de mirrored Databricks catalog;
  4. selecteer de tabellen; en
  5. selecteer Create.

Dit maakt een shortcut naar het Fabric catalog item. Het is geen tweede kopie.

4. Lees de shortcut met Spark

Koppel het Lakehouse aan een Fabric-notebook:

from notebookutils import mssparkutils

for item in mssparkutils.fs.ls("Tables"):
    print(item.name, item.path)

Bevraag daarna de geselecteerde tabel:

orders = spark.table("sales_orders")

display(
    orders
        .select("order_id", "customer_id", "order_date", "amount")
        .orderBy("order_date", ascending=False)
        .limit(20)
)

Vervang tabel en kolommen door de namen in je Lakehouse.

Voor een aggregatie:

from pyspark.sql import functions as F

summary = (
    orders
        .groupBy("customer_id")
        .agg(
            F.count("*").alias("order_count"),
            F.sum("amount").alias("total_amount")
        )
        .orderBy(F.col("total_amount").desc())
)

display(summary.limit(20))

ADLS achter een firewall

Unity Catalog-metadata en storagetoegang zijn gescheiden.

Als het ADLS Gen2-account een firewall heeft:

  1. wijs een workspace identity toe aan de Fabric-workspace;
  2. configureer de tab Network Security bij het maken van de mirrored catalog;
  3. geef die identity de vereiste storagetoegang; en
  4. laat de workspace identity met Trusted Workspace Access door de firewall.

Zelfs wanneer Databricks een service principal gebruikt, gebruikt Fabric de workspace identity om de ADLS-firewall te passeren.

Permissions volgen de data niet automatisch

Unity Catalog-grants worden niet voor iedere downstream gebruiker OneLake-grants. Houd beide systemen gelijk:

  1. synchroniseer de relevante Entra group naar Databricks;
  2. verleen de Unity Catalog-privileges;
  3. maak een OneLake data access role; en
  4. voeg dezelfde groep toe met alleen de benodigde shortcuttoegang.

Zie voor geautomatiseerde afstemming Houd Databricks- en Fabric-permissions gelijk met Policy Weaver. Dat artikel beschrijft de ondersteunde vertaalgrens en de Fabric identity settings die voor enforcement nodig zijn.

Troubleshooting

Catalog of schema ontbreekt

Controleer Unity Catalog-toegang, inclusief EXTERNAL USE SCHEMA.

Het mirrored item bestaat, maar een shortcut niet

Controleer de table inclusion list en bevestig dat het schema zichtbare tabellen bevat.

403 bij storage achter een firewall

Controleer de workspace identity en Trusted Workspace Access. Databricks-authentication geeft geen recht om de firewall te passeren.

Spark kan de shortcut niet bevragen

Bevestig dat de tweede shortcut naar de mirrored catalog wijst, het juiste Lakehouse aan de notebook is gekoppeld en de tabelnaam overeenkomt.

Bron

Het nuttige patroon is asymmetrisch: Databricks beheert de bron, terwijl Fabric geselecteerde tabellen via OneLake, SQL, Spark en Power BI ontsluit zonder te beginnen met een bulk-copyproject.


Deel deze post:

Lees verder

Vorige post
Houd Databricks- en Fabric-permissions gelijk met Policy Weaver
Volgende post
Ontbrekende of verouderde Lakehouse-tabellen in het Fabric SQL endpoint oplossen
Community

Praat mee

Meld je aan met GitHub om een reactie achter te laten.

GitHub

Reacties laden…

Meld je aan met GitHub om te reageren