Als governed data al in Azure Databricks Unity Catalog staat, is iedere tabel naar een ander lake kopiëren niet de enige optie.
Fabric kan een Mirrored Azure Databricks catalog maken. Die ontdekt Unity Catalog-metadata en maakt Databricks-type shortcuts voor geselecteerde tabellen. Een Fabric Lakehouse kan die tabellen daarna ontsluiten via OneLake-shortcuts.
De flow
Azure Databricks Unity Catalog
|
v
Mirrored Azure Databricks catalog in Fabric
|
+--> SQL analytics endpoint
|
v
OneLake shortcuts in a Fabric Lakehouse
|
+--> Spark notebook
+--> Direct Lake or semantic model
De validatieworkspace was blog_databricks_shortcuts. Deze bevatte een
sales_lakehouse en SQL analytics endpoint op actieve trial capacity.
Vereisten
Je hebt nodig:
- een Azure Databricks-workspace met Unity Catalog;
- external data access ingeschakeld op de metastore;
EXTERNAL USE SCHEMAop de schema’s waartoe Fabric toegang moet krijgen;- een Fabric-workspace met capacity; en
- permission om mirrored items, connections en shortcuts te maken.
De Databricks-connection ondersteunt Organizational account- en Service principal authentication.
1. Maak de mirrored catalog
In blog_databricks_shortcuts:
- selecteer New item;
- selecteer Mirrored Azure Databricks catalog;
- maak of selecteer de Databricks-connection;
- kies de catalog, schema’s en tabellen;
- laat Automatically sync future catalog changes for the selected schema ingeschakeld, tenzij je een vaste allowlist nodig hebt; en
- maak het item.
Fabric maakt een catalog item, shortcuts voor geselecteerde tabellen en een SQL analytics endpoint. Lege schema’s worden niet getoond.
2. Controleer met SQL
Open het SQL analytics endpoint van het mirrored item en voer uit:
select top (100)
*
from [sales].[orders];
Gebruik de namen uit je Unity Catalog-selectie. Ontbreekt het object, controleer dan eerst de Databricks-identity en Unity Catalog-privileges.
3. Maak een Lakehouse-shortcut
Maak of open:
sales_lakehouse
In Lakehouse Explorer:
- selecteer New shortcut;
- kies Microsoft OneLake;
- selecteer de mirrored Databricks catalog;
- selecteer de tabellen; en
- selecteer Create.
Dit maakt een shortcut naar het Fabric catalog item. Het is geen tweede kopie.
4. Lees de shortcut met Spark
Koppel het Lakehouse aan een Fabric-notebook:
from notebookutils import mssparkutils
for item in mssparkutils.fs.ls("Tables"):
print(item.name, item.path)
Bevraag daarna de geselecteerde tabel:
orders = spark.table("sales_orders")
display(
orders
.select("order_id", "customer_id", "order_date", "amount")
.orderBy("order_date", ascending=False)
.limit(20)
)
Vervang tabel en kolommen door de namen in je Lakehouse.
Voor een aggregatie:
from pyspark.sql import functions as F
summary = (
orders
.groupBy("customer_id")
.agg(
F.count("*").alias("order_count"),
F.sum("amount").alias("total_amount")
)
.orderBy(F.col("total_amount").desc())
)
display(summary.limit(20))
ADLS achter een firewall
Unity Catalog-metadata en storagetoegang zijn gescheiden.
Als het ADLS Gen2-account een firewall heeft:
- wijs een workspace identity toe aan de Fabric-workspace;
- configureer de tab Network Security bij het maken van de mirrored catalog;
- geef die identity de vereiste storagetoegang; en
- laat de workspace identity met Trusted Workspace Access door de firewall.
Zelfs wanneer Databricks een service principal gebruikt, gebruikt Fabric de workspace identity om de ADLS-firewall te passeren.
Permissions volgen de data niet automatisch
Unity Catalog-grants worden niet voor iedere downstream gebruiker OneLake-grants. Houd beide systemen gelijk:
- synchroniseer de relevante Entra group naar Databricks;
- verleen de Unity Catalog-privileges;
- maak een OneLake data access role; en
- voeg dezelfde groep toe met alleen de benodigde shortcuttoegang.
Zie voor geautomatiseerde afstemming Houd Databricks- en Fabric-permissions gelijk met Policy Weaver. Dat artikel beschrijft de ondersteunde vertaalgrens en de Fabric identity settings die voor enforcement nodig zijn.
Troubleshooting
Catalog of schema ontbreekt
Controleer Unity Catalog-toegang, inclusief EXTERNAL USE SCHEMA.
Het mirrored item bestaat, maar een shortcut niet
Controleer de table inclusion list en bevestig dat het schema zichtbare tabellen bevat.
403 bij storage achter een firewall
Controleer de workspace identity en Trusted Workspace Access. Databricks-authentication geeft geen recht om de firewall te passeren.
Spark kan de shortcut niet bevragen
Bevestig dat de tweede shortcut naar de mirrored catalog wijst, het juiste Lakehouse aan de notebook is gekoppeld en de tabelnaam overeenkomt.
Bron
Het nuttige patroon is asymmetrisch: Databricks beheert de bron, terwijl Fabric geselecteerde tabellen via OneLake, SQL, Spark en Power BI ontsluit zonder te beginnen met een bulk-copyproject.
Reacties laden…