Persistens och scope för tabeller

Datahantering i Databricks

Smriti Mishra

Founder, NordData Insight

Vad är tabellpersistens?

  • Tabellpersistens styr lagring och bevarande av data
  • Det påverkar lagring, åtkomst och underhåll
  • Databricks stöder hanterade och ohanterade tabeller

Tecknad bild av personer som lagrar och granskar filer i arkivskåp

Datahantering i Databricks

Hanterade tabeller i Databricks

  • Hanteras helt av Databricks, inklusive dataplats och livscykel.
  • Data raderas automatiskt när tabellen tas bort.
  • Passar enkel, centraliserad datahantering.

Bild som visar hur ett centraliserat system fungerar med olika färgade punkter

Datahantering i Databricks

Ohanterade tabeller i Databricks

  • Decentraliserat tillvägagångssätt
  • Du styr lagringsplats och livscykel för data
  • Att ta bort en ohanterad tabell raderar inte data
  • Användbart vid anpassad lagring eller regelefterlevnadskrav

Bild som visar hur ett decentraliserat system fungerar med olika färgade punkter

Datahantering i Databricks

Hanterad eller ohanterad tabell?

Aspect.png

Datahantering i Databricks

Nyckelordet LOCATION

  • Nödvändig för att ange lagringsplats i ohanterade tabeller.
  • Lagringsplatsen påverkar kostnad, hämtningstider och lagringspolicyer.

 

CREATE TABLE table_name (
    column_name data_type,
    ...
)
USING file_format
LOCATION 'path/to/data';
Datahantering i Databricks

Viktiga lärdomar

  • Hanterade tabeller centraliserar lagring och livscykel i Databricks.
  • Ohanterade tabeller ger flexibilitet för lagring och datalivscykel.
  • Välj utifrån behov av lagring, kontroll och hantering.

Bild som visar lagring och livscykelhantering av data

Datahantering i Databricks

Nu kör vi en övning!

Datahantering i Databricks

Preparing Video For Download...