databricks Databricks Blog ·

Databricks Variant data type is now generally available for semi-structured data

blogdatadatabricksgaengineer
feature patch

Databricks has announced the general availability of its Variant data type, designed to improve ingestion and querying of semi-structured data like JSON and XML. This feature addresses the long-standing tradeoff between flexibility and query performance by allowing users to ingest data without upfront schema definition while still achieving structured-like query speeds. The Variant type is integrated across Databricks' platform, impacting data and AI workloads for engineers and architects working with diverse data sources.

  • Variant data type for semi-structured data now generally available
  • Variant Shredding with Predictive Optimization boosts query performance
  • Variant integration across Databricks platform
  • Use cases for Variant data type
  • Performance benefits of Variant
Features (1)
  • Variant data type for semi-structured data now generally available

    The Variant data type, developed with the Delta and Spark communities and extended to Parquet and Iceberg, is now generally available on Databricks. It enables flexible ingestion of semi-structured data without updating pipelines and maintains structured-like query performance.

Enhancements (2)
  • Variant Shredding with Predictive Optimization boosts query performance

    Variant Shredding, now also generally available, is a performance optimization that uses Databricks' Predictive Optimization to improve query performance on Variant data. It automatically identifies critical shredded fields and collects statistics to enhance file skipping, leading to significantly faster reads.

  • Simplified ingestion and interoperability with Variant

    Variant can be ingested using Auto Loader for incremental processing of files from object storage or Zerobus, a managed ingestion service. Data written using Variant is compatible with Delta and Iceberg, allowing interoperability within the lakehouse. Genie Code in Lakeflow Pipelines Editor can generate Auto Loader pipelines using natural language.

Notes (3)
  • Variant integration across Databricks platform

    Variant is broadly integrated into Databricks, including Auto Loader and Spark Declarative Pipelines for data workloads, and Agent Bricks and AI Functions for AI workloads. This allows for seamless use across various aspects of the platform.

  • Use cases for Variant data type

    Over 5,000 teams use Variant to ingest data from streaming sources, API JSON payloads, and schemaless databases. It is particularly useful for managing unpredictable schema changes from upstream sources without breaking downstream pipelines.

  • Performance benefits of Variant

    Databricks users execute over 500 million Variant queries per month on more than 160 TB of data. Variant enables query speeds up to 30x faster than storing JSON as a string and nearly 4x faster than unshredded Variant, as demonstrated by its use in querying security logs at petabyte scale.

Read the original announcement →

https://www.databricks.com/blog/ingest-semi-structured-data-faster-and-more-efficiently-variant-now-generally-available

Related releases