Databricks Variant data type is now generally available for semi-structured data
Databricks has announced the general availability of its Variant data type, designed to improve ingestion and querying of semi-structured data like JSON and XML. This feature addresses the long-standing tradeoff between flexibility and query performance by allowing users to ingest data without upfront schema definition while still achieving structured-like query speeds. The Variant type is integrated across Databricks' platform, impacting data and AI workloads for engineers and architects working with diverse data sources.
- →Variant data type for semi-structured data now generally available
- →Variant Shredding with Predictive Optimization boosts query performance
- →Variant integration across Databricks platform
- →Use cases for Variant data type
- →Performance benefits of Variant
Features (1) ›
- Variant data type for semi-structured data now generally available
The Variant data type, developed with the Delta and Spark communities and extended to Parquet and Iceberg, is now generally available on Databricks. It enables flexible ingestion of semi-structured data without updating pipelines and maintains structured-like query performance.
Enhancements (2) ›
- Variant Shredding with Predictive Optimization boosts query performance
Variant Shredding, now also generally available, is a performance optimization that uses Databricks' Predictive Optimization to improve query performance on Variant data. It automatically identifies critical shredded fields and collects statistics to enhance file skipping, leading to significantly faster reads.
- Simplified ingestion and interoperability with Variant
Variant can be ingested using Auto Loader for incremental processing of files from object storage or Zerobus, a managed ingestion service. Data written using Variant is compatible with Delta and Iceberg, allowing interoperability within the lakehouse. Genie Code in Lakeflow Pipelines Editor can generate Auto Loader pipelines using natural language.
Notes (3) ›
- Variant integration across Databricks platform
Variant is broadly integrated into Databricks, including Auto Loader and Spark Declarative Pipelines for data workloads, and Agent Bricks and AI Functions for AI workloads. This allows for seamless use across various aspects of the platform.
- Use cases for Variant data type
Over 5,000 teams use Variant to ingest data from streaming sources, API JSON payloads, and schemaless databases. It is particularly useful for managing unpredictable schema changes from upstream sources without breaking downstream pipelines.
- Performance benefits of Variant
Databricks users execute over 500 million Variant queries per month on more than 160 TB of data. Variant enables query speeds up to 30x faster than storing JSON as a string and nearly 4x faster than unshredded Variant, as demonstrated by its use in querying security logs at petabyte scale.
https://www.databricks.com/blog/ingest-semi-structured-data-faster-and-more-efficiently-variant-now-generally-available
Related releases
- Databricks SDK for Go v0.172.0 Enhances IAMv2 and Job Cluster Management Databricks Go SDK Releases ·
- Databricks Java SDK v0.146.0 Adds IAM V2 API, Updates Job Cluster Field Databricks Java SDK Releases ·
- Databricks SDK for Python v0.128.0 Adds Account and Workspace IAM V2 API Methods Databricks Python SDK Releases ·
- Amtrak Builds Unified Data Backbone with Databricks for Rail Network Transformation Databricks Blog ·
- Databricks Re-architects Serverless Network Config Delivery for 97.5% Latency Cut Databricks Blog ·
- How a Major Freight Railroad Scaled Pipeline Creation with Databricks Genie Code Databricks Blog ·