Databricks Lança Tipo FILE para Dados Multimodais em Lakehouse
Aprofundamento CEVIU
Aprofundamento
A Databricks amplia a proposta do Lakehouse com o novo tipo FILE, agora em beta, uma coluna nativa para dados não estruturados. Isso significa que vídeos, imagens, áudios e documentos agora podem ser armazenados diretamente em tabelas, como qualquer outro dado. Para equipes de DevOps e engenheiros de plataforma, a principal vantagem é a unificação da gestão de dados. Esqueça sistemas separados para arquivos binários grandes. Tudo reside no Lakehouse, otimizando pipelines de IA e simplificando a governança.
A implementação do tipo FILE utiliza um sistema de ponteiros leves. Ele não move o binário completo para dentro da tabela, mas sim uma referência. O conteúdo real do arquivo só é processado quando a consulta exige, garantindo alta performance. Essa abordagem evita gargalos comuns em processamento de dados multimodais, onde o transporte de grandes volumes de dados pode ser um desafio. O foco é na eficiência e na capacidade de aplicar lógica de negócios e IA diretamente sobre esses dados, sem a complexidade de gerenciar o ciclo de vida de arquivos externos.
O que mudou
A novidade sobre o tipo FILE complementa e evolui inovações anteriores da Databricks. Em junho de 2026, noticiamos o anúncio do ecossistema Software-Defined Storage (SDS) e o protocolo OpenSharing, que visavam conectar ambientes de armazenamento corporativos ao Lakehouse. Com o tipo FILE, essa conexão se aprofunda: os arquivos nesses storages externos não são apenas referenciados, mas se tornam cidadãos de primeira classe nas tabelas do Lakehouse, com governança unificada. Antes, esses arquivos eram gerenciados por sistemas de permissão separados. Agora, eles se beneficiam dos mesmos controles de acesso granular e políticas de segurança aplicadas aos dados estruturados.
Além disso, a integração do FILE com formatos abertos como Parquet, Delta Lake, Iceberg e Spark, anunciada no artigo-fonte, mostra uma evolução na interoperabilidade. Já em abril de 2026, o CEVIU cobriu a introdução do Apache Iceberg™ v3 com o tipo VARIANT para dados semi-estruturados. O tipo FILE estende essa capacidade, trazendo dados *verdadeiramente* não estruturados para esses ecossistemas abertos, garantindo que o Lakehouse continue a ser uma plataforma aberta e portátil, sem vendor lock-in. A governança unificada e o ciclo de vida sincronizado (deleção de linha = deleção de arquivo) resolvem problemas como a gestão do 'direito de ser esquecido' (GDPR), que antes exigia coordenação manual complexa entre sistemas.
Por que isso importa
Para o engenheiro de plataformas, o tipo FILE significa um grande passo em direção à simplificação operacional e à otimização de custos. Ele resolve o desafio de gerenciar dados multimodais e estruturados em plataformas distintas, integrando tudo em um único ponto de governança. Isso reduz a complexidade de pipelines de dados e IA, acelera o desenvolvimento de novas aplicações e diminui a sobrecarga de manutenção. A capacidade de aplicar políticas de segurança e conformidade (como GDPR) de forma automatizada em todos os tipos de dados é um ganho enorme em termos de confiabilidade e auditoria.
Outro ponto crucial é a preparação para o futuro da IA. Com o FILE, dados brutos como vídeos de dashcams ou documentos complexos se tornam imediatamente 'AI-ready', ou seja, passíveis de consulta e análise. Isso permite que equipes de Machine Learning construam e treinem modelos com muito mais agilidade e sem a necessidade de etapas caras e demoradas de movimentação ou duplicação de dados, como a Databricks promete para o futuro do tipo FILE, com versionamento e clonagem sem copiar binários subjacentes.
Linha do tempo
A Databricks anuncia suporte para Apache Iceberg™ v3, incluindo Row Lineage e o tipo VARIANT para dados semi-estruturados.
Lançamento do DuckLake v1.0, um formato Lakehouse nativo em SQL pronto para produção.
Databricks anuncia o ecossistema Software-Defined Storage (SDS) e o protocolo OpenSharing para conectar ambientes de armazenamento ao Lakehouse.
Databricks lança o Lakehouse//RT, um data warehouse em tempo real baseado no motor Reyden.
Databricks anuncia Lakehouse//RT e LTAP no Data + AI Summit 2026 para unificar dados em tempo real.
Databricks inova com Feature Views para otimizar pipelines de ML, agora em prévia pública.
Databricks Lança Tipo FILE para Dados Multimodais em Lakehouse (notícia atual).
Perguntas frequentes
O que é o tipo FILE e qual sua principal função?
O tipo FILE é uma nova coluna nativa, em fase beta na Databricks, que permite armazenar dados não estruturados como vídeos, imagens e documentos diretamente em tabelas Lakehouse. Sua função é unificar a gestão e governança desses dados com os dados estruturados, tornando-os prontos para IA e análise sem a necessidade de sistemas separados.
Como o tipo FILE afeta a performance e o custo de armazenamento?
Ele melhora a performance armazenando apenas ponteiros leves para os arquivos binários, que residem no object storage. O conteúdo real é carregado apenas quando necessário, evitando o transporte e processamento desnecessário de grandes volumes de dados. Isso otimiza o uso de recursos e impacta positivamente nos custos de infraestrutura e processamento.
Quais benefícios o tipo FILE traz para governança e conformidade de dados?
O tipo FILE permite aplicar os mesmos controles de acesso e políticas de segurança (como ABAC) dos dados estruturados aos arquivos não estruturados. Também automatiza a conformidade, pois a exclusão de uma linha que contém um FILE resulta na exclusão automática do binário associado no object storage, facilitando requisições como o 'direito de ser esquecido' do GDPR.
Como o tipo FILE contribui para pipelines de IA e Machine Learning?
Ele torna os dados não estruturados 'AI-ready' ao integrá-los diretamente no Lakehouse, permitindo que funções de IA (UDFs em Python ou SQL) e modelos sejam executados diretamente sobre eles. Isso simplifica a criação de conjuntos de treinamento, acelera a experimentação e possibilita a construção de agentes de IA multimodais que acessam uma fonte única e governada de dados.
Fontes
- databricks.comfonte original
- Categoria
- CEVIU DevOps
- Publicado
- 12 de agosto de 2026
- Editoria
- CEVIU DevOps

