Para a Vert Analytics, empresa especializada em soluções de dados, IA e hiperautomação para governo e grandes empresas, grande parte da conversa sobre inteligência artificial em projetos corporativos concentra atenção no modelo escolhido, machine learning, IA generativa, enquanto a arquitetura de dados que alimenta esse modelo recebe atenção secundária. Um modelo sofisticado, alimentado por dados desorganizados, duplicados ou sem origem clara, tende a produzir resultados pouco confiáveis, independentemente de quão avançada seja a técnica aplicada sobre esses dados.
A Analytics, solução própria de inteligência artificial da Vert Analytics (empresa brasileira, referência em IA, nascida em Brasília/DF, com 28 anos de história, mais de 130 especialistas em dados e mais de 100 projetos entregues), resolve essa lacuna, estruturando projetos sobre uma arquitetura de Data Lakehouse, que organiza dados estruturados e não estruturados de forma consistente antes de qualquer modelo de machine learning ou IA generativa ser aplicado sobre eles.
Por que tanta atenção vai para o modelo e pouca para a arquitetura de dados?
Discussões sobre inteligência artificial tendem a girar em torno do modelo: qual técnica usar, qual algoritmo é mais avançado, qual abordagem promete melhor resultado. Esse tipo de conversa é mais visível e mais fácil de comunicar do que a discussão, menos glamorosa, sobre como os dados são organizados antes de chegar até o modelo, etapa que raramente aparece em apresentações comerciais.
Esse desequilíbrio de atenção tem consequência prática: projetos que investem pesado em modelo sofisticado, mas negligenciam a organização dos dados de origem, frequentemente entregam resultado inferior ao esperado, mesmo quando o modelo em si foi bem escolhido para o problema em questão.
O que é um Data Lakehouse e por que ele sustenta modelos mais confiáveis?
Um Data Lakehouse combina características de dois tipos de arquitetura de dados que tradicionalmente eram tratadas separadamente: a flexibilidade de armazenar dados não estruturados em grande volume, típica de um data lake, com a organização e governança de dados estruturados, típica de um data warehouse tradicional.
Essa combinação permite que dados de formatos diferentes, texto, número, documento, imagem, sejam armazenados e organizados dentro da mesma estrutura, com governança consistente sobre origem, qualidade e permissão de acesso. Essa unificação evita a necessidade de sistemas separados para cada tipo de dado.
Como estruturar dados antes do modelo?
A camada analítica da Vert Analytics organiza dados dentro de uma arquitetura de Data Lakehouse antes de qualquer modelo de machine learning ou IA generativa ser aplicado, garantindo que a origem, a qualidade e a atualização de cada dado estejam claras antes de alimentar qualquer processo analítico. Essa etapa de organização prévia costuma consumir tempo relevante do projeto, mas reduz significativamente o risco de o modelo final produzir resultado pouco confiável por depender de dados mal estruturados na origem.
Esse tipo de arquitetura também facilita a evolução do projeto ao longo do tempo: quando novos modelos precisam ser adicionados ou ajustados, eles podem se conectar à mesma base de dados já organizada, em vez de exigir uma nova estrutura de dados construída do zero para cada novo caso de uso.
A Vert Analytics reforça que essa disciplina na organização de dados é o que sustenta a confiabilidade de projetos analíticos aplicados a contextos de missão crítica, onde um resultado impreciso, gerado a partir de dado mal organizado, pode ter consequência financeira ou operacional relevante.
O que uma arquitetura de dados sólida muda no resultado final?
Quando a arquitetura de dados é bem estruturada desde o início, o modelo aplicado sobre ela tem uma base mais confiável para produzir resultado consistente, reduzindo a chance de erro causado por dado incompleto, duplicado ou de origem incerta, problema difícil de corrigir depois que o modelo já está em produção.
Em suma, essa disciplina facilita a manutenção do projeto ao longo do tempo: problemas de qualidade de dado tendem a ser identificados e corrigidos na própria arquitetura, em vez de exigir ajustes recorrentes no modelo para compensar uma base de dados que nunca foi organizada adequadamente desde o início do projeto, remendo que raramente resolve o problema de origem.
Essa disciplina técnica é reconhecida pelo mercado: a Vert Analytics é SAS Partner of the Year, Cloudera Americas Partner e Great Place to Work por dois anos consecutivos, parcerias que também sustentam o próprio stack tecnológico por trás do Data Lakehouse, construído sobre SAS, Cloudera e IBM.