DataEngineered

Datasets curados com procedência rastreável
criados a partir de fontes públicas abertas

Para desenvolvedores, equipes de dados e pesquisadores que precisam de fatos estruturados e citados em vez de coletar dez fontes manualmente.

A DataEngineered projeta e mantém conjuntos de dados estruturados e relacionais em dez segmentos de consumo e técnicos — cada registro rastreável até uma fonte pública documentada, vendidos como snapshots para download, assinaturas e APIs.

10 produtos de dados
500K+ registros curados
100% com procedência rastreável
4 de 10 atualizados automaticamente todo mês

Os conjuntos de dados

Cada produto inclui uma amostra gratuita para que você valide o esquema e a qualidade antes de licenciar.

🧴

INCIdb

Skincare e cosméticos

Formulações cosméticas decompostas em suas listas de ingredientes INCI, vinculadas à química em nível de composto.

18.583 produtos46.973 nomes INCI
$79 pagamento único · para equipes de ML/NLP que criam modelos de normalização de ingredientes e analistas de compliance que fazem auditorias em massa dos Anexos

RoasterDB

Café especial

Produtos de café especial com origem, processo e notas de degustação mapeadas para a Roda de Sabores da SCA.

8.000+ produtos280+ torrefações20+ países
$49 pagamento único · para ML, motores de recomendação e apps de café B2B
💊

SuppDB

Suplementos e nootrópicos

Rótulos reais de suplementos do NIH DSLD, normalizados para dosagens em mg, com sinalizadores de blends proprietários e química do PubChem.

17.000+ produtos2.000+ marcas
$199 / $49 pagamento único · para apps de saúde com IA, comparação de doses e integração B2B
🌿

FloraDB

Plantas de interior e botânica

Plantas de interior verificadas individualmente, com métricas quantitativas de cuidado de luz, água e temperatura, toxicidade para pets segundo a ASPCA e taxonomia verificada no GBIF.

270 espécies curadas891 registros de toxicidadeÍndice de 20.000+ espécies
$49 pagamento único · para apps de identificação de plantas, vasos inteligentes e recursos de segurança para pets
🔧

MechanicDB

Automotivo OBD-II

Códigos de diagnóstico de falhas — universais SAE mais códigos OEM de 32 montadoras — mapeados para procedimentos de reparo classificados, níveis de dificuldade para quem faz por conta própria e estimativas de custo de peças de reposição.

15.886 códigos DTC32 montadoras (OEM)56.561 soluções classificadas75.055 mapeamentos de peças
$49 / $149 pagamento único · para software de oficinas, hardware OBD e assistentes mecânicos com IA
🥃

WhiskyDB

Destilados finos

Uísques e destilados finos de registros governamentais de rótulos e registros abertos, com um índice mensal de preços de leilão de 19 anos.

2.301 destilados3.764 destilarias21.156 referências de preço
$49 pagamento único · para agentes de IA, análise de bebidas, plataformas de leilão e tecnologia para hotelaria
🛎️

RecallDB

Recalls de produtos e segurança

Recalls oficiais de produtos do governo federal dos EUA, normalizados entre CPSC, FDA, FSIS, NHTSA e USCG — cada registro vinculado à sua coleta de origem por uma impressão digital do payload bruto.

127.783 recalls292.790 produtos5 fontes federais
$49 pagamento único · para vendedores de e-commerce, equipes de compliance e agentes de IA que precisam de dados de recall offline
🍷

WineDB

Vinhos finos e safras

Produtores de vinhos finos, cuvées e safras com percentuais exatos de uvas no blend, descritores organolépticos de degustação e índices de valorização no mercado secundário.

3.675 safras106 vinícolas57 denominações de origem
$49 pagamento único · para apps de adega, avaliação de vinhos e corpora RAG de vinhos finos
🔌

ApplianceDB

Conserto de eletrodomésticos

Códigos de erro de eletrodomésticos mapeados para procedimentos de reparo classificados e peças de reposição, identificados por chave composta (marca, tipo de eletrodoméstico, código) em 13 grandes marcas.

438 códigos de erro288 reparos classificados13 marcas
$99 pagamento único · para apps de conserto de eletrodomésticos, triagem de assistência técnica e assistentes de manutenção residencial
🧬

CSA

Biotecnologia em fase clínica

Ativos farmacêuticos em fase clínica vinculados ativo → ensaio → patrocinador listado → ticker → status na FDA, com um calendário de catalisadores futuros. Cada linha traz uma URL de origem.

2.268 Phase-3 ensaios1.841 ativos farmacêuticos2.103 catalisadores futuros
$499 pagamento único · para fundos de biotecnologia, screening orientado a eventos e inteligência de cenário competitivo

Como trabalhamos

A mesma disciplina de engenharia por trás de cada produto.

Somente fontes abertas

Registros governamentais, APIs institucionais e bancos de dados abertos — coletados de forma respeitosa, dentro dos termos de cada fonte, a partir de endpoints públicos.

Registros de procedência

Cada registro traz uma referência de fonte: nome, endpoint, licença e carimbo de data e hora do acesso. Qualquer fato pode ser rastreado até a origem.

Cobertura honesta

Nenhum valor inventado. Os números de cobertura por campo são publicados de antemão; atributos que uma fonte não publica ficam vazios ou recebem um valor padrão documentado.

Pipelines mantidos

Atualizações programadas com deduplicação mantêm os snapshots em dia — os conjuntos de dados são produtos vivos, não coletas pontuais.

Perguntas frequentes

Fatos técnicos, verificação de procedência e procedimentos de licenciamento.

Como a DataEngineered verifica a procedência de seus conjuntos de dados?

Cada registro inclui um registro de procedência transparente com o nome exato da fonte pública, o endpoint da API, a classificação da licença e o carimbo de data e hora da coleta. Nunca sintetizamos nem inventamos valores ausentes.

Com que frequência os snapshots dos conjuntos de dados da DataEngineered são atualizados?

Quatro produtos (RoasterDB, FloraDB, WhiskyDB e CSA) são atualizados por pipelines automatizados de ingestão mensal. MechanicDB, WineDB, ApplianceDB, INCIDB, SuppDB e RecallDB são edições curadas, relançadas quando suas fontes mudam. Cada edição é datada e suas contagens são medidas no momento do build.

Equipes corporativas podem licenciar subconjuntos personalizados ou esquemas de dados sob medida?

Sim. Além do checkout self-service com Stripe para os snapshots padrão, equipes corporativas de engenharia de dados podem solicitar curadorias sob medida para listas-alvo específicas ou formatos de exportação especializados, incluindo Parquet, DuckDB e JSON.

Há partições de dados de amostra gratuitas antes de comprar uma licença comercial?

Com certeza. Cada card de conjunto de dados no portal DataEngineered leva diretamente a uma partição de amostra gratuita hospedada no Hugging Face ou no Kaggle, para que sua equipe possa testar e validar a compatibilidade do esquema na hora.

Licenciamento e trabalhos sob medida

Os conjuntos de dados completos são vendidos sob licenças comerciais — a maioria é self-service, com checkout seguro pelo Stripe e download imediato, como snapshots de pagamento único ou assinaturas com atualizações. Curadoria sob medida para sua lista-alvo está disponível sob solicitação.

ou escreva para hello@dataengineered.io