DataEngineered

Datasets curados con procedencia trazable
creados a partir de fuentes públicas abiertas

Para desarrolladores, equipos de datos e investigadores que necesitan datos estructurados y citados en lugar de extraer a mano diez fuentes.

DataEngineered diseña y mantiene conjuntos de datos estructurados y relacionales en diez sectores de consumo y técnicos; cada registro es trazable hasta una fuente pública documentada y se vende como snapshots descargables, suscripciones y API.

10 productos de datos
500K+ registros curados
100% con procedencia trazable
4 de 10 se actualizan automáticamente cada mes

Los conjuntos de datos

Cada producto incluye una muestra gratuita para que puedas validar el esquema y la calidad antes de licenciarlo.

🧴

INCIdb

Cuidado de la piel y cosmética

Formulaciones cosméticas desglosadas en sus listas de ingredientes INCI, vinculadas a la química de cada compuesto.

18.583 productos46.973 nombres INCI
$79 pago único · para equipos de ML/NLP que crean modelos de normalización de ingredientes y analistas de cumplimiento normativo que realizan auditorías masivas de los anexos

RoasterDB

Café de especialidad

Productos de café de especialidad con origen, proceso y notas de cata asignadas a la rueda de sabores de la SCA.

8.000+ productos280+ tostadores20+ países
$49 pago único · para ML, motores de recomendación y apps de café B2B
💊

SuppDB

Suplementos y nootrópicos

Etiquetas reales de suplementos del NIH DSLD, normalizadas a dosis en mg, con indicadores de mezclas patentadas y química de PubChem.

17.000+ productos2.000+ marcas
$199 / $49 pago único · para apps de salud con IA, comparación de dosis e integración B2B
🌿

FloraDB

Plantas de interior y botánica

Plantas de interior verificadas individualmente, con métricas cuantitativas de cuidado de luz, agua y temperatura, toxicidad para mascotas según la ASPCA y taxonomía verificada en GBIF.

270 especies curadas891 registros de toxicidadÍndice de 20.000+ especies
$49 pago único · para apps de identificación de plantas, macetas inteligentes y funciones de seguridad para mascotas
🔧

MechanicDB

Automoción OBD-II

Códigos de diagnóstico de averías (universales SAE más códigos OEM de 32 marcas) asignados a procedimientos de reparación clasificados, niveles de dificultad para hacerlo uno mismo y estimaciones de coste de piezas de recambio.

15.886 códigos DTC32 marcas (OEM)56.561 soluciones clasificadas75.055 correspondencias de piezas
$49 / $149 pago único · para software de talleres, hardware OBD y asistentes de mecánica con IA
🥃

WhiskyDB

Destilados premium

Whiskies y destilados premium procedentes de registros oficiales de etiquetas y registros abiertos, con un índice mensual de precios de subasta de 19 años.

2.301 destilados3.764 destilerías21.156 precios de referencia
$49 pago único · para agentes de IA, analítica de bebidas, plataformas de subastas y tecnología para hostelería
🛎️

RecallDB

Retiradas de productos y seguridad

Retiradas oficiales de productos del gobierno federal de EE. UU., normalizadas entre CPSC, FDA, FSIS, NHTSA y USCG; cada registro enlaza con su extracción de origen mediante una huella digital del payload sin procesar.

127.783 retiradas292.790 productos5 fuentes federales
$49 pago único · para vendedores de comercio electrónico, equipos de cumplimiento normativo y agentes de IA que necesitan datos de retiradas sin conexión
🍷

WineDB

Vinos finos y añadas

Productores de vinos finos, cuvées y añadas con porcentajes exactos de variedades en el coupage, descriptores organolépticos de cata e índices de valoración en el mercado secundario.

3.675 añadas106 bodegas57 denominaciones de origen
$49 pago único · para apps de bodega, valoración de vinos y corpus RAG de vinos finos
🔌

ApplianceDB

Reparación de electrodomésticos

Códigos de error de electrodomésticos asignados a procedimientos de reparación clasificados y piezas de repuesto, identificados por una clave compuesta (marca, tipo de electrodoméstico, código) en 13 grandes marcas.

438 códigos de error288 reparaciones clasificadas13 marcas
$99 pago único · para apps de reparación de electrodomésticos, triaje de servicio técnico y asistentes de mantenimiento del hogar
🧬

CSA

Biotecnología en fase clínica

Activos farmacológicos en fase clínica vinculados activo → ensayo → patrocinador cotizado → ticker → estado ante la FDA, con un calendario de catalizadores futuros. Cada fila incluye una URL de origen.

2.268 Phase-3 ensayos1.841 activos farmacológicos2.103 catalizadores futuros
$499 pago único · para fondos biotecnológicos, screening basado en eventos e inteligencia del panorama competitivo

Cómo trabajamos

La misma disciplina de ingeniería detrás de cada producto.

Solo fuentes abiertas

Registros oficiales, API institucionales y bases de datos abiertas, recopilados de forma respetuosa, dentro de las condiciones de cada fuente, desde endpoints públicos.

Registros de procedencia

Cada registro incluye una referencia a su fuente: nombre, endpoint, licencia y marca de tiempo de acceso. Cualquier dato puede rastrearse hasta su origen.

Cobertura honesta

Sin valores inventados. Las cifras de cobertura por campo se publican de antemano; los atributos que una fuente no publica quedan vacíos o llevan un valor por defecto documentado.

Pipelines mantenidos

Las actualizaciones programadas con deduplicación mantienen los snapshots al día: los conjuntos de datos son productos vivos, no extracciones puntuales.

Preguntas frecuentes

Datos técnicos, verificación de la procedencia y procedimientos de licencia.

¿Cómo verifica DataEngineered la procedencia de sus conjuntos de datos?

Cada registro incluye un registro de procedencia transparente con el nombre exacto de la fuente pública, el endpoint de la API, la clasificación de la licencia y la marca de tiempo de recopilación. Nunca sintetizamos ni inventamos valores faltantes.

¿Con qué frecuencia se actualizan los snapshots de los conjuntos de datos de DataEngineered?

Cuatro productos (RoasterDB, FloraDB, WhiskyDB y CSA) se actualizan mediante pipelines automatizados de ingesta mensual. MechanicDB, WineDB, ApplianceDB, INCIDB, SuppDB y RecallDB son ediciones curadas que se reeditan cuando cambian sus fuentes. Cada edición está fechada y sus recuentos se miden en el momento de la compilación.

¿Pueden los equipos empresariales licenciar subconjuntos personalizados o esquemas de datos a medida?

Sí. Además del pago autoservicio con Stripe para los snapshots estándar, los equipos de ingeniería de datos empresariales pueden solicitar curaciones a medida sobre listas objetivo específicas o formatos de exportación especializados, como Parquet, DuckDB y JSON.

¿Hay particiones de datos de muestra gratuitas antes de comprar una licencia comercial?

Por supuesto. Cada ficha de conjunto de datos del portal DataEngineered enlaza directamente a una partición de muestra gratuita alojada en Hugging Face o Kaggle, para que tu equipo pueda probar y validar la compatibilidad del esquema de inmediato.

Licencias y trabajos a medida

Los conjuntos de datos completos se venden con licencias comerciales; la mayoría son de autoservicio, con pago seguro mediante Stripe y descarga inmediata, como snapshots de pago único o suscripciones con actualizaciones. Bajo petición, ofrecemos curación a medida sobre tu lista objetivo.

o escribe a hello@dataengineered.io