DataEngineered

Kuratierte Datensätze mit nachverfolgbarer Herkunft
aus offenen öffentlichen Quellen

Für Entwickler, Datenteams und Forschende, die strukturierte, belegte Fakten brauchen, statt zehn Quellen von Hand zu scrapen.

DataEngineered entwickelt und pflegt strukturierte, relationale Datensätze in zehn Verbraucher- und Fachbereichen — jeder Datensatz ist auf eine dokumentierte öffentliche Quelle rückführbar; erhältlich als herunterladbare Snapshots, Abonnements und APIs.

10 Datensatzprodukte
500K+ kuratierte Datensätze
100% mit nachverfolgbarer Herkunft
4 von 10 monatlich automatisch aktualisiert

Die Datensätze

Zu jedem Produkt gibt es kostenlose Beispieldaten, damit Sie Schema und Qualität vor der Lizenzierung prüfen können.

🧴

INCIdb

Hautpflege & Kosmetik

Kosmetische Rezepturen, aufgeschlüsselt in ihre INCI-Zutatenlisten und verknüpft mit Chemiedaten auf Verbindungsebene.

18.583 Produkte46.973 INCI-Namen
$79 einmalig · für ML/NLP-Teams, die Modelle zur Normalisierung von Inhaltsstoffen entwickeln, und Compliance-Analysten, die Anhang-Prüfungen in großem Umfang durchführen

RoasterDB

Specialty Coffee

Specialty-Coffee-Produkte mit Herkunft, Aufbereitung und Geschmacksnoten, zugeordnet zum SCA Flavor Wheel.

8.000+ Produkte280+ Röstereien20+ Länder
$49 einmalig · für ML, Empfehlungssysteme und B2B-Kaffee-Apps
💊

SuppDB

Nahrungsergänzungsmittel & Nootropika

Echte Etiketten von Nahrungsergänzungsmitteln aus der NIH DSLD, normalisiert auf mg-Dosierungen, mit Kennzeichnung proprietärer Mischungen und PubChem-Chemiedaten.

17.000+ Produkte2.000+ Marken
$199 / $49 einmalig · für KI-Gesundheits-Apps, Dosisvergleiche und B2B-Integration
🌿

FloraDB

Zimmerpflanzen & Botanik

Einzeln geprüfte Zimmerpflanzen mit quantitativen Pflegewerten für Licht, Wasser und Temperatur, ASPCA-Angaben zur Giftigkeit für Haustiere und durch GBIF verifizierter Taxonomie.

270 kuratierte Arten891 Toxizitätseinträge20.000+-Artenindex
$49 einmalig · für Pflanzenbestimmungs-Apps, smarte Pflanzgefäße und Haustier-Sicherheitsfunktionen
🔧

MechanicDB

Fahrzeugdiagnose OBD-II

Diagnose-Fehlercodes — SAE-universell plus OEM-Codes für 32 Marken — zugeordnet zu priorisierten Reparaturabläufen, Schwierigkeitsgraden für Selbermacher und Kostenschätzungen für Nachrüstteile.

15.886 DTC-Codes32 Marken (OEM)56.561 priorisierte Lösungen75.055 Teilezuordnungen
$49 / $149 einmalig · für Werkstattsoftware, OBD-Hardware und KI-Mechaniker-Assistenten
🥃

WhiskyDB

Edle Spirituosen

Whiskys und edle Spirituosen aus staatlichen Etikettenregistern und offenen Registern, mit einem monatlichen Auktionspreisindex über 19 Jahre.

2.301 Spirituosen3.764 Brennereien21.156 Preisreferenzen
$49 einmalig · für KI-Agenten, Getränkeanalysen, Auktionsplattformen und Gastronomie-Technologie
🛎️

RecallDB

Produktrückrufe & Sicherheit

Offizielle US-Bundesrückrufe von Produkten, normalisiert über CPSC, FDA, FSIS, NHTSA und USCG — jeder Datensatz ist mit seinem Quellabruf und einem Fingerprint der Rohdaten verknüpft.

127.783 Rückrufe292.790 Produkte5 Bundesquellen
$49 einmalig · für E-Commerce-Händler, Compliance-Teams und KI-Agenten, die Rückrufdaten offline benötigen
🍷

WineDB

Edle Weine & Jahrgänge

Weingüter, Cuvées und Jahrgänge edler Weine mit exakten Rebsortenanteilen, organoleptischen Verkostungsbeschreibungen und Bewertungsindizes des Sekundärmarkts.

3.675 Jahrgänge106 Weingüter57 Herkunftsbezeichnungen
$49 einmalig · für Weinkeller-Apps, Weinbewertung und RAG-Korpora zu edlen Weinen
🔌

ApplianceDB

Reparatur von Haushaltsgeräten

Fehlercodes von Haushaltsgeräten, zugeordnet zu priorisierten Reparaturabläufen und Ersatzteilen, identifiziert über die zusammengesetzte Identität (Marke, Gerätetyp, Code), über 13 große Marken.

438 Fehlercodes288 priorisierte Reparaturen13 Marken
$99 einmalig · für Reparatur-Apps für Haushaltsgeräte, Triage im Außendienst und Assistenten für die Hausinstandhaltung
🧬

CSA

Biotech in klinischer Entwicklung

Arzneimittelkandidaten in klinischer Entwicklung, verknüpft Wirkstoff → Studie → börsennotierter Sponsor → Ticker → FDA-Status, mit einem Kalender künftiger Katalysatoren. Jede Zeile enthält eine Quell-URL.

2.268 Phase-3 Studien1.841 Wirkstoffkandidaten2.103 künftige Katalysatoren
$499 einmalig · für Biotech-Fonds, ereignisgesteuertes Screening und Marktlandschaftsanalysen

Wie wir arbeiten

Dieselbe technische Sorgfalt hinter jedem Produkt.

Nur offene Quellen

Staatliche Register, institutionelle APIs und offene Datenbanken — rücksichtsvoll erfasst, im Rahmen der Bedingungen jeder Quelle, über öffentliche Endpunkte.

Herkunftsnachweise

Jeder Datensatz enthält eine Quellenangabe: Name, Endpunkt, Lizenz und Zeitstempel des Abrufs. Jede Angabe lässt sich zurückverfolgen.

Ehrliche Abdeckung

Keine erfundenen Werte. Die Abdeckung pro Feld wird vorab veröffentlicht; Attribute, die eine Quelle nicht veröffentlicht, bleiben leer oder erhalten einen dokumentierten Standardwert.

Gepflegte Pipelines

Geplante Aktualisierungen mit Deduplizierung halten die Snapshots aktuell — die Datensätze sind lebendige Produkte, keine einmaligen Scrapes.

Häufig gestellte Fragen

Technische Fakten, Herkunftsprüfung und Lizenzierungsablauf.

Wie überprüft DataEngineered die Herkunft seiner Datensätze?

Jeder Datensatz enthält einen transparenten Herkunftsnachweis mit dem genauen Namen der öffentlichen Quelle, dem API-Endpunkt, der Lizenzeinstufung und dem Zeitstempel der Erfassung. Wir erzeugen oder erfinden niemals fehlende Werte.

Wie oft werden die Snapshots der DataEngineered-Datensätze aktualisiert?

Vier Produkte (RoasterDB, FloraDB, WhiskyDB und CSA) werden durch automatisierte monatliche Ingestion-Pipelines aktualisiert. MechanicDB, WineDB, ApplianceDB, INCIDB, SuppDB und RecallDB sind kuratierte Ausgaben, die neu erscheinen, wenn sich ihre Quellen ändern. Jede Ausgabe ist datiert, und ihre Mengenangaben werden beim Build gemessen.

Können Unternehmensteams angepasste Teilmengen oder maßgeschneiderte Datenschemata lizenzieren?

Ja. Neben dem Self-Service-Checkout über Stripe für Standard-Snapshots können Data-Engineering-Teams in Unternehmen individuelle Kuratierungsläufe für bestimmte Ziellisten oder spezielle Exportformate wie Parquet, DuckDB und JSON anfragen.

Gibt es kostenlose Beispieldaten vor dem Kauf einer kommerziellen Lizenz?

Auf jeden Fall. Jede Datensatzkarte im DataEngineered-Portal verlinkt direkt auf kostenlose Beispieldaten bei Hugging Face oder Kaggle, sodass Ihr Team die Schemakompatibilität sofort testen und prüfen kann.

Lizenzierung & individuelle Aufträge

Vollständige Datensätze werden unter kommerziellen Lizenzen verkauft — die meisten per Self-Service mit sicherem Stripe-Checkout und sofortigem Download, als einmalige Snapshots oder aktualisierte Abonnements. Eine individuelle Kuratierung Ihrer Zielliste ist auf Anfrage möglich.

oder schreiben Sie an hello@dataengineered.io