Sprachdaten für die
Dialekte Nordafrikas.
Derja Data produziert Trainingsdaten für Derja, Darija und Tamazight — aufgenommen, transkribiert und verifiziert von bezahlten Muttersprachlern vor Ort. Die Produktion läuft derzeit in Tunesien; Algerien, Marokko und Libyen folgen auf Anfrage. Lizenziert für die Entwicklung von ASR-, LLM- und TTS-Systemen.

Was Sie lizenzieren können
Fünf Produktlinien aus einer Produktionspipeline — mit Sample vor jeder vertraglichen Bindung.
Sprachkorpora
Audio, menschlich verifizierte Transkription und Sprecher-Metadaten, je Land und Dialekt.
pro geprüfter StundeAbgeleitete Datensätze
Arabizi, Transliterationspaare, Annotationslabels, Code-Switching — Nebenprodukte derselben Aufnahme.
je KorpusSprach-API
Speech-to-Text für Maghreb-Dialekte, kontinuierlich nachtrainiert mit neu verifizierten Korrekturen.
je MinuteAnnotationsdienste
Unser geschultes Team — jeder Annotator mit eigenem Trust-Score — annotiert Ihre Daten.
je AufgabeAuftragserhebung
Sie beauftragen exakt die Sprache, die Sie benötigen — wir produzieren sie vor Ort.
je KampagneJede Lieferung enthält Audio (M4A; WAV auf Anfrage), menschlich verifizierte Transkripte mit JSON/CSV-Manifesten, Sprecher- und Regionsmetadaten, Einwilligungsdokumentation und wasserzeichenmarkierte Dateien.
Vollständiger Produktkatalog →
So entsteht eine Stunde Daten
Unsere eigene Smartphone-App steuert die gesamte Pipeline — Aufnahme, maschineller Entwurf, Korrektur durch den Sprecher und abschließende Prüfung.
Aufnehmen
Die App stellt eine Sprechaufgabe aus 6.347 Vorlagen. Der Contributor spricht frei in seinem eigenen Dialekt.
Transkribieren
Unser eigenes Sprachmodell erstellt den Entwurf auf eigenen Servern; die Daten verlassen unsere Infrastruktur zu keinem Zeitpunkt.
Korrigieren
Derselbe Sprecher korrigiert den Entwurf — nur er weiß, was er gesagt hat. Die Korrektur selbst bildet das Trainingssignal.
Prüfen
Vier unabhängige Prüfschichten entscheiden darüber, ob aus der Stunde ein lieferfähiges Produkt wird.

Jede Korrektur trainiert zugleich unser internes Entwurfsmodell — jede weitere Stunde entsteht dadurch schneller und konsistenter.
Produziert in unserer eigenen App
Jede gelieferte Stunde umfasst die Aufnahme sowie ein Transkript, das der Sprecher selbst verifiziert hat: Das Modell erstellt den Entwurf, der Sprecher korrigiert ihn. So gibt der Text wieder, was tatsächlich gesagt wurde.
Aufnahme, maschineller Entwurf, Korrektur durch den Sprecher, Quality Score und Auszahlung — die Pipeline, die jede gelieferte Stunde durchläuft.
Jede Stunde wird vor der Lieferung geprüft
Vier unabhängige Kontrollschichten stehen zwischen einer Aufnahme und einer gelieferten Stunde.
Automatische Anomalie-Erkennung
Automatische Integritäts- und Plausibilitätsprüfungen jeder Einreichung — bevor ein Mensch sie sieht.
Laufende Qualitätsmessung
Objektive Genauigkeitsmessungen, die der Contributor weder einsehen noch vorhersehen kann, speisen einen persönlichen Trust-Score.
Gestufte menschliche Prüfung
Neue Contributor werden bei jeder Einreichung geprüft, erfahrene stichprobenartig. Die Prüfer stammen aus der obersten Stufe.
Unabhängiger Konsens
Schwierige Fälle beurteilen mehrere Prüfer unabhängig voneinander — nur bei Übereinstimmung passieren sie die Prüfung.

- —Dokumentierte Einwilligung jedes Sprechers
- —Herkunftsnachweis je Datensatz und Modell
- —Wasserzeichen auf jeder gelieferten Datei
- —Clean-Room-Trennung: Kommerzielle Modelle werden ausschließlich auf unseren eigenen, konsentierten Daten trainiert
Daten, die sich nicht scrapen lassen
Sprachmodellen fehlen Trainingsdaten für den Maghreb nahezu vollständig — weil es keine öffentlichen Quellen gibt, aus denen sie sich gewinnen ließen.
Eigene Auswertung auf Basis der Sprachtabelle im Whisper Technical Report (OpenAI, 2022).
Es existiert kein Archiv, das sich erwerben, und kein Bestand, der sich crawlen ließe: Derja und Darija sind gesprochene Sprachen mit Entlehnungen aus dem Französischen, Italienischen und Tamazight, die von Korpora des Standardarabischen nicht abgedeckt werden. Nutzbare Stunden entstehen ausschließlich durch eigene Produktion — mit Muttersprachlern, vor Ort.
Eben diese Produktion ist unser Geschäft: bezahlte Contributor in vier Ländern, mit prüffähiger Einwilligungs- und Herkunftsdokumentation für jede gelieferte Stunde.
Wo wir erheben
Eine Plattform in vier Ländern — jede Aufnahme trägt GPS-verifizierte Regions- und Dialektzonen-Metadaten.




| Land | Arabische Varietät | Tamazight | Regionen | Status |
|---|---|---|---|---|
| Tunesien | Tunesisches Derja (ar-TN) | — | 24 Gouvernorate · 6 Dialektzonen | In Produktion |
| Algerien | Algerisches Darja (ar-DZ) | Kabylisch | 58 Wilayas · 6 Dialektzonen | Auf Anfrage |
| Marokko | Marokkanisches Darija (ar-MA) | Taschelhit · Tarifit · Zentralatlas | 12 Regionen · 5 Dialektzonen | Auf Anfrage |
| Libyen | Libysches Arabisch (ar-LY) | — | 22 Distrikte · 4 Dialektzonen | Auf Anfrage |
24 kartierte Regionen in Tunesien, 21 Dialektzonen, 8 Sprachen — eine Plattform.
Abdeckung im Detail →Produziert von fair vergüteten Menschen — das sichert die Qualität.
Wofür unsere Daten eingesetzt werden
Überall dort, wo Software verstehen muss, wie Nordafrika tatsächlich spricht.

Sprachassistenten
Natürliche Derja-Interaktion für Apps, Geräte und Sprachmenüs — anstelle von Menüs, die in der Praxis niemand bedienen kann.

Callcenter-KI
Transkription, Qualitätsmonitoring und Live-Analyse in der Sprache, die Agenten tatsächlich sprechen.

Medien & Untertitel
Dialekt-Untertitel und durchsuchbare Archive für Streaming und Fernsehen in der MENA-Region.

Content-Moderation
Plattformen können nicht moderieren, was sie nicht transkribieren können. Dialektdaten schließen diese Lücke.

Sprachlernen
Kurse für Herkunftssprecher — eine maghrebinische Diaspora von Millionen in Europa.

Öffentliche Dienste
Bürgerdienste, Notruf-Transkription und Barrierefreiheit in den Sprachen, die Menschen tatsächlich verwenden.
Sagen Sie uns, was Sie trainieren möchten.
Nennen Sie Sprache, Domäne und Volumen — wir antworten mit Verfügbarkeit, einem Sample-Datensatz und einem Angebot. Eine Custom Collection beginnt in der Regel innerhalb weniger Wochen.

