Sprachdaten · Nordafrika

Sprachdaten für die
Dialekte Nordafrikas.

Derja Data produziert Trainingsdaten für Derja, Darija und Tamazight — aufgenommen, transkribiert und verifiziert von bezahlten Muttersprachlern vor Ort. Die Produktion läuft derzeit in Tunesien; Algerien, Marokko und Libyen folgen auf Anfrage. Lizenziert für die Entwicklung von ASR-, LLM- und TTS-Systemen.

Eine Sprecherin nimmt auf einer Dachterrasse in Tunis mit dem Smartphone auf
4
Länder auf einer Plattform
8
Sprachen inkl. vier Tamazight-Varietäten
24
kartierte Regionen in Tunesien, GPS-geprüft
LIVE
Produktion läuft in Tunesien
Datenprodukte

Was Sie lizenzieren können

Fünf Produktlinien aus einer Produktionspipeline — mit Sample vor jeder vertraglichen Bindung.

01

Sprachkorpora

Audio, menschlich verifizierte Transkription und Sprecher-Metadaten, je Land und Dialekt.

pro geprüfter Stunde
02

Abgeleitete Datensätze

Arabizi, Transliterationspaare, Annotationslabels, Code-Switching — Nebenprodukte derselben Aufnahme.

je Korpus
03

Sprach-API

Speech-to-Text für Maghreb-Dialekte, kontinuierlich nachtrainiert mit neu verifizierten Korrekturen.

je Minute
04

Annotationsdienste

Unser geschultes Team — jeder Annotator mit eigenem Trust-Score — annotiert Ihre Daten.

je Aufgabe
05

Auftragserhebung

Sie beauftragen exakt die Sprache, die Sie benötigen — wir produzieren sie vor Ort.

je Kampagne

Jede Lieferung enthält Audio (M4A; WAV auf Anfrage), menschlich verifizierte Transkripte mit JSON/CSV-Manifesten, Sprecher- und Regionsmetadaten, Einwilligungsdokumentation und wasserzeichenmarkierte Dateien.

Vollständiger Produktkatalog
Zwei Nachbarinnen im Gespräch in einer Gasse der Medina von Tunis
GESPROCHENE SPRACHE IM ALLTAG — MEDINA, TUNIS
Produktion

So entsteht eine Stunde Daten

Unsere eigene Smartphone-App steuert die gesamte Pipeline — Aufnahme, maschineller Entwurf, Korrektur durch den Sprecher und abschließende Prüfung.

01

Aufnehmen

Die App stellt eine Sprechaufgabe aus 6.347 Vorlagen. Der Contributor spricht frei in seinem eigenen Dialekt.

02

Transkribieren

Unser eigenes Sprachmodell erstellt den Entwurf auf eigenen Servern; die Daten verlassen unsere Infrastruktur zu keinem Zeitpunkt.

03

Korrigieren

Derselbe Sprecher korrigiert den Entwurf — nur er weiß, was er gesagt hat. Die Korrektur selbst bildet das Trainingssignal.

04

Prüfen

Vier unabhängige Prüfschichten entscheiden darüber, ob aus der Stunde ein lieferfähiges Produkt wird.

Eine Sprecherin nimmt in einem Innenhof in Tunis eine Sprachaufnahme mit dem Smartphone auf
AUFNAHME VOR ORT — TUNIS

Jede Korrektur trainiert zugleich unser internes Entwurfsmodell — jede weitere Stunde entsteht dadurch schneller und konsistenter.

Hinter den Daten

Produziert in unserer eigenen App

whisper large-v3 → human
أريد أن أشرب قهوة
نحب نشرب قهوة

Jede gelieferte Stunde umfasst die Aufnahme sowie ein Transkript, das der Sprecher selbst verifiziert hat: Das Modell erstellt den Entwurf, der Sprecher korrigiert ihn. So gibt der Text wieder, was tatsächlich gesagt wurde.

Aufnahme, maschineller Entwurf, Korrektur durch den Sprecher, Quality Score und Auszahlung — die Pipeline, die jede gelieferte Stunde durchläuft.

Qualität & Compliance

Jede Stunde wird vor der Lieferung geprüft

Vier unabhängige Kontrollschichten stehen zwischen einer Aufnahme und einer gelieferten Stunde.

01

Automatische Anomalie-Erkennung

Automatische Integritäts- und Plausibilitätsprüfungen jeder Einreichung — bevor ein Mensch sie sieht.

02

Laufende Qualitätsmessung

Objektive Genauigkeitsmessungen, die der Contributor weder einsehen noch vorhersehen kann, speisen einen persönlichen Trust-Score.

03

Gestufte menschliche Prüfung

Neue Contributor werden bei jeder Einreichung geprüft, erfahrene stichprobenartig. Die Prüfer stammen aus der obersten Stufe.

04

Unabhängiger Konsens

Schwierige Fälle beurteilen mehrere Prüfer unabhängig voneinander — nur bei Übereinstimmung passieren sie die Prüfung.

Eine Prüferin hört eine Aufnahme ab und korrigiert das Transkript
In jeder Lieferung enthalten
  • Dokumentierte Einwilligung jedes Sprechers
  • Herkunftsnachweis je Datensatz und Modell
  • Wasserzeichen auf jeder gelieferten Datei
  • Clean-Room-Trennung: Kommerzielle Modelle werden ausschließlich auf unseren eigenen, konsentierten Daten trainiert
Keine öffentliche Quelle

Daten, die sich nicht scrapen lassen

Sprachmodellen fehlen Trainingsdaten für den Maghreb nahezu vollständig — weil es keine öffentlichen Quellen gibt, aus denen sie sich gewinnen ließen.

Whisper-Trainingsdaten (OpenAI, 2022), Stunden Sprache
Englisch438.000 h
98 andere Sprachen zusammen242.000 h
Maghreb-Dialekte≈ 0 h

Eigene Auswertung auf Basis der Sprachtabelle im Whisper Technical Report (OpenAI, 2022).

Es existiert kein Archiv, das sich erwerben, und kein Bestand, der sich crawlen ließe: Derja und Darija sind gesprochene Sprachen mit Entlehnungen aus dem Französischen, Italienischen und Tamazight, die von Korpora des Standardarabischen nicht abgedeckt werden. Nutzbare Stunden entstehen ausschließlich durch eigene Produktion — mit Muttersprachlern, vor Ort.

Eben diese Produktion ist unser Geschäft: bezahlte Contributor in vier Ländern, mit prüffähiger Einwilligungs- und Herkunftsdokumentation für jede gelieferte Stunde.

30–50%
typische Wortfehlerrate generischer Sprachmodelle auf Maghreb-Arabisch
~7%
unser Entwicklungsziel für ein Modell, das auf diesem Korpus trainiert wird — Methodik auf Anfrage
Abdeckung

Wo wir erheben

Eine Plattform in vier Ländern — jede Aufnahme trägt GPS-verifizierte Regions- und Dialektzonen-Metadaten.

TUNIS
TUNIS
ALGIER
ALGIER
CASABLANCA
CASABLANCA
TRIPOLIS
TRIPOLIS
LandArabische VarietätTamazightRegionenStatus
TunesienTunesisches Derja (ar-TN)24 Gouvernorate · 6 DialektzonenIn Produktion
AlgerienAlgerisches Darja (ar-DZ)Kabylisch58 Wilayas · 6 DialektzonenAuf Anfrage
MarokkoMarokkanisches Darija (ar-MA)Taschelhit · Tarifit · Zentralatlas12 Regionen · 5 DialektzonenAuf Anfrage
LibyenLibysches Arabisch (ar-LY)22 Distrikte · 4 DialektzonenAuf Anfrage

24 kartierte Regionen in Tunesien, 21 Dialektzonen, 8 Sprachen — eine Plattform.

Abdeckung im Detail
Die Lieferkette

Produziert von fair vergüteten Menschen — das sichert die Qualität.

1,6–2,6×
des gesetzlichen Mindest-Stundenlohns, je nach Land
8+
Auszahlungswege, darunter Mobile Money und Bargeld
100 %
der Aufnahmen mit dokumentierter Einwilligung
Einsatzfelder

Wofür unsere Daten eingesetzt werden

Überall dort, wo Software verstehen muss, wie Nordafrika tatsächlich spricht.

Sprachassistenten

Sprachassistenten

Natürliche Derja-Interaktion für Apps, Geräte und Sprachmenüs — anstelle von Menüs, die in der Praxis niemand bedienen kann.

Callcenter-KI

Callcenter-KI

Transkription, Qualitätsmonitoring und Live-Analyse in der Sprache, die Agenten tatsächlich sprechen.

Medien & Untertitel

Medien & Untertitel

Dialekt-Untertitel und durchsuchbare Archive für Streaming und Fernsehen in der MENA-Region.

Content-Moderation

Content-Moderation

Plattformen können nicht moderieren, was sie nicht transkribieren können. Dialektdaten schließen diese Lücke.

Sprachlernen

Sprachlernen

Kurse für Herkunftssprecher — eine maghrebinische Diaspora von Millionen in Europa.

Öffentliche Dienste

Öffentliche Dienste

Bürgerdienste, Notruf-Transkription und Barrierefreiheit in den Sprachen, die Menschen tatsächlich verwenden.

Sagen Sie uns, was Sie trainieren möchten.

Nennen Sie Sprache, Domäne und Volumen — wir antworten mit Verfügbarkeit, einem Sample-Datensatz und einem Angebot. Eine Custom Collection beginnt in der Regel innerhalb weniger Wochen.