Datenprodukte
Datensätze auf Unternehmensniveau für das gesamte Spektrum nordafrikanischer Sprach-KI
Erste Korpus-Lieferungen ab Q3 2026 — die Produktion in Tunesien läuft bereits.
Early-Access-Kunden erhalten Priorität sowie Mitsprache bei der Auswahl der Domänen. Erhoben wird nach Auftrag: Sie nennen Bereiche, Regionen und Umfang, wir planen die Produktion darauf.

Tunesisch-arabische Sprachkorpora
Audioaufnahmen mit manuell verifizierten Transkriptionen — derzeit in Produktion in Tunesien; für Algerien, Marokko und Libyen erfolgt die Produktion auf Anfrage als Custom Collection. Jede Aufnahme umfasst Muttersprachler-Audio mit menschlich korrigierter Transkription, Sprechermetadaten und regionalen Dialekt-Tags.

Annotationsdatensätze
Unsere Bearbeiter arbeiten auf einem Vorrat von 2.028.674 Derja- und Darija-Sätzen aus offen lizenzierten öffentlichen Korpora. Lizenziert wird die Label-Schicht, die darauf entsteht — Stimmung, Dialektklasse, Absicht, Thema und Sprachmischung —, im Konsens mehrerer Bearbeiter mit einer Mindestübereinstimmung von 66 %. Der Quelltext bleibt unter seiner ursprünglichen Lizenz; die Annotationen gehören uns. Annotation auf Ihrem eigenen Textbestand ist ebenso möglich.

Derja ASR API
Eine Speech-to-Text-API, entwickelt speziell für nordafrikanische Dialekte. Selbst gehostete Modelle, die kontinuierlich mit neu verifizierten Sprecher-Korrekturen nachtrainiert werden.
curl -X POST https://api.derjadata.com/v1/transcribe \ -H 'Authorization: Bearer djk_your_key' \ -F 'audio=@recording.m4a' \ -F 'language=ar-TN'

Transliterations-Paare
Ein einzigartiger Dual-Script-Datensatz: arabische Schrift ↔ Arabizi (lateinische Buchstaben mit Ziffern). Beispiel: "قهوة بالحليب" ↔ "9ahwa bel 7lib".
So sieht eine Lieferung aus
Ein Datensatz im tatsächlichen Exportformat — jedes hier gezeigte Feld liegt jeder gelieferten Stunde bei.
{
"id": "a3f1c2e8-…",
"audio": "audio/…/2026-08/….m4a", // 192 kbit/s mono M4A
"duration_seconds": 47,
"language_code": "ar-TN",
"dialect_zone": "sahel",
"region": "Sousse", // GPS-verified
"transcription_corrected": "نحب نشري كرهبة مستعملة",
"transcription_arabizi": "n7eb nechri karhba mesta3mla",
"script_mode": "both",
"speaker": { "gender": "f", "age_band": "25-34", "consent_ref": "c-2026-…" },
"qa": { "status": "approved", "reviewer_verdict": "approved", "trust_score": 96 },
"provenance": { "correction_keystrokes": 41, "edit_distance": 6, "watermark": "wm-…" }
}Beispieldatensatz mit illustrativen Werten. Das vollständige Sample-Paket (Audio und Manifest) stellen wir auf Anfrage kostenfrei bereit — Audio veröffentlichen wir aus Gründen des Einwilligungsschutzes zu keinem Zeitpunkt offen.
Weitere Datenprodukte
LLM-Fine-Tuning-Daten
Instruktionsbeispiele für das Feintuning arabischer Dialekt-Sprachmodelle
TTS-Trainingsdaten
Audio-Text-Paare, optimiert für die Sprachsynthese
Dialekt-Identifikation
Länderübergreifende Klassifikation mit Ground-Truth-Labels
Code-Switching-Daten
Vorannotierte Mischmuster aus Arabisch, Französisch und Italienisch
Named Entity Recognition
Namen, Orte und Organisationen in Derja-Kontexten
Emotionserkennung
Emotionslabels auf Audioebene, aufbauend auf den Sentiment-Annotationen
RLHF-Präferenzdaten
Chosen-/Rejected-Paare für das Alignment-Training
Maschinelle Übersetzungs-Paare
Parallelkorpora Derja↔MSA und Derja↔Französisch
Annotationsservices
Unser geschultes Team annotiert Ihre eigenen Daten — abgerechnet je Aufgabe
Lieferung & Formate
Sagen Sie uns, was Sie trainieren möchten.
Nennen Sie Sprache, Domäne und Volumen — wir antworten mit Verfügbarkeit, einem Sample-Datensatz und einem Angebot. Eine Custom Collection beginnt in der Regel innerhalb weniger Wochen.
