Arabisch–Arabizi — Transliterationspaare
Derselbe Satz in zwei Schriften: arabisch und in Arabizi — jener Schreibweise aus lateinischen Buchstaben und Ziffern, die Nordafrikaner tatsächlich tippen, wo 3=ع, 5=خ, 7=ح und 9=ق steht. Trainingsmaterial für Transliterationsmodelle und für jedes System, das lesen muss, was Menschen im Chat schreiben.
- Paarbildung
- Dieselbe Stimme, derselbe Satz, beide Schriften in einer Sitzung
- Schriften
- Arabisch (UTF-8) und Arabizi (lateinische Buchstaben plus 2, 3, 5, 7, 9)
- Sprachen
- ar-TN, ar-DZ, ar-LY, ar-MA
- Audiobezug
- Jedes Paar kann mit der zugrunde liegenden Aufnahme geliefert werden
- Lieferung
- JSON, JSONL oder CSV, eine Zeile je Paar
- Lizenz
- Kommerziell, Evaluierung und White Label — je Projekt vereinbart
So sieht ein gelieferter Datensatz aus
Das sind die tatsächlichen Spalten unserer Export-Ansicht, kein vorgeschlagenes Schema. Sie wissen vor der ersten Mail, ob die Felder in Ihre Trainingsstrecke passen.
- id
- arabic
- arabizi
- country_code
- language_code
- submitted_at
- region
- gender
- age
- tier
{
"id": "pair_2c77e4",
"arabic": "قهوة بالحليب من فضلك",
"arabizi": "9ahwa bel 7lib men fadhlek",
"country_code": "TN",
"language_code": "ar-TN",
"submitted_at": "2026-08-19T09:44:03Z",
"region": "Sfax",
"gender": "f",
"age": "25-34",
"tier": 3
}Struktur ist echt, Werte sind illustrativ. Vollständiges Musterpaket mit Audio und Manifest auf Anfrage, kostenlos.
Woher die Daten kommen
Beide Schriften stammen von derselben Stimme und demselben Satz, in einer Sitzung in unserer App entstanden. Genau das macht das Paar brauchbar: Es sind nicht zwei nachträglich zusammengeführte Texte, sondern eine Person, die denselben Satz zweimal schreibt.
Wie sich das zu frei verfügbaren Korpora verhältJeder Contributor willigt je Aufnahme ein, mit Zeitstempel protokolliert. Der Einwilligungsnachweis geht mit der Lieferung mit und hält einer Prüfung stand.
Kein Scraping, keine Crowdsourcing-Reste. Die Contributor verdienen das 1,6- bis 2,6-Fache des gesetzlichen Stunden-Mindestlohns ihres Landes für geprüfte Arbeit.
Jeder Datensatz trägt die Region, in der er entstanden ist, abgeglichen mit dem hinterlegten Standort — die Dialektzone ist eine Tatsache, keine Annahme.
Jeder Export ist mit Wasserzeichen versehen und im Download nachverfolgt. Ein abgeflossenes Korpus lässt sich der Lizenz zuordnen, unter der es das Haus verlassen hat.
Produktion ab Q3 2026, gemeinsam mit dem Sprachkorpus.
Nennen Sie Sprache, Themenbereiche, Regionen und Umfang. Sie erhalten ein Musterpaket und ein Angebot — die Erhebung wird auf Ihre Vorgabe geplant.