Paires de translittération arabe–arabizi
Le même énoncé dans deux graphies : en arabe, et en arabizi — cette écriture en lettres latines et chiffres que les Nord-Africains tapent réellement, où 3=ع, 5=خ, 7=ح et 9=ق. Matériau d'entraînement pour les modèles de translittération et pour tout système devant lire ce que les gens écrivent en messagerie.
- Appariement
- Même locuteur, même énoncé, les deux graphies en une session
- Graphies
- Arabe (UTF-8) et arabizi (lettres latines plus 2, 3, 5, 7, 9)
- Langues
- ar-TN, ar-DZ, ar-LY, ar-MA
- Lien audio
- Chaque paire peut être livrée avec l'enregistrement d'origine
- Livraison
- JSON, JSONL ou CSV, une ligne par paire
- Licence
- Commerciale, évaluation et marque blanche — convenue par projet
À quoi ressemble un enregistrement livré
Ce sont les colonnes réelles de notre vue d'export, pas un schéma proposé. Vous savez avant le premier courriel si les champs conviennent à votre chaîne d'entraînement.
- id
- arabic
- arabizi
- country_code
- language_code
- submitted_at
- region
- gender
- age
- tier
{
"id": "pair_2c77e4",
"arabic": "قهوة بالحليب من فضلك",
"arabizi": "9ahwa bel 7lib men fadhlek",
"country_code": "TN",
"language_code": "ar-TN",
"submitted_at": "2026-08-19T09:44:03Z",
"region": "Sfax",
"gender": "f",
"age": "25-34",
"tier": 3
}La structure est réelle, les valeurs sont illustratives. Échantillon complet avec audio et manifeste sur demande, gratuitement.
D'où viennent les données
Les deux graphies proviennent du même locuteur et du même énoncé, produites en une seule session dans notre application. C'est ce qui rend la paire exploitable : il ne s'agit pas de deux textes appariés après coup, mais d'une personne écrivant deux fois la même phrase.
Ce que cela donne face aux corpus librement accessiblesChaque contributeur consent pour chaque enregistrement, avec un relevé horodaté. La trace du consentement accompagne la livraison et résiste à un audit.
Aucun scraping, aucun reste de crowdsourcing. Les contributeurs perçoivent 1,6 à 2,6 fois le salaire horaire minimum légal de leur pays pour un travail vérifié.
Chaque enregistrement porte la région où il a été produit, recoupée avec la localisation déclarée du contributeur — la zone dialectale est un fait, non une hypothèse.
Chaque export est filigrané et son téléchargement tracé : un corpus qui fuite peut être rattaché à la licence sous laquelle il est sorti.
Production à partir du T3 2026, conjointement au corpus vocal.
Indiquez la langue, les domaines, les régions et le volume. Vous recevez un échantillon et un devis — la collecte est planifiée selon votre cahier des charges.