Jeu de données

Paires de translittération arabe–arabizi

Le même énoncé dans deux graphies : en arabe, et en arabizi — cette écriture en lettres latines et chiffres que les Nord-Africains tapent réellement, où 3=ع, 5=خ, 7=ح et 9=ق. Matériau d'entraînement pour les modèles de translittération et pour tout système devant lire ce que les gens écrivent en messagerie.

Fiche technique
Appariement
Même locuteur, même énoncé, les deux graphies en une session
Graphies
Arabe (UTF-8) et arabizi (lettres latines plus 2, 3, 5, 7, 9)
Langues
ar-TN, ar-DZ, ar-LY, ar-MA
Lien audio
Chaque paire peut être livrée avec l'enregistrement d'origine
Livraison
JSON, JSONL ou CSV, une ligne par paire
Licence
Commerciale, évaluation et marque blanche — convenue par projet

À quoi ressemble un enregistrement livré

Ce sont les colonnes réelles de notre vue d'export, pas un schéma proposé. Vous savez avant le premier courriel si les champs conviennent à votre chaîne d'entraînement.

Champs par enregistrement
  • id
  • arabic
  • arabizi
  • country_code
  • language_code
  • submitted_at
  • region
  • gender
  • age
  • tier
Exemple d'enregistrement
{
  "id": "pair_2c77e4",
  "arabic": "قهوة بالحليب من فضلك",
  "arabizi": "9ahwa bel 7lib men fadhlek",
  "country_code": "TN",
  "language_code": "ar-TN",
  "submitted_at": "2026-08-19T09:44:03Z",
  "region": "Sfax",
  "gender": "f",
  "age": "25-34",
  "tier": 3
}

La structure est réelle, les valeurs sont illustratives. Échantillon complet avec audio et manifeste sur demande, gratuitement.

D'où viennent les données

Les deux graphies proviennent du même locuteur et du même énoncé, produites en une seule session dans notre application. C'est ce qui rend la paire exploitable : il ne s'agit pas de deux textes appariés après coup, mais d'une personne écrivant deux fois la même phrase.

Ce que cela donne face aux corpus librement accessibles
Consentement documenté

Chaque contributeur consent pour chaque enregistrement, avec un relevé horodaté. La trace du consentement accompagne la livraison et résiste à un audit.

Locuteurs natifs rémunérés

Aucun scraping, aucun reste de crowdsourcing. Les contributeurs perçoivent 1,6 à 2,6 fois le salaire horaire minimum légal de leur pays pour un travail vérifié.

Région consignée

Chaque enregistrement porte la région où il a été produit, recoupée avec la localisation déclarée du contributeur — la zone dialectale est un fait, non une hypothèse.

Livraison filigranée

Chaque export est filigrané et son téléchargement tracé : un corpus qui fuite peut être rattaché à la licence sous laquelle il est sorti.

Disponibilité

Production à partir du T3 2026, conjointement au corpus vocal.

Indiquez la langue, les domaines, les régions et le volume. Vous recevez un échantillon et un devis — la collecte est planifiée selon votre cahier des charges.