Jeu de données

Corpus vocal du derja tunisien

Enregistrements de locuteurs natifs rémunérés du derja tunisien, chacun accompagné d'une transcription en écriture arabe produite ou corrigée par un humain. Conçu pour entraîner et évaluer la reconnaissance vocale sur un dialecte où les modèles publiés se trompent dans 30 à 50 % des cas.

Fiche technique
Format audio
M4A, AAC 192 kbit/s, 44,1 kHz, mono. WAV sur demande.
Transcription
UTF-8, écriture arabe, produite ou corrigée par un humain
Langues
ar-TN en service ; ar-DZ, ar-LY, ar-MA et quatre variétés tamazight sur commande
Couverture régionale
24 régions cartographiées en Tunisie, 21 zones dialectales dans quatre pays
Livraison
Manifeste JSON, JSONL ou CSV avec les fichiers audio, filigrané
Licence
Commerciale, évaluation et marque blanche — convenue par projet

À quoi ressemble un enregistrement livré

Ce sont les colonnes réelles de notre vue d'export, pas un schéma proposé. Vous savez avant le premier courriel si les champs conviennent à votre chaîne d'entraînement.

Champs par enregistrement
  • id
  • audio_url
  • text
  • duration_seconds
  • quality_score
  • country_code
  • language_code
  • submitted_at
  • region
  • gender
  • age
  • tier
Exemple d'enregistrement
{
  "id": "sub_8f3a1c07",
  "audio_url": "audio/tn/2026/08/rec_8f3a1c07.m4a",
  "text": "اليوم الحال باهي برشة، نمشيو نقعدو في القهوة",
  "duration_seconds": 6.4,
  "quality_score": 0.94,
  "country_code": "TN",
  "language_code": "ar-TN",
  "submitted_at": "2026-08-19T09:41:22Z",
  "region": "Sfax",
  "gender": "f",
  "age": "25-34",
  "tier": 3
}

La structure est réelle, les valeurs sont illustratives. Échantillon complet avec audio et manifeste sur demande, gratuitement.

D'où viennent les données

Chaque enregistrement est réalisé dans notre propre application par un contributeur inscrit et rémunéré — jamais aspiré, jamais racheté. C'est l'étape de correction qui rend le matériau digne d'un entraînement : un brouillon machine n'est pas une étiquette, une correction humaine si.

Ce que cela donne face aux corpus librement accessibles
Consentement documenté

Chaque contributeur consent pour chaque enregistrement, avec un relevé horodaté. La trace du consentement accompagne la livraison et résiste à un audit.

Locuteurs natifs rémunérés

Aucun scraping, aucun reste de crowdsourcing. Les contributeurs perçoivent 1,6 à 2,6 fois le salaire horaire minimum légal de leur pays pour un travail vérifié.

Région consignée

Chaque enregistrement porte la région où il a été produit, recoupée avec la localisation déclarée du contributeur — la zone dialectale est un fait, non une hypothèse.

Livraison filigranée

Chaque export est filigrané et son téléchargement tracé : un corpus qui fuite peut être rattaché à la licence sous laquelle il est sorti.

Disponibilité

Premières livraisons à partir du T3 2026 — la production tourne en Tunisie.

Indiquez la langue, les domaines, les régions et le volume. Vous recevez un échantillon et un devis — la collecte est planifiée selon votre cahier des charges.