Corpus vocal du derja tunisien
Enregistrements de locuteurs natifs rémunérés du derja tunisien, chacun accompagné d'une transcription en écriture arabe produite ou corrigée par un humain. Conçu pour entraîner et évaluer la reconnaissance vocale sur un dialecte où les modèles publiés se trompent dans 30 à 50 % des cas.
- Format audio
- M4A, AAC 192 kbit/s, 44,1 kHz, mono. WAV sur demande.
- Transcription
- UTF-8, écriture arabe, produite ou corrigée par un humain
- Langues
- ar-TN en service ; ar-DZ, ar-LY, ar-MA et quatre variétés tamazight sur commande
- Couverture régionale
- 24 régions cartographiées en Tunisie, 21 zones dialectales dans quatre pays
- Livraison
- Manifeste JSON, JSONL ou CSV avec les fichiers audio, filigrané
- Licence
- Commerciale, évaluation et marque blanche — convenue par projet
À quoi ressemble un enregistrement livré
Ce sont les colonnes réelles de notre vue d'export, pas un schéma proposé. Vous savez avant le premier courriel si les champs conviennent à votre chaîne d'entraînement.
- id
- audio_url
- text
- duration_seconds
- quality_score
- country_code
- language_code
- submitted_at
- region
- gender
- age
- tier
{
"id": "sub_8f3a1c07",
"audio_url": "audio/tn/2026/08/rec_8f3a1c07.m4a",
"text": "اليوم الحال باهي برشة، نمشيو نقعدو في القهوة",
"duration_seconds": 6.4,
"quality_score": 0.94,
"country_code": "TN",
"language_code": "ar-TN",
"submitted_at": "2026-08-19T09:41:22Z",
"region": "Sfax",
"gender": "f",
"age": "25-34",
"tier": 3
}La structure est réelle, les valeurs sont illustratives. Échantillon complet avec audio et manifeste sur demande, gratuitement.
D'où viennent les données
Chaque enregistrement est réalisé dans notre propre application par un contributeur inscrit et rémunéré — jamais aspiré, jamais racheté. C'est l'étape de correction qui rend le matériau digne d'un entraînement : un brouillon machine n'est pas une étiquette, une correction humaine si.
Ce que cela donne face aux corpus librement accessiblesChaque contributeur consent pour chaque enregistrement, avec un relevé horodaté. La trace du consentement accompagne la livraison et résiste à un audit.
Aucun scraping, aucun reste de crowdsourcing. Les contributeurs perçoivent 1,6 à 2,6 fois le salaire horaire minimum légal de leur pays pour un travail vérifié.
Chaque enregistrement porte la région où il a été produit, recoupée avec la localisation déclarée du contributeur — la zone dialectale est un fait, non une hypothèse.
Chaque export est filigrané et son téléchargement tracé : un corpus qui fuite peut être rattaché à la licence sous laquelle il est sorti.
Premières livraisons à partir du T3 2026 — la production tourne en Tunisie.
Indiquez la langue, les domaines, les régions et le volume. Vous recevez un échantillon et un devis — la collecte est planifiée selon votre cahier des charges.