Données vocales · Afrique du Nord

Données vocales pour les
dialectes d'Afrique du Nord.

Derja Data produit des jeux de données d'entraînement pour la derja, la darija et le tamazight — enregistrés, transcrits et vérifiés sur le terrain par des locuteurs natifs rémunérés. La production est en cours en Tunisie ; l'Algérie, le Maroc et la Libye sont couverts sur demande. Les données sont proposées sous licence pour l'entraînement ASR, LLM et TTS.

Une contributrice enregistre sa voix sur une terrasse à Tunis
4
pays sur une seule plateforme
8
langues dont quatre variétés tamazight
24
régions cartographiées en Tunisie, vérifiées par GPS
LIVE
production en cours en Tunisie
Produits de données

Ce que vous pouvez licencier

Cinq gammes de produits issues d'une même chaîne de production — un échantillon précède tout engagement.

01

Corpus vocaux

Audio, transcription vérifiée manuellement et métadonnées du locuteur, par pays et par dialecte.

par heure validée
02

Jeux de données dérivés

Arabizi, paires de translittération, étiquettes d'annotation, alternance codique — issus des mêmes enregistrements.

par corpus
03

API vocale

Reconnaissance vocale adaptée aux dialectes maghrébins, réentraînée en continu sur les corrections vérifiées.

par minute
04

Services d'annotation

Notre équipe formée, suivie par un score de confiance, annote vos données.

par tâche
05

Collecte sur mesure

Vous définissez précisément la parole dont vous avez besoin ; nous la produisons sur le terrain.

par campagne

Chaque livraison comprend l'audio (M4A ; WAV sur demande), des transcriptions vérifiées manuellement accompagnées de manifestes JSON/CSV, les métadonnées de locuteur et de région, la documentation de consentement et des fichiers filigranés.

Catalogue complet
Deux voisines en conversation dans une ruelle de la médina de Tunis
LA PAROLE AU QUOTIDIEN — MÉDINA, TUNIS
Production

Comment naît une heure de données

Notre application mobile couvre l'ensemble de la chaîne : enregistrement, ébauche automatique, correction par le locuteur et vérification.

01

Enregistrer

L'application propose une consigne parmi 6 347 gabarits ; le contributeur s'exprime librement dans son dialecte.

02

Transcrire

Notre propre modèle vocal établit une ébauche sur nos serveurs. Les données ne quittent jamais notre infrastructure.

03

Corriger

Le locuteur corrige lui-même sa transcription — lui seul sait ce qu'il a dit. La correction constitue le signal d'entraînement.

04

Vérifier

Quatre couches de contrôle indépendantes déterminent si l'heure devient un produit livrable.

Une contributrice enregistre un échantillon vocal sur son téléphone dans un patio à Tunis
ENREGISTREMENT SUR LE TERRAIN — TUNIS

Chaque correction entraîne également notre modèle d'ébauche interne : chaque heure suivante gagne en rapidité et en cohérence.

Derrière les données

Produit dans notre propre application

whisper large-v3 → human
أريد أن أشرب قهوة
نحب نشرب قهوة

Chaque heure livrée associe l'audio à une transcription vérifiée par le locuteur lui-même : le modèle propose une ébauche, le locuteur la corrige. Le texte restitue fidèlement ce qui a été dit.

Enregistrement, ébauche automatique, correction par le locuteur, score de qualité et paiement — la chaîne que parcourt chaque heure livrée.

Qualité & conformité

Chaque heure est auditée avant livraison

Quatre couches de contrôle indépendantes séparent un simple enregistrement d'une heure livrée.

01

Détection automatique d'anomalies

Des contrôles automatiques d'intégrité et de plausibilité s'appliquent à chaque soumission — avant tout examen humain.

02

Mesure continue de la qualité

Des mesures de précision objectives, que le contributeur ne peut ni consulter ni anticiper, alimentent un score de confiance individuel.

03

Relecture humaine graduée

Les nouveaux contributeurs sont vérifiés à chaque soumission, les plus expérimentés par échantillonnage ; les relecteurs sont issus du niveau supérieur.

04

Consensus indépendant

Les cas difficiles sont évalués par plusieurs relecteurs indépendants — seule une concordance des avis les valide.

Une relectrice réécoute un enregistrement et corrige la transcription
Inclus dans chaque livraison
  • Consentement documenté de chaque locuteur
  • Traçabilité par jeu de données et par modèle
  • Filigrane sur chaque fichier livré
  • Séparation « clean room » : les modèles commerciaux sont entraînés exclusivement sur des données collectées avec un consentement documenté
Aucune source publique

Des données introuvables en ligne

Les modèles vocaux ne disposent pratiquement d'aucune donnée d'entraînement maghrébine, car il n'existe aucune source publique à exploiter.

Données d'entraînement de Whisper (OpenAI, 2022), heures de parole
Anglais438 000 h
98 autres langues réunies242 000 h
Dialectes maghrébins≈ 0 h

Analyse interne d'après la table des langues du rapport technique Whisper (OpenAI, 2022).

Il n'existe ni archive à acquérir ni corpus à moissonner : la derja et la darija sont des langues parlées, nourries d'emprunts au français, à l'italien et au tamazight, que les corpus d'arabe standard ne couvrent pas. Les seules heures utilisables sont celles que l'on produit soi-même — sur le terrain, avec des locuteurs natifs.

C'est précisément notre métier : des contributeurs rémunérés dans quatre pays et, pour chaque heure, une documentation de consentement et de provenance prête pour l'audit.

30–50%
taux d'erreur de mots habituel des modèles vocaux généralistes sur l'arabe maghrébin
~7%
notre objectif de développement pour un modèle entraîné sur ce corpus — méthodologie communiquée sur demande
Couverture

Où nous collectons

Une même plateforme dans quatre pays — chaque enregistrement porte des métadonnées de région vérifiées par GPS et de zone dialectale.

TUNIS
TUNIS
ALGER
ALGER
CASABLANCA
CASABLANCA
TRIPOLI
TRIPOLI
PaysVariété arabeTamazightRégionsStatut
TunisieDerja tunisienne (ar-TN)24 gouvernorats · 6 zones dialectalesEn production
AlgérieDarja algérienne (ar-DZ)Kabyle58 wilayas · 6 zones dialectalesSur demande
MarocDarija marocaine (ar-MA)Tachelhit · Tarifit · Atlas central12 régions · 5 zones dialectalesSur demande
LibyeArabe libyen (ar-LY)22 districts · 4 zones dialectalesSur demande

24 régions cartographiées en Tunisie, 21 zones dialectales, 8 langues — une seule plateforme.

La couverture en détail
La chaîne d'approvisionnement

Des données produites par des personnes justement rémunérées — la condition première de leur qualité.

1,6–2,6×
du salaire horaire minimum légal, selon le pays
8+
canaux de paiement dont mobile money et espèces
100 %
des enregistrements couverts par un consentement documenté
Cas d'usage

À quoi servent nos données

Partout où un logiciel doit comprendre la langue telle que l'Afrique du Nord la parle réellement.

Assistants vocaux

Assistants vocaux

Interaction naturelle en derja pour les applications, les objets connectés et les serveurs vocaux.

IA de centre d'appels

IA de centre d'appels

Transcription, contrôle qualité et analyse en temps réel dans la langue que parlent réellement les agents.

Médias & sous-titrage

Médias & sous-titrage

Sous-titres dialectaux et archives interrogeables pour le streaming et la télévision dans la région MENA.

Modération de contenu

Modération de contenu

Les plateformes ne peuvent modérer ce qu'elles ne parviennent pas à transcrire ; les données dialectales comblent cette lacune.

Apprentissage des langues

Apprentissage des langues

Des cours destinés aux locuteurs d'origine — une diaspora maghrébine forte de plusieurs millions de personnes en Europe.

Services publics

Services publics

Services aux citoyens, transcription des appels d'urgence et accessibilité dans les langues réellement parlées.

Dites-nous ce que vous souhaitez entraîner.

Langue, domaine, volume : nous vous répondons avec la disponibilité, un jeu d'échantillons et un devis. Une collecte sur mesure démarre en général en quelques semaines.