Produits de données
Des jeux de données de niveau entreprise couvrant l'ensemble du spectre de l'IA linguistique nord-africaine
Premières livraisons de corpus à compter du T3 2026 — la production est en cours en Tunisie.
Les clients en accès anticipé bénéficient d'une priorité de livraison et participent au choix des domaines couverts. La collecte se fait sur commande : indiquez les domaines, les régions et le volume, nous planifions la production en conséquence.

Corpus vocaux en arabe tunisien
Enregistrements audio accompagnés de transcriptions vérifiées manuellement — la production est en cours en Tunisie ; l'Algérie, le Maroc et la Libye sont couverts sur demande dans le cadre de collectes sur mesure. Chaque enregistrement comprend l'audio d'un locuteur natif, une transcription corrigée manuellement, les métadonnées du locuteur et les étiquettes de dialecte régional.

Jeux d'annotations
Nos annotateurs travaillent sur un fonds de 2 028 674 phrases en derja et darija constitué à partir de corpus publics sous licence ouverte. Ce que nous vous cédons sous licence, c'est la couche d'étiquettes produite par-dessus — sentiment, classe dialectale, intention, sujet et alternance codique — établie par consensus entre plusieurs annotateurs avec un seuil d'accord minimal de 66 %. Le texte source reste sous sa licence d'origine ; les annotations nous appartiennent. L'annotation de vos propres textes est également possible.

API ASR Derja
Une API de reconnaissance vocale conçue spécifiquement pour les dialectes arabes d'Afrique du Nord. Les modèles sont hébergés sur notre propre infrastructure et réentraînés en continu sur les corrections vérifiées des locuteurs.
curl -X POST https://api.derjadata.com/v1/transcribe \ -H 'Authorization: Bearer djk_your_key' \ -F 'audio=@recording.m4a' \ -F 'language=ar-TN'

Paires de translittération
Un jeu de données bigraphique unique en son genre, reliant l'écriture arabe à l'arabizi (caractères latins et chiffres). Exemple : "قهوة بالحليب" ↔ "9ahwa bel 7lib".
À quoi ressemble une livraison
Un enregistrement présenté dans son format d'export réel — chaque champ ci-dessous accompagne chaque heure livrée.
{
"id": "a3f1c2e8-…",
"audio": "audio/…/2026-08/….m4a", // 192 kbit/s mono M4A
"duration_seconds": 47,
"language_code": "ar-TN",
"dialect_zone": "sahel",
"region": "Sousse", // GPS-verified
"transcription_corrected": "نحب نشري كرهبة مستعملة",
"transcription_arabizi": "n7eb nechri karhba mesta3mla",
"script_mode": "both",
"speaker": { "gender": "f", "age_band": "25-34", "consent_ref": "c-2026-…" },
"qa": { "status": "approved", "reviewer_verdict": "approved", "trust_score": 96 },
"provenance": { "correction_keystrokes": 41, "edit_distance": 6, "watermark": "wm-…" }
}Exemple aux valeurs illustratives. Un dossier d'échantillons complet (audio et manifeste) est fourni gratuitement sur demande — l'audio n'est jamais publié en accès libre, le consentement des locuteurs l'exige.
Produits de données complémentaires
Données de fine-tuning LLM
Exemples d'instructions pour les modèles de langue en arabe dialectal
Données d'entraînement TTS
Paires audio-texte optimisées pour la synthèse vocale
Identification dialectale
Classification multi-pays avec étiquettes vérifiées
Données d'alternance codique
Schémas de mélange arabe-français-italien pré-étiquetés
Reconnaissance d'entités nommées
Noms, lieux et organisations en contexte derja
Reconnaissance des émotions
Étiquettes d'émotion audio issues des annotations de sentiment
Données de préférence RLHF
Paires retenues et rejetées pour l'entraînement d'alignement
Paires de traduction automatique
Corpus parallèles Derja↔MSA, Derja↔Français
Services d'annotation
Notre équipe formée annote vos propres données — facturation à la tâche
Livraison et formats
Dites-nous ce que vous souhaitez entraîner.
Langue, domaine, volume : nous vous répondons avec la disponibilité, un jeu d'échantillons et un devis. Une collecte sur mesure démarre en général en quelques semaines.
