Produits de données

Des jeux de données de niveau entreprise couvrant l'ensemble du spectre de l'IA linguistique nord-africaine

Disponibilité

Premières livraisons de corpus à compter du T3 2026 — la production est en cours en Tunisie.

Les clients en accès anticipé bénéficient d'une priorité de livraison et participent au choix des domaines couverts. La collecte se fait sur commande : indiquez les domaines, les régions et le volume, nous planifions la production en conséquence.

6 347
consignes d'enregistrement dans 17 domaines
194
sous-thèmes avec consignes prêtes
24
régions vérifiées par GPS en Tunisie
8
variétés linguistiques dont quatre tamazight
Corpus vocaux en arabe tunisien

Corpus vocaux en arabe tunisien

Enregistrements audio accompagnés de transcriptions vérifiées manuellement — la production est en cours en Tunisie ; l'Algérie, le Maroc et la Libye sont couverts sur demande dans le cadre de collectes sur mesure. Chaque enregistrement comprend l'audio d'un locuteur natif, une transcription corrigée manuellement, les métadonnées du locuteur et les étiquettes de dialecte régional.

Audio M4A (192 kbit/s mono) + Transcriptions UTF-8
Disponible par pays, dialecte et domaine
Fiche technique et schéma
Jeux d'annotations

Jeux d'annotations

Nos annotateurs travaillent sur un fonds de 2 028 674 phrases en derja et darija constitué à partir de corpus publics sous licence ouverte. Ce que nous vous cédons sous licence, c'est la couche d'étiquettes produite par-dessus — sentiment, classe dialectale, intention, sujet et alternance codique — établie par consensus entre plusieurs annotateurs avec un seuil d'accord minimal de 66 %. Le texte source reste sous sa licence d'origine ; les annotations nous appartiennent. L'annotation de vos propres textes est également possible.

SentimentDialectIntentTopicCode-Switch
Fiche technique et schéma
API ASR Derja
Accès anticipé — lancement avec notre premier modèle affiné

API ASR Derja

Une API de reconnaissance vocale conçue spécifiquement pour les dialectes arabes d'Afrique du Nord. Les modèles sont hébergés sur notre propre infrastructure et réentraînés en continu sur les corrections vérifiées des locuteurs.

curl -X POST https://api.derjadata.com/v1/transcribe \
  -H 'Authorization: Bearer djk_your_key' \
  -F 'audio=@recording.m4a' \
  -F 'language=ar-TN'
Paires de translittération

Paires de translittération

Un jeu de données bigraphique unique en son genre, reliant l'écriture arabe à l'arabizi (caractères latins et chiffres). Exemple : "قهوة بالحليب" ↔ "9ahwa bel 7lib".

قهوة بالحليب9ahwa bel 7lib
Fiche technique et schéma

À quoi ressemble une livraison

Un enregistrement présenté dans son format d'export réel — chaque champ ci-dessous accompagne chaque heure livrée.

{
  "id": "a3f1c2e8-…",
  "audio": "audio/…/2026-08/….m4a",          // 192 kbit/s mono M4A
  "duration_seconds": 47,
  "language_code": "ar-TN",
  "dialect_zone": "sahel",
  "region": "Sousse",                        // GPS-verified
  "transcription_corrected": "نحب نشري كرهبة مستعملة",
  "transcription_arabizi": "n7eb nechri karhba mesta3mla",
  "script_mode": "both",
  "speaker": { "gender": "f", "age_band": "25-34", "consent_ref": "c-2026-…" },
  "qa": { "status": "approved", "reviewer_verdict": "approved", "trust_score": 96 },
  "provenance": { "correction_keystrokes": 41, "edit_distance": 6, "watermark": "wm-…" }
}

Exemple aux valeurs illustratives. Un dossier d'échantillons complet (audio et manifeste) est fourni gratuitement sur demande — l'audio n'est jamais publié en accès libre, le consentement des locuteurs l'exige.

Produits de données complémentaires

Données de fine-tuning LLM

Exemples d'instructions pour les modèles de langue en arabe dialectal

Données d'entraînement TTS

Paires audio-texte optimisées pour la synthèse vocale

Identification dialectale

Classification multi-pays avec étiquettes vérifiées

Données d'alternance codique

Schémas de mélange arabe-français-italien pré-étiquetés

Reconnaissance d'entités nommées

Noms, lieux et organisations en contexte derja

Reconnaissance des émotions

Étiquettes d'émotion audio issues des annotations de sentiment

Données de préférence RLHF

Paires retenues et rejetées pour l'entraînement d'alignement

Paires de traduction automatique

Corpus parallèles Derja↔MSA, Derja↔Français

Services d'annotation

Notre équipe formée annote vos propres données — facturation à la tâche

Livraison et formats

CSV, JSON ou JSONL, accompagnés de métadonnées complètes
Exports filigranés avec suivi des téléchargements
Licences d'évaluation, commerciales et en marque blanche
Campagnes de collecte de données sur mesure sur demande

Dites-nous ce que vous souhaitez entraîner.

Langue, domaine, volume : nous vous répondons avec la disponibilité, un jeu d'échantillons et un devis. Une collecte sur mesure démarre en général en quelques semaines.