Jeu de données

Jeu d'annotations en arabe maghrébin

Couches d'étiquettes pour l'arabe nord-africain : sentiment, classe dialectale, intention, sujet et alternance codique. Chaque étiquette est posée indépendamment par plusieurs annotateurs formés et n'est retenue qu'à partir de 66 % d'accord.

Fiche technique
Types d'étiquettes
Sentiment, classe dialectale, intention, sujet, alternance codique
Règle de consensus
Plusieurs annotateurs indépendants, retenu à partir de 66 % d'accord
Langues
ar-TN, ar-DZ, ar-MA, kabyle et tamazight de l'Atlas central
Structure thématique
194 sous-thèmes répartis sur 17 domaines, de la cuisine à l'argot des jeunes
Livraison
JSON, JSONL ou CSV, une ligne par phrase et type d'étiquette
Vos propres textes
Annotation en prestation sur votre corpus — tarif par tâche

À quoi ressemble un enregistrement livré

Ce sont les colonnes réelles de notre vue d'export, pas un schéma proposé. Vous savez avant le premier courriel si les champs conviennent à votre chaîne d'entraînement.

Champs par enregistrement
  • sentence_id
  • text_ar
  • annotation_type
  • consensus_label
  • consensus_score
  • times_annotated
  • domain_code
  • country_code
  • language_code
  • region_origin
Exemple d'enregistrement
{
  "sentence_id": "ann_41d9b2",
  "text_ar": "ما نجمش نصبر أكثر من هكة",
  "annotation_type": "sentiment",
  "consensus_label": "negative",
  "consensus_score": 1,
  "times_annotated": 3,
  "domain_code": "emotions_express.frustration",
  "country_code": "TN",
  "language_code": "ar-TN",
  "region_origin": "Tunis"
}

La structure est réelle, les valeurs sont illustratives. Échantillon complet avec audio et manifeste sur demande, gratuitement.

D'où viennent les données

Nos annotateurs travaillent sur un fonds de 2 028 674 phrases en derja et darija constitué à partir de corpus publics sous licence ouverte. Le texte source reste sous sa licence d'origine — ce que nous vous cédons, c'est la couche d'étiquettes que notre équipe produit par-dessus. Nous annotons tout aussi bien les textes que vous apportez.

Ce que cela donne face aux corpus librement accessibles
Consentement documenté

Chaque contributeur consent pour chaque enregistrement, avec un relevé horodaté. La trace du consentement accompagne la livraison et résiste à un audit.

Locuteurs natifs rémunérés

Aucun scraping, aucun reste de crowdsourcing. Les contributeurs perçoivent 1,6 à 2,6 fois le salaire horaire minimum légal de leur pays pour un travail vérifié.

Région consignée

Chaque enregistrement porte la région où il a été produit, recoupée avec la localisation déclarée du contributeur — la zone dialectale est un fait, non une hypothèse.

Livraison filigranée

Chaque export est filigrané et son téléchargement tracé : un corpus qui fuite peut être rattaché à la licence sous laquelle il est sorti.

Disponibilité

Premiers lots étiquetés à partir du T3 2026 — le fonds est préparé et prêt à étiqueter.

Indiquez la langue, les domaines, les régions et le volume. Vous recevez un échantillon et un devis — la collecte est planifiée selon votre cahier des charges.