Jeu d'annotations en arabe maghrébin
Couches d'étiquettes pour l'arabe nord-africain : sentiment, classe dialectale, intention, sujet et alternance codique. Chaque étiquette est posée indépendamment par plusieurs annotateurs formés et n'est retenue qu'à partir de 66 % d'accord.
- Types d'étiquettes
- Sentiment, classe dialectale, intention, sujet, alternance codique
- Règle de consensus
- Plusieurs annotateurs indépendants, retenu à partir de 66 % d'accord
- Langues
- ar-TN, ar-DZ, ar-MA, kabyle et tamazight de l'Atlas central
- Structure thématique
- 194 sous-thèmes répartis sur 17 domaines, de la cuisine à l'argot des jeunes
- Livraison
- JSON, JSONL ou CSV, une ligne par phrase et type d'étiquette
- Vos propres textes
- Annotation en prestation sur votre corpus — tarif par tâche
À quoi ressemble un enregistrement livré
Ce sont les colonnes réelles de notre vue d'export, pas un schéma proposé. Vous savez avant le premier courriel si les champs conviennent à votre chaîne d'entraînement.
- sentence_id
- text_ar
- annotation_type
- consensus_label
- consensus_score
- times_annotated
- domain_code
- country_code
- language_code
- region_origin
{
"sentence_id": "ann_41d9b2",
"text_ar": "ما نجمش نصبر أكثر من هكة",
"annotation_type": "sentiment",
"consensus_label": "negative",
"consensus_score": 1,
"times_annotated": 3,
"domain_code": "emotions_express.frustration",
"country_code": "TN",
"language_code": "ar-TN",
"region_origin": "Tunis"
}La structure est réelle, les valeurs sont illustratives. Échantillon complet avec audio et manifeste sur demande, gratuitement.
D'où viennent les données
Nos annotateurs travaillent sur un fonds de 2 028 674 phrases en derja et darija constitué à partir de corpus publics sous licence ouverte. Le texte source reste sous sa licence d'origine — ce que nous vous cédons, c'est la couche d'étiquettes que notre équipe produit par-dessus. Nous annotons tout aussi bien les textes que vous apportez.
Ce que cela donne face aux corpus librement accessiblesChaque contributeur consent pour chaque enregistrement, avec un relevé horodaté. La trace du consentement accompagne la livraison et résiste à un audit.
Aucun scraping, aucun reste de crowdsourcing. Les contributeurs perçoivent 1,6 à 2,6 fois le salaire horaire minimum légal de leur pays pour un travail vérifié.
Chaque enregistrement porte la région où il a été produit, recoupée avec la localisation déclarée du contributeur — la zone dialectale est un fait, non une hypothèse.
Chaque export est filigrané et son téléchargement tracé : un corpus qui fuite peut être rattaché à la licence sous laquelle il est sorti.
Premiers lots étiquetés à partir du T3 2026 — le fonds est préparé et prêt à étiqueter.
Indiquez la langue, les domaines, les régions et le volume. Vous recevez un échantillon et un devis — la collecte est planifiée selon votre cahier des charges.