Affichage des articles dont le libellé est technique. Afficher tous les articles
Affichage des articles dont le libellé est technique. Afficher tous les articles

mardi 9 août 2011

Anonymisation automatisée

Le procédé d'anonymisation automatisée vient d'être activé.

Concrètement, les textes jusqu'à présent inaccessibles en raison de leur contenu sensible se voient filtrés par un algorithme qui reconnaît les mots ou séquences de mots qui peuvent correspondre à une donnée à caractère personnel.

A titre d'exemple, un échantillon de textes ainsi traités:

Le prochains développements relatifs à la protection de la vie privée viseront à étendre le champ d'application du filtrage ainsi qu'à en améliorer la qualité.

Techniquement
L'algorithme lui-même est au final remarquablement primitif dans son fonctionnement. Des approches complexes, basés sur des analyses statistiques et probabilistiques appliqués à la linguistique, étaient à l'étude mais se sont avérés au mieux équivalents à des méthodes plus naïves et bien plus rapides à mettre en application.

De plus, ce n'est pas l'algorithme lui-même mais son insertion dans la plate-forme qui demanda le plus d'efforts. Ceux-ci effectués, des raisonnements plus poussés de traitement du langage naturel permettront d'en augmenter la qualité.

Plusieurs procédés de contrôle permettent de vérifier l'application du filtrage afin d'éviter toute propagation préjudiciable. A la moindre défaillance, l'accès aux textes concernés est bloqué, et une système autonome, indépendant du site, veillera également à son bon fonctionnement.

mardi 7 juin 2011

Vie privée & Anonymisation

Tous les documents (quelques milliers) pouvant contenir des informations sensibles pouvant porter atteinte à la vie privée ont étés rendus temporairement inaccessibles sur Etaamb.

Temporairement ?

Oui, le temps de développer un procédé automatisé d'anonymisation desdits textes.

Etaamb est un exercice technique, et ce développement imprévu constitue un défi intéressant. Après les procédés de data mining (exploration de données) c'est désormais autour du npl (Natural Language Processing - Traitement automatique du langage naturel) que le développement d'Etaamb va s'articuler.

Une fois que celui-ci sera fonctionnel et offrira le résultat recherché, les textes concernés pourront alors à nouveau être consultés, intégralement anonymisés.