Vos données sont-elles prêtes pour l'IA ?
Sécurité, cadre légal et qualité des données : la check-list à passer avant de mettre un agent en production, pour éviter les mauvaises surprises une fois qu'il parle à vos clients.
Un agent se comporte parfaitement en démonstration. On lui pose trois questions, il répond juste, tout le monde repart convaincu. Trois semaines plus tard, il annonce à un client un tarif qui n'existe plus depuis six mois, parce qu'il l'a lu dans un fichier oublié au fond d'un dossier partagé.
Rien n'a changé dans le modèle. Ce qui a changé, c'est le champ de lecture. En démonstration, on lui a montré trois documents choisis. En production, on lui a ouvert la vraie vie de l'entreprise : les tableurs à trois versions, les contacts en double, les procédures que plus personne ne relit.
C'est pour cela que la question « nos données sont-elles prêtes ? » arrive avant la question de l'outil. Pas comme un chantier interminable, mais comme une demi-journée de mise en ordre qui décide de la qualité de tout ce qui suivra.
Ce qui échoue n'est presque jamais le modèle
La recherche est étonnamment convergente sur ce point. La RAND Corporation a interrogé 65 data scientists et ingénieurs ayant au moins cinq ans de pratique, et dégage cinq causes racines d'échec des projets d'IA : la deuxième est simplement que l'organisation ne dispose pas des données nécessaires, et la quatrième qu'elle n'a pas l'infrastructure pour les gérer. Deux causes sur cinq portent sur la matière première, pas sur l'intelligence.
Une étude de Google Research, menée auprès de 53 praticiens en Inde, en Afrique de l'Ouest, en Afrique de l'Est et aux États-Unis, va plus loin et nomme le mécanisme. Les auteurs parlent de « cascades de données » : des problèmes en amont qui produisent des effets composés en aval, présents dans 92 % des cas observés, et dont ils soulignent trois caractéristiques, ils sont invisibles, différés, et pourtant le plus souvent évitables.
Retenez ces trois mots, parce qu'ils décrivent exactement ce qui se passe avec un agent. Invisibles : un doublon dans un fichier client ne déclenche aucune alerte. Différés : la conséquence n'apparaît pas au moment du branchement, mais des semaines plus tard, dans une réponse envoyée à un client. Évitables : une heure de tri au départ aurait suffi.
Et ce n'est pas un problème réservé aux petites structures. Une étude publiée dans la Harvard Business Review par Tadhg Nagle, Thomas Redman et David Sammon aboutit à un titre sans ambiguïté : seules 3 % des entreprises ont des données atteignant un niveau de qualité basique. Autrement dit, le point de départ dont nous parlons est la situation normale, pas une exception honteuse.
Ce que l'IA change dans la question des données
Pendant vingt ans, « préparer ses données » voulait dire s'occuper des tableaux : des colonnes propres, des identifiants cohérents, un CRM à jour. Le reste, les mails, les PDF, les fils de discussion, les notes vocales, ne comptait pas, puisque aucun outil ne savait le lire.
Un agent conversationnel, lui, lit tout. C'est précisément ce qui le rend utile, et c'est ce qui déplace le problème : la partie désordonnée de votre entreprise, celle que personne n'a jamais rangée parce qu'elle n'était exploitable par aucun logiciel, devient d'un coup une source de réponses. Un devis envoyé en 2023 et jamais archivé a désormais autant de chances d'être cité qu'un tarif officiel.
Il y a aussi le problème inverse, moins évoqué : les données qui n'existent nulle part. Dans beaucoup d'entreprises, la règle « on ne facture pas de frais de livraison à ce client-là » ou « ce fournisseur exige un bon de commande signé » ne figure dans aucun document. Elle vit dans la tête de deux personnes, et se transmet à l'oral.
Un agent ne peut pas deviner ce qui n'a jamais été écrit. Préparer ses données consiste donc autant à trier l'existant qu'à écrire, une fois, ce que l'équipe sait déjà. C'est un travail ingrat, et c'est le plus rentable des deux : il sert à l'agent, mais il sert d'abord aux personnes qui arrivent dans l'équipe et qui mettaient jusqu'ici trois mois à apprendre ces règles par accident.
La check-list avant la mise en production
Sept points. Aucun ne demande de compétence technique particulière, et tous se traitent avec les personnes qui manipulent ces données chaque jour, parce que ce sont elles qui savent où sont les pièges.
- Savoir où vivent vos données : CRM, tableurs, boîtes mail, messageries, documents partagés. Tant que cette cartographie n'existe pas, vous ne pouvez ni sécuriser ni alimenter correctement un agent. C'est aussi le document qui vous servira pour toutes les étapes suivantes, y compris les formalités légales.
- Identifier les données personnelles : noms, numéros, adresses, historiques d'achat, échanges de support. Ce sont elles qui déterminent vos obligations et le niveau de protection à mettre en place. Marquez au passage celles que la loi considère comme sensibles, la santé, les convictions, les origines : elles suivent un régime plus strict.
- Définir qui accède à quoi : un agent doit avoir le périmètre minimal nécessaire à sa tâche. L'OWASP en a fait une catégorie de risque à part entière dans son Top 10 pour les applications à base de modèles de langage, sous le nom d'« agentivité excessive » (LLM06:2025). Un accès général « pour simplifier » est la configuration la plus banale et la plus coûteuse.
- Vérifier la fraîcheur des sources : une documentation périmée produit des réponses fausses à grande échelle et avec aplomb. Désignez un responsable et une fréquence de mise à jour avant, pas après. Un seul document obsolète suffit : l'agent n'a aucun moyen de savoir qu'il est obsolète.
- Écrire ce qui ne doit jamais sortir : la liste des informations qu'on ne colle pas dans un outil externe, et l'outil autorisé pour chaque usage. Samsung en a fait l'expérience en 2023 : moins de trois semaines après avoir autorisé l'outil, le groupe avait versé ses propres secrets dans un assistant public au moins trois fois, du code source, des notes de réunion et des informations sur des semi-conducteurs en développement, au point de prendre des mesures d'urgence et de menacer de couper l'accès sur son réseau. Personne n'agissait mal, chacun essayait simplement de travailler plus vite. La règle manquait.
- Prévoir la traçabilité : conserver les échanges et les décisions de l'agent permet de corriger vite, de justifier une réponse et de répondre à une demande d'accès. Le cadre de gestion des risques liés à l'IA publié par le NIST range cette exigence dans la première de ses quatre fonctions, « Govern », qui réclame des processus documentés, de la transparence et des mécanismes de relecture humaine. C'est aussi, plus prosaïquement, votre meilleure source d'amélioration.
- Informer les personnes concernées : dire clairement qu'un assistant automatisé intervient, et comment joindre un humain. C'est une obligation dans un nombre croissant de juridictions, et c'est surtout ce qui évite le sentiment d'être piégé.
Comprendre le vrai risque :
La donnée médiocre avant la fuite spectaculaire
Le risque le plus courant n'est pas la fuite spectaculaire, c'est la donnée médiocre. Un fichier client rempli de doublons et de champs vides produit un agent qui se trompe de destinataire, relance deux fois ou cite un montant erroné.
Ce risque a une particularité désagréable : il ne se voit pas dans les indicateurs. L'agent répond vite, le volume traité augmente, tout paraît fonctionner. Le coût se paie ailleurs, en confiance perdue et en corrections manuelles que personne ne compte.
Le périmètre trop large
Vient ensuite la question du périmètre. Un agent qui peut lire l'ensemble d'une boîte mail partagée finira tôt ou tard par réutiliser une information confidentielle dans une réponse publique. La restriction d'accès coûte une heure de paramétrage, l'incident coûte bien davantage.
Ce n'est pas une intuition : la divulgation d'informations sensibles occupe la deuxième place du Top 10 de l'OWASP pour les applications à base de modèles de langage (LLM02:2025), juste derrière l'injection de requête. Deux des dix risques majeurs du domaine tiennent donc à ce que vous laissez lire à votre agent, et à ce que vous l'autorisez à faire.
Le document juste, la réponse fausse
On croit souvent qu'il suffit de brancher l'agent sur ses propres documents pour éliminer les erreurs. C'est faux, et c'est mesuré. Une équipe de Stanford a évalué les outils de recherche juridique professionnels, précisément ceux qui s'appuient sur des bases documentaires validées, et a relevé des taux d'erreur de 17 à 33 % selon l'outil, concluant que les promesses des éditeurs étaient surévaluées.
La leçon n'est pas qu'il faut renoncer. Elle est que la qualité de la base documentaire détermine la qualité des réponses, et qu'un humain doit rester dans la boucle sur les sujets où une erreur coûte cher. L'agent prépare, propose, rédige ; la validation reste chez la personne qui porte la responsabilité.
Le cadre légal, concrètement
Le cadre juridique se prépare en amont, parce qu'il est très coûteux à rattraper une fois l'agent en production. Au Sénégal, l'essentiel tient dans quelques articles de la loi n° 2008-12 du 25 janvier 2008 sur la protection des données à caractère personnel, qu'il vaut la peine de connaître avant d'ouvrir un chantier.
- Une déclaration préalable (article 18) : les traitements de données personnelles se déclarent à la Commission de protection des données personnelles avant leur mise en œuvre, et les données sensibles demandent une autorisation.
- Une durée de conservation limitée (article 35) : les données ne se gardent pas au-delà de la période nécessaire à la finalité pour laquelle elles ont été collectées.
- Une obligation de sécurité (article 71) : le responsable du traitement doit prendre les précautions utiles pour empêcher que les données soient déformées, endommagées, ou accessibles à des tiers non autorisés.
- Des sanctions réelles (article 30) : en cas de manquement persistant, l'amende pécuniaire va de 1 million à 100 millions de francs CFA.
Ce cadre n'est pas une singularité locale. Le Sénégal a adhéré le 25 août 2016 à la Convention 108 du Conseil de l'Europe sur la protection des données, entrée en vigueur à son égard le 1er décembre 2016, ce qui explique la parenté entre la loi sénégalaise et les règles européennes. C'est un atout commercial plus qu'une contrainte : un client européen qui vous confie des données trouve en face de lui un régime qu'il reconnaît.
Si vous servez des clients en Europe, deux textes s'ajoutent directement. L'article 3.2 du RGPD s'applique aux responsables de traitement établis hors de l'Union dès lors qu'ils proposent des biens ou des services à des personnes qui s'y trouvent, ou qu'ils suivent leur comportement. Être basé à Dakar ne met donc pas hors champ.
Et depuis le 2 août 2026, l'article 50 du règlement européen sur l'intelligence artificielle impose que les systèmes conçus pour interagir directement avec des personnes les informent qu'elles s'adressent à une IA, sauf si c'est évident pour un observateur raisonnablement informé. Une phrase dans le premier message de votre agent suffit à traiter le sujet. Elle vous coûte dix secondes de rédaction et vous épargne une discussion désagréable.
La demi-journée de préparation, étape par étape
Voici la séquence que nous suivons, dans l'ordre, avant de brancher quoi que ce soit. Elle tient en quatre à cinq heures pour un premier périmètre, et se fait avec deux ou trois personnes de l'équipe concernée.
- Heure 1. La carte. Sur une seule page, la liste des endroits où vivent les données du processus visé, avec pour chacun le propriétaire et la date de dernière mise à jour. Les surprises arrivent à cette étape, presque toujours.
- Heure 2. Le tri. Dans chaque source, on marque ce qui est à jour, ce qui est périmé et ce qui fait doublon. On ne nettoie pas tout : on isole le périmètre minimal dont l'agent a besoin, et on écarte le reste.
- Heure 3. Le périmètre et les règles. Qui accède à quoi, ce qui ne sort jamais de l'entreprise, ce qui déclenche obligatoirement une relecture humaine. Cela s'écrit en une demi-page.
- Heure 4. Les formalités et la transparence. Vérification de la déclaration à la Commission, de la durée de conservation retenue, et rédaction de la phrase qui informe l'interlocuteur qu'il parle à un assistant et lui dit comment joindre une personne.
- Après. Une relecture de la carte tous les trimestres, un quart d'heure. C'est ce rendez-vous qui empêche la cascade de repartir.
Aucune de ces étapes n'exige un outil ni un budget. Le seul investissement est du temps d'attention, et il est très inférieur à celui que coûte la correction d'un agent qui a passé un mois à répondre à partir de sources périmées.
Ce que la préparation ne règle pas
Soyons honnêtes sur les limites. Des données propres ne rendent pas un agent infaillible, elles suppriment seulement la catégorie d'erreurs la plus fréquente et la plus stupide. L'étude de Stanford citée plus haut le montre bien : même adossé à des bases validées, un système se trompe encore.
C'est pourquoi la préparation des données va de pair avec une décision d'organisation : quels chemins l'agent traite seul, et à quel endroit une personne relit avant l'envoi. L'objectif n'est pas de retirer le jugement humain du circuit, mais de le concentrer là où il compte, au lieu de le dépenser sur du tri et de la recopie. Une équipe qui passe sa journée à chercher la bonne version d'un fichier ne fait pas un travail de jugement, elle fait un travail de rangement.
Conclusion :
Préparer ses données n'est pas un préalable interminable. Une demi-journée de cartographie et de nettoyage suffit à lever l'essentiel des risques d'un premier projet, et à supprimer les erreurs que la recherche identifie comme les plus fréquentes.
Et ce travail sert bien au-delà de l'IA : des données propres et un accès maîtrisé profitent à tous vos outils, aujourd'hui comme dans deux ans. La carte que vous dessinez pour un agent est la même que celle dont vous aurez besoin pour changer de CRM, répondre à un audit ou intégrer une nouvelle recrue.
Si vous voulez la faire une première fois avec nous, une heure d'échange suffit à identifier le périmètre à préparer et l'ordre dans lequel s'y prendre.
Sources
- RAND Corporation (J. Ryseff, B. F. De Bruhl, S. J. Newberry), The Root Causes of Failure for Artificial Intelligence Projects and How They Can Succeed, 13 août 2024.
- N. Sambasivan, S. Kapania, H. Highfill, D. Akrong, P. Paritosh, L. M. Aroyo (Google Research), « Everyone wants to do the model work, not the data work »: Data Cascades in High-Stakes AI, CHI 2021, 7 mai 2021.
- T. Nagle, T. C. Redman, D. Sammon, Only 3% of Companies' Data Meets Basic Quality Standards, Harvard Business Review, 11 septembre 2017.
- OWASP GenAI Security Project, OWASP Top 10 for LLM Applications 2025 (LLM02 Sensitive Information Disclosure, LLM06 Excessive Agency).
- V. Magesh, F. Surani, M. Dahl, M. Suzgun, C. D. Manning, D. E. Ho (Stanford RegLab & HAI), Hallucination-Free? Assessing the Reliability of Leading AI Legal Research Tools, Journal of Empirical Legal Studies, 2025.
- The Register (L. Dobberstein), Samsung reportedly leaked its own secrets through ChatGPT, 6 avril 2023.
- République du Sénégal, Loi n° 2008-12 du 25 janvier 2008 portant sur la protection des données à caractère personnel (articles 18, 30, 35 et 71), texte consolidé sur SenegalLII.
- Conseil de l'Europe, Convention 108, état des signatures et ratifications (Sénégal : adhésion le 25 août 2016, entrée en vigueur le 1er décembre 2016).
- Union européenne, Règlement général sur la protection des données, article 3 (champ d'application territorial).
- Union européenne, Règlement sur l'intelligence artificielle, article 50 (obligations de transparence), applicable depuis le 2 août 2026.
- NIST, Artificial Intelligence Risk Management Framework (AI RMF 1.0), NIST.AI.100-1, 26 janvier 2023.
Prêt à accélérer votre croissance ?
Chaque jour sans automatisation est un jour de retard. Réservez un appel et identifions ensemble vos premiers gains rapides.