Chaque jour, des millions de musulmans à travers le monde prennent un produit alimentaire, le retournent et plissent les yeux pour lire la minuscule liste d'ingrédients imprimée au dos. Le texte est souvent entassé dans un espace étroit, enroulé autour de surfaces courbes, imprimé avec un faible contraste, et parfois partiellement masqué par des plis, des reflets ou des dommages. Pour un humain, lire ces étiquettes est déjà un défi. Pour une machine — pour notre pipeline de ROC chez HalalLens — c'est un champ de bataille que nous n'avons pas encore gagné.

Cet article est un regard honnête sur notre situation actuelle. Nous avons construit un système capable de scanner une étiquette alimentaire, d'en extraire le texte, d'identifier les ingrédients individuels et de déterminer leur statut halal — le tout en quelques secondes. Il fonctionne remarquablement bien sur des étiquettes propres, plates et bien éclairées. Mais les emballages du monde réel sont rarement propres, plats ou bien éclairés. L'écart entre la précision en laboratoire et la réalité du plan de travail de cuisine est là où résident nos problèmes non résolus les plus difficiles, et nous pensons que nos utilisateurs méritent de savoir exactement quels sont ces problèmes.

Smartphone scanning a food product ingredient label using OCR technology in a grocery store
Un smartphone scanne une étiquette alimentaire — le point de départ de chaque vérification d'ingrédient HalalLens.

Pourquoi les emballages alimentaires sont particulièrement difficiles pour la ROC

La Reconnaissance Optique de Caractères a fait de grands progrès. Les moteurs de ROC modernes peuvent lire des documents imprimés avec une précision quasi parfaite. Mais une étiquette alimentaire n'est pas un document. C'est un objet tridimensionnel photographié dans des conditions non contrôlées par un appareil photo de téléphone tenu à un angle arbitraire. Le texte peut être imprimé en police de quatre points sur un emballage métallique brillant, avec la liste des ingrédients se poursuivant autour d'un coin physiquement impossible à capturer en une seule photographie.

Prenons une barre de chocolat typique. La liste des ingrédients pourrait être : "Sucre, beurre de cacao, poudre de lait entier, masse de cacao, émulsifiant (E471), arômes naturels, acide citrique." Sur le papier, c'est simple. Sur un emballage courbé et réfléchissant photographié sous l'éclairage fluorescent d'un supermarché, le moteur ROC pourrait retourner : "Sucre, beurre de caca0, p0udre de lait ent1er, masse de caca0, émulsifi€ur (E47I), ar0mes naturels, ac1de citr1que." Chaque caractère déformé est une mauvaise identification potentielle — et dans la vérification halal, une mauvaise identification peut signifier la différence entre un produit signalé comme sûr ou suspect.

Défi Ce qui se passe Impact sur la vérification Halal
Surfaces courbes Le texte se déforme, les caractères s'étirent et s'estompent sur les bords Noms d'ingrédients tronqués ou fusionnés
Impression à faible contraste Texte gris clair sur blanc, ou texte foncé sur fonds sombres Sections entières d'ingrédients manquées
Reflets et éblouissements Le flash de l'appareil crée des zones blanches sur les emballages brillants Ingrédients critiques cachés sous les taches de reflet
Étiquettes multilingues La même étiquette a du texte en 3-6 langues, souvent entremêlées La ROC mélange les langues, crée des mots hybrides
Taille de police minuscule Texte légalement requis imprimé à la taille minimale Les caractères deviennent ambigus : I vs l vs 1
Macro close-up of tiny ingredient text on shiny curved food packaging with glare and reflections
Reflets, surfaces courbes et polices minuscules — les conditions réelles qui défient la précision de la ROC.

Le problème du nettoyage : De la sortie brute de la ROC aux ingrédients utilisables

Même lorsque notre moteur ROC extrait avec succès le texte d'une étiquette, la sortie brute est rarement prête pour l'analyse halal. Le texte doit être "nettoyé" — un mot trompeusement simple pour un processus extrêmement complexe. Nettoyer signifie séparer la liste d'ingrédients du texte environnant comme les informations nutritionnelles, les avertissements d'allergènes et le texte marketing. Cela signifie diviser une longue chaîne séparée par des virgules en ingrédients individuels. Cela signifie reconnaître que "E471", "émulsifiant (E471)" et "mono- et diglycérides d'acides gras" font tous référence à la même substance.

C'est là que les choses deviennent vraiment difficiles. Les étiquettes alimentaires ne suivent pas un format universel. En Europe, les ingrédients sont généralement listés par ordre décroissant de poids, séparés par des virgules, avec les allergènes en gras. Aux États-Unis, le format est similaire mais les règles d'étiquetage des allergènes diffèrent. En Asie du Sud-Est, les étiquettes peuvent apparaître en malais, indonésien, arabe et anglais sur le même emballage. Dans les pays scandinaves, vous pourriez trouver des listes d'ingrédients en norvégien, suédois, danois et finnois empilées les unes sur les autres, avec des numéros E utilisés de manière incohérente.

Notre pipeline utilise actuellement une combinaison d'analyse basée sur des règles et d'extraction assistée par LLM. Le système basé sur des règles gère de manière fiable les étiquettes bien formatées : trouver "Ingrédients :", diviser sur les virgules, normaliser chaque entrée. Mais il échoue sur les cas limites — et dans le monde réel, les cas limites sont la majorité. Les ingrédients entre parenthèses imbriqués comme "enrobage chocolat (sucre, beurre de cacao, gélatine, glycérine)" doivent être analysés correctement pour identifier que la gélatine et la glycérine sont des sous-ingrédients de l'enrobage, et non des éléments autonomes. Obtenir le bon niveau d'imbrication des parenthèses est étonnamment fragile.

Sortie brute de la ROC Résultat propre attendu Échec courant
sucre, huile de palme 0, p0udre de lactosérum sucre, huile de palme, poudre de lactosérum "huile de palme 0" non reconnue comme huile de palme
E47l (mono-et diglycér1des) E471 (mono- et diglycérides) "E47l" analysé comme un code inconnu
gé1atine (bov1ne) gélatine (bovine) "gé1atine" manque le drapeau critique pour le halal
Ingredienser: Sukker, melk... [Norvégien] Sucre, lait... Langue non détectée, analysée comme un charabia anglais
Multiple food product packages from different countries showing ingredient labels in Arabic, Norwegian, Malay, Japanese, and English
Une simple course au supermarché peut produire des étiquettes dans une demi-douzaine de langues — chacune nécessitant une ROC et une traduction correctes.

Le Labyrinthe Multilingue

HalalLens sert des utilisateurs à travers la Scandinavie, l'Asie du Sud-Est, le Moyen-Orient et l'Europe de l'Ouest. Un seul produit scanné dans une épicerie norvégienne peut avoir ses ingrédients listés en norvégien, suédois, danois et finnois — parfois avec une section en arabe ou en anglais également. Notre moteur de ROC (Reconnaissance Optique de Caractères) doit non seulement lire le texte correctement mais aussi déterminer dans quelle langue il se trouve, car un même mot physique peut signifier des choses différentes dans différentes langues.

Le véritable cauchemar commence lorsque les erreurs de ROC interagissent avec l'analyse multilingue. Si le moteur lit mal un "ø" norvégien comme un "o", le mot peut accidentellement devenir valide dans une autre langue — mais avec un sens complètement différent. Notre pipeline de nettoyage de TAL (Traitement Automatique du Langage) tente d'abord de détecter la langue source, puis d'appliquer des règles de normalisation spécifiques à la langue, mais cette détection elle-même est peu fiable lorsque le texte ROC est altéré. Cela devient un problème circulaire : vous avez besoin d'un texte propre pour détecter la langue, mais vous avez besoin de la langue pour nettoyer le texte.

Nous avons expérimenté plusieurs approches : exécuter la ROC avec des indications de langue explicites, utiliser des modèles d'ensemble qui votent pour la lecture la plus probable, et post-traiter avec des LLM (Grands Modèles de Langage) qui peuvent raisonner sur ce qu'un mot altéré était "probablement" censé être. Chaque approche améliore la précision de manière incrémentale, mais aucune n'a résolu le défi fondamental. Un produit comme E120 (carmin) peut être listé comme "karmin" en norvégien, "karmiini" en finnois et "cochineal" en anglais — le tout sur le même étiquetage, tous nécessitant d'être reconnus comme le même ingrédient critique pour le halal.

Où nous en sommes aujourd'hui — Et ce qui vient ensuite

Nous voulons être transparents sur notre précision actuelle. Sur les étiquettes en anglais bien éclairées, plates et à fort contraste, notre pipeline obtient de bons résultats — identifiant et classant correctement la grande majorité des ingrédients. Sur les emballages multilingues, incurvés ou endommagés, la précision baisse sensiblement. Nous compensons cela par un score de confiance : lorsque le système est incertain concernant une lecture ROC ou une identification d'ingrédient, il signale le résultat et encourage l'utilisateur à vérifier manuellement.

Condition Extraction d'ingrédients Classification Halal
Étiquette anglaise propre, plate Élevée Élevée
Étiquette européenne multilingue Modérée Modérée
Emballage incurvé/réfléchissant Modérée Modérée
Endommagé, minuscule ou à faible contraste Faible Faible

Notre feuille de route pour améliorer le nettoyage ROC comprend plusieurs directions prometteuses. Premièrement, nous explorons les modèles vision-langage — des systèmes d'IA qui peuvent regarder l'image brute et comprendre le contexte, pas seulement les caractères individuels. Au lieu de lire "ge1atin" et d'essayer de le corriger après coup, un modèle vision-langage pourrait reconnaître d'après le contexte visuel qu'il s'agit d'une liste d'ingrédients et que le mot est presque certainement "gélatine". Deuxièmement, nous construisons une base de données croissante de mélectures ROC connues — une couche de correspondance approximative qui associe des erreurs courantes comme "E47l" à "E471" en fonction des modèles que nous avons observés sur des milliers de scans. Troisièmement, nous investissons dans des boucles de rétroaction utilisateur, permettant à notre communauté de corriger les erreurs ROC qui entraînent ensuite le système à éviter des erreurs similaires à l'avenir.

Aucune de ces solutions ne sera parfaite. Le défi fondamental de lire du texte minuscule, incurvé et multilingue à partir d'une photo d'appareil photo de téléphone ne sera peut-être jamais entièrement résolu — c'est un problème à l'intersection de l'optique, de la typographie, de la linguistique et de la variation culturelle qui repousse les limites de la technologie actuelle. Mais nous croyons qu'une communication honnête sur ces limites, combinée à une amélioration incrémentale constante, est la bonne approche. Chaque étiquette altérée que nous traitons apprend quelque chose de nouveau à notre système. Chaque correction utilisateur rend le prochain scan plus précis.

Points Clés à Retenir

  • Les emballages alimentaires réels présentent des défis — surfaces incurvées, reflets, polices minuscules, texte multilingue — qui rendent la ROC nettement plus difficile que la numérisation de documents plats.
  • Les erreurs de ROC comme "ge1atin" ou "E47l" peuvent entraîner une mauvaise identification ou l'omission complète d'ingrédients halal critiques.
  • Les étiquettes multilingues créent un problème circulaire : un texte propre est nécessaire pour détecter la langue, mais la détection de la langue est nécessaire pour nettoyer le texte.
  • HalalLens utilise un score de confiance pour signaler les résultats incertains, encourageant les utilisateurs à vérifier manuellement lorsque la qualité de la ROC est faible.
  • Les modèles vision-langage, les bases de données de correspondance approximative et les boucles de rétroaction communautaire sont les voies les plus prometteuses pour l'avenir.

Essayez HalalLens — Aidez-nous à Nous Améliorer

Chaque scan que vous effectuez aide notre système à apprendre. Utilisez HalalLens pour vérifier instantanément le statut halal — et lorsque notre ROC se trompe, vos corrections rendent le prochain scan plus précis pour tout le monde.

Essayez HalalLens Gratuitement

Avertissement : Cet article est à des fins éducatives et reflète l'état actuel de notre technologie en février 2026. HalalLens fournit une vérification halal assistée par l'IA comme un outil d'aide, et non comme une décision religieuse définitive. Consultez toujours des érudits islamiques qualifiés pour obtenir des conseils faisant autorité sur les questions alimentaires halal.