Une démonstration sur quelques images propres peut sembler parfaite. Le produit réel rencontrera ombres, cadrages, appareils, mouvements et objets inconnus. La première tâche consiste donc à définir les conditions d'acquisition et les conséquences d'une erreur, pas à choisir immédiatement un réseau neuronal.
Spécifier ce que l'image doit permettre
Classification, détection, segmentation et suivi répondent à des questions différentes. « Reconnaître un défaut » doit préciser où il apparaît, à quelle taille, sous quel éclairage et avec quelle tolérance. Une sortie qui ne change aucune action opérationnelle ne justifie pas la collecte.
Le protocole d'acquisition fixe l'angle, la résolution, la distance, la lumière et la fréquence. Lorsque ces conditions ne peuvent pas être contrôlées, le jeu de données doit refléter cette variabilité. Les cas impossibles à lire pour un humain doivent être signalés plutôt que transformés en labels arbitraires.
Construire des labels cohérents
Une consigne d'annotation décrit les classes, les frontières et les cas ambigus. Plusieurs annotateurs sur un échantillon révèlent le niveau d'accord possible. Si l'accord est faible, le problème ou le guide doit être reformulé avant de produire des milliers d'étiquettes.
La séparation des données doit éviter que des images presque identiques d'une même scène apparaissent dans l'entraînement et le test. Sinon, la mesure récompense la mémorisation. Les séries, appareils, lieux ou périodes constituent souvent de meilleurs groupes de séparation que des images tirées au hasard.
Concevoir la performance en situation
La précision moyenne ne suffit pas. On mesure les erreurs par classe, condition et impact. Le seuil peut varier selon que le système assiste un opérateur, déclenche une inspection ou agit seul. La latence, le matériel, la consommation et la confidentialité influencent aussi l'architecture.
L'interface doit permettre de rejeter une image de mauvaise qualité et de corriger une détection. Ces retours, contrôlés avant réutilisation, enrichissent les cas difficiles. Le système apprend ainsi de la production sans absorber automatiquement chaque interaction comme une vérité.
Préparation du terrain
- Choisir précisément classification, détection, segmentation ou suivi
- Définir les conditions d'acquisition acceptables
- Mesurer l'accord entre annotateurs
- Séparer les données par scène, appareil, lieu ou période
- Prévoir rejet, correction, confidentialité et budget de latence
La vision par ordinateur devient un produit fiable lorsque l'environnement, les labels et la décision finale sont conçus ensemble. Le réseau n'est qu'un composant de cette chaîne visuelle.