L’IA peut-elle interpréter le comportement des chiens ? Ce que montrent les études
Sommaire
Une revue des données probantes sur les recherches consacrées aux émotions canines et aux indicateurs de douleur, des systèmes DogFACS aux modèles vidéo, ainsi que sur les limites du passage des résultats de laboratoire à la vie quotidienne.
Recherche et données probantes | Revue des données probantes | Mise à jour le 31 août 2026
En bref
Les recherches actuelles montrent que les modèles de vision par ordinateur peuvent classer certaines catégories à partir d’images ou de vidéos de chiens, dans les conditions précises d’une étude. Par exemple, un modèle peut distinguer deux états provoqués expérimentalement chez un groupe contrôlé de labradors, ou classer de courtes séquences vidéo annotées par des experts pour repérer des indicateurs de douleur. Il s’agit là d’un résultat de recherche important.
Cela ne revient pas à lire les émotions intimes d’un chien. Les études ne démontrent pas qu’une application mobile puisse diagnostiquer une douleur, déterminer l’humeur d’un chien à partir d’une seule photo ou décider qu’un chien est en sécurité ou non à partir d’une unique vidéo tournée à la maison. La question n’est pas simplement de savoir si un modèle peut produire un pourcentage. Il faut déterminer si la catégorie, les données, la méthode d’évaluation et le contexte réel justifient la décision que l’on souhaite prendre.

Cette revue pose la question suivante : Que peuvent réellement déduire les études actuelles en vision par ordinateur d’une vidéo montrant le visage ou le corps d’un chien, et quelles preuves manquent encore avant que ces résultats puissent être utilisés par les familles avec animaux ?
Ce que nous avons examiné
Il s’agit d’une revue narrative des données probantes, et non d’une revue systématique ni d’une méta-analyse. Nous avons sélectionné cinq sources scientifiques qui permettent d’aborder la question sous différents angles :
- une étude comportementale de référence utilisant FACS et DogFACS ;
- une étude contrôlée d’apprentissage profond portant sur deux états émotionnels canins ;
- une étude vidéo des indicateurs de douleur, annotée par des vétérinaires ;
- une étude ayant évalué des modèles de reconnaissance des émotions sur des séquences vidéo de races différentes et dans des environnements moins contrôlés ; et
- une synthèse évaluée par des pairs des méthodes de vision par ordinateur appliquées à la douleur et aux états affectifs chez les animaux.
Nous avons privilégié la publication officielle dans une revue ou les actes d’une conférence lorsqu’elle était disponible, puis vérifié le texte intégral ou un dépôt faisant autorité. Pour chaque étude, nous avons relevé l’espèce, la population, la source des données, la définition des catégories, la tâche confiée au modèle, la méthode d’évaluation et les limites. Nous n’avons pas considéré le marketing des applications grand public comme une preuve et nous n’avons pas traité les travaux portant sur d’autres espèces comme des preuves concernant les chiens.
Commençons par définir ce que signifie ici « reconnaissance des émotions »
Dans le langage courant, « reconnaître l’émotion de mon chien » semble supposer un accès direct à son vécu intérieur. Dans une étude, cela signifie généralement quelque chose de plus limité : associer des pixels visibles, des points du corps ou des codes décrivant les mouvements du visage à une catégorie définie par les chercheurs pour un protocole donné.
DogFACS en est un bon exemple. Il s’agit d’un système de codage anatomique des mouvements observables du visage. Il fournit aux chercheurs un vocabulaire pour décrire des actions telles qu’un mouvement d’oreille, un clignement des yeux ou un mouvement de la bouche. Ce n’est pas un indicateur d’humeur. Dans leur étude de 2017, Caeiro, Guo et Mills ont utilisé FACS et DogFACS pour comparer les mouvements faciaux humains et canins en fonction de différentes catégories de stimuli. Les chiens ont bien effectué des mouvements distinctifs associés aux différentes catégories, mais il ne s’agissait pas simplement d’expressions humaines reproduites sur un visage canin. La conclusion de l’article invite à limiter les interprétations anthropomorphiques ; elle ne permet pas d’associer une posture faciale donnée à une émotion universelle. L’article comporte également une correction des auteurs : il faut donc le considérer comme un travail scientifique susceptible d’évoluer, et non comme un dictionnaire infaillible des expressions. Lire l’étude publiée dans Scientific Reports
Cette distinction est importante, car un modèle peut très bien reproduire les catégories d’une étude alors que celles-ci restent plus limitées que la question à laquelle une famille souhaite répondre. « Cette séquence ressemble à l’état de frustration étudié » n’est pas la même affirmation que « votre chien est frustré ».
La synthèse des données probantes
| Étude | Ce qui a été enregistré et catégorisé | Ce que le modèle ou l’analyse a indiqué | Ce que le résultat ne permet pas d’établir |
|---|---|---|---|
| Caeiro, Guo et Mills (2017) | Vidéos de 100 chiens de famille et de 50 humains réagissant à quatre catégories de stimuli ; mouvements faciaux codés avec FACS et DogFACS. | Les chiens ont produit des mouvements faciaux distinctifs selon la catégorie de stimulus, mais pas un système d’expressions simple et comparable à celui des humains. | Qu’un visage, une race ou un mouvement facial pris isolément permette de détecter universellement une émotion. |
| Boneh-Shitrit et al. (2022) | 29 labradors dans le cadre d’un protocole contrôlé ; 164 vidéos équilibrées de trois secondes représentant une anticipation positive ou une frustration ; annotations DogFACS. | Dans le protocole présenté, l’approche fondée sur DogFACS a obtenu une précision supérieure à 71%. Une approche d’apprentissage profond DINO-ViT a dépassé 89% au niveau de la vidéo et atteint 85% au niveau de l’image. | La reconnaissance générale des émotions, toutes races confondues, dans des vidéos tournées à la maison ou pour l’ensemble des états positifs et négatifs. |
| Zhu et al. (version présentée à la conférence en 2023 ; texte intégral en 2022) | 61 vidéos recueillies par des vétérinaires, dont 23 indiquant une douleur et 38 sans douleur, pour un total de 6 heures et 45 minutes. Des professionnels vétérinaires ont fourni les annotations. | Un modèle à deux flux combinant des points clés du corps et des vidéos RVB a obtenu une F1 moyenne de 76.3% ± 4.4 et une précision moyenne de 77.0% ± 4.6 in lors de ses expériences de validation croisée. | Ni un diagnostic, ni un test de dépistage à domicile validé, ni une mesure directe de la douleur subjective. |
| Franzoni, Biondi et Milani (2024) | 100 vidéos issues de sources publiques, montrant différentes races et réparties équitablement entre cinq catégories étudiées : peur, frustration, bonheur, anticipation positive et détente. | Dans l'une des configurations de partitionnement des vidéos, une configuration de modèle VGG19 fondée sur une boîte englobante du visage a atteint une précision de 0.605 pour la tâche à cinq catégories. Une autre agrégation en deux classes, intitulée « danger », a atteint une précision maximale de 0.8577 après le prétraitement. | Une garantie de sécurité en temps réel. Les catégories « danger » correspondent à l'agrégation des catégories de l'étude réalisée par les auteurs, et non à un outil cliniquement validé d'évaluation du risque de morsure. |
| Balayé et al.. (2023) | Revue évaluée par des pairs des recherches en vision par ordinateur consacrées à la douleur et aux états affectifs chez les animaux, notamment à partir de méthodes fondées sur le visage, le corps et la vidéo. | La revue souligne que les taux de précision ne sont pas directement comparables lorsque la collecte des données, les catégories, l'équilibre entre les classes et la validation diffèrent. Elle recommande des tests excluant les sujets déjà utilisés et une validation externe plus poussée. | Ni une référence universelle, ni une raison de classer les outils grand public selon un seul pourcentage mis en avant. |
Les pourcentages sont reproduits comme résultats rapportés, et non comme un classement. Les études portent sur des populations, des tâches, des catégories, des unités et des partitions différentes. La revue met explicitement en garde contre le fait que ces différences peuvent modifier la métrique avant même qu'un modèle ne soit confronté à un nouveau chien. Consulter les données de la revue

Ce que les études montrent de façon concordante
1. Le contexte fait partie de la mesure
Le résultat le plus probant obtenu dans des conditions contrôlées sur les émotions répondait à une question volontairement étroite. Boneh-Shitrit et ses collègues ont travaillé avec 29 labradors et deux états induits expérimentalement : l'anticipation positive et la frustration. Les vidéos étaient courtes, équilibrées et recueillies dans le cadre d'un protocole conçu pour rendre ces états interprétables. Le résultat rapporté par le modèle profond est intéressant, car il montre qu'un modèle peut apprendre à distinguer ces états dans ces conditions. Les cartes d'activation permettent en outre d'observer les zones prises en compte par le modèle.
Cette même méthodologie constitue aussi sa limite. Un labrador observé dans le cadre d'une expérience contrôlée ne représente pas tous les chiens présents dans une cuisine, un parc ou une salle de toilettage. Une séquence de trois secondes ne rend pas compte d'une journée entière de comportement. L'étude elle-même préconise de disposer de caractéristiques de participants plus variées, ainsi que de données plus longues ou plus diversifiées, avant de tirer des conclusions plus générales. Lire l'étude contrôlée sur les émotions
2. Les indicateurs de douleur ne correspondent pas à l'expérience subjective de la douleur
L’étude sur la douleur chez les chiens menée par Zhu et al. est particulièrement prudente sur cette distinction. Son pipeline combine un flux fondé sur la posture et un flux RVB, utilise une séquence de huit images échantillonnées sur quatre secondes et produit une sortie de modèle pour une tâche binaire portant sur l’état douloureux. L’article précise qu’une image ou une vidéo isolée ne permet pas de mesurer directement l’expérience subjective de la douleur. Un tel système peut tout au plus estimer des indices visuels représentés dans les données et les étiquettes.
Le jeu de données est utile, car des professionnels vétérinaires ont recueilli les vidéos et fourni les annotations. Il reste toutefois limité au regard des standards des produits grand public : il comprend 61 vidéos sources, desquelles ont été extraites de courtes séquences répétées. Le jeu de données source n'est pas accessible au public, même si les auteurs ont mis le code et les annotations à disposition dans les conditions décrites dans l'article. Les différences entre les races, la posture, l'éclairage, les éléments masqués et les stratégies d'adaptation influencent toutes ce qu'une caméra peut voir. La F1 et la précision rapportées constituent donc des éléments sur ce dispositif expérimental, et non un diagnostic à domicile. Lire l'article et sa déclaration sur les données ou la publication de la conférence
3. Un modèle peut apprendre le décor plutôt que le chien
Franzoni, Biondi et Milani ont testé un jeu de données composé de 100 vidéos issues de sources publiques, couvrant cinq catégories et différentes races. Leur analyse est intéressante, car elle considère le prétraitement comme une question de fiabilité des données. Le recadrage du visage, l'isolation du chien et le floutage de l'arrière-plan ont modifié les performances. Les auteurs évoquent un biais bien connu : si de nombreux chiens « heureux » sont filmés dans des parcs et que de nombreux chiens « tristes » sont filmés à l'intérieur, un modèle peut apprendre à reconnaître le parc ou la pièce plutôt que l'expression.
La précision de 0.605 rapportée pour l'une des configurations du modèle à cinq catégories et la précision maximale de 0.8577 pour son agrégation en deux classes « danger » doivent être interprétées dans ce contexte. Ces chiffres décrivent un seul jeu de données, une seule définition de la tâche et une seule méthode d'évaluation. Les auteurs soulignent eux-mêmes le manque de diversité des races et la nécessité de tester la dynamique temporelle. Les séquences transformées sont accessibles via la déclaration sur les données de l'article, tandis que la collection originale issue de sources publiques est soumise à des restrictions liées aux droits d'auteur. Lire l'étude publiée dans Neural Computing and Applications
4. Le temps peut apporter des informations qu'une image fixe ne permet pas de saisir
La revue de Balayé et de ses collègues distingue les travaux de vision par ordinateur fondés sur une seule image, l'agrégation d'images et les véritables modèles vidéo spatio-temporels. Chaque approche répond à une question différente. Compter la fréquence à laquelle une oreille est orientée vers l'avant peut relever d'une analyse image par image. En revanche, distinguer un clignement, un changement de posture ou un comportement d'évitement répété nécessite une séquence.
Les modèles vidéo ne sont pas automatiquement meilleurs. Ils nécessitent davantage de données, peuvent être coûteux à entraîner et risquent de surapprendre des images répétées provenant du même enregistrement. Une image fixe et une séquence de quatre secondes sont deux mesures différentes. Toute affirmation destinée aux consommateurs qui ne précise pas la durée de la séquence analysée omet une partie essentielle de la méthode.
5. La « précision » ne garantit pas la fiabilité
La précision répond à une question : à quelle fréquence la catégorie prédite correspondait-elle à la catégorie enregistrée dans le cadre de ce test ? La F1 équilibre les performances entre les classes d'une autre manière. À elles seules, ces deux mesures ne nous indiquent pas si le modèle est correctement calibré pour une nouvelle race, combien de cas urgents il ne détecte pas, s'il fonctionne avec la caméra d'un téléphone ou ce qui se passe lorsque l'éclairage et la posture changent.
La revue met clairement en évidence ce problème de comparaison. Les chercheurs utilisent des caméras, des angles, des unités d'échantillonnage, des sources de catégories, des équilibres entre classes et des méthodes de validation différents. Une partition aléatoire peut placer des images ou des séquences presque identiques du même chien dans les deux parties du test. Une partition excluant les sujets, dans laquelle un chien entier est conservé à part, est plus exigeante et renseigne davantage sur la capacité de généralisation à un nouvel individu. Une validation externe menée dans une nouvelle clinique, un nouveau foyer, avec une nouvelle caméra ou sur une nouvelle race est plus exigeante encore.
C'est pourquoi le tableau ci-dessus présente la métrique rapportée à côté de la population et de la tâche. Supprimer le dénominateur et les conditions de l'étude transformerait un résultat utile en chiffre marketing trompeur.
À quoi ressembleraient des données plus probantes
Avant qu'un outil destiné au grand public puisse raisonnablement formuler une affirmation à fort enjeu, nous voudrions voir davantage qu'un score élevé obtenu sur le jeu de test d'un seul article :
- Une approche transparente. L'outil doit préciser s'il classe un comportement observable, une catégorie opérationnelle utilisée dans une étude ou un résultat clinique. Sans définition, le terme « émotion » est trop général.
- Des participants variés. Les tests doivent inclure différentes races, formes de tête, couleurs de robe, tranches d'âge, situations de santé et variations normales, en indiquant les effectifs plutôt qu'en les dissimulant dans un titre accrocheur.
- Une séparation au niveau du chien. Aucun chien, foyer ou enregistrement quasi identique ne doit se retrouver à la fois dans les ensembles d'entraînement et de test.
- Une validation externe et prospective. Le modèle doit être évalué dans de nouvelles cliniques, de nouveaux foyers, avec d'autres caméras et sur d'autres périodes, et pas uniquement sur une partie mise de côté de la collection d'origine.
- Une présentation des erreurs pertinente sur le plan clinique. La sensibilité, la spécificité, l'étalonnage, les faux négatifs et l'incertitude doivent être présentés en fonction de la décision que l'outil demande à une personne de prendre.
- Un examen indépendant et des corrections. Des vétérinaires et des spécialistes du comportement doivent examiner l'objectif, les étiquettes, les consignes de sécurité et les cas d'échec. Les changements de version et les limites connues doivent rester visibles.
- Une marche à suivre sûre. Si le résultat peut influencer les soins ou la manière d'interagir avec l'animal, l'interface doit indiquer à la personne ce qu'elle doit observer ensuite et quand contacter un vétérinaire. Elle ne doit pas transformer une classification peu fiable en fausse assurance.
Ces exigences ne sont pas des obstacles inventés par une seule marque. Elles découlent concrètement des lacunes en matière de mesure et de validation décrites dans l'ensemble des études.

Une limite utile pour les familles avec animaux
Si vous essayez une fonctionnalité d'IA consacrée au comportement, considérez-la comme une piste de réflexion, et non comme une conclusion. Voici une démarche plus responsable :
- notez ce qui s'est passé avant et après la séquence, et pas seulement l'image la plus expressive ;
- observez les mouvements, l'appétit, la respiration, la posture, l'environnement et la durée, en complément de l'image ;
- comparez ce que vous observez aux habitudes normales de votre chien, et non à une catégorie générique ;
- évitez de modifier un traitement, de retarder les soins ou de vous approcher d'un chien effrayé parce qu'une application semble sûre d'elle ; et
- contactez rapidement un vétérinaire en cas de douleur, de difficulté à respirer, de faiblesse soudaine, d'effondrement, de blessure ou de changement rapide de comportement.
Notre bibliothèque Bien-être des animaux est le meilleur endroit pour trouver des réponses pratiques à vos questions sur les soins. Pour découvrir le contexte du marché qui explique l'intérêt récent pour les technologies intelligentes dédiées aux animaux, consultez notre revue hebdomadaire du secteur d'août.
En bref
Les recherches sont prometteuses, mais leur portée est plus précise que ne le laisse entendre le slogan. La vision par ordinateur peut aider les chercheurs à quantifier des schémas visibles et à classer des catégories définies avec soin. DogFACS peut rendre les descriptions des mouvements faciaux plus explicites. Les modèles vidéo peuvent combiner la posture, l'apparence et la durée. Ce sont de véritables avancées.
Les données disponibles ne justifient toujours pas le raccourci destiné au grand public qui consiste à passer de « le modèle a reconnu une catégorie étudiée » à « l'application sait ce que ressent mon chien » ou « le chien ne risque rien ». Le prochain test utile ne consiste pas à afficher un pourcentage impressionnant de plus, pris isolément. Il faut plutôt disposer de données de référence plus fiables, de chiens plus variés, d'une validation au niveau de chaque chien et d'une validation externe, d'une incertitude transparente et d'une limite claire indiquant quand faire appel à un professionnel.
C'est la norme que nous appliquerons à nos prochains articles « Recherche et données probantes » : indiquer la source, préserver la méthode, expliciter l'incertitude et rendre aussi visible ce que l'étude ne permet pas de déduire que le résultat lui-même.
Les questions que vous vous posez
Une application d'IA peut-elle savoir si mon chien est heureux ?
Elle peut classer une séquence à l'aide de catégories apprises à partir d'un jeu de données particulier, mais les études actuelles ne valident pas l'existence d'un détecteur universel du bonheur chez les chiens vivant dans un foyer. Demandez quelles catégories, quels chiens, quelles caméras et quel protocole de test étayent l'affirmation de l'application.
Un modèle de détection de la douleur chez le chien peut-il diagnostiquer mon animal ?
Non. Les travaux publiés sur la douleur chez le chien évaluent des indicateurs visuels dans le cadre d'une étude. Ils ne remplacent pas un examen vétérinaire et ne mesurent pas directement la douleur ressentie à partir d'une vidéo prise à la maison.
Pourquoi les articles scientifiques font-ils état de 77%, 86% ou 89% si la technologie n’est pas encore au point ?
Ces chiffres peuvent être des résultats légitimes dans le cadre de leurs expériences. Ils ne sont pas interchangeables, car les études utilisent des catégories, des échantillons, des fenêtres d’analyse, des répartitions et des indicateurs différents. Un résultat n’est utile que si son dénominateur et ses limites sont toujours précisés.
Que dois-je vérifier avant de croire une affirmation concernant l’IA appliquée au comportement canin ?
Vérifiez que la cible est clairement définie, que les chiens sont séparés entre les ensembles de données, qu’une validation externe a été réalisée, que les erreurs et l’incertitude sont indiquées, que les données sont décrites et qu’une procédure de sécurité oriente les situations urgentes vers un vétérinaire.
Sources et mise à jour
Toutes les pages sources ont été vérifiées le 31 août 2026. Les descriptions des études ci-dessus distinguent les résultats rapportés de notre interprétation. Si une source est corrigée, rétractée ou substantiellement mise à jour, nous réviserons le passage concerné et indiquerons la modification, plutôt que de remplacer discrètement la conclusion. Cet article est fourni à titre informatif et ne constitue ni un diagnostic vétérinaire ni un conseil thérapeutique.
- Caeiro, C., Guo, K. et Mills, D. « Les chiens et les humains réagissent aux stimuli à forte pertinence émotionnelle en produisant des mouvements faciaux différents. » Scientific Reports (2017 ; correction des auteurs en 2018). Référence Nature
- Boneh-Shitrit, T. et al. « Reconnaissance automatisée et explicable des états émotionnels à partir des expressions faciales canines : le cas de l’anticipation positive et de la frustration. » Scientific Reports (2022). Référence Nature
- Zhu, H. et al. « Estimation des indicateurs de douleur chez le chien à partir de vidéos. » IEEE International Conference on Affective Computing and Intelligent Interaction (publication dans les actes de la conférence en 2023 ; texte intégral arXiv v2 en 2022). Référence DOI | Texte intégral
- Franzoni, V., Biondi, G. et Milani, A. « Techniques avancées de reconnaissance automatisée des émotions chez les chiens à partir de données vidéo grâce à l’apprentissage profond. » Neural Computing and Applications (2024). Référence Springer Nature
- Broomé, S. et al. « Aller au-delà du suivi : état de l’art de la reconnaissance de la douleur et des émotions animales fondée sur la vision par ordinateur. » International Journal of Computer Vision (2023). Référence DOI Springer | Dépôt universitaire