L’IA può interpretare il comportamento del cane? Cosa mostrano davvero gli studi attuali
Table of contents
Una revisione delle evidenze, basata sulle fonti, sulle ricerche relative alle emozioni e agli indicatori di dolore nei cani: da DogFACS ai modelli video, fino ai limiti del trasferimento di un risultato di laboratorio nella vita quotidiana.
Ricerca e prove | Revisione delle evidenze | Aggiornato il 31 agosto 2026
La risposta in breve
Le ricerche attuali mostrano che i modelli di visione artificiale possono classificare determinate categorie a partire da immagini o video di cani, in condizioni di studio definite. Per esempio, un modello può distinguere due condizioni indotte sperimentalmente in un gruppo controllato di Labrador, oppure classificare brevi video annotati da esperti con indicatori di dolore. Si tratta di un risultato di ricerca significativo.
Ma non equivale ad accedere ai sentimenti personali di un cane. Gli studi non dimostrano che un'app sul telefono possa diagnosticare il dolore, identificare l'umore di un cane da una sola foto o stabilire se sia sicuro o meno sulla base di un singolo video girato in casa. La questione non è semplicemente se un modello sia in grado di produrre una percentuale. Bisogna chiedersi se l'etichetta, i dati, il disegno dello studio e il contesto reale giustifichino la decisione che si vuole prendere.

Questa revisione si chiede: Che cosa possono davvero dedurre gli attuali studi di visione artificiale dai video del muso o del corpo di un cane, e quali evidenze mancano ancora prima che questi risultati possano essere utilizzati dalle famiglie?
Che cosa abbiamo esaminato
Questa è una revisione narrativa delle evidenze, non una revisione sistematica né una meta-analisi. Abbiamo selezionato cinque fonti accademiche che aiutano a rispondere alla domanda da prospettive diverse:
- uno studio comportamentale fondamentale basato su FACS e DogFACS;
- uno studio controllato di apprendimento profondo su due condizioni emotive canine;
- uno studio video sugli indicatori di dolore, con annotazioni veterinarie;
- uno studio che ha testato modelli per il riconoscimento delle emozioni su video di razze diverse e in ambienti meno controllati; e
- una rassegna sottoposta a revisione paritaria sui metodi di visione artificiale per il dolore e gli stati affettivi negli animali.
Abbiamo dato priorità alla pubblicazione ufficiale su rivista o agli atti della conferenza, quando disponibili, verificando poi il testo completo o un archivio autorevole. Per ogni studio abbiamo registrato la specie, la popolazione, la fonte dei dati, la definizione delle etichette, l'obiettivo del modello, il metodo di valutazione e i limiti. Non abbiamo considerato il marketing delle app per consumatori come una prova e non abbiamo trattato le ricerche su altre specie come dimostrazioni valide per i cani.
Prima di tutto, definiamo che cosa si intende qui per «riconoscimento delle emozioni»
Nel linguaggio quotidiano, «riconoscere l'emozione del mio cane» sembra significare accedere direttamente alla sua esperienza interiore. In uno studio, di solito indica qualcosa di più circoscritto: associare pixel visibili, punti del corpo o codici delle azioni facciali a un'etichetta definita dai ricercatori per uno specifico protocollo.
DogFACS è un esempio utile. Si tratta di un sistema di codifica dei movimenti facciali osservabili basato sull'anatomia. Fornisce ai ricercatori un vocabolario per descrivere azioni come il movimento delle orecchie, un battito delle palpebre o un movimento della bocca. Non è un misuratore dell'umore. Lo studio del 2017 di Caeiro, Guo e Mills ha utilizzato FACS e DogFACS per confrontare le azioni facciali umane e canine in risposta a diverse categorie di stimoli. I cani hanno mostrato azioni distintive associate alle varie categorie, ma non si trattava semplicemente di espressioni umane riprodotte su un muso canino. La conclusione dell'articolo invita a ridurre le interpretazioni antropomorfiche, non autorizza ad associare una singola posizione del muso a un sentimento universale. L'articolo include inoltre una correzione degli autori, quindi va letto come un lavoro scientifico in evoluzione, non come un dizionario infallibile delle etichette. Leggi lo studio pubblicato su Scientific Reports
Questa distinzione è importante perché un modello può essere molto efficace nel riprodurre le etichette di uno studio, anche quando tali etichette sono più circoscritte della domanda a cui una famiglia vuole rispondere. «Questo video somiglia alla condizione di frustrazione dello studio» non significa «il tuo cane è frustrato».
La mappa delle evidenze
| Studio | Che cosa è stato registrato ed etichettato | Che cosa ha riportato il modello o l'analisi | Che cosa il risultato non dimostra |
|---|---|---|---|
| Caeiro, Guo e Mills (2017) | Video di 100 cani di famiglia e 50 persone mentre rispondevano a quattro categorie di stimoli; i movimenti facciali sono stati codificati con FACS e DogFACS. | I cani hanno prodotto azioni facciali distintive in base alla categoria di stimolo, ma non un sistema di espressioni semplice e simile a quello umano. | Che un singolo muso, una razza o un'azione facciale sia un rilevatore universale delle emozioni. |
| Boneh-Shitrit et al. (2022) | 29 Labrador Retriever in un protocollo controllato; 164 video bilanciati di tre secondi, rappresentativi di anticipazione positiva o frustrazione; annotazioni DogFACS. | Nel contesto descritto, l'approccio basato su DogFACS ha superato 71% di accuratezza. Un approccio di apprendimento profondo DINO-ViT ha superato 89% a livello di video e raggiunto 85% a livello di fotogramma. | Il riconoscimento generale delle emozioni tra razze diverse, nei video girati in casa o in tutti gli stati positivi e negativi. |
| Zhu et al. (versione della conferenza 2023; testo completo 2022) | 61 video raccolti in ambito veterinario, di cui 23 etichettati come relativi al dolore e 38 come non relativi al dolore, per un totale di 6 ore e 45 minuti. Le annotazioni sono state fornite da professionisti veterinari. | Un modello a due flussi, che combina i punti chiave del corpo e video RGB, ha riportato un punteggio F1 medio pari a 76.3% ± 4.4 e un'accuratezza media pari a 77.0% ± 4.6 in negli esperimenti di convalida incrociata. | Una diagnosi, un test di screening domestico convalidato o una misurazione diretta del dolore soggettivo. |
| Franzoni, Biondi e Milani (2024) | 100 video provenienti da fonti pubbliche, con cani di razze diverse, distribuiti equamente in cinque categorie di studio: paura, frustrazione, felicità, attesa positiva e rilassamento. | In una delle configurazioni di suddivisione dei video, un modello VGG19 basato sui riquadri di delimitazione del volto ha raggiunto un'accuratezza del 0.605 nel compito a cinque categorie. Un'aggregazione separata in due classi, denominata «pericolo», ha raggiunto un'accuratezza massima riportata del 0.8577 dopo la pre-elaborazione. | Una garanzia di sicurezza in tempo reale. Le categorie «pericolo» erano un'aggregazione delle etichette dello studio definita dagli autori, non uno strumento clinicamente convalidato per valutare il rischio di morso. |
| Broomé e colleghi (2023) | Una rassegna sottoposta a revisione paritaria della ricerca sulla visione artificiale applicata al dolore e agli stati affettivi degli animali, inclusi i metodi basati su volto, corpo e video. | La rassegna sottolinea che i valori di accuratezza non sono direttamente confrontabili quando differiscono la raccolta dei dati, le etichette, l'equilibrio tra le classi e la convalida. Raccomanda test con soggetti esclusivi e una convalida esterna più solida. | Un unico benchmark universale o un motivo per classificare gli strumenti destinati ai consumatori in base a una sola percentuale principale. |
Le percentuali sono riportate come risultati dichiarati, non come una classifica. Gli studi utilizzano popolazioni, compiti, etichette, unità e suddivisioni diversi. La rassegna avverte esplicitamente che queste differenze possono modificare la metrica prima ancora che il modello analizzi un cane nuovo. Consulta il record della rassegna

Su cosa concordano gli studi
1. Il contesto fa parte della misurazione
Il risultato più solido sulle emozioni, ottenuto in condizioni controllate, deriva da una domanda volutamente circoscritta. Boneh-Shitrit e colleghi hanno lavorato con 29 Labrador e due condizioni indotte sperimentalmente: attesa positiva e frustrazione. I video erano brevi, bilanciati e raccolti seguendo un protocollo pensato per rendere interpretabili le condizioni. Il risultato riportato del modello apprendimento profondo è interessante perché mostra che, in queste condizioni, un modello può imparare a distinguere tra le due situazioni; inoltre, le mappe di attivazione permettono di esaminare dove il modello ha concentrato l'attenzione.
Lo stesso disegno sperimentale rappresenta anche un limite. Un Labrador osservato in un esperimento controllato non rappresenta tutti i cani in cucina, al parco o in un ambiente dedicato alla toelettatura. Un filmato di tre secondi non equivale a un'intera giornata di comportamento. Lo studio stesso invita a includere caratteristiche più varie dei partecipanti e dati più lunghi o diversificati prima di formulare conclusioni più ampie. Leggi lo studio controllato sulle emozioni
2. Gli indicatori del dolore non coincidono con l'esperienza soggettiva del dolore
Lo studio sul dolore nei cani condotto da Zhu e colleghi è molto chiaro su questo limite. La sua procedura combina un flusso basato sulla postura con un flusso RGB, utilizza un segmento di otto fotogrammi campionato nell'arco di quattro secondi e restituisce l'output di un modello per un compito binario di classificazione dello stato di dolore. L'articolo spiega che una semplice immagine o un video non possono misurare direttamente l'esperienza soggettiva del dolore. Al massimo, possono stimare indicatori visivi rappresentati nei dati e nelle etichette.
Il set di dati è utile perché i video sono stati raccolti da professionisti veterinari, che hanno anche fornito le annotazioni. È però ridotto rispetto agli standard dei prodotti per consumatori: comprende 61 video di origine, dai quali sono stati ricavati brevi segmenti ripetuti. Il set di dati originale non è disponibile pubblicamente, anche se gli autori hanno reso disponibili il codice e le annotazioni secondo le condizioni descritte nell'articolo. Le differenze tra razze, la postura del corpo, l'illuminazione, gli elementi che nascondono parzialmente il soggetto e i comportamenti adottati per affrontare la situazione influenzano ciò che una videocamera può vedere. L'F1 e l'accuratezza riportati sono quindi una prova relativa a quella procedura sperimentale, non una diagnosi effettuata a casa. Leggi l'articolo e la relativa nota sui dati oppure il record pubblicato della conferenza
3. Un modello può imparare lo sfondo invece del cane
Franzoni, Biondi e Milani hanno testato un set di dati composto da 100 video provenienti da fonti pubbliche, relativo a cinque categorie e a razze diverse. La loro analisi è utile perché considera la pre-elaborazione come una questione di evidenza. Ritagliare il volto, isolare il cane e sfocare lo sfondo ha modificato le prestazioni. Gli autori discutono un errore ricorrente: se molti cani «felici» vengono filmati nei parchi e molti cani «tristi» in ambienti chiusi, il modello può imparare a riconoscere il parco o la stanza invece dell'espressione.
L'accuratezza del 0.605 riportata per una configurazione del modello a cinque categorie e l'accuratezza massima del 0.8577 per l'aggregazione in due classi denominata «pericolo» vanno interpretate alla luce di questo contesto. I numeri descrivono un solo set di dati, una sola definizione del compito e una sola configurazione di valutazione. Gli stessi autori indicano la scarsa varietà delle razze e la necessità di testare le dinamiche temporali. I segmenti trasformati sono disponibili nella nota sui dati dell'articolo, mentre la raccolta originale proveniente da fonti pubbliche è soggetta a limitazioni legate al diritto d'autore. Leggi lo studio pubblicato su Neural Computing and Applications
4. Il tempo può contenere informazioni che un'immagine fissa perde
La rassegna di Broomé e colleghi suddivide la ricerca sulla visione artificiale in metodi basati su un singolo fotogramma, aggregazione di fotogrammi e modelli video realmente spazio-temporali. Ogni scelta risponde a una domanda diversa. Contare quante volte un orecchio è orientato in avanti può essere un compito basato sul singolo fotogramma. Distinguere un battito di ciglia, un cambiamento di postura o un comportamento ripetuto di evitamento richiede una sequenza.
I modelli video non sono automaticamente migliori. Richiedono più dati, possono essere costosi da addestrare e possono adattarsi eccessivamente a fotogrammi ripetuti della stessa registrazione. Un'immagine fissa e un segmento di quattro secondi sono misurazioni diverse. Un'affermazione rivolta ai consumatori che non specifichi la finestra temporale dell'input omette una parte essenziale del metodo.
5. «Accuratezza» non significa necessariamente affidabilità
L'accuratezza risponde a una domanda: con quale frequenza l'etichetta prevista coincideva con quella registrata in quella configurazione di test? L'F1 bilancia le prestazioni tra le classi in modo diverso. Nessuno dei due valori ci dice, da solo, se il modello è calibrato per una razza nuova, quanti casi urgenti non riconosce, se funziona con la videocamera di uno smartphone o cosa accade quando cambiano illuminazione e postura.
La rassegna rende esplicito questo problema di confronto. I ricercatori utilizzano videocamere, angolazioni, unità campionarie, fonti delle etichette, equilibri tra le classi e schemi di convalida diversi. Una suddivisione casuale può collocare fotogrammi quasi identici o segmenti dello stesso cane su entrambi i lati del confine di test. Una suddivisione con soggetti esclusivi, in cui un intero cane viene lasciato fuori, è più difficile e offre informazioni più utili sulla capacità di generalizzare a un nuovo individuo. La convalida esterna su una nuova clinica, abitazione, videocamera o razza è ancora più difficile.
Ecco perché la tabella precedente affianca la metrica riportata alla popolazione e al compito. Eliminare il denominatore e le condizioni dello studio trasformerebbe un risultato utile in un numero di marketing fuorviante.
Come sarebbe un'evidenza più solida
Prima che uno strumento destinato ai consumatori possa avanzare responsabilmente un'affermazione importante, vorremmo vedere più di un punteggio elevato ottenuto sul set di test di un singolo articolo:
- Un obiettivo trasparente. Lo strumento dovrebbe indicare se sta classificando un comportamento osservabile, un'etichetta operativa dello studio o un esito clinico. «Emozione», senza una definizione, è un termine troppo ampio.
- Partecipanti diversificati. I test dovrebbero includere razze, forme della testa, colori del mantello, età, condizioni di salute e normali variazioni, indicando i numeri invece di nasconderli in un titolo.
- Separazione a livello di singolo cane. Nessun cane, famiglia o registrazione quasi identica dovrebbe comparire sia nei set di addestramento sia in quelli di test.
- Validazione esterna e prospettica. Il modello dovrebbe essere valutato in nuove cliniche, abitazioni, con nuove telecamere e in periodi diversi, non soltanto su una porzione tenuta da parte della raccolta originale.
- Report degli errori clinicamente significativi. Sensibilità, specificità, calibrazione, falsi negativi e incertezza dovrebbero essere riportati in relazione alla decisione che lo strumento chiede di prendere.
- Revisione e correzione indipendenti. Esperti veterinari e del comportamento dovrebbero esaminare l'obiettivo, le etichette, le indicazioni di sicurezza e i casi di errore. Le modifiche alle versioni e i limiti noti dovrebbero rimanere visibili.
- Un percorso d'azione sicuro. Se il risultato potrebbe influenzare le cure o il modo di interagire con l'animale, l'interfaccia dovrebbe indicare cosa osservare in seguito e quando contattare un veterinario. Non dovrebbe trasformare una classificazione poco attendibile in una rassicurazione.
Non si tratta di ostacoli inventati da un singolo marchio. Sono le conseguenze pratiche delle lacune nella misurazione e nella validazione descritte nei diversi studi.

Un limite utile per le famiglie con animali domestici
Se provi una funzione di intelligenza artificiale dedicata al comportamento, considerala come uno spunto di riflessione, non un verdetto. Un approccio più responsabile consiste nel:
- registrare ciò che è successo prima e dopo il video, non soltanto il fotogramma più espressivo;
- annotare movimento, appetito, respirazione, postura, ambiente e durata insieme all'immagine;
- confrontare ciò che osservi con il normale comportamento del tuo cane, non con un'etichetta generica;
- evitare di modificare i farmaci, rimandare le cure o avvicinarti a un cane spaventato solo perché un'app sembra sicura di sé; e
- contattare tempestivamente un veterinario in caso di dolore, difficoltà respiratorie, debolezza improvvisa, collasso, lesioni o rapido cambiamento del comportamento.
La nostra biblioteca sul benessere degli animali è il posto migliore per trovare risposte pratiche alle domande sulla cura degli animali. Per conoscere il contesto di mercato alla base del recente interesse per la tecnologia intelligente dedicata agli animali domestici, consulta il nostro Industry Weekly di agosto.
In sintesi
La ricerca è promettente, ma la sua portata è più precisa dello slogan. La visione artificiale può aiutare i ricercatori a quantificare schemi visibili e classificare etichette definite con cura. DogFACS può rendere più esplicite le descrizioni dei movimenti facciali. I modelli video possono combinare postura, aspetto e andamento nel tempo. Sono progressi concreti.
Le prove non giustificano ancora il passaggio, tipico delle app per consumatori, da «il modello ha associato il video a un'etichetta dello studio» a «l'app sa cosa prova il mio cane» o «il cane è al sicuro». Il prossimo test utile non è un'altra percentuale impressionante presa isolatamente. Servono invece dati di riferimento più solidi, cani più diversificati, validazione a livello di singolo cane ed esterna, un'incertezza trasparente e un confine chiaro che indichi quando rivolgersi a un professionista.
Questo è lo standard che applicheremo ai futuri articoli di Ricerca e prove: indicare la fonte, preservare il metodo, dichiarare l'incertezza e rendere altrettanto visibile ciò che non si può inferire quanto il risultato ottenuto.
Le domande più frequenti dei lettori
Un'app di intelligenza artificiale può dirmi se il mio cane è felice?
Può classificare un video usando etichette apprese da un determinato set di dati, ma gli studi attuali non hanno validato un rilevatore universale della felicità per i cani che vivono in famiglia. Verifica quali etichette, cani, telecamere e impostazioni di test supportano l'affermazione dell'app.
Un modello che rileva il dolore nei cani può diagnosticare il mio animale?
No. Gli studi pubblicati sul dolore nei cani stimano indicatori visivi all'interno di un'attività di ricerca. Non sostituiscono una visita veterinaria e non misurano direttamente il dolore soggettivo a partire da un video girato in casa.
Perché gli studi riportano 77%, 86% o 89% se la tecnologia non è ancora pronta?
Questi valori possono essere risultati legittimi all'interno degli esperimenti in cui sono stati ottenuti. Non sono però intercambiabili, perché gli studi usano etichette, campioni, intervalli di input, suddivisioni dei dati e metriche diversi. Un risultato diventa utile solo quando viene accompagnato dal denominatore e dai relativi limiti.
Che cosa dovrei verificare prima di fidarmi di un'affermazione sull'IA applicata al comportamento?
Cerca una definizione chiara dell'obiettivo, una separazione dei dati a livello di singolo cane, una validazione esterna, informazioni su errori e incertezza, una descrizione dei dati e indicazioni di sicurezza che invitino a rivolgersi al veterinario per i problemi urgenti.
Fonti e nota sugli aggiornamenti
Tutte le pagine delle fonti sono state verificate il 31 agosto 2026. Le descrizioni degli studi riportate sopra distinguono i risultati pubblicati dalla nostra interpretazione. Se una fonte viene corretta, ritirata o aggiornata in modo sostanziale, modificheremo il passaggio pertinente e segnaleremo il cambiamento, invece di sostituire la conclusione senza darne notizia. Questo articolo ha finalità informative e non fornisce diagnosi o consigli terapeutici veterinari.
- Caeiro, C., Guo, K. e Mills, D. «Cani ed esseri umani rispondono a stimoli emotivamente rilevanti producendo diverse espressioni facciali.» Scientific Reports (2017; correzione degli autori nel 2018). Scheda su Nature
- Boneh-Shitrit, T. et al. «Riconoscimento automatizzato e spiegabile degli stati emotivi dalle espressioni facciali canine: il caso dell'attesa positiva e della frustrazione.» Scientific Reports (2022). Scheda su Nature
- Zhu, H. et al. «Stima degli indicatori del dolore nei cani basata su video.» IEEE International Conference on Affective Computing and Intelligent Interaction (record della conferenza pubblicato nel 2023; testo completo su arXiv, versione 2 del 2022). Scheda DOI | Testo completo
- Franzoni, V., Biondi, G. e Milani, A. «Tecniche avanzate per il riconoscimento automatico delle emozioni nei cani a partire da dati video mediante l’apprendimento profondo.» Neural Computing and Applications (2024). Scheda Springer Nature
- Broomé, S. et al. «Oltre il monitoraggio: una rassegna del riconoscimento del dolore e delle emozioni negli animali basato sulla visione artificiale.» International Journal of Computer Vision (2023). Scheda DOI Springer | Archivio istituzionale