Kan AI tolka hundars beteende? Det visar studierna
Innehållsförteckning
En källbaserad kunskapsöversikt om forskning kring hundars känslor och smärtindikatorer – från DogFACS till videomodeller – och om begränsningarna med att överföra laboratorieresultat till hemmiljön.
Forskning och evidens | Kunskapsöversikt | Uppdaterad 31 augusti 2026
Det korta svaret
Aktuell forskning visar att datorseendemodeller kan klassificera utvalda kategorier från bilder eller videor av hundar under definierade studieförhållanden. En modell kan till exempel skilja mellan två experimentellt framkallade tillstånd hos en kontrollerad grupp labradorer eller klassificera korta videoklipp som experter har annoterat med smärtindikatorer. Det är ett betydelsefullt forskningsresultat.
Det är inte samma sak som att läsa av en hunds privata känslor. Studierna visar inte att en mobilapp kan diagnostisera smärta, fastställa en hunds sinnesstämning utifrån en enda bild eller avgöra om en hund är säker eller utsatt utifrån en enskild hemmavideo. Frågan handlar inte bara om huruvida en modell kan ange en procentsiffra. Det handlar om huruvida kategorin, datan, testupplägget och den verkliga miljön ger tillräckligt stöd för det beslut någon vill fatta.

Den här översikten ställer frågan: Vad kan aktuell forskning inom datorseende faktiskt utläsa från video av en hunds ansikte eller kropp, och vilken evidens saknas fortfarande innan resultaten bör användas av hundägare?
Det här har vi gått igenom
Det här är en narrativ kunskapsöversikt, inte en systematisk översikt eller metaanalys. Vi valde ut fem vetenskapliga källor som belyser frågan ur olika perspektiv:
- en grundläggande beteendestudie som använde FACS och DogFACS;
- en kontrollerad djupinlärningsstudie av två känslotillstånd hos hundar;
- en videostudie av smärtindikatorer med annoteringar från veterinärer;
- en studie som testade känslomodeller på klipp från olika raser och mindre kontrollerade miljöer; samt
- en sakkunniggranskad översikt över datorseendemetoder för smärta och affektiva tillstånd hos djur.
Vi prioriterade den formella tidskrifts- eller konferenspublikationen när en sådan fanns tillgänglig och kontrollerade därefter fulltexten eller ett auktoritativt arkiv. För varje studie noterade vi art, population, datakälla, definition av kategorier, modelluppgift, utvärderingsdesign och begränsningar. Vi tog inte med marknadsföring för konsumentappar som evidens och betraktade inte forskning på andra arter som bevis för hur det fungerar hos hundar.
Först: vad menar vi med ”känsloigenkänning” här?
I vardagligt språk låter ”känna igen min hunds känsla” som direkt tillgång till en inre upplevelse. I en studie betyder det vanligtvis något snävare: att koppla synliga pixlar, kroppspunkter eller ansiktsrörelser enligt ett kodsystem till en kategori som forskarna har definierat för ett visst protokoll.
DogFACS är ett bra exempel. Det är ett anatomiskt baserat kodsystem för observerbara ansiktsrörelser. Det ger forskare ett gemensamt språk för att beskriva handlingar som öronrörelser, blinkningar eller munrörelser. Det är ingen mätare av sinnesstämning. Studien från 2017 av Caeiro, Guo och Mills använde FACS och DogFACS för att jämföra ansiktsrörelser hos människor och hundar inom olika stimuluskategorier. Hundarna uppvisade särskilda rörelser som var kopplade till olika kategorier, men rörelserna var inte bara mänskliga uttryck överförda till ett hundansikte. Studiens slutsats är ett skäl att minska antropomorfa tolkningar, inte ett tillstånd att likställa en viss ansiktsposition med en universell känsla. Artikeln har dessutom en författarrättelse och bör därför läsas som ett pågående vetenskapligt arbete, inte som en ofelbar ordbok över etiketter. Läs studien i Scientific Reports
Den skillnaden spelar roll eftersom en modell kan vara mycket bra på att återskapa en studies kategorier, samtidigt som kategorierna är snävare än den fråga en hundägare vill ha svar på. ”Det här klippet liknar studiens frustrationstillstånd” är inte samma påstående som ”din hund är frustrerad”.
Evidenskartan
| Studie | Det som spelades in och kategoriserades | Det som modellen eller analysen rapporterade | Det som resultatet inte visar |
|---|---|---|---|
| Caeiro, Guo och Mills (2017) | Video av 100 familjehundar och 50 människor som reagerade på fyra stimuluskategorier; ansiktsrörelser kodades med FACS och DogFACS. | Hundarna uppvisade särskilda ansiktsrörelser för olika stimuluskategorier, men inget enkelt, människoliknande system av ansiktsuttryck. | Att ett enskilt ansikte, en viss ras eller en ansiktsrörelse kan fungera som en universell känslodetektor. |
| Boneh-Shitrit et al. (2022) | 29 labradorer i ett kontrollerat protokoll; 164 balanserade videor på tre sekunder som representerade positiv förväntan eller frustration; annoteringar enligt DogFACS. | Den DogFACS-baserade metoden uppnådde en noggrannhet på över 71% i det rapporterade upplägget. En djupinlärningsmetod baserad på DINO-ViT översteg 89% på videonivå och nådde 85% på bildrutenivå. | Allmän känsloigenkänning över olika raser, hemmavideor eller alla positiva och negativa tillstånd. |
| Zhu et al. (konferensversion 2023; fulltext 2022) | 61 videor insamlade av veterinärer, varav 23 var märkta som smärta och 38 som ingen smärta, med en total längd på 6 timmar och 45 minuter. Veterinärer och annan djursjukvårdspersonal stod för annoteringarna. | En tvåströmsmodell som kombinerade kroppens nyckelpunkter med RGB-video rapporterade ett genomsnittligt F1-värde på 76.3% ± 4.4 och en genomsnittlig träffsäkerhet på 77.0% ± 4.6 in i sina korsvalideringsexperiment. | En diagnos, ett validerat screeningtest för hemmabruk eller en direkt mätning av subjektiv smärta. |
| Franzoni, Biondi and Milani (2024) | 100 videor från offentliga källor med olika hundraser, jämnt fördelade över fem studiekategorier: rädsla, frustration, glädje, positiv förväntan och avslappning. | I en uppdelning av videomaterialet nådde en modelluppsättning med ansiktsavgränsningsrutor och VGG19 en träffsäkerhet på 0.605 i uppgiften med fem kategorier. En separat sammanslagning i två klasser, benämnd "fara", nådde en rapporterad högsta träffsäkerhet på 0.8577 efter förbehandling. | En säkerhetsgaranti i realtid. Kategorierna "fara" var författarnas sammanslagning av studiens kategorier, inte ett kliniskt validerat instrument för bedömning av bitrisk. |
| Broomé m.fl. (2023) | En expertgranskad översikt av datorseendeforskning om smärta och affektiva tillstånd hos djur, inklusive metoder baserade på ansiktsuttryck, kroppsrörelser och video. | Översikten betonar att träffsäkerhetssiffror inte kan jämföras direkt när datainsamling, etiketter, klassbalans och validering skiljer sig åt. Den rekommenderar tester där individer hålls åtskilda samt mer omfattande extern validering. | Ett universellt riktmärke eller en anledning att rangordna konsumentverktyg efter en enda framträdande procentsiffra. |
Procentsiffrorna återges som rapporterade resultat, inte som en topplista. Studierna använder olika populationer, uppgifter, etiketter, enheter och datauppdelningar. Översikten varnar uttryckligen för att dessa skillnader kan påverka mätvärdet innan modellen ens möter en ny hund. Läs översiktens post

Det här är studierna överens om
1. Sammanhanget är en del av mätningen
Det starkaste kontrollerade resultatet om känslor kom från en medvetet avgränsad frågeställning. Boneh-Shitrit och kollegor arbetade med 29 labradorer och två experimentellt framkallade tillstånd: positiv förväntan och frustration. Videorna var korta, balanserade och samlades in enligt ett protokoll som var utformat för att göra tillstånden möjliga att tolka. Det rapporterade resultatet från deep learning-modellen är intressant eftersom det visar att en modell kan lära sig att skilja mellan tillstånden under dessa förhållanden, och värmekartorna ger möjlighet att se var modellen fokuserade.
Samma upplägg är också begränsningen. En labrador i ett kontrollerat experiment är inte samma sak som alla hundar i ett kök, en park eller ett trimningsrum. Ett klipp på tre sekunder visar inte en hel dags beteende. Studien efterlyser själv bredare deltagaregenskaper samt längre eller mer varierade data innan man drar mer långtgående slutsatser. Läs studien om kontrollerade känslor
2. Smärtindikatorer är inte samma sak som den subjektiva smärtupplevelsen
Smärtstudien på hundar av Zhu och kollegor är noga med denna gränsdragning. Metoden kombinerar en posebaserad dataström med en RGB-ström, använder ett åttabildersklipp som samplats över fyra sekunder och ger ett modellresultat för en binär uppgift om smärttillstånd. I artikeln står det att en enskild bild eller video inte direkt kan mäta den subjektiva smärtupplevelsen. Som mest kan den uppskatta visuella tecken som fanns representerade i data och etiketter.
Datamängden är användbar eftersom veterinärmedicinsk personal samlade in videorna och stod för annoteringarna. Med konsumentprodukter som måttstock är den samtidigt liten: 61 källvideor, med upprepade korta klipp som hämtats från dessa videor. Källdatamängden är inte offentligt tillgänglig, även om författarna gjorde kod och annoteringar tillgängliga enligt villkoren som beskrivs i artikeln. Skillnader mellan raser, kroppshållning, ljusförhållanden, skymmande objekt och hur hunden hanterar situationen påverkar allt vad en kamera kan se. Det rapporterade F1-värdet och träffsäkerheten är därför belägg för den experimentella metoden, inte en diagnos för hemmabruk. Läs artikeln och dess dataredogörelse eller den publicerade konferensposten
3. En modell kan lära sig bakgrunden i stället för hunden
Franzoni, Biondi och Milani testade en datamängd med 100 videor från offentliga källor, som omfattade fem kategorier och olika hundraser. Deras analys är användbar eftersom den behandlar förbehandling som en kunskapsfråga. När ansiktet beskars, hunden avgränsades och bakgrunden suddades ut förändrades resultatet. Författarna beskriver ett välkänt problem: om många "glada" hundar filmas i parker och många "ledsna" hundar filmas inomhus kan en modell lära sig att känna igen parken eller rummet i stället för ansiktsuttrycket.
Studiens rapporterade träffsäkerhet på 0.605 för en modelluppsättning med fem kategorier och högsta träffsäkerhet på 0.8577 för sammanslagningen i två klasser, "fara", bör läsas i detta sammanhang. Siffrorna beskriver en datamängd, en definition av uppgiften och ett utvärderingsupplägg. Författarna pekar själva på bristande mångfald bland raserna och behovet av att testa tidsförlopp. De omvandlade klippen finns tillgängliga via artikelns dataredogörelse, medan den ursprungliga samlingen från offentliga källor omfattas av upphovsrättsliga begränsningar. Läs studien i Neural Computing and Applications
4. Tiden kan innehålla information som en stillbild förlorar
Översikten av Broomé och kollegor delar in datorseendeforskningen i metoder för enskilda bildrutor, sammanvägning av bildrutor och egentliga spatiotemporala videomodeller. Varje val besvarar en annan fråga. Att räkna hur ofta ett öra är riktat framåt kan vara en uppgift på bildrutenivå. Att urskilja en blinkning, en förändring i kroppshållning eller ett upprepat undvikandemönster kräver en sekvens.
Videomodeller är inte automatiskt bättre. De kräver mer data, kan vara dyra att träna och kan överanpassas till upprepade bildrutor från samma inspelning. En stillbild och ett klipp på fyra sekunder är olika mätningar. Ett konsumentpåstående som inte anger vilket tidsfönster som används saknar en viktig del av metoden.
5. "Träffsäkerhet" är inte samma sak som tillförlitlighet
Träffsäkerhet besvarar en fråga: hur ofta stämde den förutsagda etiketten överens med den registrerade etiketten i just den testuppställningen? F1 balanserar resultatet mellan klasser på ett annat sätt. Ingen av siffrorna visar i sig om modellen är kalibrerad för en ny ras, hur många akuta fall den missar, om den fungerar med en mobilkamera eller vad som händer när ljusförhållanden och kroppshållning förändras.
Översikten tydliggör detta jämförelseproblem. Forskare använder olika kameror, vinklar, provsenheter, källor till etiketter, klassbalanser och valideringsmetoder. En slumpmässig uppdelning kan placera nästan identiska bildrutor eller klipp från samma hund på båda sidor av testgränsen. En individexklusiv uppdelning, där en hel hund hålls utanför, är svårare och ger mer information om hur väl modellen generaliserar till en ny individ. Extern validering på en ny klinik, i ett nytt hushåll, med en ny kamera eller på en ny ras är ännu svårare.
Det är därför tabellen ovan placerar det rapporterade mätvärdet bredvid populationen och uppgiften. Om man tar bort nämnaren och studiens villkor förvandlas ett användbart resultat till en missvisande marknadsföringssiffra.
Så skulle starkare belägg kunna se ut
Innan ett verktyg för konsumenter på ett ansvarsfullt sätt skulle kunna göra ett påstående med stora konsekvenser vill vi se mer än ett högt resultat på en enskild artikels testmängd:
- Ett transparent mål. Verktyget bör ange om det klassificerar ett observerbart beteende, en operativ studiemärkning eller ett kliniskt utfall. ”Känsla” utan en definition är för brett.
- Deltagare med varierande bakgrund. Testningen bör omfatta olika raser, huvudformer, pälsfärger, åldrar, hälsorelaterade sammanhang och variationer inom det normala, och antalet bör redovisas i stället för att döljas i en rubrik.
- Separation på hundnivå. Ingen hund, inget hushåll och ingen nästan identisk inspelning bör förekomma i både tränings- och testuppsättningarna.
- Extern och prospektiv validering. Modellen bör utvärderas på nya kliniker, i nya hem, med andra kameror och under andra tidsperioder – inte bara på en undanhållen del av den ursprungliga datainsamlingen.
- Rapportering av kliniskt relevanta fel. Sensitivitet, specificitet, kalibrering, falskt negativa resultat och osäkerhet bör rapporteras utifrån det beslut som verktyget ber en person att fatta.
- Oberoende granskning och korrigering. Veterinärer och beteendeexperter bör granska målvariabeln, märkningarna, säkerhetsinformationen och fallen där systemet misslyckas. Versionsändringar och kända begränsningar bör fortsätta vara synliga.
- En säker väg till rätt åtgärd. Om resultatet kan påverka vård eller samspel bör gränssnittet tala om för personen vad den bör observera härnäst och när det är dags att kontakta en veterinär. En klassificering med låg säkerhet bör inte omvandlas till lugnande besked.
Det här är inte hinder som ett enskilt varumärke har hittat på. De är praktiska följder av de brister i mätning och validering som beskrivs i studierna.

En användbar gränsdragning för djurägare
Om du provar en AI-funktion för beteende bör du se den som en fråga att utgå från, inte som ett definitivt svar. Ett mer ansvarsfullt arbetssätt är att:
- dokumentera vad som hände före och efter klippet, inte bara den mest uttrycksfulla bilden;
- notera rörelser, aptit, andning, kroppshållning, omgivning och varaktighet tillsammans med bilden;
- jämföra observationen med just din hunds normala beteendemönster, inte med en generell märkning;
- undvika att ändra medicinering, skjuta upp vård eller gå fram till en rädd hund bara för att en app låter säker; och
- kontakta en veterinär snarast vid smärta, andningssvårigheter, plötslig svaghet, kollaps, skada eller en snabb beteendeförändring.
Vårt bibliotek om djurhälsa är en bättre plats för praktiska frågor om djurvård. För branschbakgrunden till det ökade intresset för smart teknik för sällskapsdjur kan du läsa vårt branschbrev från augusti.
Sammanfattning
Forskningen är lovande, men verkligheten är mer nyanserad än slagordet. Datorseende kan hjälpa forskare att kvantifiera synliga mönster och klassificera noggrant definierade märkningar. DogFACS kan göra beskrivningar av ansiktsrörelser mer exakta. Videomodeller kan kombinera kroppshållning, utseende och tid. Det är verkliga framsteg.
Evidensen motiverar fortfarande inte den förenklade konsumentslutsatsen från ”modellen matchade en studiemärkning” till ”appen vet vad min hund känner” eller ”hunden är säker”. Nästa användbara test är inte ytterligare en imponerande procentsiffra tagen ur sitt sammanhang. Det handlar om bättre grunddata, fler hundar med varierande egenskaper, validering på hundnivå och i externa miljöer, transparent osäkerhet och en tydlig gräns för när professionell hjälp behövs.
Det är den standard vi kommer att använda i framtida artiklar i Research & Evidence: visa källan, bevara metoden, redovisa osäkerheten och göra det som inte kan utläsas lika synligt som själva resultatet.
Frågor som läsare ställer
Kan en AI-app tala om huruvida min hund är glad?
Den kan klassificera ett klipp utifrån märkningar som har lärts in från en viss datamängd, men aktuella studier har inte validerat någon universell glädjedetektor för hundar i hemmiljö. Ta reda på vilka märkningar, hundar, kameror och vilken testdesign som ligger till grund för appens påstående.
Kan en modell för hundsmärta diagnostisera mitt husdjur?
Nej. Den publicerade forskningen om smärta hos hundar uppskattar visuella indikatorer i en forskningsuppgift. Den ersätter inte en veterinärundersökning och mäter inte direkt subjektiv smärta i en hemvideo.
Varför rapporterar forskningsartiklar 77%, 86% eller 89% om tekniken inte är redo?
De siffrorna kan vara legitima resultat inom ramen för de experiment där de togs fram. De går inte att jämföra rakt av, eftersom studierna använder olika etiketter, urval, tidsfönster för indata, datauppdelningar och mätvärden. Ett resultat blir användbart först när även nämnare och begränsningar följer med.
Vad bör jag titta efter innan jag litar på ett påstående om AI för beteendeanalys?
Leta efter en tydlig definition av vad som mäts, uppdelning på hundnivå, extern validering, redovisning av fel och osäkerhet, en beskrivning av datamaterialet samt en säkerhetsrutin som hänvisar akuta problem till en veterinär.
Källor och information om uppdateringar
Alla källsidor kontrollerades den 31 augusti 2026. Studie beskrivningarna ovan skiljer mellan rapporterade resultat och vår tolkning. Om en källa rättas, dras tillbaka eller uppdateras i väsentlig omfattning reviderar vi det berörda avsnittet och anger vad som ändrats, i stället för att i tysthet ersätta slutsatsen. Den här artikeln är endast informativ och innehåller ingen veterinärmedicinsk diagnos eller behandlingsrådgivning.
- Caeiro, C., Guo, K. och Mills, D. ”Hundar och människor reagerar på känslomässigt relevanta stimuli genom att frambringa olika ansiktsuttryck.” Scientific Reports (2017; rättelse av författarna 2018). Nature-post
- Boneh-Shitrit, T. et al. ”Förklarbar automatisk identifiering av känslotillstånd utifrån hundars ansiktsuttryck: fallet positiv förväntan och frustration.” Scientific Reports (2022). Nature-post
- Zhu, H. et al. ”Videobaserad uppskattning av smärtindikatorer hos hundar.” IEEE International Conference on Affective Computing and Intelligent Interaction (publicerad konferenspublikation 2023; arXiv-fulltext v2 2022). DOI-post | Fulltext
- Franzoni, V., Biondi, G. och Milani, A. ”Avancerade metoder för automatisk identifiering av känslor hos hundar från videodata med hjälp av djupinlärning.” Neural Computing and Applications (2024). Springer Nature-post
- Broomé, S. et al. ”Bortom spårning: en översikt över datorseendebaserad identifiering av smärta och känslor hos djur.” International Journal of Computer Vision (2023). Springer DOI-post | Universitetsarkiv