A IA consegue interpretar o comportamento dos cães? O que mostram os estudos

Tempo de leitura
11 min de leitura
Publicado
Atualizado
Capa editorial com um cão tricolor tranquilo, linhas subtis a assinalar os traços faciais e uma pergunta sobre a IA aplicada ao comportamento canino

Uma revisão da evidência, fundamentada em fontes, sobre a investigação das emoções e dos indicadores de dor nos cães — do DogFACS aos modelos de análise de vídeo — e sobre os limites de aplicar um resultado laboratorial numa sala de estar.

Investigação e evidência | Revisão da evidência | Atualizado em 31 de agosto de 2026

A resposta curta

A investigação atual mostra que os modelos de visão computacional conseguem classificar determinados rótulos a partir de imagens ou vídeos de cães, em condições de estudo previamente definidas. Por exemplo, um modelo pode distinguir duas condições induzidas experimentalmente num grupo controlado de Labradores ou classificar excertos de vídeo curtos que especialistas tenham anotado quanto a indicadores de dor. Trata-se de um resultado de investigação relevante.

Isso não é o mesmo que ler os sentimentos íntimos de um cão. Os estudos não demonstram que uma aplicação de telemóvel consiga diagnosticar dor, identificar o estado de espírito de um cão a partir de uma única fotografia ou determinar se um cão está seguro ou em risco com base num único vídeo feito em casa. A questão não é simplesmente saber se um modelo consegue apresentar uma percentagem. É saber se o rótulo, os dados, o desenho do teste e o contexto real justificam a decisão que alguém pretende tomar.

Diagrama que mostra um vídeo de um cão a passar por vários fotogramas e por características da postura ou do rosto até chegar a um rótulo do estudo, ao resultado do modelo e a uma decisão humana, com o contexto e a validação assinalados como etapas essenciais da evidência.
A gravação, o rótulo e o desenho da validação acompanham o resultado do modelo.

Esta revisão procura responder à seguinte pergunta: O que conseguem realmente inferir os estudos atuais de visão computacional a partir de vídeos do rosto ou do corpo de um cão e que evidência continua a faltar antes de esses resultados deverem ser usados pelas famílias?

O que analisámos

Esta é uma revisão narrativa da evidência, não uma revisão sistemática nem uma meta-análise. Selecionámos cinco fontes académicas que ajudam a responder à questão a partir de diferentes perspetivas:

  • um estudo comportamental fundamental que utilizou FACS e DogFACS;
  • um estudo controlado de aprendizagem profunda sobre duas condições emocionais caninas;
  • um estudo de vídeos sobre indicadores de dor, com anotações de profissionais veterinários;
  • um estudo que testou modelos de reconhecimento de emoções em excertos de vídeo de diferentes raças e em ambientes menos controlados; e
  • uma revisão por pares dos métodos de visão computacional aplicados à dor e aos estados afetivos dos animais.

Demos prioridade ao registo formal da revista ou da conferência, quando disponível, e consultámos depois o texto integral ou um repositório autorizado. Registámos a espécie, a população, a fonte dos dados, a definição dos rótulos, a tarefa do modelo, o desenho da avaliação e as limitações de cada estudo. Não incluímos o marketing de aplicações destinadas ao consumidor como evidência, nem considerámos trabalhos sobre outras espécies como prova aplicável aos cães.

Primeiro, importa definir o que significa aqui «reconhecimento de emoções»

Na linguagem do dia a dia, «reconhecer a emoção do meu cão» parece significar ter acesso direto à sua experiência interior. Num estudo, normalmente significa algo mais limitado: associar píxeis visíveis, pontos do corpo ou códigos de ações faciais a um rótulo definido pelos investigadores para um protocolo específico.

DogFACS é um exemplo útil. Trata-se de um sistema de codificação baseado na anatomia para descrever movimentos faciais observáveis. Dá aos investigadores um vocabulário para descrever ações como o movimento das orelhas, um piscar de olhos ou um movimento da boca. Não é um medidor do estado de espírito. No estudo de 2017, Caeiro, Guo e Mills utilizaram FACS e DogFACS para comparar ações faciais humanas e caninas perante diferentes categorias de estímulos. Os cães apresentaram ações distintas associadas a diferentes categorias, mas essas ações não eram simplesmente expressões humanas reproduzidas num rosto canino. A conclusão do artigo é uma razão para reduzir as interpretações antropomórficas, não uma autorização para associar uma determinada expressão facial a um sentimento universal. O artigo inclui também uma correção dos autores, pelo que deve ser lido como um registo académico em evolução, e não como um dicionário infalível de rótulos. Leia o estudo da Scientific Reports

Esta distinção é importante porque um modelo pode ser muito eficaz a reproduzir os rótulos de um estudo, enquanto esses rótulos continuam a ser mais restritos do que a pergunta para a qual uma família quer obter resposta. «Este excerto assemelha-se à condição de frustração do estudo» não é o mesmo que dizer «o seu cão está frustrado».

Mapa da evidência

Estudo O que foi registado e rotulado O que o modelo ou a análise indicou O que o resultado não demonstra
Caeiro, Guo e Mills (2017) Vídeos de 100 cães de companhia e 50 pessoas a responderem a quatro categorias de estímulos; movimentos faciais codificados com FACS e DogFACS. Os cães produziram ações faciais distintas consoante a categoria de estímulo, mas não apresentaram um sistema de expressões simples semelhante ao humano. Que um único rosto, uma raça ou uma ação facial seja um detetor universal de emoções.
Boneh-Shitrit et al. (2022) 29 Labradores num protocolo controlado; 164 vídeos equilibrados de três segundos, representando antecipação positiva ou frustração; anotações DogFACS. A abordagem baseada no DogFACS ultrapassou 71% de precisão nas condições apresentadas. Uma abordagem de aprendizagem profunda DINO-ViT ultrapassou 89% ao nível do vídeo e atingiu 85% ao nível do fotograma. Um reconhecimento geral de emoções entre diferentes raças, em vídeos feitos em casa ou abrangendo todos os estados positivos e negativos.
Zhu et al. (versão da conferência de 2023; texto integral de 2022) 61 vídeos recolhidos por profissionais veterinários, 23 rotulados como casos de dor e 38 como casos sem dor, num total de 6 horas e 45 minutos. As anotações foram fornecidas por profissionais veterinários. Um modelo de dois fluxos, que combina pontos-chave corporais e vídeo RGB, apresentou um F1 médio de 76.3% ± 4.4 e uma precisão média de 77.0% ± 4.6 in nos seus ensaios de validação cruzada. Um diagnóstico, um teste de rastreio doméstico validado ou uma medição direta da dor subjetiva.
Franzoni, Biondi e Milani (2024) 100 vídeos de fontes públicas, de diferentes raças, distribuídos equitativamente por cinco categorias do estudo: medo, frustração, felicidade, antecipação positiva e relaxamento. Numa das configurações de divisão dos vídeos, uma configuração de modelo VGG19 baseada em caixas delimitadoras do rosto atingiu uma precisão de 0.605 na tarefa de classificação em cinco categorias. Uma agregação separada em duas classes, com a designação «perigo», atingiu uma precisão máxima comunicada de 0.8577 após o pré-processamento. Uma garantia de segurança em tempo real. As classes «perigo» resultaram da agregação das categorias do estudo feita pelos autores, não sendo um instrumento clinicamente validado para avaliar o risco de mordedura.
Broomé e colaboradores (2023) Revisão por pares da investigação em visão computacional sobre a dor e os estados afetivos dos animais, incluindo métodos baseados no rosto, no corpo e em vídeo. A revisão salienta que os valores de precisão não são diretamente comparáveis quando diferem a recolha de dados, as categorias, o equilíbrio entre classes e a validação. Recomenda testes com exclusão por indivíduo e uma validação externa mais robusta. Um padrão de referência universal ou um motivo para classificar ferramentas destinadas ao consumidor com base numa única percentagem de destaque.

As percentagens são reproduzidas como resultados apresentados, não como uma tabela classificativa. Os estudos utilizam populações, tarefas, categorias, unidades e divisões diferentes. A revisão alerta explicitamente para o facto de essas diferenças poderem alterar a métrica antes mesmo de o modelo analisar um cão novo. Consultar o registo da revisão

Matriz que compara cinco fontes de evidência sobre o comportamento dos cães segundo a população, os dados de entrada, a categoria e a principal limitação.
As fontes analisadas utilizam populações, dados de entrada, categorias e métodos de validação diferentes.

Em que os estudos estão de acordo

1. O contexto faz parte da medição

O resultado mais sólido sobre emoções, obtido em condições controladas, partiu de uma pergunta deliberadamente limitada. Boneh-Shitrit e os seus colegas trabalharam com 29 Labradores e duas condições induzidas experimentalmente: antecipação positiva e frustração. Os vídeos eram curtos, equilibrados e foram recolhidos segundo um protocolo concebido para tornar as condições interpretáveis. O resultado comunicado pelo modelo profundo é interessante porque mostra que um modelo consegue aprender uma distinção nessas condições, e os mapas de calor permitem observar para onde dirigiu a sua atenção.

O mesmo desenho experimental é também a sua limitação. Um Labrador num estudo controlado não representa todos os cães numa cozinha, num parque ou num espaço de tosquia. Um vídeo de três segundos não é um dia inteiro de comportamento. O próprio estudo defende a inclusão de características mais diversificadas dos participantes e de dados mais longos ou variados antes de se avançar para conclusões mais abrangentes. Consultar o estudo controlado sobre emoções

2. Os indicadores de dor não são a experiência subjetiva da dor

O estudo sobre a dor nos cães, realizado por Zhu et al., é cuidadoso quanto a esta distinção. O seu sistema combina um fluxo de dados sobre a postura com um fluxo RGB, utiliza um excerto de oito imagens consecutivas recolhido ao longo de quatro segundos e produz um resultado do modelo para uma tarefa binária de classificação do estado de dor. O artigo afirma que uma simples imagem ou vídeo não pode medir diretamente a experiência subjetiva da dor. No máximo, pode estimar indicações visuais representadas nos dados e nas categorias.

O conjunto de dados é útil porque os vídeos foram recolhidos por profissionais veterinários, que também forneceram as anotações. É, contudo, pequeno segundo os padrões dos produtos destinados ao consumidor: 61 vídeos de origem, dos quais foram extraídos vários excertos curtos. O conjunto de dados original não está disponível publicamente, embora os autores tenham disponibilizado o código e as anotações nas condições descritas no artigo. As diferenças entre raças, a postura corporal, a iluminação, as obstruções visuais e o comportamento de adaptação influenciam aquilo que uma câmara consegue captar. Por isso, o F1 e a precisão comunicados constituem evidência sobre esse sistema experimental, não um diagnóstico doméstico. Consultar o artigo e a respetiva nota sobre os dados ou o registo publicado da conferência

3. Um modelo pode aprender o fundo em vez do cão

Franzoni, Biondi e Milani testaram um conjunto de dados com 100 vídeos de fontes públicas, abrangendo cinco categorias e diferentes raças. A sua análise é útil porque encara o pré-processamento como uma questão de evidência. Recortar o rosto, segmentar o cão e desfocar o fundo alterou o desempenho. Os autores discutem um erro comum: se muitos cães «felizes» forem filmados em parques e muitos cães «tristes» forem filmados em espaços interiores, um modelo pode aprender a reconhecer o parque ou a divisão, em vez da expressão.

A precisão comunicada de 0.605 para uma configuração de modelo com cinco categorias e a precisão máxima de 0.8577 para a sua agregação em duas classes, «perigo», devem ser interpretadas neste contexto. Os valores descrevem um conjunto de dados, uma definição de tarefa e um método de avaliação específicos. Os próprios autores salientam a pouca diversidade de raças e a necessidade de testar a dinâmica temporal. Os excertos transformados estão disponíveis através da nota sobre os dados do artigo, enquanto a coleção original de fontes públicas está sujeita a limitações de direitos de autor. Consultar o estudo da revista Neural Computing and Applications

4. O tempo pode conter informação que uma imagem fixa perde

A revisão de Broomé e dos seus colegas divide a investigação em visão computacional entre métodos de uma única imagem, agregação de imagens e modelos de vídeo genuinamente espaço-temporais. Cada opção responde a uma pergunta diferente. Contar a frequência com que uma orelha está levantada pode ser uma tarefa ao nível da imagem. Distinguir um pestanejar, uma mudança de postura ou um padrão repetido de evitamento exige uma sequência.

Os modelos de vídeo não são automaticamente melhores. Precisam de mais dados, podem ser dispendiosos de treinar e podem ajustar-se em excesso a imagens repetidas da mesma gravação. Uma imagem fixa e um excerto de quatro segundos são medições diferentes. Uma alegação dirigida aos consumidores que não indique a janela de entrada está a omitir uma parte essencial do método.

5. «Precisão» não é o mesmo que fiabilidade

A precisão responde a uma pergunta: com que frequência coincidiu a categoria prevista com a categoria registada naquela configuração de teste? O F1 equilibra o desempenho entre classes de uma forma diferente. Nenhum destes valores nos diz, por si só, se o modelo está calibrado para uma raça nova, quantos casos urgentes não deteta, se funciona com a câmara de um telemóvel ou o que acontece quando mudam a iluminação e a postura.

A revisão torna explícito este problema de comparação. Os investigadores utilizam câmaras, ângulos, unidades de amostragem, fontes das categorias, equilíbrios entre classes e métodos de validação diferentes. Uma divisão aleatória pode colocar imagens quase idênticas ou excertos do mesmo cão em ambos os lados da separação entre treino e teste. Uma divisão com exclusão por indivíduo, em que um cão inteiro é mantido de fora, é mais exigente e fornece mais informação sobre a generalização a um novo indivíduo. A validação externa, com uma nova clínica, família, câmara ou raça, é ainda mais exigente.

É por isso que a tabela acima coloca a métrica comunicada junto da população e da tarefa. Retirar o denominador e as condições do estudo transformaria um resultado útil num valor de marketing enganador.

Como seria uma evidência mais sólida

Antes de uma ferramenta destinada aos consumidores poder fazer de forma responsável uma alegação de grande impacto, seria necessário ver mais do que uma pontuação elevada no conjunto de teste de um único artigo:

  1. Um objetivo transparente. A ferramenta deve indicar se classifica um comportamento observável, um rótulo operacional utilizado no estudo ou um resultado clínico. «Emoção», sem uma definição, é demasiado abrangente.
  2. Participantes diversificados. Os testes devem abranger diferentes raças, formatos de cabeça, cores do pelo, idades, contextos de saúde e variações normais, apresentando os números em vez de os ocultar num título.
  3. Separação ao nível de cada cão. Nenhum cão, agregado familiar ou gravação quase idêntica deve passar para os conjuntos de treino e de teste.
  4. Validação externa e prospetiva. O modelo deve ser avaliado em novas clínicas, casas, câmaras e períodos de tempo, e não apenas numa parte da recolha original reservada para teste.
  5. Relato de erros clinicamente relevantes. A sensibilidade, a especificidade, a calibração, os falsos negativos e a incerteza devem ser comunicados para a decisão que a ferramenta pede à pessoa que tome.
  6. Revisão e correção independentes. Especialistas veterinários e em comportamento devem rever o objetivo, os rótulos, a linguagem de segurança e os casos de falha. As alterações de versão e as limitações conhecidas devem continuar visíveis.
  7. Um caminho de ação seguro. Se o resultado puder influenciar os cuidados ou a interação, a interface deve indicar à pessoa o que observar a seguir e quando contactar um veterinário. Não deve transformar uma classificação de baixa confiança numa falsa tranquilização.

Estes não são obstáculos inventados por uma só marca. São consequências práticas das lacunas de medição e validação descritas nos vários estudos.

Mapa de duas colunas sobre os limites da evidência, mostrando as afirmações sustentadas pelos estudos atuais e as que estes não comprovam para as famílias com animais de companhia.
A evidência atual sustenta uma classificação restrita de rótulos de estudo, não diagnósticos feitos em casa nem garantias de segurança.

Um limite útil para famílias com animais de companhia

Se experimentar uma funcionalidade de IA para analisar o comportamento, trate-a como um ponto de partida para perguntas, não como um veredito. Um processo mais responsável é:

  • registar o que aconteceu antes e depois do vídeo, e não apenas o fotograma mais expressivo;
  • anotar o movimento, o apetite, a respiração, a postura, o ambiente e a duração juntamente com a imagem;
  • comparar o que observou com o padrão habitual do seu cão, e não com um rótulo genérico;
  • evitar alterar a medicação, adiar cuidados ou aproximar-se de um cão assustado só porque uma aplicação parece confiante; e
  • contactar rapidamente um veterinário em caso de dor, dificuldade em respirar, fraqueza súbita, colapso, lesão ou alteração rápida do comportamento.

A nossa biblioteca de bem-estar animal é o lugar mais indicado para questões práticas sobre cuidados. Para conhecer o contexto de mercado por detrás do interesse recente na tecnologia inteligente para animais de companhia, consulte a nossa edição de agosto da Industry Weekly.

Em resumo

A investigação é promissora, mas o seu potencial é mais específico do que o slogan sugere. A visão computacional pode ajudar os investigadores a quantificar padrões visíveis e a classificar rótulos cuidadosamente definidos. O DogFACS pode tornar mais explícitas as descrições dos movimentos faciais. Os modelos de vídeo podem combinar postura, aparência e tempo. São avanços reais.

A evidência ainda não justifica o atalho feito pelo consumidor entre «o modelo correspondeu a um rótulo de estudo» e «a aplicação sabe o que o meu cão sente» ou «o cão está seguro». O próximo teste útil não é apresentar mais uma percentagem impressionante isoladamente. É obter dados de referência mais sólidos, incluir cães mais diversificados, fazer uma validação ao nível de cada cão e externa, comunicar a incerteza de forma transparente e definir claramente quando é necessário procurar ajuda profissional.

É esse o padrão que seguiremos nos próximos artigos de Investigação e evidência: indicar a fonte, preservar o método, declarar a incerteza e tornar a ausência de inferência tão visível como a descoberta.

Perguntas dos leitores

Uma aplicação de IA consegue dizer se o meu cão está feliz?

Pode classificar um vídeo utilizando rótulos aprendidos a partir de um conjunto de dados específico, mas os estudos atuais não validam um detetor universal de felicidade para cães que vivem em casa. Procure saber que rótulos, cães, câmaras e desenho de teste sustentam a afirmação da aplicação.

Um modelo de dor canina consegue diagnosticar o meu animal?

Não. Os estudos publicados sobre dor canina estimam indicadores visuais numa tarefa de investigação. Não substituem um exame veterinário nem medem diretamente a dor subjetiva a partir de um vídeo feito em casa.

Por que razão os artigos apresentam 77%, 86% ou 89% se a tecnologia ainda não está pronta?

Esses valores podem ser resultados legítimos no âmbito das respetivas experiências. Não são diretamente comparáveis, porque os estudos utilizam rótulos, amostras, janelas de entrada, divisões de dados e métricas diferentes. Um resultado só se torna útil quando o respetivo denominador e as suas limitações são apresentados em conjunto.

O que devo procurar antes de confiar numa afirmação sobre IA capaz de analisar o comportamento?

Procure uma definição clara do objetivo, uma separação dos dados por cão, validação externa, comunicação dos erros e da incerteza, uma descrição dos dados e um procedimento de segurança que encaminhe preocupações urgentes para um veterinário.

Fontes e nota de atualização

Todas as páginas das fontes foram consultadas em 31 de agosto de 2026. As descrições dos estudos acima distinguem os resultados comunicados da nossa interpretação. Se uma fonte for corrigida, retirada ou atualizada de forma material, iremos rever a passagem relevante e identificar a alteração, em vez de substituir silenciosamente a conclusão. Este artigo tem caráter informativo e não fornece diagnóstico veterinário nem aconselhamento sobre tratamentos.

  1. Caeiro, C., Guo, K. e Mills, D. «Os cães e os seres humanos respondem a estímulos emocionalmente competentes produzindo ações faciais diferentes.» Scientific Reports (2017; correção dos autores em 2018). registo na Nature
  2. Boneh-Shitrit, T. et al. «Reconhecimento automatizado e explicável de estados emocionais a partir de expressões faciais caninas: o caso da antecipação positiva e da frustração.» Scientific Reports (2022). registo na Nature
  3. Zhu, H. et al. «Estimativa de indicadores de dor em cães com base em vídeo.» IEEE International Conference on Affective Computing and Intelligent Interaction (registo da conferência publicado em 2023; texto integral no arXiv, versão 2, de 2022). registo do DOI | Texto integral
  4. Franzoni, V., Biondi, G. e Milani, A. «Técnicas avançadas para o reconhecimento automatizado de emoções em cães a partir de dados de vídeo através de aprendizagem profunda.» Neural Computing and Applications (2024). registo na Springer Nature
  5. Broomé, S. et al. «Ir além do rastreamento: uma revisão do reconhecimento da dor e das emoções dos animais baseado em visão computacional.» International Journal of Computer Vision (2023). registo do DOI na Springer | Repositório universitário

Produtos recomendados