¿Puede la IA interpretar el comportamiento de un perro? Lo que muestran realmente los estudios actuales

Tiempo de lectura
11 min de lectura
Publicado
Actualizado
Portada editorial con un perro tricolor tranquilo y sutiles líneas que señalan rasgos faciales, junto a una pregunta sobre la inteligencia artificial aplicada al comportamiento canino

Una revisión de la evidencia, basada en fuentes, sobre la investigación de las emociones y los indicadores de dolor en perros: desde DogFACS hasta los modelos de vídeo, y los límites de trasladar un resultado de laboratorio al salón de casa.

Investigación y evidencia | Revisión de la evidencia | Actualizado el 31 de agosto de 2026

La respuesta breve

Las investigaciones actuales muestran que los modelos de visión por ordenador pueden clasificar determinadas etiquetas a partir de imágenes o vídeos de perros en condiciones de estudio definidas. Por ejemplo, un modelo puede distinguir entre dos condiciones inducidas experimentalmente en un grupo controlado de labradores, o clasificar clips breves que expertos han anotado en función de indicadores de dolor. Es un resultado de investigación relevante.

Pero eso no equivale a leer lo que siente un perro. Los estudios no demuestran que una aplicación móvil pueda diagnosticar el dolor, identificar el estado de ánimo de un perro a partir de una sola imagen ni decidir si está seguro o en peligro basándose en un único vídeo grabado en casa. La cuestión no es simplemente si un modelo puede producir un porcentaje. Lo importante es saber si la etiqueta, los datos, el diseño de la prueba y el contexto real justifican la decisión que alguien pretende tomar.

Diagrama que muestra cómo un vídeo de un perro pasa por distintos fotogramas y características de la postura o el rostro hasta llegar a una etiqueta del estudio, el resultado del modelo y una decisión humana, con el contexto y la validación señalados como filtros de evidencia.
La grabación, la etiqueta y el diseño de validación acompañan al resultado del modelo.

Esta revisión plantea la siguiente pregunta: ¿Qué pueden inferir realmente las investigaciones actuales de visión por ordenador a partir de un vídeo del rostro o del cuerpo de un perro, y qué pruebas siguen faltando antes de que las familias puedan utilizar esos resultados?

Qué hemos revisado

Esta es una revisión narrativa de la evidencia, no una revisión sistemática ni un metaanálisis. Seleccionamos cinco fuentes académicas que ayudan a responder a la pregunta desde distintos ángulos:

  • un estudio conductual fundamental basado en FACS y DogFACS;
  • un estudio controlado de aprendizaje profundo sobre dos estados emocionales caninos;
  • un estudio de vídeos sobre indicadores de dolor, anotados por profesionales veterinarios;
  • un estudio que puso a prueba modelos de emociones con clips de distintas razas y entornos menos controlados; y
  • una revisión académica sometida a evaluación por pares sobre métodos de visión por ordenador para detectar dolor y estados afectivos en animales.

Dimos prioridad al registro formal de la revista o la conferencia cuando estaba disponible y, después, comprobamos el texto completo o un repositorio autorizado. Registramos la especie, la población, la fuente de los datos, la definición de las etiquetas, la tarea del modelo, el diseño de la evaluación y las limitaciones de cada estudio. No incluimos el marketing de aplicaciones para consumidores como evidencia ni consideramos que las investigaciones sobre otras especies demostraran algo sobre los perros.

Primero, definamos qué significa aquí «reconocimiento de emociones»

En el lenguaje cotidiano, «reconocer la emoción de mi perro» suena a acceder directamente a su experiencia interna. En un estudio, normalmente significa algo más limitado: relacionar píxeles visibles, puntos corporales o códigos de acciones faciales con una etiqueta que los investigadores definieron para un protocolo concreto.

DogFACS es un buen ejemplo. Se trata de un sistema de codificación basado en la anatomía para describir movimientos faciales observables. Proporciona a los investigadores un vocabulario para describir acciones como mover las orejas, parpadear o mover la boca. No es un medidor del estado de ánimo. El estudio de 2017 de Caeiro, Guo y Mills utilizó FACS y DogFACS para comparar las acciones faciales de personas y perros ante distintas categorías de estímulos. Los perros sí mostraron acciones características asociadas a diferentes categorías, pero no eran simplemente expresiones humanas copiadas en un rostro canino. La conclusión del artículo invita a reducir las interpretaciones antropomórficas, no autoriza a equiparar una postura facial concreta con un sentimiento universal. El artículo también incluye una corrección de autor, por lo que debe entenderse como un registro académico vivo, no como un diccionario de etiquetas infalible. Leer el estudio de Scientific Reports

Esta distinción es importante porque un modelo puede reproducir muy bien las etiquetas de un estudio, aunque esas etiquetas sean más limitadas que la pregunta que una familia quiere responder. «Este clip se parece a la condición de frustración del estudio» no significa lo mismo que «tu perro está frustrado».

El mapa de la evidencia

Estudio Qué se grabó y cómo se etiquetó Qué comunicó el modelo o análisis Qué no demuestra el resultado
Caeiro, Guo y Mills (2017) Vídeos de 100 perros de familia y 50 personas respondiendo a cuatro categorías de estímulos; los movimientos faciales se codificaron con FACS y DogFACS. Los perros produjeron acciones faciales características según la categoría del estímulo, pero no un sistema de expresiones simple y similar al humano. Que un solo rostro, una raza o una acción facial permita detectar universalmente una emoción.
Boneh-Shitrit et al. (2022) 29 perros labradores en un protocolo controlado; 164 vídeos equilibrados de tres segundos que representaban anticipación positiva o frustración; anotaciones realizadas con DogFACS. El enfoque basado en DogFACS superó el 71% de precisión en la configuración descrita. Un enfoque de aprendizaje profundo DINO-ViT superó el 89% a nivel de vídeo y alcanzó el 85% a nivel de fotograma. El reconocimiento general de emociones en distintas razas, vídeos domésticos o todos los estados positivos y negativos.
Zhu et al. (versión de la conferencia de 2023; texto completo de 2022) 61 vídeos recopilados por profesionales veterinarios: 23 etiquetados como vídeos con dolor y 38 como vídeos sin dolor, con un total de 6 horas y 45 minutos. Las anotaciones fueron realizadas por profesionales veterinarios. Un modelo de dos flujos que combinaba puntos clave del cuerpo y vídeo RGB obtuvo un F1 medio de 76.3% ± 4.4 y una exactitud media de 77.0% ± 4.6 in en sus experimentos de validación cruzada. Un diagnóstico, una prueba de cribado doméstica validada o una medición directa del dolor subjetivo.
Franzoni, Biondi y Milani (2024) 100 vídeos de acceso público de distintas razas, distribuidos por igual entre cinco etiquetas del estudio: miedo, frustración, felicidad, anticipación positiva y relajación. En una configuración que dividía los vídeos, un modelo VGG19 basado en recuadros delimitadores del rostro alcanzó una exactitud de 0.605 en la tarea de cinco etiquetas. Una agregación independiente en dos clases, etiquetada como "peligro", alcanzó una exactitud máxima comunicada de 0.8577 después del preprocesamiento. Una garantía de seguridad en tiempo real. Las clases de "peligro" eran una agrupación de las etiquetas del estudio realizada por los autores, no un instrumento clínicamente validado para evaluar el riesgo de mordedura.
Escoba y otros. (2023) Revisión académica por pares de la investigación en visión artificial sobre el dolor y los estados afectivos de los animales, incluidos métodos basados en el rostro, el cuerpo y el vídeo. La revisión destaca que las cifras de exactitud no son directamente comparables cuando difieren la recopilación de datos, las etiquetas, el equilibrio entre clases y la validación. Recomienda realizar pruebas con individuos excluidos del entrenamiento y una validación externa más sólida. Un único estándar universal o un motivo para clasificar las herramientas de consumo según un solo porcentaje destacado.

Los porcentajes se reproducen como resultados comunicados, no como una clasificación. Los estudios utilizan poblaciones, tareas, etiquetas, unidades y particiones diferentes. La revisión advierte expresamente que esas diferencias pueden cambiar la métrica antes incluso de que el modelo analice a un perro nuevo. Consulta la ficha de la revisión

Matriz que compara cinco fuentes de evidencia sobre el comportamiento canino según la población, los datos de entrada, la etiqueta y la principal limitación.
Las fuentes revisadas utilizan poblaciones, datos de entrada, etiquetas y diseños de validación diferentes.

En qué coinciden los estudios

1. El contexto forma parte de la medición

El resultado más sólido sobre emociones en condiciones controladas surgió de una pregunta deliberadamente limitada. Boneh-Shitrit et al. trabajaron con 29 labradores y dos condiciones inducidas experimentalmente: anticipación positiva y frustración. Los vídeos eran breves, estaban equilibrados y se recopilaron siguiendo un protocolo diseñado para que las condiciones pudieran interpretarse. El resultado comunicado del modelo profundo es interesante porque muestra que un modelo puede aprender a distinguir entre esas condiciones, y los mapas de calor permiten examinar dónde centró su atención.

Ese mismo diseño también marca la limitación. Un labrador en un experimento controlado no representa a todos los perros en una cocina, un parque o una sala de peluquería. Un clip de tres segundos no equivale a un día completo de comportamiento. El propio estudio pide ampliar las características de los participantes y utilizar datos más largos o variados antes de extraer conclusiones más generales. Lee el estudio controlado sobre las emociones

2. Los indicadores de dolor no equivalen a la experiencia subjetiva del dolor

El estudio sobre el dolor canino de Zhu et al. establece cuidadosamente este límite. Su sistema combina un flujo de datos de postura con otro de vídeo RGB, utiliza un clip de ocho fotogramas tomado a lo largo de cuatro segundos y genera el resultado de un modelo para una tarea binaria sobre el estado de dolor. El artículo señala que una imagen o un vídeo por sí solos no pueden medir directamente la experiencia subjetiva del dolor. Como mucho, pueden estimar indicios visuales representados en los datos y las etiquetas.

El conjunto de datos resulta útil porque profesionales veterinarios recopilaron los vídeos y proporcionaron las anotaciones. También es pequeño para los estándares de los productos de consumo: consta de 61 vídeos originales, de los que se obtuvieron repetidos clips breves. El conjunto de datos original no está disponible públicamente, aunque los autores facilitaron el código y las anotaciones en las condiciones descritas en el artículo. Las diferencias entre razas, la postura corporal, la iluminación, las obstrucciones visuales y la conducta de afrontamiento influyen en lo que una cámara puede captar. Por tanto, el F1 y la exactitud comunicados son pruebas sobre ese sistema experimental, no un diagnóstico doméstico. Consulta el artículo y su declaración sobre los datos o la publicación de la conferencia

3. Un modelo puede aprender el entorno en lugar del perro

Franzoni, Biondi y Milani probaron un conjunto de datos formado por 100 vídeos de acceso público que cubrían cinco etiquetas y distintas razas. Su análisis resulta útil porque considera el preprocesamiento una cuestión relacionada con la evidencia. Recortar el rostro, segmentar al perro y desenfocar el fondo modificó el rendimiento. Los autores describen un fallo habitual: si muchos perros "felices" se graban en parques y muchos perros "tristes" se graban en interiores, el modelo puede aprender a reconocer el parque o la habitación en lugar de la expresión.

La exactitud comunicada de 0.605 para una configuración de modelo con cinco etiquetas y la exactitud máxima de 0.8577 para su agregación en dos clases de "peligro" deben interpretarse teniendo en cuenta ese contexto. Las cifras describen un conjunto de datos, una definición de la tarea y un diseño de evaluación concretos. Los propios autores señalan la falta de diversidad de razas y la necesidad de probar la dinámica temporal. Los clips transformados están disponibles a través de la declaración de datos del artículo, mientras que la recopilación original de acceso público está sujeta a limitaciones de derechos de autor. Consulta el estudio de Neural Computing and Applications

4. El tiempo puede aportar información que una imagen fija pierde

La revisión de Escoba y otros. divide los trabajos de visión artificial en métodos basados en un solo fotograma, agregación de fotogramas y modelos de vídeo verdaderamente espaciotemporales. Cada opción responde a una pregunta diferente. Contar cuántas veces está adelantada una oreja puede ser una tarea basada en fotogramas. Distinguir un parpadeo, un cambio de postura o un patrón repetido de evitación requiere una secuencia.

Los modelos de vídeo no son automáticamente mejores. Necesitan más datos, pueden ser costosos de entrenar y pueden sobreajustarse a fotogramas repetidos de una misma grabación. Una imagen fija y un clip de cuatro segundos son mediciones diferentes. Una afirmación de un producto de consumo que no indique la ventana de entrada omite una parte esencial del método.

5. La "exactitud" no equivale a fiabilidad

La exactitud responde a una pregunta: ¿con qué frecuencia coincidió la etiqueta predicha con la etiqueta registrada en esa configuración de prueba? El F1 equilibra el rendimiento entre clases de otra manera. Ninguna de las dos cifras indica por sí sola si el modelo está calibrado para una raza nueva, cuántos casos urgentes pasa por alto, si funciona con la cámara de un teléfono o qué ocurre cuando cambian la iluminación y la postura.

La revisión hace explícito este problema de comparación. Los investigadores utilizan cámaras, ángulos, unidades de muestra, fuentes de etiquetas, equilibrios entre clases y esquemas de validación diferentes. Una partición aleatoria puede colocar fotogramas o clips casi idénticos del mismo perro a ambos lados de la división de prueba. Una partición con exclusión de individuos, en la que se reserva por completo a un perro, es más difícil y ofrece más información sobre la generalización a un individuo nuevo. La validación externa en una clínica, un hogar, una cámara o una raza nuevos es aún más exigente.

Por eso, la tabla anterior sitúa la métrica comunicada junto a la población y la tarea. Eliminar el denominador y las condiciones del estudio convertiría un resultado útil en una cifra de marketing engañosa.

Cómo sería una evidencia más sólida

Antes de que una herramienta dirigida al consumidor pudiera hacer responsablemente una afirmación de alto riesgo, querríamos ver algo más que una puntuación alta en el conjunto de prueba de un solo artículo:

  1. Un objetivo transparente. La herramienta debería indicar si clasifica un comportamiento observable, una etiqueta operativa de un estudio o un resultado clínico. «Emoción», sin una definición, es un término demasiado amplio.
  2. Participantes diversos. Las pruebas deberían incluir distintas razas, formas de cabeza, colores de pelaje, edades, contextos de salud y variaciones normales, y mostrar las cantidades en lugar de ocultarlas en un titular.
  3. Separación por perro. Ningún perro, hogar ni grabación casi idéntica debería aparecer tanto en los conjuntos de entrenamiento como en los de prueba.
  4. Validación externa y prospectiva. El modelo debería evaluarse con clínicas, hogares, cámaras y periodos de tiempo nuevos, no solo con una parte reservada de la colección original.
  5. Informes de errores clínicamente relevantes. Deberían notificarse la sensibilidad, la especificidad, la calibración, los falsos negativos y la incertidumbre para la decisión que la herramienta pide tomar a una persona.
  6. Revisión y corrección independientes. Especialistas en veterinaria y comportamiento deberían revisar el objetivo, las etiquetas, los mensajes de seguridad y los casos en los que el sistema falla. Los cambios de versión y las limitaciones conocidas deberían mantenerse visibles.
  7. Un camino de acción seguro. Si el resultado pudiera influir en los cuidados o en la interacción, la interfaz debería indicar qué observar a continuación y cuándo contactar con un veterinario. No debería convertir una clasificación de baja confianza en un mensaje tranquilizador.

Estas no son dificultades inventadas por una sola marca. Son consecuencias prácticas de las carencias de medición y validación descritas en los distintos estudios.

Mapa de dos columnas sobre los límites de la evidencia, con las afirmaciones que los estudios actuales respaldan y las que no permiten establecer para las familias con mascotas.
La evidencia actual respalda la clasificación de etiquetas de estudio concretas, no el diagnóstico en el hogar ni las garantías de seguridad.

Un límite útil para las familias con mascotas

Si pruebas una función de IA para interpretar el comportamiento, considérala una pregunta para orientarte, no un veredicto. Un proceso más responsable sería:

  • anotar lo que ocurrió antes y después del vídeo, no solo el fotograma más expresivo;
  • observar el movimiento, el apetito, la respiración, la postura, el entorno y la duración junto con la imagen;
  • comparar lo observado con el patrón habitual de tu perro, no con una etiqueta genérica;
  • evitar cambiar la medicación, retrasar la atención veterinaria o acercarte a un perro asustado porque una aplicación parezca segura de sí misma; y
  • contactar pronto con un veterinario si hay dolor, dificultad para respirar, debilidad repentina, colapso, una lesión o un cambio rápido en el comportamiento.

Nuestra biblioteca de bienestar para mascotas es un lugar más adecuado para resolver dudas prácticas sobre sus cuidados. Para conocer el contexto del mercado que explica el reciente interés por la tecnología inteligente para mascotas, consulta nuestro informe semanal del sector de agosto.

En resumen

La investigación es prometedora, pero sus posibilidades son más concretas de lo que sugiere el eslogan. La visión por computador puede ayudar a los investigadores a cuantificar patrones visibles y clasificar etiquetas definidas con precisión. DogFACS puede hacer más explícitas las descripciones de los movimientos faciales. Los modelos de vídeo pueden combinar la postura, el aspecto y el tiempo. Son avances reales.

La evidencia todavía no justifica el atajo dirigido a los consumidores que lleva de «el modelo coincidió con una etiqueta del estudio» a «la aplicación sabe lo que siente mi perro» o «el perro está a salvo». La siguiente prueba útil no es otro porcentaje llamativo presentado de forma aislada. Es contar con mejores datos de referencia, perros más diversos, validación por perro y externa, una incertidumbre transparente y un límite claro que indique cuándo buscar ayuda profesional.

Ese es el criterio que aplicaremos en futuros artículos de Investigación y evidencia: mostrar la fuente, preservar el método, expresar la incertidumbre y hacer que lo que no se puede inferir sea tan visible como el hallazgo.

Preguntas frecuentes de los lectores

¿Puede una aplicación de IA decirme si mi perro está contento?

Puede clasificar un vídeo utilizando etiquetas aprendidas de un conjunto de datos concreto, pero los estudios actuales no han validado un detector universal de la felicidad para perros en el hogar. Pregunta qué etiquetas, perros, cámaras y diseño de prueba respaldan la afirmación de la aplicación.

¿Puede un modelo de dolor canino diagnosticar a mi mascota?

No. Los estudios publicados sobre el dolor en perros estiman indicadores visuales en una tarea de investigación. No sustituyen una exploración veterinaria ni miden directamente el dolor subjetivo a partir de un vídeo grabado en casa.

¿Por qué los artículos informan de 77%, 86% o 89% si la tecnología aún no está lista?

Esas cifras pueden ser resultados legítimos dentro de sus respectivos experimentos. No son comparables entre sí porque los estudios utilizan etiquetas, muestras, ventanas de entrada, particiones y métricas diferentes. Un resultado solo resulta útil cuando sus denominadores y limitaciones se presentan junto con él.

¿Qué debería comprobar antes de confiar en una afirmación sobre IA y comportamiento canino?

Busca una definición clara del objetivo, una separación por perro, una validación externa, información sobre errores e incertidumbre, una descripción de los datos y un protocolo de seguridad que derive las preocupaciones urgentes a un veterinario.

Fuentes y nota de actualización

Todas las páginas de las fuentes se revisaron el 31 de agosto de 2026. Las descripciones de los estudios anteriores distinguen entre los resultados comunicados y nuestra interpretación. Si una fuente se corrige, se retira o se actualiza de forma sustancial, revisaremos el pasaje correspondiente e indicaremos el cambio, en lugar de sustituir la conclusión sin avisar. Este artículo tiene carácter informativo y no ofrece diagnóstico ni consejos de tratamiento veterinario.

  1. Caeiro, C., Guo, K. y Mills, D. «Los perros y los seres humanos responden a estímulos emocionalmente competentes produciendo distintas acciones faciales». Scientific Reports (2017; corrección de los autores en 2018). registro de Nature
  2. Boneh-Shitrit, T. et al. «Reconocimiento automatizado y explicable de estados emocionales a partir de expresiones faciales caninas: el caso de la anticipación positiva y la frustración». Scientific Reports (2022). registro de Nature
  3. Zhu, H. et al. «Estimación mediante vídeo de indicadores de dolor en perros». Conferencia internacional del IEEE sobre computación afectiva e interacción inteligente (actas de la conferencia publicadas en 2023; texto completo en arXiv, versión 2, 2022). registro del DOI | Texto completo
  4. Franzoni, V., Biondi, G. y Milani, A. «Técnicas avanzadas para el reconocimiento automatizado de emociones en perros a partir de vídeos mediante aprendizaje profundo». Neural Computing and Applications (2024). registro de Springer Nature
  5. Broomé, S. et al. «Más allá del seguimiento: revisión del reconocimiento del dolor y las emociones en animales mediante visión por computador». International Journal of Computer Vision (2023). registro del DOI de Springer | Repositorio universitario

Productos recomendados