AIは犬の行動を読み取れる?現在の研究で分かっていること
目次
DogFACSから動画モデルまで、犬の感情や痛みの指標に関する研究を、信頼できる情報源に基づいて検証します。研究室で得られた結果を家庭でどう捉えるべきか、その限界も解説します。
研究・エビデンス|エビデンスレビュー|2026年8月31日更新
結論を先に
現在の研究では、コンピュータービジョンモデルが、一定の研究条件のもとで、犬の画像や動画から定義された一部のラベルを分類できることが示されています。たとえば、管理された環境で飼育されたラブラドールの集団について、実験的に引き起こした2つの状態を識別したり、専門家が痛みの指標を注釈付けした短い動画を分類したりできます。これは意味のある研究成果です。
しかし、それは犬の内面にある感情を直接読み取ることとは異なります。スマートフォンのアプリで痛みを診断できること、1枚の写真から犬の気分を特定できること、家庭で撮影した1本の動画だけで犬が安全か危険かを判断できることを、これらの研究は示していません。重要なのは、モデルが何パーセントの精度を出せるかだけではありません。そのラベル、データ、検証方法、そして実際の利用環境が、誰かが下そうとしている判断を正当化できるものかどうかです。

このレビューでは、次の問いを検討します。 現在のコンピュータービジョン研究は、犬の顔や体の動画から実際に何を推測できるのでしょうか。また、その出力をペットと暮らす家族が利用する前に、どのようなエビデンスがまだ必要なのでしょうか。
今回検証した内容
これは ナラティブ・エビデンスレビューであり、系統的レビューやメタ分析ではありません。異なる角度からこの問いに答えるのに役立つ、5つの学術資料を選びました。
- FACSとDogFACSを用いた、基礎となる行動研究
- 犬の2つの感情状態を対象にした、管理された環境でのディープラーニング研究
- 獣医師が注釈を付けた、痛みの指標に関する動画研究
- 異なる犬種の動画や、より管理の行き届いていない環境で撮影された動画を使って感情モデルを検証した研究
- 動物の痛みや情動状態を判定するコンピュータービジョン手法に関する、査読済みの調査研究
正式な学術誌または学会の記録がある場合はそれを優先し、その後、全文または信頼できるリポジトリを確認しました。それぞれの研究について、対象となる動物種、集団、データソース、ラベルの定義、モデルの課題、評価設計、限界を記録しました。一般向けアプリのマーケティング情報はエビデンスとして扱わず、他の動物種を対象とした研究を犬についての根拠ともみなしませんでした。
まず、「感情認識」がここで何を意味するのかを定義します
日常会話で「愛犬の感情を認識する」と聞くと、心の内側にある体験へ直接アクセスするように思えるかもしれません。しかし研究においては、通常もっと限定された意味で使われます。つまり、目に見える画素、体の各部位の位置、顔の動きのコードを、特定の研究手順に基づいて研究者が定義したラベルに対応付けることです。
DogFACS は、その具体例として役立ちます。これは、観察可能な顔の動きを、解剖学的な観点から記録するためのコード体系です。耳の動き、まばたき、口の動きといった行動を表現する共通の語彙を、研究者に提供します。犬の気分を測るメーターではありません。Caeiro、Guo、Millsによる2017年の研究では、FACSとDogFACSを使い、異なる刺激カテゴリーに対する人間と犬の顔の動きを比較しました。犬はカテゴリーごとに特徴的な動きを示しましたが、それは人間の表情をそのまま犬の顔に当てはめたようなものではありませんでした。この論文の結論は、擬人化した推測を控えるべき理由にはなりますが、1つの顔の姿勢を普遍的な1つの感情と結び付けてよいという許可ではありません。また、この論文には著者による訂正もあるため、絶対に誤りのないラベル辞書ではなく、更新され続ける学術記録として読むべきです。 Scientific Reportsの研究を読む
この違いが重要なのは、モデルが研究で使われたラベルの再現には非常に優れていても、そのラベルが、飼い主が知りたい問いより限定的なままである可能性があるからです。「この動画は、研究で設定された欲求不満の状態に似ている」という発言は、「あなたの犬は欲求不満を感じている」という発言とは異なります。
エビデンスの全体像
| 研究 | 記録・ラベル付けされた内容 | モデルまたは分析が示した結果 | この結果だけでは明らかにならないこと |
|---|---|---|---|
| Caeiro、Guo、Mills(2017年) | 4つの刺激カテゴリーに反応する家庭犬100頭と人間50人の動画。顔の動きはFACSとDogFACSでコード化。 | 犬は刺激カテゴリーごとに特徴的な顔の動きを示しましたが、単純な人間のような表情システムではありませんでした。 | 1つの顔、犬種、または顔の動きだけで、普遍的に感情を検出できること。 |
| Boneh-Shitrit et al.(2022年) | 管理された研究手順に参加したラブラドール・レトリーバー29頭。ポジティブな期待または欲求不満を表す、バランスを取った3秒間の動画164本。DogFACSによる注釈。 | 報告された設定では、DogFACSに基づく手法が71%を上回る精度を示しました。DINO-ViTを使ったディープラーニング手法は、動画単位で89%を上回り、フレーム単位では85%に達しました。 | 犬種をまたいだ一般的な感情認識、家庭で撮影した動画、またはポジティブ・ネガティブなあらゆる状態を認識できること。 |
| Zhu et al.(学会発表版は2023年、全文は2022年) | 獣医療の現場で収集された動画61本。そのうち痛みありとラベル付けされたものが23本、痛みなしが38本で、合計6時間45分。注釈は獣医療の専門家が行いました。 | 体のキーポイントとRGB動画を組み合わせた2ストリームモデルでは、交差検証実験において、平均F1値が76.3% ± 4.4、平均正解率が77.0% ± 4.6 inと報告されました。 | 診断でも、検証済みの家庭用スクリーニング検査でも、主観的な痛みを直接測定するものでもありません。 |
| Franzoni, Biondi and Milani(2024年) | 異なる犬種から集めた公開ソースの動画100本を、恐怖、欲求不満、幸福、ポジティブな期待、リラックスという5つの研究ラベルに均等に割り当てたもの。 | 動画の分割方法の一つでは、顔のバウンディングボックスを用いたVGG19モデル構成が、5ラベルの分類課題で0.605の正解率に達しました。別途、2クラスに集約した「危険」分類では、前処理後の最高正解率として0.8577が報告されています。 | リアルタイムの安全性を保証するものではありません。「危険」クラスは研究上のラベルを著者が集約したもので、臨床的に検証された咬傷リスク評価ツールではありません。 |
| Broomé ら(2023年) | 動物の痛みや情動状態を対象としたコンピュータービジョン研究の査読付きレビュー。顔、体、動画を用いた手法を含みます。 | このレビューでは、データの収集方法、ラベル、クラスのバランス、検証方法が異なる場合、正解率を単純に比較できないと強調しています。また、個体をまたいだ重複のないテストと、より厳格な外部検証を推奨しています。 | 普遍的なベンチマークでも、単一の目立つパーセンテージだけで消費者向けツールの優劣を順位付けする根拠でもありません。 |
パーセンテージは 報告された結果として再掲したものであり、ランキング表ではありません。研究ごとに、対象集団、課題、ラベル、単位、データ分割が異なります。このレビューでは、こうした違いによって、モデルが新しい犬を処理する前から指標が変わりうると明確に注意喚起しています。 レビューの記録を読む

研究結果から共通していえること
1. 文脈も測定の一部
管理された条件下で得られた情動に関する最も有力な結果は、意図的に範囲を絞った問いから導かれたものでした。Boneh-Shitrit らは、ラブラドール29頭を対象に、ポジティブな期待と欲求不満という2つの実験的に誘発した状態を調べました。動画は短く、各条件の数をそろえ、状態を解釈しやすいよう設計された手順のもとで収集されています。深層モデルの報告結果が興味深いのは、こうした条件下でモデルが違いを学習できることを示している点です。また、ヒートマップによって、モデルがどこに注目したのかを確認できます。
同じ実験設計が、そのまま限界にもなっています。管理された実験に参加した1頭のラブラドールは、キッチンや公園、グルーミングルームにいるすべての犬を代表するわけではありません。3秒間の動画も、1日の行動全体を示すものではありません。研究自体も、より幅広い参加犬の特徴を含め、より長く多様なデータを用いてから、より広範な主張を行う必要があるとしています。 管理された情動研究を読む
2. 痛みの指標は、主観的な痛みの体験そのものではない
Zhu らによる犬の痛みに関する研究は、この境界を慎重に扱っています。研究の処理パイプラインは、姿勢情報のストリームとRGB情報のストリームを組み合わせ、4秒間からサンプリングした8フレームの動画を使い、痛みの状態を2値で分類するモデル出力を返します。論文では、単一の画像や動画だけで、主観的な痛みの体験を直接測定することはできないと述べています。できるのは、せいぜい、データとラベルに表現された視覚的な兆候を推定することです。
このデータセットが有用なのは、獣医療の専門家が動画を収集し、アノテーションを付けているためです。一方で、消費者向け製品の基準から見ると規模は小さく、元動画は61本で、そこから短い動画クリップが繰り返し作成されています。元のデータセットは一般公開されていませんが、著者らは論文に記載した条件のもとで、コードとアノテーションを公開しています。犬種の違い、体の姿勢、照明、遮蔽、対処行動は、カメラに見える情報すべてに影響します。したがって、報告されたF1値と正解率は、この実験的な処理パイプラインに関するエビデンスであって、家庭での診断結果ではありません。 論文とデータに関する記載を読む または 公開された学会記録
3. モデルは犬ではなく、背景を学習してしまうことがある
Franzoni, Biondi and Milani は、5つのラベルとさまざまな犬種を含む、公開ソースの動画100本からなるデータセットを検証しました。この分析が有用なのは、前処理をエビデンスに関わる問題として扱っている点です。顔の切り抜き、犬の領域分割、背景のぼかしによって、性能は変化しました。著者らは、よく知られた失敗パターンについても論じています。たとえば、多くの「幸せな」犬が公園で撮影され、多くの「悲しい」犬が屋内で撮影されていると、モデルは表情ではなく、公園や部屋を学習してしまう可能性があります。
5つのラベルを使ったモデル構成の一つで報告された正解率0.605と、2クラスの「危険」集約で報告された最高正解率0.8577は、こうした文脈とともに読む必要があります。これらの数値が示すのは、1つのデータセット、1つの課題定義、1つの評価設計における結果です。著者ら自身も、犬種の多様性が不足していることと、時間的な変化を検証する必要性を指摘しています。変換後の動画クリップは論文のデータに関する記載を通じて利用できますが、元の公開ソースの動画コレクションには著作権上の制限があります。 Neural Computing and Applications の研究を読む
4. 静止画では失われる情報を、時間の変化が伝えることがある
Broomé らのレビューでは、コンピュータービジョン研究を、単一フレームの手法、フレームの集約、そして本来の時空間動画モデルに分けています。それぞれが異なる問いに答えます。耳が前を向いている頻度を数えるのは、フレーム単位の課題かもしれません。一方、まばたき、姿勢の変化、繰り返される回避行動を見分けるには、連続したデータが必要です。
動画モデルが自動的に優れているわけではありません。より多くのデータが必要で、学習コストが高く、同じ録画から繰り返し抽出したフレームに過適合する可能性もあります。静止画と4秒間の動画クリップは、異なる測定です。入力する時間の範囲を明示していない消費者向けの主張には、手法を理解するうえで必要な情報が欠けています。
5. 「正解率」と信頼できることは同じではない
正解率が答えるのは、あるテスト条件のもとで、予測ラベルが記録されたラベルと一致した割合です。F1値は、異なる方法でクラス間の性能のバランスを取ります。しかし、どちらの数値も、それだけでは、新しい犬種に対してモデルが適切に調整されているか、緊急性の高いケースをいくつ見逃すか、スマートフォンのカメラで機能するか、照明や姿勢が変わったときにどうなるかを示しません。
この比較の難しさは、レビューでも明確に示されています。研究ごとに、カメラ、撮影角度、サンプル単位、ラベルの出所、クラスのバランス、検証方法が異なります。ランダム分割では、ほぼ同一のフレームや、同じ犬から切り出した動画クリップが、テストの境界の両側に入ることがあります。1頭の犬のデータ全体をテストから除外する、個体単位で重複のない分割は、より難しい一方で、新しい個体への汎化性能を知るうえで、より有益です。新しい診療所、家庭、カメラ、犬種を使った外部検証は、さらに難しくなります。
そのため、上の表では、報告された指標を対象集団と課題の横に並べています。分母や研究条件を取り除いてしまうと、有用な結果が誤解を招くマーケティング上の数値に変わってしまいます。
より確かなエビデンスとは
消費者向けツールが高いリスクを伴う主張を責任をもって行うには、1本の論文のテストセットで高得点を取るだけでは不十分です。次のような情報が必要になります。
- 透明性のある判定対象。 そのツールが示すのは、観察可能な行動の分類なのか、研究上の運用ラベルなのか、それとも臨床的な結果なのかを明確にすべきです。定義のない「感情」という言葉は広すぎます。
- 多様な対象犬。 犬種、頭部の形、被毛の色、年齢、健康状態、通常の個体差を含めて検証し、見出しの裏に隠すのではなく、対象数も示すべきです。
- 犬単位での分離。 学習用データとテスト用データの間で、同じ犬や家庭、ほぼ同一の録画が重複してはいけません。
- 外部検証と前向き検証。 元のデータセットから取り分けた一部だけでなく、新しい動物病院、家庭、カメラ、時期のデータを使ってモデルを評価すべきです。
- 臨床的に意味のある誤差の報告。 感度、特異度、キャリブレーション、偽陰性、そして不確実性を、そのツールが利用者に求める判断に即して報告すべきです。
- 独立したレビューと修正。 獣医療と行動学の専門家が、判定対象、ラベル、安全に関する説明、失敗事例を確認すべきです。バージョン変更や既知の限界も、常に確認できるようにしておく必要があります。
- 安全な行動につながる案内。 出力がケアや接し方に影響する可能性があるなら、次に何を観察すべきか、いつ獣医師に相談すべきかを画面上で示すべきです。信頼度の低い分類を、安心してよいという判断に変えてはいけません。
これは、特定のブランドが独自に設けたハードルではありません。各研究で明らかにされている、測定と検証のギャップから導かれる実際的な要件です。

ペットの飼い主にとって役立つ見極めの基準
AIによる行動判定機能を試すなら、 問いかけのきっかけとして扱い、判定とは考えないでください。より責任ある進め方は次のとおりです。
- 最も表情が豊かな1フレームだけでなく、動画の前後に何が起きたかを記録する。
- 画像とあわせて、動き、食欲、呼吸、姿勢、周囲の環境、継続時間を記録する。
- 一般的なラベルではなく、愛犬自身の普段の様子と観察結果を比較する。
- アプリが自信ありげに見えるからといって、薬を変えたり、受診を遅らせたり、おびえている犬に近づいたりしない。そして
- 痛み、呼吸困難、突然の衰弱、倒れる、けが、行動の急な変化が見られた場合は、速やかに獣医師へ相談する。
私たちの ペットウェルネス・ライブラリ は、日々のケアに関する実践的な疑問を解決するのに適した場所です。スマートペットテクノロジーへの最近の関心を取り巻く市場背景については、 8月の業界ウィークリーをご覧ください。
結論
研究は有望ですが、その可能性はキャッチフレーズが示すよりも、はるかに限定されています。コンピュータービジョンは、目に見えるパターンを数値化し、注意深く定義されたラベルを分類するうえで研究者の助けになります。DogFACSによって、顔の動きの記述をより明確にできるようになります。動画モデルは、姿勢、外見、時間的な変化を組み合わせて分析できます。いずれも確かな進歩です。
それでもエビデンスは、「モデルが研究用ラベルと一致した」ことから、「アプリが愛犬の気持ちを理解している」または「その犬は安全だ」という結論へ、利用者が短絡することを正当化していません。次に必要なのは、単独で目を引く新たなパーセンテージではありません。より確かな正解データ、より多様な犬、犬単位および外部での検証、透明性のある不確実性、そして専門家の助けを求めるべき明確な境界です。
今後の「リサーチ&エビデンス」記事では、これを基準とします。情報源を示し、方法を保ち、不確実性を明記し、わかったことと同じくらい、そこからは判断できないことも明確に伝えます。
読者からよく寄せられる質問
AIアプリで、愛犬が幸せかどうかわかりますか?
特定のデータセットから学習したラベルを使って、動画を分類することはできるかもしれません。しかし現在の研究では、家庭で暮らす犬に普遍的に使える「幸福度検出器」は検証されていません。そのアプリの主張を支えているラベル、対象犬、カメラ、検証設計を確認しましょう。
犬の痛みを判定するモデルで、愛犬を診断できますか?
いいえ。公表されている犬の痛みに関する研究が推定しているのは、研究課題における視覚的な指標です。獣医師による診察の代わりにはならず、家庭で撮影した動画から主観的な痛みを直接測定するものでもありません。
技術がまだ実用段階にないのに、なぜ論文では77%、86%、89%といった結果が報告されるのでしょうか?
これらの数値は、それぞれの実験の範囲内では正当な結果である可能性があります。 ただし、研究ごとに使用するラベル、サンプル、入力する時間範囲、データ分割、評価指標が異なるため、単純に比較することはできません。結果を有用な情報として受け取るには、その分母と限界も併せて示されている必要があります。
行動を分析するAIの主張を信頼する前に、何を確認すべきですか?
明確な対象の定義、犬単位で分離されたデータ、外部データによる検証、誤差と不確実性の報告、データの詳細な説明、そして緊急性のある懸念を獣医師に相談するよう案内する安全面の手順が示されているかを確認しましょう。
出典と更新情報
すべての出典ページは2026年8月31日に確認しました。上記の研究概要では、報告された知見と私たちの解釈を区別しています。出典の内容に訂正、撤回、または重要な更新があった場合は、結論を黙って差し替えるのではなく、該当する箇所を修正し、変更内容を明示します。この記事は情報提供を目的としたものであり、獣医師による診断や治療の助言を提供するものではありません。
- Caeiro, C.、Guo, K.、Mills, D.「犬と人間は、感情を適切に伝える刺激に対して、異なる顔の動きを示す」 Scientific Reports (2017年、著者による訂正は2018年)。 Natureの掲載情報
- Boneh-Shitrit et al.「犬の表情から感情状態を説明可能な形で自動認識する:肯定的な期待と欲求不満を対象とした研究」 Scientific Reports (2022年)。 Natureの掲載情報
- Zhu et al.「動画を用いた犬の痛みの指標の推定」 IEEE感情コンピューティング・知的インタラクション国際会議 (学会記録の公開は2023年、arXiv全文のバージョン2は2022年)。 DOI情報 | 全文
- Franzoni, V.、Biondi, G.、Milani, A.「深層学習を用いた動画データからの犬の感情の自動認識に向けた高度な手法」 ニューラル・コンピューティング・アンド・アプリケーションズ (2024年)。 Springer Natureの掲載情報
- Broomé, S. et al.「追跡の先へ:コンピュータービジョンを用いた動物の痛みと感情の認識に関する調査」 コンピュータビジョン国際誌 (2023年)。 SpringerのDOI情報 | 大学リポジトリ