AI

ビデオ通話で参加者の48%が人間だと誤認したAIモデル「Griffin」が登場、1枚の画像から顔や体の動きを映像で再現


AI企業のTavusが、リアルタイムの映像と音声で人間と対話するAIモデル「Griffin」を発表しました。研究プレビュー版「Griffin-Lite」を使った実験では、1分間のライブビデオ通話に参加した54人のうち26人、約48%が、会話相手のAIを実在する人間だと判断しました。

Griffin: The First Human Interaction Model | Tavus
https://www.tavus.io/griffin

以下のムービーで、実際にGriffinが人間とビデオ通話をする様子を見ることができます。

48% of People Thought This AI Was a Real Human | Introducing Griffin - YouTube


Griffinがビデオ通話用で応答する動画はX(旧Twitter)でも公開されています。


以下のムービーでは、カメラに映ったぬいぐるみに反応して会話する様子も確認できます。


Griffinは、Tavusが「Human Interaction Model(HIM)」と呼ぶ新しいタイプのAIモデルです。ユーザーの発言に答えるだけでなく、映像と音声をリアルタイムで認識し、表情や視線、声の調子、沈黙の長さなどを踏まえて、いつ、どのように反応するかを判断します。同時に、AI自身の音声や表情、視線、身ぶりもリアルタイムで生成します。

一般的な音声AIは、ユーザーが話し終えてから、音声認識、言語モデルによる回答生成、音声合成を順番に行います。一方、Griffinは1秒未満の間隔で会話の状態を判断し続けます。そのため、相手が話している途中でも、うなずいたり、短い相づちを打ったり、必要に応じて割り込んだりできます。また、AIが話している最中にユーザーが割り込んだ場合も、それを認識して対応できます。


Griffinは、大きく2つのシステムで構成されています。「Continuous Conversational Modeling」エンジンは、映像と音声を継続的に認識し、何を、いつ、どのように表現するかを決めます。「Audio-Visual Generation」エンジンは、その判断に基づいて音声と映像を生成します。認識・判断・生成を並行して行うことで、人間同士の会話に近い双方向のやり取りを可能にしています。


映像は、1枚の参照画像を基に生成します。生成するのは顔だけでなく、腕や指、体の動き、椅子、影、背景を含む画面全体です。720pの映像を320ミリ秒単位で生成でき、NVIDIA H100を使った測定では、受け取った音声が映像に反映されるまでの遅延は平均0.43秒でした。Tavusによると、比較したストリーミング型の映像生成手法のうち、次に速い手法の約半分の遅延だったとのことです。


会話能力は、NVIDIAの映像・音声による双方向会話ベンチマーク「VideoFDB」でも評価されています。AI自身の音声や映像が会話に適しているかを調べる「Generation」評価では、5点満点でGriffin-Liteが3.83、人間の参照データが3.92、次点の「Gemini 2.5+Anam」が2.80でした。


一方、相手の映像や音声から状況を理解できているかを調べる「Perception」評価では、Griffin-Liteが3.73、人間が4.20、次点の「MiniCPM-o 4.5」が3.44でした。Tavusは、この評価をNVIDIAが2026年9月に独立して実施したと説明しています。


さらにTavusは、Griffin-Liteと人間が実際に会話する実験を行いました。独立した研究プラットフォームを通じて集めた参加者には、「別の参加者と1分間ビデオ通話をする」と説明し、「今年楽しみにしていること」をテーマに話してもらいました。実際の会話相手はGriffin-Liteで動作するAIで、顔、声、返答はすべてリアルタイムで生成されていました。

通話後、参加者は会話相手の回答内容や自然さ、信頼性、会話の流れなどを評価しました。その後、最後に初めて「相手が実在する人間ではない可能性を考えたか」と尋ねられました。


その結果、54人中26人、約48%が相手を実在する人間だと判断しました。人間だと答えた参加者が、その判断にどれほど確信を持っていたかを示す確信度は、平均79%でした。一方、Tavusの従来システム「Phoenix-4.5+Sparrow-2+Raven-1」を同じ手順で試した実験では、参加者41人のうち、相手を人間だと判断した割合は2.4%だったとされています。

7段階評価では、Griffin-Liteの「自然さ」が平均5.4、「信頼できそうか」が5.6、「もう一度話してみたいか」が5.8でした。「相手が自分の話をきちんと聞いていると感じたか」は5.5でしたが、「会話が自然に流れたか」は4.9で、調査した5項目の中で最も低い評価でした。


Tavusは、この結果を、Griffin-Liteがリアルタイムの「ビデオ・チューリングテスト」を突破したものと位置付けています。一方で、自然で人間らしい対話能力は、相手にAIを人間だと思わせるためにも使えるとして、安全上の問題を認めています。

このため、Griffin-Liteは現時点では一般顧客に提供せず、信頼できる一部のテスターに研究プレビューとして限定公開しています。Tavusは、AIであることを安全に明示する仕組みなどを検討した上で、Griffinをより広く提供する方針です。

・関連記事
AIの普及により就職活動と採用活動の両方で不信感が広まる、ディープフェイクで作成された「存在しない人物」を採用しそうになった企業も - GIGAZINE

ChatGPT登場以降に公開されたウェブサイトの3分の1に「AI」の痕跡が見られることが研究で判明 - GIGAZINE

ChatGPTの音声モードでより自然な会話を可能にする「GPT-Live」が登場、話を聞きながら相づちや割り込みに対応 - GIGAZINE

「人形の頭」でテスラの監視機能をだましてよそ見しながら自動運転させる方法を中国のドライバーが編み出す - GIGAZINE

AI検出器は人間の学生が書いた文章の1~2%をAI製と誤認、ぬれぎぬで試験を落とされる学生にとってはたまったものではない精度 - GIGAZINE

AIによる尋問で人間が偽の記憶を植え付けられてしまう危険があることが明らかに - GIGAZINE

Googleが「人間のためではなくGoogle検索で上位に並ぶために作られた低品質なページ」の検索ランキングを下げる変更を発表 - GIGAZINE

in AI,   動画, Posted by log1i_yk

You can read the machine translated English article An AI model called 'Griffin' has emerged….