「Grok Voice Think Fast 2.0」が登場、文字起こしと音声対話の両方に対応

SpaceXAIが音声AIモデル「Grok Voice Think Fast 2.0」を発表しました。ユーザーとの対話を音声でやりとりできるモデルで、前モデルをベースに音声推論能力・会話能力・ツール使用時の信頼性において大幅な向上を実現しています。
Introducing Grok Voice Think Fast 2.0 | SpaceXAI
https://x.ai/news/grok-voice-think-fast-2
以下は、Grok Voice Think Fast 2.0、前モデルのGrok Voice Think Fast 1.0、OpenAIのリアルタイム音声対話AI「GPT Realtime 2.1(High)」、Googleの高速推論モデル「Gemini 3.1 Flash(High)」をArtificial Analysisのベンチマークで比較した表。評価項目は上から「音声関連品質指標全体」「音声推論」「会話のダイナミクス」「エージェントのパフォーマンス」「最初の音声までのスピード」となっており、会話のダイナミクス以外の4項目でGrok Voice Think Fast 2.0は比較対象の中で最高スコアまたは最速の結果を記録しています。
Announcing Grok Voice Think Fast 2.0, our next-generation voice model with improved intelligence, transcription accuracy, and conversational capabilities.https://t.co/XUiX1CouKz pic.twitter.com/Nel3zwzkwY
— SpaceXAI (@SpaceXAI) 2026年7月29日
Artificial Analysisによると、Grok Voice Think Fast 2.0はSpeech-to-Speech Quality Indexで「Qwen Audio 3.0 TTS Plus」に次いで2位、エージェントのパフォーマンスで1位でありつつ、最初の音声までのスピードが0.70秒と最速クラスになっているとのこと。
SpaceXAI has released Grok Voice Think Fast 2.0 today, with the High reasoning variant debuting at #2 on the Artificial Analysis Speech to Speech Index at 82.9%, and #1 on Tau Voice for Agentic Performance at 56.5% - among the fastest models at 0.70s Time to First Audio
— Artificial Analysis (@ArtificialAnlys) 2026年7月29日
Grok… pic.twitter.com/kaNtcka3kO
Grok Voice Think Fast 2.0は音声対話だけではなく文字起こしモデルとしても優れています。24の異なる言語で数千の短いフレーズを対象とした評価では、音声認識と音声合成に特化した「Deepgram Nova 3」およびElevenLabsが「150msの低遅延で最も正確なリアルタイム文字起こし」としてアピールする音声認識モデルの「Scribe v2」と比較して、Grok Voice Think Fast 2.0は1.5~2.0倍の改善を記録しました。前モデルのGrok Voice Think Fast 1.0と比較すると、1.4倍の改善を実現しています。またSpaceXAIによると、Grok Voice Think Fast 2.0はバックグラウンドノイズや電話越しの劣化音声といった実際の環境で非常に優れたパフォーマンスを発揮できるよう開発に注力しており、騒がしい環境ではその他の音声認識モデルとの差が約10倍にまで広がるとのこと。
以下は言語ごとの単語誤り率のグラフで、数値が低いほど文字起こしの精度が高いことを示しています。いずれの言語もGrok Voice Think Fast 2.0は低い単語誤り率を記録しています。

Grok Voice Think Fastモデルの特徴として、発話しながらクエリを推論するため、他の音声対話モデルよりもはるかに賢く、なおかつレイテンシを増加させないようになっています。さらに、Grok Voice Think Fast 2.0では前モデルに比べて推論トークンの処理効率が非常に高くなるようトレーニングされており、推論トークンを約60%削減しているとしています。そのため、実運用環境ではツール呼び出しがより迅速になり、通常はエージェントの最初の文が終わる前に実行されるそうです。
「grok-voice-latest」という指定で使っている場合、2026年8月5日から自動的にGrok Voice Think Fast 2.0に切り替わります。アップグレードのために何か操作する必要はありませんが、前モデルを使い続けたい場合には「grok-voice-think-fast-1.0」を指定してバージョンを固定する必要があります。Grok Voice Think Fast 2.0の料金は音声1分当たり0.08ドル(約13円)です。
・関連記事
OpenAIが文字起こしAI「GPT Transcribe」と「GPT Live Transcribe」をリリース - GIGAZINE
Googleが「Gemini 3.1 Flash Lite」を発表、高速で安価なコスパ重視AIモデル - GIGAZINE
OpenAIがリアルタイム会話・通訳・文字起こしAIをリリース、「GPT-Realtime-2」「GPT-Realtime-Translate」「GPT-Realtime-Whisper」の3種 - GIGAZINE
xAIの音声会話エージェントAI「Grok Voice Think Fast 1.0」が登場 - GIGAZINE
高齢者を狙ったAI音声詐欺が急増中、たった3秒の音声データでAI音声クローンが作られてしまう - GIGAZINE
音声クローンが可能な音声合成AI「Qwen-Audio-3.0-TTS」が登場、日本語対応でGemini超えの性能 - GIGAZINE
・関連コンテンツ
in AI, Posted by log1e_dh
You can read the machine translated English article Grok Voice Think Fast 2.0 has been relea….







