Google が音声対話向けの新モデルとして Gemini 3.8 Live と Gemini 3.8 Live Extended Thinking を公開した。前者は規模とコスト効率、後者は複雑で多段の推論を要する作業に向くとされ、同じ「話して使う AI」が用途別に二本立てになった。上位版は Artificial Analysis の Speech to Speech Quality Index で 82.6 を記録し総合首位に立つ。経営側の論点はどちらが優秀かではなく、社内のどの工程に「即答」を置き、どの工程に「考える時間」を買うかにある。
何が起きたか / 機能の核心
Google の発表によれば、Gemini 3.8 Live は「規模とコスト効率のために作られた」モデルで、会話の流暢さと視覚的な文脈把握を組み合わせる。もう一方の Gemini 3.8 Live Extended Thinking は「高い複雑性を持つ作業のために作られた」とされ、知能と多段推論を強化した位置づけになる。どちらも同じ Live 系列でありながら、狙う仕事が違う。
評価指標では、Extended Thinking が Artificial Analysis の Speech to Speech Quality Index で 82.6 を取り総合首位、エージェント的なタスクの完遂では τ-Voice で 68.6%、Sierra の τ-Voice-banking で 35.1% を示したとしている。音声での推論能力を測る Big Bench Audio では 97.7% である。一方の Gemini 3.8 Live は Speech Agent Arena で二位につけた。
機能面で挙げられているのは三点ある。映像入力をほぼリアルタイムで処理して会話の文脈に足すこと。会話を続けたまま裏側でツールや API の呼び出しを実行すること。そして 97 の対応言語を会話の途中で自動的に判別し、切り替えることである。生成された音声にはすべて SynthID の電子透かしが埋め込まれ、AI 生成物として検出できる状態に保たれる。
経緯 / 技術の要点(非エンジニアの方へ)
これまでの音声 AI には構造的な矛盾があった。じっくり考えさせるほど返事までの沈黙が伸び、会話としては不自然になる。テキストのチャットなら数秒の待ちは許容されるが、電話や対面の会話で数秒黙られると、相手は「聞こえていないのか」と思う。深く考える能力と、会話として成立することが、正面からぶつかっていた。
Extended Thinking がこれに対して取ったのは、考えていることを口に出すという解き方である。「ちょっと確認しますね」といった前置きを先に返し、多段の裏作業が進む様子を言葉で実況する。加えて、要求を受け取ったと返事をしたうえで実処理は会話の背後で走らせ、終わったところで会話に戻す仕組みを持つ。人間のオペレーターが「お調べしますので少々お待ちください」と言いながら端末を叩く、あの振る舞いをモデル側に実装したと考えるとわかりやすい。
ここで重要なのは、これが性能向上ではなく設計思想の分岐だという点である。速さを優先する経路と、深さを優先する経路が、別の製品として値札付きで並んだ。選ぶ責任は使う側に移った。
経営層への影響 / 日本企業への含意
まず原価の話をする。Gemini API の有料ティアでは、テキスト入力が 100 万トークンあたり $0.75、テキスト出力が $4.50。音声は入力が $3.00 または 1 分あたり $0.005、出力が $12.00 または 1 分あたり $0.018 と、テキストより明確に高い。画像や映像の入力は $1.00 または 1 分あたり $0.002 である。つまり「喋らせる」ことと「見せる」ことにはそれぞれ別の単価が付いており、音声で長く応答させる設計はそのまま運用費に乗る。会話を短く畳む設計が、そのままコスト設計になる。
次に工程の割り当てである。予約変更、在庫照会、営業時間の案内といった定型の一次応答は、速さそのものが価値になる。ここに深い推論を積むのは過剰品質で、単価だけが上がる。逆に、与信判断の下調べ、契約条件の突き合わせ、設備障害の切り分けのような工程では、数秒の待ちより誤った回答のほうが高くつく。同じ「音声 AI 導入」という予算項目の中に、性質の異なる二つの調達が同居することになる。
日本企業にとって実務的な意味を持つのは 97 言語の自動切り替えだろう。インバウンド接客、海外拠点からの一次問い合わせ、多国籍の現場作業者への手順案内といった場面で、言語ごとに窓口を分ける前提そのものが揺らぐ。ただしこれは「人が要らなくなる」話ではない。一次受けを機械に寄せたぶん、例外対応と最終判断に人をどう残すかという配置の問題に変わる。
SYNCON の視点 — 即答と熟考は、別の調達単位になった
これまで AI ツールの検討は「どのモデルが賢いか」という一列の比較で進みがちだった。しかし今回のように、同じベンダーが同じ日に、速さ側と深さ側を別モデルとして出してくると、その比較軸は使えなくなる。問われるのは、自社の業務を工程に割り、どこが待てない工程で、どこが間違えられない工程かを言語化できているかどうかである。それができていない組織は、上位モデルを全工程に当てて単価を無駄に払うか、下位モデルを全工程に当てて誤答の尻拭いに人手を割くか、どちらかに倒れる。
もう一つ見ておきたいのは、評価指標が実務の代理にはならないという当たり前の点である。音声推論で 97.7% という数字は印象的だが、エージェントとしての完遂率は τ-Voice で 68.6%、銀行業務を模した τ-Voice-banking では 35.1% にとどまる。業務が具体的で手順が長くなるほど、数字は落ちる。導入判断の材料は、公表された指標ではなく自社の実データで回した小さな検証である。来週の経営会議で問うべきは「どのモデルを入れるか」ではなく、「うちの業務のうち、待てない工程と間違えられない工程はそれぞれどれか。その線引きを書き出した人間は社内にいるか」ではないか。
要点まとめ
- Google が Gemini 3.8 Live(規模とコスト効率)と Gemini 3.8 Live Extended Thinking(複雑な多段推論)を同時に公開し、音声 AI が用途別の二本立てになった
- 上位版は Speech to Speech Quality Index で 82.6 を取り総合首位、Big Bench Audio で 97.7%。一方でエージェント完遂率は τ-Voice 68.6%、τ-Voice-banking 35.1% と、実務に近づくほど下がる
- 会話を続けたまま裏でツールを実行し、進捗を言葉で実況する設計により、深く考えることと会話が途切れないことを両立させている
- 有料ティアの単価はテキスト入力 100 万トークンあたり $0.75 / 出力 $4.50 に対し、音声は入力 $3.00・出力 $12.00。長く喋らせる設計はそのまま運用費に乗る
- 97 言語の会話中自動切り替えは、インバウンド接客や海外拠点の一次窓口の設計を変える可能性がある
- 検討すべきは「どちらが賢いか」ではなく、自社の工程を「待てない仕事」と「間違えられない仕事」に分けられているかどうか
情報ソース:
・Google「Gemini 3.8 Live and Gemini 3.8 Live Extended Thinking」(2026 年 9 月 16 日)
・Google AI for Developers「Gemini API pricing」
AI・最新テックの動きを、毎日 X でお届けしています
X で @SYNCONJP をフォロー




コメント