Perplexityの音声検索は、単に音声入力を付けた検索UIではありません。OpenAI Developersの2026年3月25日公開記事によると、PerplexityはRealtime-1.5を本番利用し、毎月数百万件規模の音声セッションを処理しています。しかも論点はモデル精度だけではなく、長文コンテキストの扱い、音声前処理、VAD、ツール出力の設計まで含めた“運用設計”にあります。この記事では、CometのVoice ModeやPerplexityのChangelogで確認できる公式情報を踏まえ、企業が音声エージェントを試す前に何を先に固めるべきかを整理します。
Perplexityの音声検索で何が実現されているか
Perplexityの公式ヘルプによれば、CometのVoice Modeは現在のタブ上に見えている文字・画像・価格・要約をその場で質問でき、音声だけでページ移動やリンク遷移、スクロールも行えます。さらに、タブをまたいでも会話コンテキストを維持し、2026年3月4日時点で36言語と10種類の音声スタイルに対応しています。3月27日の公式ChangelogでもComet iOS LaunchとComputerの更新が案内されており、音声は実験機能ではなく複数プロダクトに横展開される前提で設計されていると読めます。
1. 先に決めるべきはモデルよりコンテキスト戦略
OpenAI Developersの記事で最も実務的なのは、Perplexityが長時間のポッドキャスト転記を音声検索に載せる際、巨大な文脈投入が失敗しやすいと明言している点です。残り5,000トークンしかない文脈窓に10,000トークンの更新を送ると、前の履歴までまとめて失うことがありました。そこでPerplexityは大きな塊を避け、2,000トークン単位の小さなチャンクへ分割して順次投入する方針へ切り替えています。
ここで重要なのは量だけでなく役割です。Perplexityはconversation.item.createで入れるメッセージのroleをsystem、user、assistantで明確に分け、閲覧中ページの断片を“ユーザーが全部しゃべった内容”として扱わないようにしています。社内向け音声FAQや営業支援ボットでも、画面情報・検索結果・実際の発話を同じuser扱いにすると応答が不自然になりやすいため、まずは『どの情報を、どのroleで、どの粒度で入れるか』を仕様化する方が先です。
2. 音声品質はクライアント差分を放置しない
PerplexityはAsk、Comet、ComputerでSwift、TypeScript、Rust、C++など異なるクライアント実装を抱えており、各クライアントが生の音声を勝手な形式で送ると性能がぶれると説明しています。そこでRust製SDKを用意し、48kHzモノラルへのリサンプリング、Opusコーデック前提の整形、WebRTC APMによるエコー除去、自動ゲイン制御、ノイズ低減、高域通過フィルタまでを共通化しました。
企業導入で見落としやすいのは、モデル選定よりも前に“録音前処理の標準契約”を決めることです。スマホ、PC、ブラウザ拡張、会議室端末が混ざる環境では、サンプリング周波数、ノイズ処理、ミュート時挙動が揃っていないだけで評価結果が大きくぶれます。PoC段階でもSDKか共通ライブラリを先に置き、音声パイプラインの差分を潰してからプロンプトやUIを詰めた方が、再現性のある比較ができます。
3. VADは静かな会議室ではなく現場ノイズで決める
PerplexityはVAD調整の実験環境として“騒がしいサンフランシスコのバー”を挙げています。実利用では、利用者が途中で考え込む、画面上の式を探す、周囲が騒がしい、といった条件が普通です。静かな検証室だけで調整すると、少し間が空いただけでモデルが割り込み、質問を最後まで言わせない失敗が起きます。
この問題に対し、Perplexityはpush-to-talkではなく、必要なときだけユーザーが発話権を保持するvoice lockの考え方を採っています。社内ヘルプデスク、営業ロールプレイ、現場点検支援のように“途中で資料を見ながら話す”用途では、この種のターン制御が満足度を左右します。評価設計では、正答率だけでなく『途中割り込み率』『聞き返し発生率』『発話完了までの秒数』も追うべきです。
4. ツールは増やすより少数精鋭で設計する
Perplexityは音声エージェントに与えるツールを10未満の中核セットへ絞り、システムプロンプトで『いつ・どう呼ぶか』を明示しています。さらに、ツール出力は自然文に指示を混ぜず、response_textやrequire_repeat_verbatimのような分離済みJSONで返す方が安定すると共有しています。これは企業の音声ワークフローでも有効で、CRM検索、FAQ参照、日程確認、エスカレーション起票の4〜6個から始める方が、20個以上の便利ツールを一度に渡すより失敗要因を切り分けやすくなります。
導入前チェックリスト
最初の確認項目は4つです。1つ目は、画面情報・検索結果・ユーザー発話のrole設計が分かれているか。2つ目は、音声前処理を全クライアントで共通化しているか。3つ目は、VADと割り込み制御を実環境ノイズで評価しているか。4つ目は、ツール数を絞り、JSONスキーマを安定運用できる形にしているか。Perplexityの事例が示す通り、音声UIの差は“話せるか”ではなく“業務で破綻しないか”で決まります。
FAQ
Q. まず改善すべきはモデルですか? A. いいえ。Perplexityの公開事例では、最初に効いているのは文脈投入方法、音声SDKの標準化、VAD調整、ツール出力設計です。Q. 多言語対応は後回しでよいですか? A. Comet Voice Modeは36言語対応を前提にしており、少なくとも言語追加時に音声品質と用語辞書が崩れない設計は早めに作っておくべきです。
音声エージェントのPoCを進めたいが、どこから標準化すべきか迷う場合は、 HelloCraftAIに相談してください。 音声UX、業務フロー、権限制御まで含めて導入設計を一緒に整理できます。