米半導体大手のクアルコムは、ハワイで開催した「Snapdragon Summit 2026」でプレミアムオーディオ機器向けの新しいシステム・オン・チップ(SoC)「Snapdragon Sound Elite Gen 2」を発表した。
名前に「Sound」を冠するチップだが、今回の進化で特に目を引くのは音質ではない。AI処理を担う性能が大幅に強化されている。背景にある理由を現地で取材した。
-

クアルコムが2026年の年次発表会「Snapdragon Summit」で、ワイヤレスイヤホンやスマートグラスなどのウェアラブルデバイスに先進のAI機能をもたらす新しいSoC「Snapdragon Sound Elite Gen 2」を披露した
AIエージェントとの常時接続を実現する「Gen 2」の進化
前世代の「Snapdragon S7+ Gen 1 Sound Platform」は低消費電力の設計を基盤に、音響処理とオンデバイスAIの能力を大幅に強化したチップだった。
クアルコムでプレミアムオーディオ向け半導体製品のプロダクトマネージャーを務めるアンディ・レイスター氏によれば、採用メーカーが求めるAIの用途は、ウェイクワードの検出や従来の音声処理の調整にとどまらず、音声信号そのものをAIモデルで処理する方向へ広がっている。たとえば、複数のマイクで拾った音や再生中の音声をAIモデルに入力し、声を聞き取りやすくする処理が考えられる。楽曲から声だけを取り除き、ほかの音を残す音源分離もその一例として挙げた。
今回、新世代のSoCではAIアクセラレーターが128 GOPSの処理性能を備え、デバイス上でのAI処理能力はS7+ Gen 1比で最大2倍になった。
クアルコムによれば、前世代と比べて消費電力を最大40%低減し、プラットフォームの実装面積も最大30%縮小した。ただし、消費電力の比較はWi-Fi接続中の待機状態を対象とする。小さな筐体と限られたバッテリー容量で動くワイヤレスイヤホンなどにとって、省電力化と小型化は重要な改良だ。
省電力化には、AIをいつでも使える状態にしておくという狙いもある。
「消費電力を40%低減したのは、ユーザーが必要とした時にデバイスがいつでもエージェントに接続できる状態にしておくためです」(アシュガール氏)
クアルコムのXR、ウェアラブル、パーソナルAI事業を統括するジアッド・アシュガール氏は、各国のメディア関係者が参加した質疑応答でこう説明した。
通信ではQualcomm XPAN(以下、XPAN)の進化にも注目したい。XPANはBluetoothと低消費電力Wi-Fiを状況に応じて使い分けながら、ワイヤレスイヤホンとスマートフォンなどの接続を維持する技術だ。Bluetoothの通信範囲を外れても、Wi-Fiを介して音楽再生や通話を継続できる。
XPAN自体は前世代のS7+ Gen 1ですでに導入されていたが、レイスター氏によれば、Gen 2ではWi-Fiのデータレートを3倍以上に高めている。変調・符号化方式も従来のMCS3から、より高速なMCS7へと引き上げたほか、Wi-Fi 6Eの周波数帯にも対応し、通信可能な距離も拡大した。
さらに、従来は別部品として実装していた低消費電力Wi-Fi機能をひとつのパッケージに統合したことで、SoC周辺の実装面積削減にもつながっている。
カメラを内蔵するデバイスでは、撮影した画像をAI処理に利用する際に、従来のオーディオ機器以上の通信帯域が求められる場面も想定される。アシュガール氏は、XPANで強化された帯域幅と通信範囲が、たとえばカメラを備えるオーディオグラスのようなデバイスにも有効だと説明する。
デバイスの用途で分かれるSoCの豊富な選択肢
イベント2日目の基調講演で、アシュガール氏は「これからもスマートフォンがAI体験の重要なハブであり続ける一方、ウォッチやアイウェア、リング、ペンダントといったウェアラブルデバイスは、ユーザーが目にしている情景や聞こえている音、身体の状態をリアルタイムに捉えられるため、その時々の状況に即した支援を提供できる」と説明した。
クアルコムは、こうしたウェアラブルデバイスを「パーソナルAI」の重要な構成要素と位置づけ、その発展を後押しする考えを示している。
同社がスマートグラス向けに専用設計したSoCには「Snapdragon AR1 Gen 1」がある。基調講演後に設けられた質疑応答の機会で、アシュガール氏にSnapdragon Sound Elite Gen 2が狙うターゲットの違いを聞いた。
アシュガール氏は「カメラを持たないオーディオグラスにはSound Elite Gen 2が適している」としたうえで、カメラを内蔵するウェアラブルデバイスについても、用途により適するSoCが異なると説明する。
「たとえば、友人と共有する高解像度の写真や動画を撮影することを想定するのであれば、スマートフォンに近い高度なカメラ機能を実現できるAR1 Gen 1が適しています。一方で、画像をAI処理の入力として取り込み、周囲の状況を理解するために使うというアプローチもあります。後者であればSound Elite Gen 2も選択肢に入ります。私たちはスマートグラスにも用途や機能に応じた異なる階層があると考えています」(アシュガール氏)
「ただし、Sound Elite Gen 2が対象とするのはスマートグラスだけではありません。リングやペンダントなど、ほかのウェアラブルデバイスにも広がると考えています。こうしたデバイスでも、Sound Elite Gen 2が備える低消費電力性能とアーキテクチャ上の利点が活かせるからです」(同)
なお、映像を没入的に表示するVRヘッドセットやスマートグラス向けには、より高度な映像表示と空間処理を担う「Snapdragon Reality Elite」がある。こちらはXR2+ Gen 2を継ぐ最上位のXRプラットフォームだ。
関連記事
スマートグラスからイヤホンへ、カメラがAIの「目」になる
アシュガール氏は基調講演の壇上で、メモリの小さな機器でもAIを動かす技術として、米国拠点のスタートアップであるPrism MLが開発する1bit量子化モデルを載せた、カメラ内蔵スマートグラスの試作機を紹介。デバイスを装着したユーザーが、目の前にあるリンゴの色をAIに尋ねる利用例などが示された。カメラで捉えた画像をオンデバイスAIで解析し、音声で答える。機内モードのようなオフライン環境でも動作する。
この例は、視覚情報を取り込むことでAIがユーザーの状況をより深く理解できる可能性を示している。今回新たに発表されたSound Elite Gen 2も、AI処理を担うeNPU 6を統合し、センサー情報の処理に対応する。クアルコムは音声を中心に、必要に応じて周囲の情報も取り込める小型デバイスにパーソナルAIの対象を広げようとしている。
モデルの重みを8bitから1bitに量子化できれば、データ量は理論上8分の1に抑えられる。筆者も会場で、クアルコムのSoCとPrism MLのモデルを搭載したスマートグラスの試作機を体験した。内蔵カメラで捉えた被写体が「フルーツ」、あるいは「広いデモンストレーション会場に大勢の人が集まっている様子」であっても、撮影した画像をAIが素速く解析し、その内容を音声でユーザーに伝える。
Prism MLの担当者は「クラウドを利用せず、デバイス上で動作する軽量かつ高性能な1bit量子化モデルだからこそ、迅速で正確な応答を実現できる」と、その利点を強調した。ネットワークへの常時接続に頼らない視覚支援用ウェアラブルデバイスの可能性も広がりそうだ。
クアルコムのアシュガール氏は、同じ米国のスタートアップであるCleerが商品化に向けて開発を進める、カメラ付きイヤホンを例に挙げながらもうひとつの展望を語った。
「Cleerのデバイスがカメラから取り込むことを想定しているのは、写真として残すための高精細な画像ではなく、周囲を理解するための視覚的な手がかりです。たとえば『この部屋には大勢の人がいて、会議の場のようだ』、屋外なら『昼間で、空は晴れている』といった情報です。そうした手がかりが加わることで、AIエージェントはユーザーの状況をよりよく理解できます。この用途に高い解像度の写真は必要ありません」(アシュガール氏)
暗い店内でメニューの文字を読み取るような用途には、より高性能なカメラが必要になるとアシュガール氏は付け加えた。一方、Sound Elite Gen 2が視野に入れるのは、高精細な写真を撮って共有する用途よりも、AIがユーザーの置かれた状況を理解するために視覚的な手がかりを取り込む使い方だ。
その一例として、クアルコムのレイスター氏は、店頭で商品についてAIに相談する場面を挙げた。見ている商品の画像を音声の質問に添えれば、対象や周囲の状況を言葉で長々と説明せずに済む。音声に視覚情報を加えることで、AIへの問いかけがよりシンプルにできる。
スマートフォンでは、ユーザー自身がカメラを取り出して対象に向ける必要がある。一方、身に着けるデバイスのカメラは、常にユーザーの視点に近い位置にある。カメラとAIが、その場の文脈を理解するための「目」として機能する仕組みは、スマートグラスだけでなく、ワイヤレスイヤホンを含むさまざまなウェアラブルデバイスにも広がる可能性がある。
プライバシーの課題と向き合いながらパーソナルAIを育てる
ただし、撮影そのものを主目的としなくても、身に着けたカメラが他人や私的な空間を捉えることへの懸念は残る。撮影や画像取得の状態を示す表示について周知し、ユーザーだけでなく周囲の人もその仕組みを理解できるようにすることが肝要だ。
画像をいつ取得し、端末内で何を処理し、どの情報をクラウドサーバーへ送るのか。そのうえで、ユーザーや被写体となる人物のプライバシーをどのように保護するのかについても、明確に示す必要がある。
アシュガール氏は基調講演で、画像全体ではなく必要な情報だけをAI解析に利用することで、プライバシーに配慮する構想を示した。ただし、こうした保護を実効性のあるものにできるかどうかは、最終的には各メーカーの実装に委ねられる。
Snapdragon Sound Elite Gen 2がもたらす進化は、サウンドに関わる製品の変化だけでは捉えきれない。音声を中心に据えながら、必要に応じて視覚情報や身体の状態も取り込み、さまざまな形のウェアラブルデバイスにAIを活用した新しい機能や役割を与えられるからだ。
カメラがもたらす利便性と、まわりの人々への配慮をどう両立させるか。その課題と向き合いながら、日本のメーカーにも音響技術や装着性、小型化といった強みを活かした多様なパーソナルAIデバイスの開発に挑んでほしい。







