この半導体ニュースのまとめ

・韓国Rebellionsがai&との協業を通じ、日本市場へ本格参入
・ai&がRebel100を8基搭載するRebelServerを100台規模で導入へ
・高効率なNPUをGPUなどと組み合わせ、日本国内でAI推論サービスを提供

韓国のAI半導体スタートアップRebellionsと、日本でAIインフラ事業を展開するai&は9月30日、9月15日に発表した協業内容に関して、日本国内メディア向けに説明会を開催した。

両社はこの協業を通じて、RebellionsのAI推論向けNPU「Rebel100」を8基搭載するAI推論サーバ「RebelServer」を、ai&が国内で運営するデータセンターへ100台規模で導入を進めていくこととなる。

RebelServerを4台組み合わせると、32基のRebel100を搭載するAI推論ラック「RebelRack」となる。100台のRebelServerが導入された場合、Rebel100の搭載数は最大800基となる。

RebelServerの最初の100台が最初のバッチとして10~11月に、ai&が東京で運営している既存データセンターに導入される予定。その後も同社は12月にも東京に新たなデータセンターを開設予定で、今後の協業の進展次第で、追加でそうした新たなデータセンターなどへのRebelServerの導入が期待されるという。

  • Rebellionsとai&による日本国内のAI推論インフラ構築に向けた協業説明会

    Rebellionsとai&による協業発表の説明会での記念撮影。左がai&の共同創業者 兼 CEOのDavid Bennett(デビッド・ベネット)氏、右がRebellions CBOのMarshall Choy(マーシャル・チョイ)氏

RebelServerを最大100台、NPUは最大800基

Rebellionsは2020年に韓国で設立されたAI半導体スタートアップで、AI推論向けNPUの設計に加え、アクセラレータカード、サーバ、ラック、POD、データセンター向けシステム、ソフトウェアスタックまでを開発している。

今回、発表を行ったMarshall Choy(マーシャル・チョイ)氏は、Rebellionsがグローバル市場での事業拡大に向け、2025年11月に米国法人を設立した際に、CBO(最高事業責任者)として入社。同社のグローバル事業開発、営業、アライアンス、チャネル、製品管理などを統括し、米国法人を海外展開の拠点として顧客や戦略パートナーの開拓を進める役割を担っている。

同氏は同社入社以前、AI半導体メーカーのSambaNova Systemsで製品管理、営業、マーケティングなどのグローバル組織を率い、直近では最高顧客責任者(CCO)を務めた。SambaNova以前はOracleやSun Microsystemsで20年以上にわたり、エンタープライズシステムの製品戦略や市場展開に携わった経歴を持っており、SambaNova在籍時は、[製品担当上級副社長として、独自AI半導体「SN40L」と3階層のデータフローメモリ、ソフトウェア、システム、基盤モデルを組み合わせたフルスタック戦略を説明するなど、技術とビジネスの両方に精通した人物である](https://news.mynavi.jp/techplus/article/20240725-2992160/)。

同氏によると、韓国のSK Telecomではすでに100台を超えるラック規模で同社製品が導入されており、社内用途から顧客向けAIサービスまで適用範囲を広げているという。今回のai&との協業については、RebellionsにとってAI推論システムを商用サービスとして日本市場へ本格展開する最初の大規模案件に位置付けられるとする。

一方、ai&はRebelServerを単独で運用するのではなく、NVIDIAやAMD、TenstorrentなどのAIアクセラレータと組み合わせた複数種類の演算基盤を利用するヘテロジニアスなAIインフラを構築。ワークロードの規模や処理内容、求められる応答速度、コストに応じて適切なハードウェアへ処理を割り振ることで、高性能GPUだけですべての推論を処理する場合と比べ、設備投資と運用コストを抑えたAI活用を顧客企業に提供していくとしている。

  • RebelServer最大100台とai&による40MW規模のAI基盤整備計画

    ai&による日本でのAI推論基盤構築に向けた取り組みの概要。今回の協業の最初のステップとしてai&はRebellionsのRebelServerを100台導入。GPUに限らず柔軟にAI推論性能を向上させていくことで、2027年末までに国内10か所のデータセンター運用を開始し、40MW規模のAIインフラ容量確保を目指す

4つのチップレットで約2PFLOPSを実現

Rebel100は、大規模言語モデル(LLM)や混合専門家モデル(MoE)、マルチモーダルAIの推論処理を想定して設計されたRebellionsのフラッグシップNPUである。

Samsung Electronics(サムスン)のファウンドリ部門Samsung Foundryが提供する4nmプロセスを採用し、同一設計の4つのチップレットをUCIe-Advancedで接続したSoCとなる。4つのチップレットを仮想的な1つの大規模ダイとして動作させ、FP16で1024TFLOPS、FP8で2048TFLOPS(約2PFLOPS)の演算性能を実現。実行演算性能についても、理論演算値にかなり近い性能を出せるとしている。

合計144GBのHBM3Eを採用し、メモリ帯域幅は4.8TB/s。オンチップで合計512MBのSRAMも搭載する。ホストとの接続にはPCI Express Gen 5 x16を2系統備え、最大消費電力は600Wとされる。

  • RebellionsのAI推論向けNPU「Rebel100」
  • RebellionsのAI推論向けNPU「Rebel100」
  • RebellionsのAI推論向けNPU「Rebel100」
  • RebellionsのAI推論向けNPU「Rebel100」。500円玉との比較がどの程度の大きさかがわかりやすいが、同一設計の4つのチップレットをUCIe-Advancedで接続し、周囲にHBM3Eを配置。FP8で約2PFLOPSの演算性能と144GBのHBM3Eを搭載する

LLMの推論処理は、大きく分けて入力された文章を一括処理する「プレフィル」と、トークンを1つずつ生成する「デコード」で構成される。プレフィルは演算性能への依存度が高い一方、デコードでは過去の計算結果を保存するKVキャッシュへのアクセスが増え、メモリ容量と帯域幅が処理性能を左右する。

Rebel100は、FP8、FP16、FP32を単一コアで処理できる混合精度演算エンジンを採用。精度ごとに独立した演算ブロックを用意する構成と比べ、演算器の占有面積とデータ移動を抑え、同社の従来設計比で2.8倍の演算密度を実現したとしている。

また、予測型DMAエンジンとオンチップのメッシュネットワークを組み合わせ、必要となるKVキャッシュのデータを演算前に読み込む。Rebellionsによると、有効メモリ帯域幅は2.7TB/sで、長いコンテキストを扱うLLMのデコード処理で生じるメモリアクセス待ちを軽減できるという。

SRAMとHBMを組み合わせたメモリ中心型設計

RebellionsはRebel100の特徴を、メモリ中心型コンピューティングアーキテクチャと説明する。

LLM推論の効率を高める手法の1つに、プレフィルとデコードを異なるアクセラレータへ割り当てる「推論ディスアグリゲーション」がある。一般的には、演算負荷の高いプレフィルをHBM搭載アクセラレータ、メモリアクセスが中心となるデコードを大容量SRAM搭載アクセラレータへ分けて処理する。

Rebel100は1チップあたり512MBのSRAMと144GBのHBM3Eを搭載し、双方へアクセスできるようにした。このため、小規模な環境では1つのRebel100でプレフィルとデコードの両方を処理し、システム規模が拡大した場合には、NPUごとに役割を分担させる柔軟な構成が可能になるという。

チップレット間は、UCIe-Advancedを基盤とする独自D2Dプロトコルで接続する。チャンネル当たりの双方向帯域幅は1TB/sで、チップレット間のパス遅延は11nsとしている。

さらに、ハードウェアベースのP2P通信と階層型の同期機構を備え、複数のチップレットやNPUにモデルを分散した場合でも、演算待ちや通信待ちによる利用効率の低下を抑える設計となっているという。

1サーバあたり約16.4PFLOPSのFP8性能を提供

ai&が導入するRebelServerは、1台当たり8基のRebel100を搭載するAI推論サーバで、Rebel100が1基当たりFP8で約2.048PFLOPSの演算性能を提供するため、サーバ1台あたりのFP8演算性能は約16.4PFLOPSとなる。

最大100台を導入した場合、Rebel100の搭載数は800基となり、単純合算したFP8演算性能は約1.64EFLOPSとなる。ただし、実際のAI推論性能はモデル、精度、バッチサイズ、コンテキスト長、ソフトウェア最適化、サーバ間通信などの条件によって異なることに注意が必要である。

RebelServerを4台組み合わせたRebelRackでは、32基のRebel100を搭載し、FP8の理論演算性能は約65.5PFLOPSとなる。さらに複数のRebelRackを組み合わせることで、RebelPODやデータセンター規模へ拡張することもできる。

今回の説明会では、1台当たりのRebelServerの平均消費電力は約4kWとの説明があった。空冷に対応しており、液冷設備を前提とせず、既存のエンタープライズ向けデータセンターへ導入できる点を特徴としている。

  • RebelServerからRebelRack RebelPOD データセンターへ拡張するRebellionsの製品体系

    RebellionsのAI推論インフラ製品体系。1台のRebelServerに8基のRebel100を搭載し、4台のRebelServerで32基のNPUを備えるRebelRackを構成。複数のラックを組み合わせることでRebelPODやデータセンター規模へと拡張することができる

特定ハードウェア向けの独自フォークを作らない

Rebellionsがハードウェアと並んで強調するのが、「No Forks」と呼ぶオープンソースソフトウェア戦略である。

利用者に対して、特定のNPU向けに独自フォークしたAIフレームワークの使用を要求せず、PyTorch、vLLM、Hugging Face、Kubernetes、OpenStackなど、既存のAI・クラウド環境で利用されているオープンソースソフトウェアへの対応を進める。

ソフトウェアスタック「RBLN SDK」は、コンパイラ、ランタイム、プロファイラ、モデルライブラリなどで構成される。PyTorch 2.x、vLLM、Tritonをネイティブにサポートし、既存のAIモデルや推論ワークフローへNPUを組み込みやすくする。

クラウド環境向けには「RBLN Cloud Toolkit」を提供し、Kubernetes用のNPU Operator、Device Plugin、Node Feature Discovery、Metrics Exporterなどを用意する。Red HatとはOpenShift向けのOperatorを共同設計しており、OpenShift上でRebellionsのNPUを管理できるようにした。

  • PyTorch vLLM Kubernetes OpenStackなどに対応するRebellionsのソフトウェアスタック

    Rebellionsのオープンソース対応ソフトウェアスタック。PyTorch、Hugging Face、vLLM、Kubernetes、OpenStackなどに対応し、NPU固有のハードウェアを抽象化することで既存のAIワークフローへの統合を容易にする

ai&がRebellionsを採用した理由の1つも、このソフトウェア互換性にある。

ai&は複数ベンダーのGPU、CPU、NPUを組み合わせており、新たなアクセラレータを導入するたびに専用の推論サーバや運用環境を構築すると、管理負担が増大する。

既存のオープンソース環境へ組み込みやすいRebellionsのNPUであれば、技術者が新たな独自環境を習得する負担を抑えつつ、ワークロードに応じてGPUとNPUを使い分けられると判断したという。

NVIDIA製GPUに対する性能・コスト優位性を主張

Choy氏は、特定の128B規模のオープンソースモデルを対象とした比較で、Rebel100がNVIDIA製GPU比で約2倍の推論性能を実現できると説明したほか、初期導入コストを約半分に抑えられるため、価格当たりの性能は約4倍になると主張。消費電力を含む運用面でも優位性があるとの見方を示した。

ai&は実際の導入前にクラウド環境でRebel100の評価を進めており、実際のAI推論サービスで使用するモデルやワークロードを対象に、性能や電力効率、運用性を確認している段階だという。

ai&は2026年内に国内5拠点、12MWのAI基盤を稼働へ

ai&は2026年3月に設立され、AI推論サービス、モデルのファインチューニングや学習、異種アクセラレータを組み合わせたコンピューティング基盤、データセンター運営を一体で展開している。

同社によると、現在は大阪2拠点、東京2拠点でサービスを提供しており、合計12MWを超えるAIインフラを稼働させている。12月には東京都内で新たな拠点を立ち上げる予定で、2027年末までに40MWへ拡大する計画である。

AI推論サービスの利用者数は提供開始からこれまでで2万人を超え、処理するトークン数は月ごとに約10倍のペースで増加しているという。

RebellionsのRebelServerは、このヘテロジニアス基盤へAI推論向けの選択肢として加えられる。比較的軽量な処理は低コストなアクセラレータへ、大規模な推論や学習は高性能GPUへ割り当てるなど、モデルとハードウェアの双方をオーケストレーションする構想である。

日本国内で生成・消費するソブリンAI基盤へ

ai&は、データセンターからアクセラレータ、AI推論サービス、モデルまでを国内で保有・運用する理由として、ソブリンAIへの対応を挙げる。

国内のデータセンターで推論処理を行い、入力データや生成結果を国外へ出さない環境を提供することで、政府機関や企業の機密情報を扱う用途でも、データの所在と処理経路を管理できるようにする考えである。

Rebellionsも、AI推論に特化したNPUを商用規模で日本へ導入することで、GPUだけに依存しないAIインフラの選択肢を増やせるとしている。

アクセラレータを複数のアーキテクチャへ分散することは、コストや電力効率だけでなく、特定ベンダーの製品供給やサプライチェーンへ依存するリスクの低減にもつながる。

  • 複数のGPUやNPUを組み合わせるai&のヘテロジニアスAI基盤

    ai&が構築するヘテロジニアスなAIインフラの考え方。NVIDIAやAMD、Tenstorrent、Rebellionsなど複数のアクセラレータを組み合わせ、モデルやワークロードに応じて適切なハードウェアへ処理を割り当てる

一方、Rebel100はSamsung Foundryで製造し、メモリはSamsungだけでなくSK hynixも採用している。AI半導体の供給にはファウンドリやHBMの生産能力が影響するため、Rebellionsは需要予測に基づいて早期に生産枠を確保し、供給不足へ備えてきたと説明している。

ai&も複数ベンダーのアクセラレータを利用することで、特定製品を調達できない場合でも、ほかのアーキテクチャへワークロードを割り当てられる体制を整える。

両社の協業は、AI推論に特化した半導体が、実験的なアクセラレータではなく、商用データセンターで利用可能な選択肢へ移行しつつあることを示す取り組みともいえる。

Rebellionsはai&を足掛かりに日本の企業や政府機関へRebel100を用いた推論基盤を提供し、ai&は低消費電力なNPUを既存のGPU基盤へ加えることで、AI推論サービスの低価格化と処理能力の拡大を進める。

両社はRebelServerの100台導入を最初の一歩として、日本国内でAI推論の生成から消費まで完結できる基盤の構築・拡充を進めていくとしている。