米Reflection AIは10月5日(現地時間)、オープンウェイトのAIモデル「Beam」を発表した。総パラメータ数5010億、推論時に利用するアクティブパラメータ数は230億のMixture-of-Experts(MoE)モデルで、コーディング、推論、AIエージェントを使った処理を主な用途としている。現在は最終段階のレッドチーミングと評価を進めており、早期アクセスの登録を受け付けている。モデルの重みは10月中にApache 2.0ライセンスで公開する予定である。
Beamはテキストのみを扱うモデルで、事前学習にはWebや公開データ、ライセンスを取得した独自データセットなどから選別した23.8兆トークンを使用した。中間学習ではコンテキスト長を最大100万トークンまで拡張。長大なコードリポジトリや文書を扱い、長時間にわたるタスクの情報を保持できるよう訓練したという。
中国勢の大型モデルに対し、推論効率を重視
Reflectionが公表した評価では、BeamのスコアはSWE-bench Verifiedが80.9、Terminal Bench v2.1が80.1、DeepSWE v1.1が44.4だった。Terminal Bench v2.1ではGLM 5.2(81.0)とほぼ並ぶ一方、Kimi K3(88.3)やDeepSeek V4.1 Flash(90.6)を下回る。DeepSWE v1.1もGLM 5.2(44.0)と同水準だが、DeepSeek V4.1 Flash(74.2)とは差がある。
ReflectionがBeamで強調するのが、推論時の計算効率である。同社は、高度な推論ベンチマークでGLM 5.2と競合する性能を示しながら、必要な推論計算量を3分の1〜4分の1程度に抑えたとしている。コーディングやエージェント関連の一部ベンチマークでもGLM 5.2と競合する性能を示し、より大規模な「Qwen 3.8-Max」に近づいたとしている。
ただし、この推論計算量は実測値ではない。Artificial AnalysisとDataCurveのデータを基に、アクティブパラメータ数と平均生成トークン数から推定した概算値である。プロンプトの事前処理、コンテキスト長に応じて変化するAttention処理、モデル配信時のオーバーヘッドなどは含まれないため、実際の推論コストを直接比較したものではない。また、Reflectionが公表した性能は、現時点では第三者による独立した検証を受けていない。
同社がBeamの性能を支える要素として挙げるのが、大規模な強化学習(RL)である。NVIDIA GB300を1万500基、4週間使用し、1億回を超えるロールアウトを生成した。学習と評価には約13億個のサンドボックスを使い、コーディングやAIエージェント、STEM分野など約100万件の学習環境を用意した。同社によると、RLに投入する計算量を増やしても、評価した範囲では性能向上が頭打ちになる兆候は見られなかったという。
Beamでは、正解できた場合でも不要に長い出力を抑えるよう学習する仕組みを導入している。利用者は「reasoning effort」パラメータを使い、短い応答を優先する設定から、より多くの推論トークンを使って難しい問題に取り組む設定まで調整できる。性能とトークン消費量のバランスを用途に応じて選べる。
安全性とアライメントについては、事前学習済みのチェックポイントを基に、別のSFT(教師ありファインチューニング)とRLパイプラインで専用モデルを学習させた。その上で両モデルの能力を「multi-teacher on-policy distillation(MOPD)」で1つのモデルに統合した。安全性評価の結果は技術レポートで公表し、社内で開発・使用した安全性評価もオープンソース化する予定である。
Reflectionは10月中に、モデルの重みに加えて技術レポート、モデルカード、実行・評価・ファインチューニング用のソフトウェア一式を公開する。配布パートナーや各種オープンソースライブラリとの連携も提供開始時に用意する。今回発表したBeamはシリーズ最初のモデルであり、同社はすでに後継モデルの学習を始めている。
Reflection AIは、Google DeepMind出身の研究者2人が2024年に設立したAIスタートアップで、ニューヨーク・ブルックリンに拠点を置く。NVIDIA、Sequoia Capital、Lightspeed Venture Partnersなどから約47億ドルを調達している。今夏にはSpaceX、Nebiusと総額70億ドル超の契約を結び、2029年までのGB300の利用枠を確保した。



