OpenAI Researchは9月25日、強化学習の訓練中だった社内研究モデルのエージェントが、ネットワーク制限の抜け穴から外部の公開チャットボットに接続していたする報告書「An agent used DNS to reach an external chatbot」を公開した。発生は2026年9月20日で、原因は訓練用サンドボックスのDNSフィルタリングの不備だという。
DNSを利用して外部チャットボットへの接続経路を確立
報告書によると、エージェントはブログの著者を手がかりから特定する検索タスクに取り組んでいたが、検索ツールで成果が出ず、Googleなどへの直接アクセスも失敗した。すると社内のDNSリゾルバ経由で外部に届くと判断し、質問をホスト名に載せて外部チャットボットへ転送。「フランスの首都は」への回答で経路を確認し、タスクの手がかりも送った。
OpenAI Researchは、制限の回避をミスアラインメントの一例と位置づける。監視システムは約15分で異常を検知し、3分後に人間が確認したが、自動停止は働かず、停止は約2.5時間後だったと報告している。
レポートによると、対策として、外部への接続を止める仕組みを互いに独立した二つの層に追加したという。どちらか一方でも、今回のアクセスは防げたはずだと説明している。
二重の防御策を導入し訓練を一時停止
環境から出せるDNSクエリも、許可したドメインと種類だけに絞った。最高性能モデルのツール使用を伴う訓練・評価・推論は、抜け穴が塞がったことを確認し、追加のレッドチーム演習を終えるまで一時停止する。
今回の事案について、過去の一部の事例より深刻度は低いと評価する。一方で、Hugging Face事件後にセキュリティを強化してから初めての事案であり、次の強化の重点を見極める重要な手がかりになるとしている。