FlashLabsは10月2日、AI推論ゲートウェイ「OrcaRouter」の開発チームが、AIエージェントの行動判断を学習するためのオープンデータセット「Orca Incident Alignment(OIAS)」を公開したと発表した。実際のインシデントを基に再構成した基本シナリオ41件と、条件を1つだけ変えた派生シナリオ220件の計261件を収録する。
「許可・確認・検証・エスカレーション・ブロック」の5段階で判断
OIASは、AIエージェントの失敗事例を記録した公開データベース「Orca AI Incident Archive」を基にしたデータセットである。エージェントが判断を迫られた分岐点について、その時点で何を観察し、何ができ、実際に何をして、本来どう行動すべきだったかを再構成している。
行動判断は、「許可(ALLOW)」「確認(CONFIRM)」「検証(VERIFY)」「エスカレーション(ESCALATE)」「ブロック(BLOCK)」の5段階に分かれる。基本シナリオ41件と、反事実と呼ばれる派生シナリオ220件を使って、これらの判断を学習できる構成だ。単に危険な操作を拒否させるのではなく、状況に応じて安全にタスクを完了するための判断を学ばせる設計になっているという。
条件を1つだけ変えた派生シナリオ
反事実シナリオでは、「誰が操作を許可したか」「使用するツールが実在するか」「対象環境が検証用か」など、基本シナリオの条件を1つだけ変更している。これにより、条件の違いに応じた判断を学習できるとしている。
また、モデルに与える文章にはエージェントが実際に観察できる情報だけを含めており、情報の出所は示す一方で「信頼できる」「信頼できない」といった評価は加えていないという。
学習・評価の用途に応じた7種類のデータ形式
OIASは、AIモデルの学習・評価の用途に応じて、7種類のデータ形式で構成される。具体的には、望ましい応答を収めたSFT、望ましい応答と望ましくない応答を組み合わせた選好学習、候補から正しい行動を選ぶ判定、行動を5段階で評価する判定モデル、手順の各段階が安全かどうかをラベル付けした監督データ、応答を採点する報酬モデル、各形式の基になる完全な記録から成る。
公開にあたっては、5段階判定の盲検による再判定や出典の事実確認を含む、5ラウンドの独立レビューを実施。自動検証ツールによるチェックと、データ所有者による最終承認も行ったという。
OIASは英語のみで、2025年から2026年までのインシデントを対象とする。ライセンスはCC BY 4.0で、評価用の分割データは「IncidentBench」として別途提供している。
なお、収録シナリオは言語モデルによって再構成されたものであり、インシデントの証拠そのものではない。シナリオは判断の分岐点までを扱い、実行可能な攻撃コードは含まれていない。
