ホームZ - バナーホーム ita新しいLLMフレームワークが、20件中19件の報告書でサイバー脅威の攻撃チェーンをマッピング

新しいLLMフレームワークが、20件中19件の報告書でサイバー脅威の攻撃チェーンをマッピング

セキュリティチームは長年、頑固な問題に直面してきました。攻撃者の行動様式を最もよく記述しているインテリジェンス、すなわち詳細で物語性の高いサイバー脅威インテリジェンス(CTI)レポートは、コンピューターが容易に推論できない形式で存在しているという問題です。arXiv に掲載された研究論文で詳述されている新しい自動化フレームワークは、このギャップを直接埋めることを目指し、非構造化の脅威ナラティブを、論理推論エンジンが実際にたどることのできる機械可読なサイバー脅威攻撃チェーンへと変換します。

主なポイント

  • CTI レポートは現実世界の攻撃を物語形式で記述しているが、自動化された攻撃パス推論には直接利用できない。
  • このフレームワークは各攻撃ステップを攻撃ユニットとしてモデル化する。これは、事前条件・攻撃行動・事後条件からなる構造化された三つ組である。
  • 大規模言語モデルを用いた多段階パイプラインにより、生の CTI テキストからこれらのユニットを抽出・正規化・修復する。
  • 334 の人手検証済みステップを含む 20 本の CTI レポートにおいて、Datalog 推論は20 本中 19 本で指定された攻撃目標への到達に成功し、後方探索により34 本の攻撃パスが発見された。
  • このフレームワークは、カバレッジ、完全性、一貫性の点で、代表的な CTI 抽出システムおよびエンドツーエンド LLM ベースラインの両方を上回った。

CTI レポートから構造化知識を抽出する際の課題

脅威インテリジェンスレポートは、サイバーセキュリティ分野で最も情報密度の高い文書の一つです。これらは攻撃者のツール、ラテラルムーブメント手法、権限昇格のシーケンス、最終目標などを捉えており、多くの場合、侵害がリアルタイムで進行する様子を目撃したアナリストによって記述されています。しかし、その豊富さには代償があります。その知識は構造化データではなく、自由形式の文章の中に埋もれているのです。

この非構造化という性質が、自動 CTI 抽出を本質的に困難なものにしています。人間のアナリストはレポートを読み、頭の中でタイムラインを構築します。自動システムには同等の近道がありません。ステップ 2 が特定のシステム状態を確立したために、ステップ 3 が初めて可能になった、ということを自明に推論することはできないのです。

現在の抽出ツールが見落としているもの

既存の CTI 抽出手法の多くは、侵害指標(IP アドレス、ファイルハッシュ、ドメイン名など)の抽出や、MITRE ATT&CK のようなフレームワークに対する戦術・技術・手順(TTP)のタグ付けに焦点を当てています。これらの出力は有用ではあるものの、本質的にはフラットです。なぜ一つの行動が次の行動を可能にしたのかという理由を符号化することなく、何が起きたのかという事実だけを伝えるにとどまります。

根本的な制約は、実行条件の欠如にあります。攻撃者がコマンドを実行する前にシステムがどのような状態にあり、その後にどのような状態になったのかが分からなければ、ステップ同士をつなぎ合わせて一貫した攻撃パスを構成することはできません。状態マッチングや到達可能性解析、すなわち防御側が「この出発点から攻撃者は本当にこの目標に到達できるのか?」と問うことを可能にする操作は、ラベルレベルの抽出ではそもそもサポートされていないのです。

提案された攻撃チェーン抽出の自動化フレームワーク

この研究は、より豊かな分析単位を中心に据えて抽出問題を再定式化するフレームワークを提示します。個々の侵害指標や TTP ラベルを抽出するのではなく、攻撃の各ステップを攻撃ユニットとしてモデル化します。これは、事前条件・攻撃行動・事後条件からなる構造化オブジェクトです。事前条件は、そのステップが実行される前に環境について成り立っていなければならないことを表現します。事後条件は、その後に新たに成り立つことを表現します。この二つを組み合わせることで、一つのステップが次のステップへとつながり得るかどうかを推論できるようになります。

大規模言語モデルを用いた多段階抽出パイプライン

生テキストからこれらの攻撃ユニットを構築する段階で、大規模言語モデルが登場します。ただし単一のエンドツーエンド生成器としてではなく、多段階の攻撃分析パイプラインの構成要素として用いられます。パイプラインは順次動作し、まず CTI ナラティブから攻撃行動の骨格を抽出し、次に各行動に対する事前条件と事後条件を復元し、その後すべての要素をあらかじめ定義された述語集合へと正規化し、最後にチェーンを分断してしまう依存関係の破綻を修復します。

この最後の修復ステップは、分析上きわめて重要です。実際の CTI レポートはエンジニアリング仕様書として書かれているわけではありません。著者は自明だと考える前提を省略し、中間ステップを飛ばし、原因に言及せずに結果だけを記述することがあります。こうしたギャップを積極的に埋めないシステムは、論理的な穴だらけの攻撃チェーンを生成してしまいます。一見すると完全なシーケンスに見えても、実際にはたどることができないのです。修復ステージはこの問題に直接対処します。

パイプライン全体の結果として得られるのは、正規化され内部的に一貫した攻撃ユニットの集合であり、単にカタログ化されるのではなく、推論エンジンに引き渡す準備が整った状態になっています。

論理推論と評価結果

抽出された攻撃ユニットは、Datalog 形式のルールへとコンパイルされます。Datalog は到達可能性クエリに適した論理プログラミング言語であり、一連の事実とルールが与えられたとき、指定された目標状態に到達可能かどうかを導出できます。このように攻撃チェーンを定式化することで、知識抽出の問題は明確な成功基準を持つ形式的推論の問題へと変換されます。

到達可能性解析のための Datalog 形式ルールへのコンパイル

各攻撃ユニットは一つのルールになります。すなわち、事前条件が成り立てば事後条件が導かれる、という形です。これらのルールを連鎖させることで、推論エンジンは、例えば「ドメイン全体の完全な侵害」といった特定の攻撃目標が、CTI レポートに記述された行動に基づき、初期の足掛かりから到達可能かどうかを問うことができます。これは、ある TTP が観測されたという事実を知ることとは本質的に異なる能力です。材料のリストと、結果が検証されたレシピとの違いに相当します。

注釈付き CTI レポートにおける性能

評価データセットは、20 本の CTI レポートから構成され、そこには334 の人手検証済み注釈ステップが含まれていました。このデータセット全体において、本フレームワークは代表的な CTI 抽出システムよりも高い注釈ステップカバレッジを達成しました。これは、人間のアナリストが重要だと判断した攻撃行動を、より多く回収できたことを意味します。

Datalog 推論エンジンは、20 本中 19 本のレポートで指定された攻撃目標への到達に成功しました。生成されたルール集合に対する後方探索では、34 本の異なる攻撃パスが得られました。この最後の数字は重要です。同じ目標に至る複数のパスを見つけることは、攻撃者の戦略に冗長性があることを示し、防御側に対して、どこを塞ぐ必要があるのかをより完全な形で示してくれるからです。

エンドツーエンド LLM ベースラインに対する優位性

単一のモデルに一度のプロンプトで完全な攻撃ユニットの生成を求めるエンドツーエンド大規模言語モデルのベースラインと比較すると、構造化パイプラインは、より完全で一貫性の高い攻撃ユニットを生成しました。エンドツーエンド生成は、もっともらしく見える出力を生み出しがちですが、その一方で事前条件を落としてしまったり、前のステップと矛盾する事後条件を生成したりします。これに対し段階的アプローチでは、各構成要素を組み立てる前に個別に抽出・正規化することを強制するため、ドリフトや抜け漏れが減少します。

これが、この研究に埋め込まれたより深い方法論的洞察です。大規模言語モデルは、非構造化テキストから意味を抽出する強力なツールですが、放任したままでは論理構造の設計者としては信頼できません。各ステージに特定かつ限定されたタスクを与える厳格なパイプラインの中に組み込むことで、制約のない生成では失われてしまう一貫性を取り戻せるように見えます。

脅威インテリジェンスと防御にとっての意義

実務的な意味としては、防御側は理論上、新たに公開された CTI レポートをこの種のシステムに投入し、攻撃者の行動概要だけでなく、「この報告されたテクニックのシーケンスに基づき、特定の侵入経路から我々のクラウンジュエルに到達可能か」という問いに対する機械的に検証された回答を得ることができます。この種の攻撃目標到達可能性解析は、歴史的には熟練アナリストが手作業で行う必要がありましたが、それは時間とコストがかかり、組織が受け取る脅威インテリジェンスの量にはスケールしません。

また、AI 支援セキュリティにおける構造化推論の役割について、より広い示唆もあります。組織が大規模言語モデルをセキュリティオペレーションに統合する中で、それらを万能のソルバーとして扱いたくなる誘惑があります。しかし本研究の結果は、よりニュアンスのある姿を示唆しています。形式的推論エンジンと組み合わせた LLM は、互いの弱点を補完し合うことで、単独で用いるよりも強力になり得るということです。ソースコードと実験成果物は匿名化されたリポジトリで公開されており、第三者による検証や拡張に道を開いています。

FAQ

なぜ CTI レポートから攻撃チェーンを抽出することは難しいのですか?

CTI レポートは現実世界の攻撃を記述した非構造化のナラティブであり、そのため攻撃パス推論の自動化が困難になります。文章は前提を省略し、中間ステップを飛ばし、一つの攻撃ステップが次に続くかどうかを決定するシステム状態を符号化していません。

提案されたフレームワークは既存の CTI 抽出手法と比べてどのように優れていますか?

各攻撃ステップを事前条件・行動・事後条件でモデル化し、多段階の言語モデルパイプラインを用いてこれらの構成要素を抽出・正規化します。また、依存関係の破綻を修復するステージも含まれています。これにより、ラベルレベルの抽出手法ではサポートできない状態マッチングと到達可能性推論が可能になります。

このフレームワークにおいて Datalog 推論はどのような役割を果たしますか?

抽出された攻撃ユニットは Datalog 形式のルールにコンパイルされ、システムは到達可能性推論を行い、特定の目標に至る攻撃パスを特定できるようになります。これにより、抽出された知識は、攻撃者が何を達成し得るかについての形式的に検証可能な主張へと変換されます。

このフレームワークの性能はどのように評価されましたか?

334 の人手検証済み注釈ステップを含む 20 本の CTI レポートにおいて、本フレームワークは代表的な CTI 抽出システムより高いカバレッジを達成し、エンドツーエンド LLM ベースラインよりも完全性の高い攻撃ユニットを生成しました。Datalog に基づく到達可能性解析は 20 本中 19 本で成功し、後方探索では 34 本の異なる攻撃パスが特定されました。

{“@context”:”https://schema.org”,”@type”:”FAQPage”,”mainEntity”:[{“@type”:”Question”,”name”:”なぜ CTI レポートから攻撃チェーンを抽出することは難しいのですか?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”CTI レポートは現実世界の攻撃を記述した非構造化のナラティブであり、そのため攻撃パス推論の自動化が困難になります。文章は前提を省略し、中間ステップを飛ばし、一つの攻撃ステップが次に続くかどうかを決定するシステム状態を符号化していません。”}},{“@type”:”Question”,”name”:”提案されたフレームワークは既存の CTI 抽出手法と比べてどのように優れていますか?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”各攻撃ステップを事前条件・行動・事後条件でモデル化し、多段階の言語モデルパイプラインを用いてこれらの構成要素を抽出・正規化します。また、依存関係の破綻を修復するステージも含まれています。これにより、ラベルレベルの抽出手法ではサポートできない状態マッチングと到達可能性推論が可能になります。”}},{“@type”:”Question”,”name”:”このフレームワークにおいて Datalog 推論はどのような役割を果たしますか?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”抽出された攻撃ユニットは Datalog 形式のルールにコンパイルされ、システムは到達可能性推論を行い、特定の目標に至る攻撃パスを特定できるようになります。これにより、抽出された知識は、攻撃者が何を達成し得るかについての形式的に検証可能な主張へと変換されます。”}},{“@type”:”Question”,”name”:”このフレームワークの性能はどのように評価されましたか?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”334 の人手検証済み注釈ステップを含む 20 本の CTI レポートにおいて、本フレームワークは代表的な CTI 抽出システムより高いカバレッジを達成し、エンドツーエンド LLM ベースラインよりも完全性の高い攻撃ユニットを生成しました。Datalog に基づく到達可能性解析は 20 本中 19 本で成功し、後方探索では 34 本の異なる攻撃パスが特定されました。”}}]}

本記事は人工知能の支援を受けて作成され、編集チームによるレビューを経ています。

Satoshi Voice
この記事は人工知能の支援を受けて作成され、正確さと品質を保証するために我々の記者チームによってレビューされた。
RELATED ARTICLES

Stay updated on all the news about cryptocurrencies and the entire world of blockchain.

Featured video

LATEST