セキュリティ研究者たちは長い間、大規模言語モデルエージェントがインシデントレスポンスで最も退屈な作業の1つ、つまり散在するログやテレメトリを使って攻撃者がシステム内をどのように移動したかを一歩ずつつなぎ合わせる作業を高速化してくれることを期待してきた。DiagChainと呼ばれる新しい診断ベンチマークは、その期待を検証するものであり、その結果は、この技術が攻撃チェーン再構成を単独で確実に処理できるようになるまでには、まだ長い道のりがあることを示唆している。
Xuyang Liu、Yibin Han、Zhenwei Zhang、Kai Chang、Zhiwei Xu、Tian Qiu、Weixian Deng、Jiabao Gao、Xiaolin Peng、Hai Wan、Xibin Zhao らの研究チームによって開発された DiagChain は、単なる精度スコアボードではない。これは、LLM エージェントがシステムテレメトリから取得した証拠に基づいて、攻撃者が取った一連の行動を順序立てて再構成しようとする際に、どこで、なぜ失敗するのかを明らかにすることを目的として構築されている。
Summary
主なポイント
- DiagChain は、単純な合否精度を超えて、証拠に基づく攻撃チェーン再構成における LLM エージェントを評価する診断ベンチマークである。
- ベンチマークの MAIN-69 スイートには、複数のオペレーティングシステム、証拠ノイズレベル、チェーン長にまたがる 69 のシナリオが含まれる。
- ECRAG と呼ばれる新しい手法は、再構成中のチェーンの進化する構造化表現と証拠検索を組み合わせる。
- テストされた 6 つの異なる LLM の中で、最良の構成でも 849 の参照ステップのうち 39.6% でしか成功しなかった。
- 小型モデルは取得した証拠を活用すること自体に苦戦し、大型モデルは主にその証拠を正しい順序に並べることに苦戦する。
DiagChain の紹介:攻撃チェーン再構成のための新しいベンチマーク
DiagChain が存在するのは、既存のベンチマークの多くが最終出力や全体の精度スコアだけを見ており、エージェントの推論プロセスの中で実際にどのように誤りが形成されるのかについてほとんど洞察を与えないからである。これは、AI エージェントが実際の侵害のトリアージを支援するのに十分信頼できるかどうかを判断しようとするサイバーセキュリティチームにとって、意味のあるギャップとなっている。
DiagChain の目的と範囲
DiagChain の中核は、証拠に基づくサイバーセキュリティタスクのために構築された診断ベンチマークである。エージェントが最終的な攻撃ストーリーを正しく導き出したかどうかだけを採点するのではなく、再構成プロセスの各段階を個別に評価する。この段階ごとのアプローチにより、研究者は LLM エージェントの推論がどこで破綻するのか、証拠収集の段階なのか、証拠解釈の段階なのか、あるいは出来事を首尾一貫したチェーンに並べる段階なのかを正確に特定できる。
MAIN-69 シナリオスイートの構成
このベンチマークの中心となるのが MAIN-69 であり、これはエージェントをさまざまな現実的条件下でストレステストするよう設計された69 のシナリオスイートである。これらのシナリオは複数のオペレーティングシステムにまたがり、証拠に混入するノイズの量が異なり、チェーンの長さも異なる。つまり、攻撃シーケンスが短いものもあれば、攻撃者の行動のより長い連なりを追跡する必要があるものもある。この多様性は、すべてがきれいで単純な状況だけでなく、条件がより混沌としてきたときにもエージェントの性能が維持されるかどうかを明らかにすることを目的としている。
方法論上の革新と評価指標
シナリオスイートに加えて、DiagChain は独自の検索手法と 5 つの評価軸からなるスコアリングシステムを導入しており、いずれも失敗の診断を当て推量ではなく体系的なものにすることを目的としている。
Evidence-Centric Retrieval-Augmented Generation (ECRAG)
この論文の主要な貢献の 1 つが、Evidence-Centric Retrieval-Augmented Generation の略であるECRAGである。標準的な検索拡張生成セットアップとは異なり、ECRAG は証拠の検索と、エージェントが再構成しようとしているチェーンの進化する構造化表現を結びつける。実務的には、システムは一度関連する証拠を取得して終わりにするのではなく、新たな証拠が入るたびに攻撃チェーンの内部的なイメージを継続的に更新していくことを意味する。理論的には、これによりエージェントは複雑で多段階の侵入をより首尾一貫して追跡できるようになるはずだ。
診断評価のための 5 つの補完的指標
どこで物事がうまくいかなくなるのかを理解するために、DiagChain は再構成プロセスのそれぞれ異なる段階を対象とする 5 つの補完的指標に依存している。これらの指標を組み合わせることで、研究者はあらゆる誤りを 1 つの一般的な精度指標にまとめてしまうのではなく、特定の失敗ポイントを切り分けることができる。これはこのベンチマークの価値の中核であり、「エージェントが適切な証拠を見つけられなかった」のか、「証拠は見つけたが出来事を誤った順序に並べた」のかを区別する診断評価は、単一の合否スコアよりも、これらのシステムを改善するうえで遥かに有用である。
大規模言語モデルの性能評価
では、現在のモデルは実際どの程度の性能を示したのか。ベンチマークの結果によれば、決して良好とは言えない。
6 つの LLM を用いた実験設定
研究チームは、MAIN-69 シナリオに対して 6 つの異なる LLM を用いて評価を実施した。この設定により、能力の異なるモデルが、同じ証拠に基づく再構成タスクを、同じノイズ条件とチェーン長の課題の下でどのように処理するかを比較でき、全体として一貫した性能比較の基盤が得られた。
主要な性能結果と成功率
注目すべき数字は厳しいものだ。研究で最も高性能だった構成でさえ、MAIN-69 に含まれる 849 の参照ステップのうち 39.6% でしか成功しなかった。言い換えれば、最も強力なセットアップであっても、ベンチマークのグラウンドトゥルースのステップと比較した場合、攻撃者の行動シーケンスを 60% 以上のケースで誤っていることになる。これは、攻撃チェーン再構成を今すぐ完全に AI エージェントに任せたいと考えている人にとって、現実を突きつける結果だ。
モデルサイズと再構成の課題に関する洞察
このことが単なる数値以上に重要なのはなぜか。それは、失敗パターンがモデルサイズによって異なり、その違いが解決すべき 2 つのまったく異なるエンジニアリング上の問題を示しているからである。
小型モデルの限界
研究者の分析によると、小型モデルは出来事を正しく並べる以前の、より基本的な部分でつまずいている。すなわち、取得した証拠を出力に取り込むこと自体に苦戦しているのだ。これは、小型モデルにとってのボトルネックが、証拠がエージェントの推論を実際に支える段階、つまり証拠が無視されたり誤用されたりするのではなく、推論に反映されるべき段階にあることを示唆している。
大型モデルにおける証拠の順序付けの課題
大型モデルはその最初のハードルをよりうまく乗り越え、再構成プロセスのさらに先へと進むことができる。しかし、そこで別の壁に突き当たる。すなわち、収集した証拠を正しく順序付けることが主なボトルネックとなる。この失敗モードはより微妙であり、モデルは正しいピースを持っているものの、それらを正確な攻撃者行動のシーケンスに並べることに苦戦する。だが、まさにこの出力こそが、実際のセキュリティ調査において最も重要となる。
この分岐は、セキュリティオペレーションにおいてLLM 評価ベンチマークツールを構築・導入している人にとって重要である。これは、モデルサイズを単にスケールアップするだけでは、攻撃チェーン再構成の問題が自動的に解決されないことを示唆している。2 つの失敗モードは異なる対処を必要としており、小型モデルにはより良い証拠統合が、大型モデルにはより良いシーケンス化や推論戦略が求められるのであって、万能の改善パスが存在するわけではない。
研究者たちは、これらの知見を、単純なエンドツーエンドの精度スコアではなく診断的評価を行うことの妥当性として位置づけている。単一の集約値は、あるモデルが「40% の確率で正解する」とセキュリティチームに伝えるかもしれないが、その失敗が証拠の見落としによるものなのか、証拠の読み違いによるものなのか、あるいはシーケンスの混乱によるものなのかは教えてくれない。DiagChain の段階別指標はこのギャップを埋めるよう設計されており、著者らが「証拠に基づくサイバーセキュリティエージェントを今後改善するための実行可能なインサイト」と表現するものを提供している。
FAQ
DiagChain は何を評価するために設計されていますか?
DiagChain は、診断的かつ段階別の評価を通じて、証拠に基づく攻撃チェーン再構成における大規模言語モデルエージェントを評価するよう設計されています。
MAIN-69 シナリオスイートはどのような内容をカバーしていますか?
MAIN-69 には、複数のオペレーティングシステム、さまざまな証拠ノイズレベル、異なる攻撃チェーンの長さをカバーする 69 のシナリオが含まれています。
ECRAG 手法はどのように攻撃チェーン再構成を改善しますか?
ECRAG は、再構成されたチェーンの進化する構造化表現と証拠検索を組み合わせることで、チェーン分析を支援します。
このベンチマークで特定された LLM の主な性能上の課題は何ですか?
小型モデルは取得した証拠を取り込むことに苦戦し、大型モデルは再構成において証拠を正しい順序に並べることに課題を抱えています。
{“@context”:”https://schema.org”,”@type”:”FAQPage”,”mainEntity”:[{“@type”:”Question”,”name”:”DiagChain は何を評価するために設計されていますか?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”DiagChain は、診断的かつ段階別の評価を通じて、証拠に基づく攻撃チェーン再構成における大規模言語モデルエージェントを評価するよう設計されています。”}},{“@type”:”Question”,”name”:”MAIN-69 シナリオスイートはどのような内容をカバーしていますか?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”MAIN-69 には、複数のオペレーティングシステム、さまざまな証拠ノイズレベル、異なる攻撃チェーンの長さをカバーする 69 のシナリオが含まれています。”}},{“@type”:”Question”,”name”:”ECRAG 手法はどのように攻撃チェーン再構成を改善しますか?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”ECRAG は、再構成されたチェーンの進化する構造化表現と証拠検索を組み合わせることで、チェーン分析を支援します。”}},{“@type”:”Question”,”name”:”このベンチマークで特定された LLM の主な性能上の課題は何ですか?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”小型モデルは取得した証拠を取り込むことに苦戦し、大型モデルは再構成において証拠を正しい順序に並べることに課題を抱えています。”}}]}
本記事は人工知能の支援を受けて作成され、編集チームによるレビューを経ています。

