AI ペネトレーションテストという言葉は、いま2つの別物を指して使われています。1つは、AI が攻撃者の役を務めて自社システムへの侵入を試みるテスト。もう1つは、自社が業務に入れたチャットボットや RAG、AI エージェントを標的にして、人が侵入を試みるテストです。どちらを買おうとしているのかを最初に分けないと、見積もりの段階で話が噛み合いません。前者については、2026年9月末から韓国の銀行が GitHub 公開の自律型ツール「ARTEX」とみられる手口で立て続けに侵入され、確認分だけで約2万6,000人分の情報が漏れました。攻撃側が先に使い始めた、というのが現在地です。本記事では2つの違い、ARTEX で何が起きたか、守る側の AI ペネトレーションテストの実力と限界、国内で使えるサービス、そして導入を判断する基準を扱います。
LOCKED は、SSO と多要素認証で認証を束ねる LOCKED MSO、アカウントの発行・停止・棚卸しを自動化する LOCKED DAS、端末を管理する LOCKED MDM を組み合わせたサービス群です。AI がまず突く「認証とアカウントの隙」を、テストの前にふさいでおくための土台になります。
無料で製品資料をお送りしています。テスト結果の修正計画にお使いください。 製品資料をダウンロードする →
AIペネトレーションテストには「AIがやる」と「AIを対象にする」の2つがある
ペネトレーションテストは、攻撃者と同じ手順で実際に侵入を試し、どこまで入れるかを確かめる作業です。既知の弱点を機械的に洗い出す脆弱性診断とは、「見つける」で止まるか「入ってみせる」まで行くかが違います。経済産業省の「情報セキュリティサービス基準」でも、ペネトレーションテストは脆弱性診断サービスのオプションに位置づけられ、適合した事業者が IPA(情報処理推進機構)の公開リストに載っています。
この「攻撃者と同じ手順」を人の代わりに AI エージェントが回すのが、1つ目の意味の AI ペネトレーションテストです。対象を調べ、弱点の仮説を立て、ツールを動かし、結果を読んで次の手を決める。この繰り返しを AI が自分で進めます。海外の製品でいえば XBOW や Horizon3、国内では GMO Flatt Security の Takumi が近い位置にいます。
2つ目は、今度は AI がテストされる側に回るものです。社内文書を検索して答えるチャットボットや、チケットや顧客管理(CRM)を操作する AI エージェントに対して、指示文の細工で機密を吐き出させたり、与えた権限を越えて操作させたりできないかを人が試します。GMO サイバーセキュリティ byイエラエが2026年4月に始めた「AI エージェントペネトレーションテスト」がこちらです。検索で上位に出る解説記事は、この2つが混ざっていることが多いので、見積もりを取る前にどちらの話かを確かめてください。
本記事は1つ目を厚く、2つ目は要点だけ扱います。
2026年版 情シスが直面するIDガバナンス5大課題
2026年に情シスが直面するIDガバナンスの5つの主要課題を分析。SaaS増加、リモートワーク常態化、コンプライアンス強化などへの対応策を提示します。
攻撃側が先に使った:ARTEXと韓国の銀行への不正アクセス
ニュースの文脈で AI ペネトレーションテストが注目されたのは、守る道具としてではなく、攻撃に転用された事例としてでした。情報漏洩ニュースでも触れたとおり、AI エージェントが絡む不正アクセスは2025年後半から海外で続いており、韓国の銀行の件はその延長線上にあります。
ARTEXは、GitHubで公開された中国発の自律型ペネトレーションテストシステム
ARTEX は2026年7月26日に GitHub で公開されたオープンソースのソフトウェアで、説明文には「AI 自主渗透测试系统」、つまり AI 自律型ペネトレーションテストシステムとあります。開発者は中国語圏で、画面やドキュメントも中国語が主です。Go で書いたバックエンドと画面を1つの実行ファイルにまとめ、データベースを添えて自分のサーバーに立てて使う構成で、利用する大規模言語モデルは Anthropic や OpenAI などから自分で選びます。公開から数か月で GitHub の star は2,000を超え、百度(バイドゥ)が開いた攻防コンテストで優勝した、と作者は記しています。
ソフトウェア自体は、攻撃のためだけに作られたものではありません。配布ページの利用規約は「個人の学習・コード研究・ローカルでの技術検証のみ」に用途を限り、許可の有無にかかわらず実在のオンラインシステムやサイトへの実テストを禁じています。ペネトレーションテストの道具は、許可された対象に使えば防御の道具であり、無断で他人のシステムに向ければ不正アクセスになる、という「諸刃の剣」の典型です。実際にテストを行うなら、対象の明確な許可を取ることが大前提になります。
韓国の銀行で約2万6,000人分が漏れた。ただしARTEXの関与は状況証拠
一連の不正アクセスは、2026年9月30日に最初の報告を出した新韓銀行から始まり、複数の金融機関に広がりました。韓国の金融保安院(FSI)が新韓銀行の通信記録と攻撃元の IP を追ったところ、ARTEX を指す痕跡が見つかった、と報じられています。きっかけは、セキュリティ企業 Genians のムン・ジョンヒョン氏が、攻撃に使われたサーバーのページ見出しに「ARTEX-」という文字列を見つけたことでした。ただし本人も、これはあくまで状況証拠にとどまる、と断っています。
漏れた件数は、新韓銀行が融資代理店向けの照会サービスから25,729人分、KB国民銀行が従業員向けシステムから119件、ハナ銀行が営業支援システムから89件、釜山銀行が契約社員11人分、と各行の公表をまとめて確認分で約2万6,000人分です。狙われたのは顧客が使うインターネットバンキングではなく、監視の手薄な従業員・取引先向けの内部システムでした。侵入の入口は事前に入手した認証情報の使い回しだった可能性が高い、とされています。当局者は「AI が攻撃に使われたのは事実だが、AI が人の関与なしに単独で動いたわけではない。攻撃者が AI を道具として使った」と強調しました。
ここから自社向けに引き出せる教訓は2つです。1つは、入口が内部向けの軽視されがちなシステムと、使い回された認証情報だったこと。顧客向けの正面だけ固めても足りません。もう1つは、AI が加わると攻撃の速度が上がること。韓国の業界関係者は、弱点の発見から攻撃までが数十日から数か月だったものが、数十分から数時間に縮んだと話しています。
Anthropicも2025年11月に、AIが8〜9割を担った攻撃を報告している
同じ構図は、生成 AI を提供する Anthropic 自身の報告にも出ています。2025年11月13日、同社は中国の国家が背後にいると高い確度で見る集団が、同社の Claude Code を攻撃の自動化基盤に仕立て、約30の標的に対し攻撃の作業の80〜90%を AI に実行させた事例を公表しました。人間は偵察から実際の侵入に移る判断など、要所だけを担っていたとされます。安全機構は、作業を無害に見える小さな断片に分けることと、正規のセキュリティ企業の防御テストだと偽ることで回避されていました。
同時に、AI がまだ万能でないことも報告は書いています。Claude は存在しない認証情報をでっち上げたり、公開情報を機密だと誇張したりしており、これが完全自動の攻撃を妨げている、としています。守る側への助言は明快で、同じ AI を防御に使えというものです。監視センターの自動化、脅威検知、脆弱性評価、インシデント対応に AI を取り入れることを勧めています。攻撃が AI で速くなるなら、守りも AI で速くする、という発想です。
内部システムと認証情報の守りの点検を、無料でご相談を承っています。 デモ・個別相談を申し込む →
守る側のAIペネトレーションテストは、どこまでできるのか
攻撃に転用される一方で、AI ペネトレーションテストは本来、防御のための技術として開発されてきました。2025年から2026年にかけての検証では、特定の条件で人間の専門家に匹敵する成績も出ています。ただし万能ではありません。得意な作業と苦手な作業が、はっきり分かれます。
大学ネットワークの検証では、AIが人間10人中9人を上回った
スタンフォード大などの研究者が2025年12月に公開した論文は、約8,000台・12のサブネットからなる大学の実ネットワークを舞台に、AI エージェント「ARTEMIS」と人間のペネトレーションテスト専門家10人の成績を比べました。ARTEMIS は有効な脆弱性を9件見つけ、提出した指摘のうち82%が有効と判定され、総合で2位、人間10人のうち9人を上回りました。首位の人間は13件を見つけています。費用も、ある構成では1時間あたり18ドルで、専門家の60ドルより安いと報告されました。中心にいるのは、作業を分けて複数の下請けエージェントに振り、結果を検証モジュールで選り分ける「まとめ役」のエージェントです。コマンド操作中心の偵察と悪用で強かった一方、画面操作の課題でつまずき、誤検知も人間より多かった、とも書かれています。
XBOWはバグバウンティで米国1位になったが、人の確認を挟んでいる
商用の例では、自律型 AI ペネトレーションテストをうたう XBOW が、2025年6月にバグバウンティ(脆弱性の報奨金)大手 HackerOne の米国ランキングで1位に立ちました。90日で約1,060件の脆弱性を提出し、運営側が解決扱いにしたのが130件、重大度の内訳は深刻54件・高242件・中524件・低65件と公表されています。ただし「完全自動」の看板とは裏腹に、各指摘は自動の検証役が査読し、提出前に XBOW 側のセキュリティ担当が確認していました。数字の裏に人の確認が入っている点は、製品を見るときの目安になります。
苦手は、GUI操作・複雑な業務ロジック・誤検知
これらの検証から見える限界は共通しています。コマンドで進む偵察や既知の弱点の悪用は速い一方、画面を見ながらの操作、業務ごとに固有の複雑なロジック、前例のない新しい攻撃手法では、人間の臨機応変さに届きません。誤検知も残り、量を出すほど選り分けの手間が増えます。だから2026年時点の現実解は、網羅と量を AI が担い、深さと最終判断を人が担うハイブリッドに落ち着きます。
国内で使えるAIペネトレーションテスト/診断サービス
国内で「AI が診断する」側の製品は、ペネトレーションテストの全工程を置き換えるものというより、脆弱性診断を自動化し、人の診断を補うものとして売られています。名前に「AI」と付いていても中身は幅広いので、何を自動化し、どこを人が見るのかを確かめるのが要点です。
GMO Flatt Security「Takumi」:Slackに頼む自律型の診断エージェント
Takumi は GMO Flatt Security が2025年3月に発表した、セキュリティ診断に特化した AI エージェントです。Slack に追加し、同僚のエンジニアに頼むように設計やコードのレビューを依頼すると、数分から数十分の試行錯誤を自分で進めます。10日間の実証では0-day(未公表の脆弱性)を10件見つけ、テキストエディタ Vim の脆弱性などを報告しています。料金は月額7万円(税抜)からで、2026年2月には見つけた問題を直す自動修正機能も加わりました。国内では最も「自律的に動く AI」に近い製品の1つです。
エーアイセキュリティラボ「AeyeScan」:Web脆弱性診断の自動化
AeyeScan は、AI による自動巡回で Web アプリの脆弱性診断を自動化するクラウド型ツールで、有償契約は500社を超えると公表されています。富士キメラ総研や ITR の調査で、Web アプリ脆弱性診断ツールの国内シェア1位をうたっています。手動診断に近い網羅性を自動で得ることを狙う診断ツールで、攻撃者の手順を自分で考えて進む自律型エージェントとは位置づけが異なります。
GMOサイバーセキュリティ byイエラエ:AIエージェント自体を狙うテスト
同じ「AI ペネトレーションテスト」でも、GMO サイバーセキュリティ byイエラエが2026年4月に始めたサービスは、2つ目の意味、つまり企業が導入した AI エージェントやチャットボット、RAG を標的にするものです。Microsoft 365 Copilot や Azure OpenAI を使った社内システムに対し、ホワイトハッカーが実際の攻撃者と同じ手法で、意図しない情報漏えいや権限逸脱、横展開が起きないかを検証します。後述する AI セーフティ・インスティテュート(AISI)の手法ガイドに沿った検証にも対応します。
もう1つのAIペネトレーションテスト:自社のAIエージェントを守る
社内に AI エージェントを入れ始めた企業にとっては、2つ目の意味のテストが現実の課題になります。AI 特有の弱点は、従来の脆弱性スキャナーでは拾えないからです。
代表的な弱点は、OWASP が2025年にまとめた「OWASP Top 10 for LLM Applications」に整理されています。筆頭はプロンプトインジェクション(指示文の細工で AI の振る舞いを乗っ取る手口)で、機密情報の漏えい、過剰な権限付与、システムプロンプトの流出などが続きます。検証の進め方は、AISI が2025年3月31日に公開した「AI セーフティに関するレッドチーミング手法ガイド 第1.10版」が、RAG を実装したシステムを攻撃者視点で評価する手順まで含めて示しています。自社で AI エージェントに権限を渡すなら、人間の従業員以上に接続先と権限を絞ること、そしてこの観点でのテストを診断範囲に加えることが要ります。
導入の判断基準:指摘で終わるか、実証まで行くか
AI ペネトレーションテストや AI 診断を選ぶとき、最も効く分かれ目は、潜在的な問題を挙げるだけか、実際に動く形で到達可能性まで示せるかです。前者は脆弱性スキャナーに近く、後者がペネトレーションテストの本来の価値です。
数字だけで製品を比べないことも大切です。NTT データは2026年8月の解説で、報告件数が多くても未検証の候補が混じっている場合があり、少なくても成立を確認した結果かもしれない、と指摘しています。性能は使う AI モデルだけでなく、入力情報・探索範囲・ツール・検証環境・人の承認条件をまとめた「ハーネス」で大きく変わるため、両者を一体で評価すべきだとしています。実際の診断対象に近いコードで、同じ条件を複数回試して結果の安定性を見るのが現実的です。
過信も禁物です。ペネトレーションテスト事業者の Cobalt が約455人の専門家に聞いた調査では、テストを完全に AI の自動化だけに頼る組織の割合が前年の29%から9%へ下がりました。回答者の78%が、全自動のスキャンツールが重大な脆弱性を見落としたと答え、47%が人の専門性で AI を補うハイブリッドを支持しています。Cobalt はテスト事業者なので割り引いて読む必要はありますが、「全部 AI に任せる」から「人と組ませる」へ揺り戻しが起きているのは確かです。制度面でも、クレジットカード業界の PCI DSS は内部・外部のペネトレーションテストを少なくとも年1回、重要な変更のたびに求めており、AI がその頻度と範囲を広げる余地はあります。
テストの前に、AIが最初に狙う「認証とアカウント」を固める
AI ペネトレーションテストは、弱点を速く見つけてくれます。ただし見つかった穴は、直さなければふさがりません。そして韓国の銀行の件でも、Anthropic の報告でも、AI がまず突いたのは認証情報とアカウントの隙でした。使い回されたパスワード、止め忘れた退職者のアカウント、権限の付けすぎ。ここが開いていれば、AI は最短でそこから入ります。
LOCKED MSO は、SaaS ごとにパスワードを持つ状態を SSO でなくし、多要素認証と IP・デバイスの制限を重ねます。パスワードが1つ漏れても、それだけでは入れません。LOCKED DAS は入社・退社に合わせたアカウントの発行と停止、権限の棚卸しを自動化するので、止め忘れたアカウントや余分な権限が残りません。LOCKED MDM は端末の状態を押さえ、どの端末からの接続を許すかの判断材料を出します。AI エージェントに権限を渡すときに、人間以上に接続先と権限を絞る、という先ほどの原則も、アカウントと権限を一元管理できて初めて実行できます。
テストで穴を探すことと、そもそも穴を減らしておくことは、両輪です。多要素認証(MFA)とアカウント管理を先に固めておけば、AI ペネトレーションテストの結果は「重大な侵入経路」ではなく「細かな改善点」で埋まります。そこまで持っていくのが、テストを活かす前提になります。
認証とアカウント管理の現状整理から、無料でご相談を承っています。 資料請求・デモ依頼はこちら →
参考資料
- ARTEX(GitHub, Autumn-27/ARTEX)
- The Herald Business:Chinese AI tool ARTEX used in wave of bank hacks, probe finds
- Kyunghyang Shinmun(英語版):ARTEX をめぐる報道
- Anthropic:Disrupting the first reported AI-orchestrated cyber espionage campaign
- arXiv 2512.09882:Comparing AI Agents to Cybersecurity Professionals in Real-World Penetration Testing
- XBOW:How XBOW reached #1 on the US HackerOne leaderboard
- GMO Flatt Security「Takumi」リリース(ScanNetSecurity)
- GMOサイバーセキュリティ byイエラエ「AIエージェントペネトレーションテスト」(ScanNetSecurity)
- AISI:AIセーフティに関するレッドチーミング手法ガイド
- OWASP Top 10 for LLM Applications 2025
- NTTデータ:AIを活用した脆弱性診断の選び方
- IPA:情報セキュリティサービス基準適合サービスリスト