NTTデータグループ、監視運用統合でオンコール時間を92%短縮 AIで調査も自動化

2026年9月24日09:00|ニュースCaseHUB.News編集部
x
hatebu

 NTTデータグループは、社内プラットフォームとネットワークの監視オペレーション基盤に、PagerDutyのインシデント管理プラットフォーム「PagerDuty」を採用した。9月18日、PagerDutyが発表した。監視体制とオンコールのプロセスを束ねることで、障害検知からオンコールまでの所要時間を約92%短縮したという。今後はAIエージェントの適用範囲を広げ、原因究明から復旧までを自律化する仕組みを目指す。

 NTTデータグループのITマネジメント室は、グループ約70社を対象に、約120の社内システムを動かす基盤とネットワークの開発や維持運用を担っている。プライベートクラウド上で約3000の仮想マシンが稼働し、全国約200拠点、国内10万人以上の利用者を支える大規模な環境だ。同室では、クラウドシフトやゼロトラスト環境を見据えた基幹ネットワークの刷新を進めており、運用自動化やAIOpsによる監視オペレーションの高度化が検討されていた。

 従来の監視現場では、プライベートクラウド、パブリッククラウド、拠点間ネットワークの3領域にチームが分かれており、それぞれ異なるツールや運用体制でインシデント管理やオンコールを行っていた。このため、システム障害発生時に確認すべき情報が散在し、同じ原因に対してサーバー担当とネットワーク担当が同時に対応に動くといった非効率が生じていた。さらに、運用システム数の増加に伴ってインシデント件数が増加し、アラートの取捨選択やオンコール要否の判断に人の手を介さざるを得ない点が大きな負担となっていた。

 同社は監視運用の全体最適に向けて、当初は既存ツールの1本化を検討したものの、アカウント追加に伴う費用の急増や各チーム独自の手順書を作り直す調整負荷が課題となった。そこで既存の監視体制を大きく崩さずにインシデント管理を統一できるSaaSの導入へ舵を切り、PagerDutyを選定した。十数年使い続けてきた統合運用管理ソフトウェア「Hinemos」のアラートをそのまま受け渡せる点や、海外拠点のオペレーターを含めた実運用に耐えうるかを約3カ月間の概念実証(PoC)で確認し、採用を決めた。

 導入プロジェクトは段階的に進められた。まずネットワーク領域でHinemosのアラートを起点としたインシデントチケット起票とオンコールの自動化を実施し、続いて15年以上の運用実績を持つプライベートクラウド領域へと適用を広げた。PagerDutyの機能を活用してチャットツール上で障害対応の記録や共有を完結させるChatOps環境も整えている。

 新基盤の稼働により、監視オペレーションの効率は改善した。Hinemosが検知したアラートをPagerDutyが受け取り、担当者へ直接オンコールする仕組みとしたことで、アラートメールの目視確認や切り分け工程が省かれ、オンコールまでの時間は約92%短縮された。また、アラート重複を自動で排除するトリアージ機能によって不要なインシデント起票を約65%防ぎ、監視オペレーション全体に要する時間を約20%効率化できている。一部領域では、PagerDutyのSREエージェントを活用し、従来は約15分を要していたアラート内容の確認、関連情報の調査、影響判断といった一次調査を自動化している。

 NTTデータグループ ITマネジメント室 システム開発担当 部長の川戸祐介氏は、プロセスとツールの統一を通じて標準化を進め、将来的な体制最適化につながる道筋を示せたと説明する。

 今後は、2026年度中をめどにパブリッククラウド領域でも自動オンコールを実装する方針だ。すべてのアラートを起点に、原因の切り分けからシステムの復旧実行までを人手を介さずに完結させる「自動解析・自動リカバリー」の実現に向け、運用基盤の高度化を継続して進めるとしている。

ニュースリリース