本文へ移動

基本情報技術者試験 · 学習ガイド

サービスマネジメント

サービスマネジメントとは

サービスマネジメントとは、システムを止めず使い続けられる状態に保ち、品質を合意して支える活動です。

予備機への切替えでサービスを復旧する場面と、原因を調べ恒久対策を行う場面を分けた図。
予備機へ切り替えてサービスを復旧するのがインシデント管理の例です。繰り返す停止の根本原因を調べ、恒久対策を行う活動は問題管理として考えます。

システムが止まったときは、原因の完全解明を待つより、先に利用を再開する必要がある場合があります。サービス管理は使い続けられる状態を支えます。

基本の仕組み

基本の仕組みの図解。中央に「サービス停止」を置き、上の矢印は右の予備機へ向かい「サービス復旧」につなぐ。下の矢印は「繰り返す停止の根本原因」から「恒久対策」へつなぎ、上下を仕切って復旧と原因解決の違いを示す。
覚えること:復旧後も原因を調べ変更管理し恒久対策

予備機へ切り替えてサービスを復旧するのがインシデント管理の例です。繰り返す停止の根本原因を調べ、恒久対策を行う活動は問題管理として考えます。

SLAはサービス提供者と顧客の間で合意する、サービスの内容と品質目標の文書です。目標復旧時間などを定め、実績を測ることで、期待と実際のずれを把握します。

復旧と原因解決は同じではありません。暫定対応で動いていても再発のおそれは残るため、変更を管理しながら恒久対策を進めます。

事業継続計画では、止められない業務を選び、許容する停止時間や失ってよいデータ量から復旧を設計します。RTOは復旧までの目標時間、RPOはどの時点のデータまで戻せるようにするかの目標です。前日夜のバックアップだけなら、当日昼の障害で午前中の更新を失う場合があります。

復旧と再発防止

復旧と再発防止の図解。左の中断したサービスから上下に分岐させ、上段は回避策を経てサービス回復へ、下段は根本原因が判明し恒久対策前の場合だけ「既知の誤り」の記録を経て問題管理へ向かう矢印にする。上下を仕切り、回復を優先する流れと再発防止の流れを区別する。
覚えること:合意した時間内に回復、原因特定と再発防止

インシデントは、サービスの計画外の中断や品質の低下のことです。インシデント管理では、回避策(ワークアラウンド)も使って、合意した時間内にサービスを回復させることを優先します。根本原因は分かっているが恒久対策がまだの状態は「既知の誤り」として記録し、問題管理で再発防止を進めます。

恒久対策としてシステムを直すときは、変更管理で変更要求(RFC)の影響とリスクを評価して承認し、リリース及び展開管理で本番環境へ展開します。構成管理は、どの機器やソフトウェアがどの版で動いているかを記録し、影響範囲の特定を支えます。利用者からの問合せは、単一の窓口であるサービスデスクが受け付けます。

復旧と再発防止
管理主な目的
インシデント管理合意した時間内にサービスを回復する
問題管理根本原因を特定し、再発を防ぐ
変更管理変更の影響を評価し、承認する
リリース及び展開管理承認された変更を本番環境へ展開する
構成管理構成品目とその版を記録・管理する
サービスレベル管理SLAを合意し、実績を監視・報告する

SLAと可用性の計算

SLAと可用性の計算の図解。上段に「毎日8〜20時×30日→提供360時間」を置く。中央の横棒を左の利用可能な99%と右端の停止1%に分け、停止部分から下の「停止3.6時間」へ矢印を引く。
覚えること:提供360時間・99%なら停止3.6時間

SLA(サービスレベル合意書)には、サービス時間、可用性、応答時間、障害時の回復時間などの目標(サービスレベル目標)を数値で定めます。サービスレベル管理では、実績を定期的に測って目標と比べ、顧客とレビューします。

可用性は、サービスを提供する時間のうち実際に利用できた時間の割合です。例えば毎日8時から20時まで(12時間)、月30日提供するサービスで可用性99%を約束すると、月の提供時間360時間の1%、つまり3.6時間まで停止が許されます。計画停止を提供時間に含めるかどうかは、SLAの定義で決まります。

試験に出る

  • インシデント管理(復旧を優先)と問題管理(根本原因の追究と恒久対策)の違い。
  • SLAは提供者と顧客の間で合意する、サービスの内容と品質目標である点。
  • 復旧しても再発のおそれがあるため、変更を管理しながら恒久対策を進める点。
  • RTOは復旧までの目標時間、RPOは戻せるデータの時点の目標である点。
  • 事業継続計画では、許容する停止時間と失ってよいデータ量から復旧を設計する点。
  • SLAの可用性から、サービス提供時間×(1−可用性)で許容される停止時間を計算する点。
  • 変更は変更管理で評価・承認し、リリース及び展開管理で本番へ展開するという役割分担。

重要な言葉

インシデント管理
障害時に予備機切替などで利用を早く再開する活動。
問題管理
繰り返す障害の根本原因を調べ、恒久対策を行う活動。
SLA
サービス提供者と顧客の間で、サービスの内容と品質目標を合意した文書。
RTO
復旧までの目標時間。
既知の誤り
根本原因や回避策は分かっているが、恒久対策がまだ済んでいない問題。

確認問題

確かめよう再起動で動くようになれば根本原因は解決済み?

いいえ。復旧後も原因分析が必要な場合があります。

再起動で動くようになれば、根本原因は解決済みとみなしてよい。

RPOは、どの時点のデータまで戻せるようにするかの目標である。

復旧を優先する活動はどちらですか。

前日夜のバックアップだけの場合、当日昼の障害で失い得るものは?

毎日12時間、月30日提供するサービスで可用性99%を約束した。月に許される停止時間は?

システムが止まったときは、原因の完全解明を待つより、先に利用を再開する必要がある場合があります。サービス管理はを支えます。

予備機へ切り替えてサービスを復旧するのがの例です。繰り返す停止の根本原因を調べ、恒久対策を行う活動はとして考えます。

はサービス提供者と顧客の間で合意する、サービスの内容と品質目標の文書です。目標復旧時間などを定め、実績を測ることで、期待と実際のずれを把握します。

復旧と原因解決は同じではありません。暫定対応で動いていても再発のおそれは残るため、変更を管理しながらを進めます。

事業継続計画では、止められない業務を選び、許容する停止時間や失ってよいデータ量から復旧を設計します。は復旧までの目標時間、はどの時点のデータまで戻せるようにするかの目標です。前日夜のバックアップだけなら、当日昼の障害で午前中の更新を失う場合があります。

出典・参考資料

試験の公式案内と、この記事の参考にした学習資料です。

編集:Pinternet Works · 更新日:

教材の編集方針・訂正について