Operations & support · reference function

Cloud Capacity, Availability & Continuity

Ensure cloud services can meet capacity, availability and recovery commitments.

Reference mandate

Own capacity and availability planning, continuity requirements, recovery evidence and lifecycle improvement across service, platform and provider boundaries.

Short

Ensure cloud services can meet capacity, availability and recovery commitments.

Standard

Own capacity and availability planning, continuity requirements, recovery evidence and lifecycle improvement across service, platform and provider boundaries.

Detailed

Own capacity and availability planning, continuity requirements, recovery evidence and lifecycle improvement across service, platform and provider boundaries. The function maintains explicit decision boundaries, measurable outcomes, governed interfaces and a documented improvement loop for its scope.

Scope in

  • Capacity planning
  • Availability management
  • Continuity requirements
  • Recovery testing and evidence

Scope out

  • Business continuity ownership
  • Implementing every recovery mechanism
  • Accepting untested recovery claims

Responsibilities

  • Capacity planning
  • Availability management
  • Continuity requirements
  • Recovery testing and evidence

Services

  • Capacity planning service
  • Availability management service
  • Continuity requirements service
  • Recovery testing and evidence service

Required capabilities

  • Service Continuity Lead capability
  • Availability Manager capability
  • Recovery Engineer capability

Roles

  • Service Continuity Lead
  • Availability Manager
  • Recovery Engineer

Decision rights

  • Approve a recovery test outcome
  • Escalate an availability exposure
  • Set a capacity remediation priority

Key interfaces

  • Cloud Service Management
  • Cloud Operations
  • Platform Engineering

Inputs

  • Requirements from Cloud Service Management
  • Requirements from Cloud Operations

Outputs

  • Governed output to Cloud Operations
  • Governed output to Platform Engineering

Governance forums

  • Recover design review
  • Cloud operating-model review

Measures

  • Recovery evidence coverage
  • Capacity risk age
  • Availability objective attainment

Dependencies

  • Cloud Service Management
  • Cloud Operations
  • Platform Engineering

Sourcing options

  • Retained internal
  • Shared
  • MSP-supported

Organizational placements

  • Central cloud organization
  • Federated domain
  • Shared technology function

Decisions owned

  • Approve a recovery test outcome
  • Escalate an availability exposure
  • Set a capacity remediation priority

Decisions contributed to

  • Contribute to decisions owned by Cloud Service Management
  • Contribute to decisions owned by Cloud Operations
  • Contribute to decisions owned by Platform Engineering
Design boundary

Common failure modes

  • Recovery plans are not tested
  • Provider resilience claims are accepted without evidence
  • Capacity issues are treated only as incidents
Sourcing principle

Testing and engineering may be sourced; continuity requirements and acceptance remain internally accountable.

Minimum retained capability

Testing and engineering may be sourced; continuity requirements and acceptance remain internally accountable.

Maturity guidance

Begin with named ownership and one measurable outcome; add delegation and automation only when evidence and capability are reliable.

Reference note

Vendor-neutral practitioner reference pattern; validate against organizational, regulatory and sourcing context.

Version 2026.3 · reviewed 8 September 2026