消去符号化(EC)は、RAIDやミラーリング戦略に比べ、より多くのディスクをデータ用に利用できるため、その効率性の高さもあり、データ保護のための最もよく知られた手法の1つである。
消去符号化とは何ですか。また、RAID やミラーリングのデータ保護方式と比較してどうですか。RAIDストライピングやミラーリングのような他のデータ保護方式と比較した場合、消去符号化にはどのような利点と欠点があるのでしょうか。このブログポストでは、これらの疑問にお答えし、Qumuloがどのようにオンプレミスのストレージインスタンスで消去符号化を活用し、ハードウェア障害から保護しながらパフォーマンスと効率を最大化しているかを説明します。
消去符号化とは何か?
消去符号化は、高度な数学を活用したストレージ・データ保護手法であり、生存しているデータ・ブロックと付随するパリティ・ブロックを比較することにより、ストレージ・システムが失われたデータ・ブロックを再生することを可能にする。
消去符号化とRAIDの比較:長所と短所
消去コーディングが他のデータ保護方法より優れていることを説明するために、データ保護の様々な形態とその長所と短所を理解することが役立ちます。
安価なディスクの冗長アレイ(RAID)
RAIDの歴史は長い。最も基本的なデータ保護構成はRAID1であり、ミラーリングとも呼ばれる。その名が示すように、ミラーリングはすべてのデータを2台(またはそれ以上)のドライブに同時に書き込み、同一のコピーを2つ作成します。
RAID1 ミラーリング構成のディスクの 1 つが故障しても、各コピーが独立したディスクに存在するため、失われたデータは「ミラーイメージ」から回復可能である。ミラーリングの実装は簡単ですが、いくつかの欠点があります。ミラーリングにはデータセット全体の少なくとも1つの冗長コピーが必要なため、データ保護に必要なスペースの点で無駄が多い。また、ミラーリングは一度に1台のドライブの障害にしか対応できないため、一般的にほとんどの障害シナリオ、特にクラスタ・サイズが大きくなるにつれて、十分な保護にはなりません。
RAID標準では、RAID1のミラーリングオプション以外にも、パフォーマンス、保護、またはその両方を最適化するコンフィギュレーションを提供しています。オプションにはRAID5があり、ハードディスクのグループ(通常は5~10台)を1つのアレイにまとめ、その中の1台のディスクをパリティデータに使用します。RAID6と呼ばれる別のアプローチは、同じ基本的なアプローチを使用しますが、パリティデータの格納にセット内の2つのディスクを専用に使用します。もう 1 つの構成である RAID10 は、ディスクセット全体を同一のディスクセットにミラーリングします。
これらのオプションにはそれぞれトレードオフがある。RAID5とRAID6はどちらも優れた読み出しパフォーマンスを提供しますが、書き込み操作のたびに1つまたは2つのパリティブロックを計算する必要があるため、書き込みパフォーマンスは遅くなります。さらに、これらの高度なRAID構成は非常に複雑になり、管理や保守が困難になる可能性があります。また、コンポーネントに障害が発生した場合、RAIDの再構築時間は許容できないほど遅くなることがあり、ユーザーのパフォーマンスに大きく影響します。
消去符号化
Qumuloのオンプレミス・ストレージ・スタックには、以下のものが含まれます。 スケーラブル・ブロックストア(SBS) これは、RAIDではなく、消去符号化を使用した効率的なブロックベースのデータ保護を可能にする基盤層である。
RAIDストライピングやミラーリングとは異なり、消去符号化は大規模データストレージにスケーラブルな保護を提供します。消去符号化は、オンプレミスのQumuloクラスタにおいて、完全なデータ保護と応答性を維持しながら、より優れたパフォーマンス、より高い柔軟性、より高い効率を実現し、無制限の成長を可能にします。
Qumuloの消去符号化アルゴリズムは、以下のものに基づいている。 リードソロモン エラー訂正の原則、確立されたベストプラクティスを使用してパフォーマンスと効率を最大化します。さらに、Qumuloの 適応型データ保護 のサポートは、Qumuloクラスタの消去符号化フレームワークが、クラスタの成長に合わせてより効率的に調整できることを意味します。
消去符号化の説明(例)
消去符号化は例で理解するのが一番簡単です。ここでは、私たちの3,2符号化アルゴリズムの例を示します:
3,2エンコーディングでは、3つのブロック(m = 3)が3つの異なる物理デバイスにまたがっている。ブロック1と2には保護したいユーザー・データ(n = 2)が含まれ、3番目のブロックにはパリティ・データが含まれる。パリティ・ブロックの内容は、消去符号化アルゴリズムを使って計算される。
各ブロックは別々のドライブに書き込まれるため、3台のドライブのうち1台が故障しても、ブロック1と2に保存された情報はパリティ・ブロックから再作成できるため安全である。
消去符号化の仕組み
仕組みはこうだ。データ・ブロック1が利用可能であれば、システムは単純にそれを読み込む。データ・ブロック2についても同様です。しかし、データ・ブロック1が欠落している場合、消去符号化システムはデータ・ブロック2とパリティ・ブロックを読み取り、データ・ブロック1の値を再構築する。
同様に、データブロック2が故障したディスクに存在する場合、システムはデータブロック1とパリティブロックを読み取ります。SBSは常にブロックが異なるスピンドル上にあることを確認するため、システムはブロックから同時に読み取ることができます。
3,2エンコーディングの効率は2 / 3 (n/m)、つまり67%である。ミラーリングの効率50%よりは良いが、3,2エンコーディングはまだ1つのディスク障害からしか保護できない。
消去符号化により、設定可能なデータ保護を実現
消去コーディングは、パフォーマンスを最適化したり、メディア故障時の復旧時間を最適化したり、あるいは耐障害性を高めるために構成することができます。一般的に、保護の強化は使用可能な容量を犠牲にします。
最低でも、Qumuloは6,4エンコーディングを使用します。これは、ミラーリングと同じスペースに3分の1以上のユーザーデータを保存し、ミラーリングや3,2のように1つのディスク故障ではなく、2つのディスク故障を許容する能力を持っています。6,4構成では、ユーザーデータを含む2つのブロックが利用できなくなったとしても、システムは残りの2つのデータブロックと2つのパリティブロックを読み込むだけで、失われたデータを回復することができる。
つまり、どういうことなのか?
他のファイルプラットフォームのようにファイルレベルではなく、ブロックレベルで動作するQumulo独自の消去符号化は、全データボリュームの1:1コピーを作成することなく、効果的にデータを保護することを可能にするだけでなく、ファイルのサイズがエンコードとリカバリーの時間に影響を与えないことを意味します。ファイルサイズが巨大であろうと小サイズであろうと、エンコードとリカバリーのパフォーマンスは単に速いだけではありません。
他のシステムでは、クラスタに保存されているファイルサイズの組み合わせによって、イベントからの復旧に数時間から数日、あるいはそれ以上かかることがあります。Qumuloは、保存されているファイルデータの組み合わせに関係なく、パフォーマンスに影響を与えることなく、迅速かつ確実に復旧します。また、Qumuloの顧客は、市場最大で最も経済的なドライブをリスクなく活用することができます。
Qumuloのクラウドネイティブ・インスタンスでのデータ保護!
スケーラブル・ブロックストアは、物理的な(オンプレミスの)Qumuloクラスタ上でのみ消去符号化を管理します。クラウドネイティブのQumuloインスタンス、例えば アズール・ネイティブ・クムロ (ANQ)は、Azure Blob Storageなど、クラウド・プロバイダー独自の永続データ・サービス上に構築されている。
編集部注:2021年11月3日に発表されたこのブログ記事は、その後、正確性と包括性のために更新されました。