mirror of
https://github.com/rustfs/rustfs.git
synced 2026-08-23 04:39:04 +00:00
Compare commits
13 Commits
| Author | SHA1 | Date | |
|---|---|---|---|
| 405237ff04 | |||
| 23a2c7d776 | |||
| 76aad3772b | |||
| 06d00e2502 | |||
| 3be5efab67 | |||
| dfbe165882 | |||
| 5360b87459 | |||
| 646de337c5 | |||
| 7985251b67 | |||
| bef7e5bb68 | |||
| e1b5c665e8 | |||
| a206895fad | |||
| 3cee88f313 |
@@ -39,11 +39,10 @@ jobs:
|
||||
env:
|
||||
FORCE_JAVASCRIPT_ACTIONS_TO_NODE24: "true"
|
||||
steps:
|
||||
- name: Checkout main branch
|
||||
- name: Checkout repository
|
||||
uses: actions/checkout@9c091bb21b7c1c1d1991bb908d89e4e9dddfe3e0 # v7
|
||||
with:
|
||||
persist-credentials: false
|
||||
ref: main
|
||||
|
||||
- name: Setup Rust environment
|
||||
uses: ./.github/actions/setup
|
||||
@@ -89,11 +88,10 @@ jobs:
|
||||
# either casing.
|
||||
NO_PROXY: 127.0.0.1,localhost
|
||||
steps:
|
||||
- name: Checkout main branch
|
||||
- name: Checkout repository
|
||||
uses: actions/checkout@9c091bb21b7c1c1d1991bb908d89e4e9dddfe3e0 # v7
|
||||
with:
|
||||
persist-credentials: false
|
||||
ref: main
|
||||
|
||||
- name: Setup Rust environment
|
||||
uses: ./.github/actions/setup
|
||||
@@ -178,11 +176,10 @@ jobs:
|
||||
FORCE_JAVASCRIPT_ACTIONS_TO_NODE24: "true"
|
||||
NO_PROXY: 127.0.0.1,localhost
|
||||
steps:
|
||||
- name: Checkout main branch
|
||||
- name: Checkout repository
|
||||
uses: actions/checkout@9c091bb21b7c1c1d1991bb908d89e4e9dddfe3e0 # v7
|
||||
with:
|
||||
persist-credentials: false
|
||||
ref: main
|
||||
|
||||
- name: Setup Rust environment
|
||||
uses: ./.github/actions/setup
|
||||
|
||||
@@ -1089,9 +1089,7 @@ impl PeerRestClient {
|
||||
.await?
|
||||
.max_decoding_message_size(BACKGROUND_HEAL_STATUS_MAX_MESSAGE_SIZE);
|
||||
let response = match client
|
||||
.background_heal_status(Request::new(BackgroundHealStatusRequest {
|
||||
protocol_version: rustfs_protos::BACKGROUND_HEAL_STATUS_PROTOCOL_VERSION,
|
||||
}))
|
||||
.background_heal_status(Request::new(BackgroundHealStatusRequest::default()))
|
||||
.await
|
||||
{
|
||||
Ok(response) => response.into_inner(),
|
||||
|
||||
@@ -13,6 +13,8 @@
|
||||
// limitations under the License.
|
||||
|
||||
use crate::bucket::replication::replication_state_from_filemeta;
|
||||
#[cfg(test)]
|
||||
use crate::bucket::utils::is_meta_bucketname;
|
||||
use crate::bucket::versioning_sys::BucketVersioningSys;
|
||||
use crate::bucket::{
|
||||
lifecycle::{
|
||||
@@ -1347,6 +1349,53 @@ fn should_cleanup_decommission_source_entry(decommissioned: usize, total_version
|
||||
decommissioned.saturating_add(expired) == total_versions
|
||||
}
|
||||
|
||||
const DECOMMISSION_FREE_VERSION_MIGRATED_REASON: &str = "tier_free_version_migrated";
|
||||
const DECOMMISSION_FREE_VERSION_CONSUMED_REASON: &str = "tier_free_version_already_consumed";
|
||||
const DECOMMISSION_FREE_VERSION_RETAINED_REASON: &str = "tier_free_version_migration_failed";
|
||||
const DECOMMISSION_FREE_VERSION_SWEEP_REASON: &str = "tier_free_version_unresolved_after_decommission";
|
||||
const DECOMMISSION_FREE_VERSION_DISPOSITION_REASON: &str = "tier_free_version_disposition_recorded";
|
||||
|
||||
#[derive(Debug, Default, Clone, Copy, PartialEq, Eq)]
|
||||
struct DecommissionFreeVersionDisposition {
|
||||
migrated: usize,
|
||||
consumed: usize,
|
||||
retained: usize,
|
||||
}
|
||||
|
||||
impl DecommissionFreeVersionDisposition {
|
||||
fn record_migrated(&mut self) {
|
||||
self.migrated += 1;
|
||||
}
|
||||
|
||||
fn record_consumed(&mut self) {
|
||||
self.consumed += 1;
|
||||
}
|
||||
|
||||
fn record_retained(&mut self) {
|
||||
self.retained += 1;
|
||||
}
|
||||
|
||||
fn total(self) -> usize {
|
||||
self.migrated.saturating_add(self.consumed).saturating_add(self.retained)
|
||||
}
|
||||
}
|
||||
|
||||
enum DecommissionFreeVersionAttempt {
|
||||
Migrated,
|
||||
Consumed,
|
||||
CapacityFailure(Error),
|
||||
Retry(Error),
|
||||
}
|
||||
|
||||
fn classify_decommission_free_version_attempt(result: Result<()>) -> DecommissionFreeVersionAttempt {
|
||||
match result {
|
||||
Ok(()) => DecommissionFreeVersionAttempt::Migrated,
|
||||
Err(err) if is_decommission_copy_cleanup_safe_error(&err) => DecommissionFreeVersionAttempt::Consumed,
|
||||
Err(err) if is_decommission_target_capacity_error(&err) => DecommissionFreeVersionAttempt::CapacityFailure(err),
|
||||
Err(err) => DecommissionFreeVersionAttempt::Retry(err),
|
||||
}
|
||||
}
|
||||
|
||||
#[derive(Debug, Clone, Copy, PartialEq, Eq)]
|
||||
#[allow(
|
||||
dead_code,
|
||||
@@ -2615,8 +2664,12 @@ fn determine_decommission_final_state(items_failed: usize, was_cancelled: bool)
|
||||
}
|
||||
}
|
||||
|
||||
fn decommission_remaining_version_count(total_versions: usize, expired: usize) -> usize {
|
||||
total_versions.saturating_sub(expired)
|
||||
fn decommission_remaining_version_count(versions: &[rustfs_filemeta::FileInfo], expired: usize) -> usize {
|
||||
versions
|
||||
.iter()
|
||||
.filter(|version| !version.tier_free_version())
|
||||
.count()
|
||||
.saturating_sub(expired)
|
||||
}
|
||||
|
||||
fn should_skip_decommission_delete_marker(
|
||||
@@ -2679,6 +2732,7 @@ fn decommission_remote_tiered_opts(
|
||||
user_defined: version.metadata.clone(),
|
||||
src_pool_idx,
|
||||
data_movement: true,
|
||||
incl_free_versions: version.tier_free_version(),
|
||||
include_part_checksums: true,
|
||||
http_preconditions: Some(crate::data_movement::data_movement_target_precondition()),
|
||||
expected_bucket_incarnation_id,
|
||||
@@ -3822,6 +3876,7 @@ impl ECStore {
|
||||
|
||||
let mut decommissioned: usize = 0;
|
||||
let mut expired: usize = 0;
|
||||
let mut free_version_disposition = DecommissionFreeVersionDisposition::default();
|
||||
let mut cleanup_preflight_allowed_missing = Vec::new();
|
||||
|
||||
for version in fivs.versions.iter() {
|
||||
@@ -3830,6 +3885,115 @@ impl ECStore {
|
||||
}
|
||||
decommission_cancel_signal_result(rx.is_cancelled())?;
|
||||
|
||||
if version.tier_free_version() {
|
||||
let version_id = version.version_id.map(|v| v.to_string());
|
||||
let mut migration_error = None;
|
||||
let mut migrated = false;
|
||||
let mut consumed = false;
|
||||
let mut capacity_failure = false;
|
||||
for _ in 0..3 {
|
||||
match classify_decommission_free_version_attempt(
|
||||
run_decommission_side_effect(&rx, &operation_gate, || async {
|
||||
self.decommission_tiered_object(
|
||||
bucket.as_str(),
|
||||
&version.name,
|
||||
version,
|
||||
&decommission_remote_tiered_opts(
|
||||
version,
|
||||
version_id.clone(),
|
||||
idx,
|
||||
expected_bucket_incarnation_id,
|
||||
),
|
||||
)
|
||||
.await
|
||||
})
|
||||
.await,
|
||||
) {
|
||||
DecommissionFreeVersionAttempt::Migrated => {
|
||||
migrated = true;
|
||||
migration_error = None;
|
||||
break;
|
||||
}
|
||||
DecommissionFreeVersionAttempt::Consumed => {
|
||||
consumed = true;
|
||||
migration_error = None;
|
||||
break;
|
||||
}
|
||||
DecommissionFreeVersionAttempt::CapacityFailure(err) => {
|
||||
capacity_failure = true;
|
||||
migration_error = Some(err);
|
||||
break;
|
||||
}
|
||||
DecommissionFreeVersionAttempt::Retry(err) => migration_error = Some(err),
|
||||
}
|
||||
}
|
||||
|
||||
{
|
||||
let mut pool_meta = self.pool_meta.write().await;
|
||||
ensure_decommission_generation(&pool_meta, idx, generation)?;
|
||||
if let Err(err) = count_decommission_item(&mut pool_meta, idx, 0, !migrated && !consumed) {
|
||||
return Err(with_decommission_entry_context(
|
||||
"count_decommission_item",
|
||||
bucket.as_str(),
|
||||
entry.name.as_str(),
|
||||
err,
|
||||
));
|
||||
}
|
||||
}
|
||||
|
||||
if migrated || consumed {
|
||||
decommissioned += 1;
|
||||
cleanup_preflight_allowed_missing.push(data_movement::source_cleanup_version_identity(version));
|
||||
}
|
||||
if migrated {
|
||||
free_version_disposition.record_migrated();
|
||||
} else if consumed {
|
||||
free_version_disposition.record_consumed();
|
||||
} else {
|
||||
free_version_disposition.record_retained();
|
||||
}
|
||||
|
||||
debug!(
|
||||
event = EVENT_DECOMMISSION_ENTRY,
|
||||
component = LOG_COMPONENT_ECSTORE,
|
||||
subsystem = LOG_SUBSYSTEM_POOLS,
|
||||
pool_index = idx,
|
||||
bucket = %bucket,
|
||||
object = %version.name,
|
||||
version_id = ?version_id,
|
||||
result = ?migration_error,
|
||||
reason = if migrated {
|
||||
DECOMMISSION_FREE_VERSION_MIGRATED_REASON
|
||||
} else if consumed {
|
||||
DECOMMISSION_FREE_VERSION_CONSUMED_REASON
|
||||
} else {
|
||||
DECOMMISSION_FREE_VERSION_RETAINED_REASON
|
||||
},
|
||||
state = if migrated {
|
||||
"free_version_migrated"
|
||||
} else if consumed {
|
||||
"free_version_consumed"
|
||||
} else {
|
||||
"free_version_retained"
|
||||
},
|
||||
"Decommission free-version disposition recorded"
|
||||
);
|
||||
|
||||
if capacity_failure {
|
||||
return Err(with_decommission_entry_context(
|
||||
"decommission_tier_free_version",
|
||||
bucket.as_str(),
|
||||
version.name.as_str(),
|
||||
migration_error.expect("capacity failure must retain its error"),
|
||||
));
|
||||
}
|
||||
|
||||
if !migrated && !consumed {
|
||||
break;
|
||||
}
|
||||
continue;
|
||||
}
|
||||
|
||||
if run_decommission_side_effect(&rx, &operation_gate, || async {
|
||||
should_skip_lifecycle_for_data_movement(
|
||||
self.clone(),
|
||||
@@ -3850,7 +4014,7 @@ impl ECStore {
|
||||
continue;
|
||||
}
|
||||
|
||||
let remaining_versions = decommission_remaining_version_count(fivs.versions.len(), expired);
|
||||
let remaining_versions = decommission_remaining_version_count(&fivs.versions, expired);
|
||||
if should_skip_decommission_delete_marker(version, remaining_versions, replication_config.is_some()) {
|
||||
//
|
||||
decommissioned += 1;
|
||||
@@ -4129,6 +4293,24 @@ impl ECStore {
|
||||
}
|
||||
}
|
||||
|
||||
if free_version_disposition.total() > 0 {
|
||||
debug!(
|
||||
event = EVENT_DECOMMISSION_ENTRY,
|
||||
component = LOG_COMPONENT_ECSTORE,
|
||||
subsystem = LOG_SUBSYSTEM_POOLS,
|
||||
pool_index = idx,
|
||||
bucket = %bucket,
|
||||
object = %entry.name,
|
||||
free_versions_migrated = free_version_disposition.migrated,
|
||||
free_versions_consumed = free_version_disposition.consumed,
|
||||
free_versions_retained = free_version_disposition.retained,
|
||||
free_versions_total = free_version_disposition.total(),
|
||||
reason = DECOMMISSION_FREE_VERSION_DISPOSITION_REASON,
|
||||
state = "free_version_disposition",
|
||||
"Decommission free-version disposition summary"
|
||||
);
|
||||
}
|
||||
|
||||
if should_cleanup_decommission_source_entry(decommissioned, fivs.versions.len(), expired) {
|
||||
if bucket_incarnation_fence.as_ref().is_some_and(|guard| guard.is_lock_lost()) {
|
||||
return Err(Error::other("decommission bucket incarnation fence was lost before source cleanup"));
|
||||
@@ -4298,6 +4480,39 @@ impl ECStore {
|
||||
.await
|
||||
}
|
||||
|
||||
#[cfg(test)]
|
||||
pub(crate) async fn decommission_entry_for_test_with_bucket_incarnation(
|
||||
self: &Arc<Self>,
|
||||
idx: usize,
|
||||
entry: MetaCacheEntry,
|
||||
bucket: String,
|
||||
set: Arc<SetDisks>,
|
||||
) -> Result<()> {
|
||||
let expected_bucket_incarnation_id = if is_meta_bucketname(&bucket) {
|
||||
None
|
||||
} else {
|
||||
Some(self.bucket_incarnation_id_from_disk(&bucket).await?)
|
||||
};
|
||||
self.decommission_entry(
|
||||
CancellationToken::new(),
|
||||
idx,
|
||||
OffsetDateTime::now_utc(),
|
||||
entry,
|
||||
bucket,
|
||||
set,
|
||||
None,
|
||||
None,
|
||||
None,
|
||||
expected_bucket_incarnation_id,
|
||||
)
|
||||
.await
|
||||
}
|
||||
|
||||
#[cfg(test)]
|
||||
pub(crate) async fn check_after_decommission_for_test(self: &Arc<Self>, idx: usize) -> Result<()> {
|
||||
self.check_after_decommission(idx).await
|
||||
}
|
||||
|
||||
#[tracing::instrument(skip(self, rx))]
|
||||
async fn decommission_pool(
|
||||
self: &Arc<Self>,
|
||||
@@ -5162,6 +5377,7 @@ impl ECStore {
|
||||
let lifecycle_config_cb = lifecycle_config.clone();
|
||||
let object_lock_config_cb = object_lock_config.clone();
|
||||
let store = Arc::clone(self);
|
||||
let set_cb = Arc::clone(set);
|
||||
let callback_rx_cb = callback_rx.clone();
|
||||
|
||||
let callback: ListCallback = Arc::new(move |entry: MetaCacheEntry| {
|
||||
@@ -5171,6 +5387,7 @@ impl ECStore {
|
||||
let lifecycle_config = lifecycle_config_cb.clone();
|
||||
let object_lock_config = object_lock_config_cb.clone();
|
||||
let store = Arc::clone(&store);
|
||||
let set = Arc::clone(&set_cb);
|
||||
let callback_rx = callback_rx_cb.clone();
|
||||
Box::pin(async move {
|
||||
if callback_rx.is_cancelled() {
|
||||
@@ -5185,11 +5402,14 @@ impl ECStore {
|
||||
return;
|
||||
}
|
||||
|
||||
let fivs = match load_decommission_entry_versions(
|
||||
let fivs = match load_decommission_entry_exact_versions(
|
||||
&set,
|
||||
&entry,
|
||||
&bucket_name,
|
||||
"check_after_decommission.file_info_versions",
|
||||
) {
|
||||
)
|
||||
.await
|
||||
{
|
||||
Ok(fivs) => fivs,
|
||||
Err(err) => {
|
||||
let mut first_err = entry_error.lock().await;
|
||||
@@ -5202,7 +5422,23 @@ impl ECStore {
|
||||
};
|
||||
|
||||
let mut remaining = 0;
|
||||
for version in &fivs.versions {
|
||||
for version in fivs.versions.iter().chain(fivs.free_versions.iter()) {
|
||||
if version.tier_free_version() {
|
||||
remaining += 1;
|
||||
debug!(
|
||||
event = EVENT_DECOMMISSION_ENTRY,
|
||||
component = LOG_COMPONENT_ECSTORE,
|
||||
subsystem = LOG_SUBSYSTEM_POOLS,
|
||||
pool_index = idx,
|
||||
bucket = %bucket_name,
|
||||
object = %entry.name,
|
||||
version_id = ?version.version_id,
|
||||
reason = DECOMMISSION_FREE_VERSION_SWEEP_REASON,
|
||||
state = "free_version_retained",
|
||||
"Decommission final sweep retained a free version"
|
||||
);
|
||||
continue;
|
||||
}
|
||||
if version.deleted {
|
||||
continue;
|
||||
}
|
||||
@@ -5317,13 +5553,6 @@ mod tests {
|
||||
assert_eq!(determine_decommission_final_state(0, true), DecommissionFinalState::Failed);
|
||||
}
|
||||
|
||||
#[test]
|
||||
fn decommission_remaining_version_count_excludes_only_expired_versions() {
|
||||
assert_eq!(decommission_remaining_version_count(1, 0), 1);
|
||||
assert_eq!(decommission_remaining_version_count(2, 1), 1);
|
||||
assert_eq!(decommission_remaining_version_count(1, 1), 0);
|
||||
}
|
||||
|
||||
#[test]
|
||||
fn lifecycle_action_removes_data_movement_version_rejects_delete_marker_action() {
|
||||
assert!(!lifecycle_action_removes_data_movement_version(IlmAction::DeleteAction));
|
||||
@@ -5380,6 +5609,21 @@ mod tests {
|
||||
)));
|
||||
}
|
||||
|
||||
#[test]
|
||||
fn decommission_free_version_attempt_treats_missing_source_as_consumed() {
|
||||
let attempt =
|
||||
classify_decommission_free_version_attempt(Err(Error::ObjectNotFound("bucket".to_string(), "object".to_string())));
|
||||
|
||||
assert!(matches!(attempt, DecommissionFreeVersionAttempt::Consumed));
|
||||
}
|
||||
|
||||
#[test]
|
||||
fn decommission_free_version_attempt_preserves_capacity_failure() {
|
||||
let attempt = classify_decommission_free_version_attempt(Err(Error::DiskFull));
|
||||
|
||||
assert!(matches!(attempt, DecommissionFreeVersionAttempt::CapacityFailure(Error::DiskFull)));
|
||||
}
|
||||
|
||||
#[test]
|
||||
fn decommission_delete_marker_copy_error_rejects_data_movement_overwrite() {
|
||||
let err = Error::DataMovementOverwriteErr("bucket".to_string(), "object".to_string(), "version".to_string());
|
||||
@@ -5561,6 +5805,12 @@ mod tests {
|
||||
assert!(opts.include_part_checksums);
|
||||
assert!(opts.http_preconditions.is_some());
|
||||
assert_eq!(opts.expected_bucket_incarnation_id, Some(incarnation));
|
||||
assert!(!opts.incl_free_versions);
|
||||
|
||||
let mut free_version = version;
|
||||
free_version.set_tier_free_version();
|
||||
let free_opts = decommission_remote_tiered_opts(&free_version, Some("free-version-id".to_string()), 9, Some(incarnation));
|
||||
assert!(free_opts.incl_free_versions);
|
||||
}
|
||||
|
||||
#[test]
|
||||
|
||||
@@ -1950,6 +1950,19 @@ mod tests {
|
||||
assert!(source_cleanup_versions_match_with_allowed_missing(&expected, ¤t, &allowed_missing));
|
||||
}
|
||||
|
||||
#[test]
|
||||
fn test_decommission_cleanup_preflight_accepts_migrated_free_version_consumed_from_source() {
|
||||
let migrated = cleanup_test_file_info("object.txt", Uuid::from_u128(1), "migrated");
|
||||
let mut free_version = cleanup_test_file_info("object.txt", Uuid::from_u128(2), "tier-cleanup");
|
||||
free_version.deleted = true;
|
||||
free_version.set_tier_free_version();
|
||||
let expected = cleanup_test_versions(vec![migrated.clone(), free_version.clone()]);
|
||||
let current = cleanup_test_versions(vec![migrated]);
|
||||
let allowed_missing = vec![source_cleanup_version_identity(&free_version)];
|
||||
|
||||
assert!(source_cleanup_versions_match_with_allowed_missing(&expected, ¤t, &allowed_missing));
|
||||
}
|
||||
|
||||
#[test]
|
||||
fn test_decommission_cleanup_preflight_rejects_unexpected_missing_version() {
|
||||
let migrated = cleanup_test_file_info("object.txt", Uuid::from_u128(1), "migrated");
|
||||
|
||||
@@ -227,6 +227,70 @@ pub(super) fn restore_commit_operation_id_from_metadata(metadata: &HashMap<Strin
|
||||
restore_operation_id_from_metadata(metadata)
|
||||
}
|
||||
|
||||
async fn inspect_decommission_tier_free_version_target(
|
||||
disk: &DiskStore,
|
||||
bucket: &str,
|
||||
object: &str,
|
||||
source: &FileInfo,
|
||||
) -> Result<bool> {
|
||||
let raw = match disk.read_xl(bucket, object, false).await {
|
||||
Ok(raw) => raw,
|
||||
Err(DiskError::FileNotFound | DiskError::FileVersionNotFound | DiskError::VolumeNotFound) => return Ok(false),
|
||||
Err(err) => return Err(err.into()),
|
||||
};
|
||||
let meta = FileMeta::load(&raw.buf)?;
|
||||
let source_version_id = source.version_id.filter(|version_id| !version_id.is_nil());
|
||||
let mut matching_count = 0;
|
||||
let mut all_matching_versions_equivalent = true;
|
||||
for existing in meta
|
||||
.versions
|
||||
.iter()
|
||||
.filter(|version| version.header.version_id.filter(|version_id| !version_id.is_nil()) == source_version_id)
|
||||
{
|
||||
matching_count += 1;
|
||||
let existing = existing.into_fileinfo(bucket, object, true)?;
|
||||
existing.validate_for_metadata_read()?;
|
||||
if !existing.tier_free_version() || !crate::store::tiered_data_movement_source_matches(source, &existing)? {
|
||||
all_matching_versions_equivalent = false;
|
||||
}
|
||||
}
|
||||
if matching_count == 0 {
|
||||
return Ok(false);
|
||||
}
|
||||
if matching_count == 1 && all_matching_versions_equivalent {
|
||||
return Ok(true);
|
||||
}
|
||||
|
||||
Err(StorageError::DataMovementOverwriteErr(
|
||||
bucket.to_owned(),
|
||||
object.to_owned(),
|
||||
source_version_id.map(|version_id| version_id.to_string()).unwrap_or_default(),
|
||||
)
|
||||
.into())
|
||||
}
|
||||
|
||||
fn ensure_decommission_tier_free_version_commit_fence(bucket: &str, object: &str, opts: &ObjectOptions) -> Result<()> {
|
||||
if opts
|
||||
.namespace_lock_fence
|
||||
.as_ref()
|
||||
.is_some_and(NamespaceLockFence::is_lock_lost)
|
||||
|| opts
|
||||
.bucket_lifecycle_lock_fence
|
||||
.as_ref()
|
||||
.is_some_and(NamespaceLockFence::is_lock_lost)
|
||||
{
|
||||
return Err(StorageError::NamespaceLockQuorumUnavailable {
|
||||
mode: "decommission_tier_free_version_commit",
|
||||
bucket: bucket.to_string(),
|
||||
object: object.to_string(),
|
||||
required: 1,
|
||||
achieved: 0,
|
||||
});
|
||||
}
|
||||
|
||||
Ok(())
|
||||
}
|
||||
|
||||
impl SetDisks {
|
||||
pub(super) async fn require_current_restore_operation_id(
|
||||
&self,
|
||||
@@ -4665,6 +4729,98 @@ fn resolve_delete_version_state(opts: &ObjectOptions, goi: &ObjectInfo, version_
|
||||
}
|
||||
|
||||
impl SetDisks {
|
||||
/// Publish an internal tier free-version record without changing its
|
||||
/// delete-marker shape or remote-tier identity. The caller holds the
|
||||
/// source and target object locks; a write quorum is required before the
|
||||
/// source cleanup may remove the original record.
|
||||
#[tracing::instrument(skip(self, fi, opts))]
|
||||
pub(crate) async fn decommission_tier_free_version(
|
||||
&self,
|
||||
bucket: &str,
|
||||
object: &str,
|
||||
fi: &FileInfo,
|
||||
opts: &ObjectOptions,
|
||||
) -> Result<()> {
|
||||
if !fi.deleted || !fi.tier_free_version() {
|
||||
return Err(Error::other("decommission tier free-version write requires a free version record"));
|
||||
}
|
||||
ensure_decommission_tier_free_version_commit_fence(bucket, object, opts)?;
|
||||
|
||||
self.validate_decommission_tier_free_version_target(bucket, object, fi)
|
||||
.await?;
|
||||
ensure_decommission_tier_free_version_commit_fence(bucket, object, opts)?;
|
||||
|
||||
let disks = self.disks.read().await.clone();
|
||||
let write_quorum = self.default_write_quorum();
|
||||
let futures = disks.into_iter().map(|disk| {
|
||||
let file_info = fi.clone();
|
||||
async move {
|
||||
if let Some(disk) = disk {
|
||||
disk.write_metadata("", bucket, object, file_info).await
|
||||
} else {
|
||||
Err(DiskError::DiskNotFound)
|
||||
}
|
||||
}
|
||||
});
|
||||
|
||||
let mut errs = Vec::new();
|
||||
for result in join_all(futures).await {
|
||||
match result {
|
||||
Ok(_) => errs.push(None),
|
||||
Err(err) => errs.push(Some(err)),
|
||||
}
|
||||
}
|
||||
|
||||
ensure_decommission_tier_free_version_commit_fence(bucket, object, opts)?;
|
||||
|
||||
resolve_tiered_decommission_write_quorum_result(&errs, write_quorum, bucket, object)
|
||||
}
|
||||
|
||||
pub(crate) async fn validate_decommission_tier_free_version_target(
|
||||
&self,
|
||||
bucket: &str,
|
||||
object: &str,
|
||||
fi: &FileInfo,
|
||||
) -> Result<()> {
|
||||
// The caller holds the source and target object locks. Inspect every
|
||||
// target disk before an idempotent return or metadata fan-out so a
|
||||
// sub-quorum conflict cannot be hidden by a successful quorum.
|
||||
let disks = self.disks.read().await.clone();
|
||||
let preflight = disks
|
||||
.iter()
|
||||
.flatten()
|
||||
.map(|disk| inspect_decommission_tier_free_version_target(disk, bucket, object, fi));
|
||||
for result in join_all(preflight).await {
|
||||
result?;
|
||||
}
|
||||
Ok(())
|
||||
}
|
||||
|
||||
pub(crate) async fn has_decommission_tier_free_version_write_quorum(
|
||||
&self,
|
||||
bucket: &str,
|
||||
object: &str,
|
||||
fi: &FileInfo,
|
||||
opts: &ObjectOptions,
|
||||
) -> Result<bool> {
|
||||
ensure_decommission_tier_free_version_commit_fence(bucket, object, opts)?;
|
||||
let disks = self.disks.read().await.clone();
|
||||
let preflight = disks.iter().map(|disk| async {
|
||||
match disk {
|
||||
Some(disk) => inspect_decommission_tier_free_version_target(disk, bucket, object, fi).await,
|
||||
None => Ok(false),
|
||||
}
|
||||
});
|
||||
let mut equivalent = 0;
|
||||
for result in join_all(preflight).await {
|
||||
if result? {
|
||||
equivalent += 1;
|
||||
}
|
||||
}
|
||||
ensure_decommission_tier_free_version_commit_fence(bucket, object, opts)?;
|
||||
Ok(equivalent >= self.default_write_quorum())
|
||||
}
|
||||
|
||||
#[tracing::instrument(skip(self, fi, opts))]
|
||||
pub(crate) async fn decommission_tiered_object(
|
||||
&self,
|
||||
@@ -9887,6 +10043,147 @@ mod tests {
|
||||
assert_ne!(updated.erasure.distribution, original.erasure.distribution);
|
||||
}
|
||||
|
||||
#[tokio::test]
|
||||
async fn decommission_tier_free_version_preserves_remote_identity() {
|
||||
let set_disks = make_local_bucket_test_set_disks().await;
|
||||
let bucket = "free-version-decommission";
|
||||
let object = "object.txt";
|
||||
set_disks
|
||||
.make_bucket(bucket, &MakeBucketOptions::default())
|
||||
.await
|
||||
.expect("target bucket should exist before free-version migration");
|
||||
let version_id = Uuid::new_v4();
|
||||
let mut free_version = FileInfo {
|
||||
name: object.to_string(),
|
||||
volume: bucket.to_string(),
|
||||
version_id: Some(version_id),
|
||||
mod_time: Some(time::OffsetDateTime::now_utc()),
|
||||
deleted: true,
|
||||
transition_tier: "WARM-TIER".to_string(),
|
||||
transitioned_objname: "remote/object".to_string(),
|
||||
..Default::default()
|
||||
};
|
||||
free_version.set_tier_free_version();
|
||||
// Decoded free versions always carry the on-disk free-version
|
||||
// suffix alongside the in-memory tier marker; mirror that here so
|
||||
// the record satisfies delete-marker metadata validation.
|
||||
rustfs_utils::http::metadata_compat::insert_str(
|
||||
&mut free_version.metadata,
|
||||
rustfs_utils::http::metadata_compat::SUFFIX_FREE_VERSION,
|
||||
String::new(),
|
||||
);
|
||||
|
||||
set_disks
|
||||
.decommission_tier_free_version(bucket, object, &free_version, &ObjectOptions::default())
|
||||
.await
|
||||
.expect("free-version metadata should reach the target quorum");
|
||||
set_disks
|
||||
.decommission_tier_free_version(bucket, object, &free_version, &ObjectOptions::default())
|
||||
.await
|
||||
.expect("replaying the same free-version metadata should be idempotent");
|
||||
|
||||
let versions = set_disks
|
||||
.load_file_info_versions_exact(bucket, object)
|
||||
.await
|
||||
.expect("migrated free-version metadata should decode")
|
||||
.expect("migrated free-version metadata should exist");
|
||||
let migrated = versions
|
||||
.versions
|
||||
.iter()
|
||||
.find(|version| version.version_id == Some(version_id))
|
||||
.expect("free version should be present on the target");
|
||||
|
||||
assert_eq!(
|
||||
versions
|
||||
.versions
|
||||
.iter()
|
||||
.filter(|version| version.version_id == Some(version_id))
|
||||
.count(),
|
||||
1
|
||||
);
|
||||
assert!(migrated.tier_free_version());
|
||||
assert_eq!(migrated.transition_tier, "WARM-TIER");
|
||||
assert_eq!(migrated.transitioned_objname, "remote/object");
|
||||
}
|
||||
|
||||
#[tokio::test]
|
||||
async fn decommission_tier_free_version_resume_requires_write_quorum() {
|
||||
let set_disks = make_local_bucket_test_set_disks_with_drive_count(4).await;
|
||||
let bucket = "free-version-decommission-resume";
|
||||
let object = "object.txt";
|
||||
set_disks
|
||||
.make_bucket(bucket, &MakeBucketOptions::default())
|
||||
.await
|
||||
.expect("target bucket should exist before free-version migration");
|
||||
let mut free_version = FileInfo {
|
||||
name: object.to_string(),
|
||||
volume: bucket.to_string(),
|
||||
version_id: Some(Uuid::new_v4()),
|
||||
mod_time: Some(time::OffsetDateTime::now_utc()),
|
||||
deleted: true,
|
||||
transition_tier: "WARM-TIER".to_string(),
|
||||
transitioned_objname: "remote/object".to_string(),
|
||||
..Default::default()
|
||||
};
|
||||
free_version.set_tier_free_version();
|
||||
// Decoded free versions always carry the on-disk free-version
|
||||
// suffix alongside the in-memory tier marker; mirror that here so
|
||||
// the record satisfies delete-marker metadata validation.
|
||||
rustfs_utils::http::metadata_compat::insert_str(
|
||||
&mut free_version.metadata,
|
||||
rustfs_utils::http::metadata_compat::SUFFIX_FREE_VERSION,
|
||||
String::new(),
|
||||
);
|
||||
let opts = ObjectOptions::default();
|
||||
|
||||
let disks = set_disks.get_disks_internal().await;
|
||||
for disk in disks.iter().take(2).flatten() {
|
||||
disk.write_metadata("", bucket, object, free_version.clone())
|
||||
.await
|
||||
.expect("partial first attempt should leave equivalent metadata");
|
||||
}
|
||||
assert!(
|
||||
!set_disks
|
||||
.has_decommission_tier_free_version_write_quorum(bucket, object, &free_version, &opts)
|
||||
.await
|
||||
.expect("partial target metadata should remain valid"),
|
||||
"write-quorum-minus-one must not be accepted as an idempotent migration"
|
||||
);
|
||||
|
||||
disks[2]
|
||||
.as_ref()
|
||||
.expect("third target disk should be online")
|
||||
.write_metadata("", bucket, object, free_version.clone())
|
||||
.await
|
||||
.expect("third equivalent target write should complete quorum");
|
||||
assert!(
|
||||
set_disks
|
||||
.has_decommission_tier_free_version_write_quorum(bucket, object, &free_version, &opts)
|
||||
.await
|
||||
.expect("write-quorum target metadata should remain valid")
|
||||
);
|
||||
}
|
||||
|
||||
#[test]
|
||||
fn decommission_tier_free_version_commit_rejects_lost_fence() {
|
||||
let opts = ObjectOptions {
|
||||
namespace_lock_fence: Some(NamespaceLockFence::lost_for_test()),
|
||||
..Default::default()
|
||||
};
|
||||
|
||||
let err = ensure_decommission_tier_free_version_commit_fence("bucket", "object", &opts)
|
||||
.expect_err("lost target lock must fail the free-version commit");
|
||||
assert!(matches!(
|
||||
err,
|
||||
Error::NamespaceLockQuorumUnavailable {
|
||||
mode: "decommission_tier_free_version_commit",
|
||||
required: 1,
|
||||
achieved: 0,
|
||||
..
|
||||
}
|
||||
));
|
||||
}
|
||||
|
||||
#[test]
|
||||
fn test_resolve_tiered_decommission_write_quorum_result_allows_successful_quorum() {
|
||||
let errs = vec![None, None, Some(DiskError::DiskNotFound), None];
|
||||
|
||||
@@ -553,6 +553,8 @@ mod tests {
|
||||
should_retry_format_load, should_retry_local_decommission_resume, wait_for_local_decommission_resume_delay,
|
||||
};
|
||||
#[cfg(feature = "test-util")]
|
||||
use crate::disk::DiskAPI;
|
||||
#[cfg(feature = "test-util")]
|
||||
use crate::{
|
||||
bucket::lifecycle::{
|
||||
lifecycle::{TRANSITION_PENDING, TransitionOptions},
|
||||
@@ -1307,6 +1309,77 @@ mod tests {
|
||||
});
|
||||
}
|
||||
|
||||
#[cfg(feature = "test-util")]
|
||||
async fn seed_transitioned_free_version(
|
||||
ctx: &Arc<crate::runtime::instance::InstanceContext>,
|
||||
store: &Arc<crate::store::ECStore>,
|
||||
bucket: &str,
|
||||
object: &str,
|
||||
) -> (uuid::Uuid, uuid::Uuid) {
|
||||
let tier_name = format!("DECOMFREE{}", uuid::Uuid::new_v4().simple());
|
||||
register_mock_tier(&ctx.tier_config_mgr(), &tier_name).await;
|
||||
|
||||
let mut reader = PutObjReader::from_vec(b"transitioned source bytes".to_vec());
|
||||
let source = store.pools[0]
|
||||
.put_object(
|
||||
bucket,
|
||||
object,
|
||||
&mut reader,
|
||||
&ObjectOptions {
|
||||
versioned: true,
|
||||
..Default::default()
|
||||
},
|
||||
)
|
||||
.await
|
||||
.expect("write transitioned decommission source");
|
||||
let source_version = source.version_id.expect("transitioned source must be versioned");
|
||||
store.pools[0]
|
||||
.transition_object(
|
||||
bucket,
|
||||
object,
|
||||
&ObjectOptions {
|
||||
versioned: true,
|
||||
version_id: Some(source_version.to_string()),
|
||||
transition: TransitionOptions {
|
||||
status: TRANSITION_PENDING.to_string(),
|
||||
tier: tier_name,
|
||||
etag: source.etag.clone().expect("transitioned source must have an ETag"),
|
||||
..Default::default()
|
||||
},
|
||||
mod_time: source.mod_time,
|
||||
..Default::default()
|
||||
},
|
||||
)
|
||||
.await
|
||||
.expect("transition source before decommission");
|
||||
store.pools[0]
|
||||
.delete_object(
|
||||
bucket,
|
||||
object,
|
||||
ObjectOptions {
|
||||
versioned: true,
|
||||
version_id: Some(source_version.to_string()),
|
||||
..Default::default()
|
||||
},
|
||||
)
|
||||
.await
|
||||
.expect("delete transitioned source version");
|
||||
|
||||
let versions = store.pools[0]
|
||||
.get_disks_by_key(object)
|
||||
.load_file_info_versions_exact(bucket, object)
|
||||
.await
|
||||
.expect("source versions should decode after transition delete")
|
||||
.expect("source free version should remain after transition delete");
|
||||
let free_version = versions
|
||||
.versions
|
||||
.iter()
|
||||
.find(|version| version.tier_free_version())
|
||||
.and_then(|version| version.version_id)
|
||||
.expect("transition delete should create a free version");
|
||||
(source_version, free_version)
|
||||
}
|
||||
|
||||
async fn write_decommission_test_multipart_source(
|
||||
store: &Arc<crate::store::ECStore>,
|
||||
pool_idx: usize,
|
||||
@@ -3846,6 +3919,383 @@ mod tests {
|
||||
shutdown.cancel();
|
||||
}
|
||||
|
||||
#[cfg(feature = "test-util")]
|
||||
#[tokio::test(flavor = "multi_thread", worker_threads = 2)]
|
||||
#[serial_test::serial(storage_class_env)]
|
||||
async fn decommission_entry_skips_cleanup_only_marker_when_free_version_is_present() {
|
||||
let temp_dir = tempfile::tempdir().expect("create free-version decommission store dir");
|
||||
let (ctx, store, shutdown) =
|
||||
without_storage_class_env(build_isolated_test_store(temp_dir.path(), "decommission-free-marker", &[4, 4])).await;
|
||||
crate::bucket::metadata_sys::init_bucket_metadata_sys(store.clone(), Vec::new()).await;
|
||||
let bucket = format!("decom-free-marker-{}", uuid::Uuid::new_v4());
|
||||
let object = "free-marker-object";
|
||||
store
|
||||
.make_bucket(&bucket, &MakeBucketOptions::default())
|
||||
.await
|
||||
.expect("create free-version decommission bucket");
|
||||
let (_, free_version) = seed_transitioned_free_version(&ctx, &store, &bucket, object).await;
|
||||
let source_free = store.pools[0]
|
||||
.get_disks_by_key(object)
|
||||
.load_file_info_versions_exact(&bucket, object)
|
||||
.await
|
||||
.expect("source free-version metadata should decode")
|
||||
.and_then(|versions| {
|
||||
versions
|
||||
.versions
|
||||
.into_iter()
|
||||
.find(|version| version.version_id == Some(free_version) && version.tier_free_version())
|
||||
})
|
||||
.expect("source free-version identity should be present before decommission");
|
||||
let mut target_reader = PutObjReader::from_vec(b"target ordinary bytes".to_vec());
|
||||
let target_w = store.pools[1]
|
||||
.put_object(
|
||||
&bucket,
|
||||
object,
|
||||
&mut target_reader,
|
||||
&ObjectOptions {
|
||||
versioned: true,
|
||||
..Default::default()
|
||||
},
|
||||
)
|
||||
.await
|
||||
.expect("write unrelated target version");
|
||||
let target_w_version = target_w.version_id.expect("target version should have an id");
|
||||
let marker = store.pools[0]
|
||||
.delete_object(
|
||||
&bucket,
|
||||
object,
|
||||
ObjectOptions {
|
||||
versioned: true,
|
||||
..Default::default()
|
||||
},
|
||||
)
|
||||
.await
|
||||
.expect("write cleanup-only delete marker");
|
||||
assert!(marker.delete_marker);
|
||||
|
||||
mark_test_pool_decommissioning(&store, 0).await;
|
||||
let source_set = store.pools[0].get_disks_by_key(object);
|
||||
store
|
||||
.decommission_entry_for_test_with_bucket_incarnation(
|
||||
0,
|
||||
MetaCacheEntry {
|
||||
name: object.to_string(),
|
||||
..Default::default()
|
||||
},
|
||||
bucket.clone(),
|
||||
source_set.clone(),
|
||||
)
|
||||
.await
|
||||
.expect("real decommission entry should migrate the free version");
|
||||
|
||||
let target_versions = store.pools[1]
|
||||
.get_disks_by_key(object)
|
||||
.load_file_info_versions_exact(&bucket, object)
|
||||
.await
|
||||
.expect("target versions should decode")
|
||||
.expect("target free version should be present");
|
||||
assert!(
|
||||
target_versions
|
||||
.versions
|
||||
.iter()
|
||||
.any(|version| { version.version_id == Some(free_version) && version.tier_free_version() })
|
||||
);
|
||||
let migrated_free = target_versions
|
||||
.versions
|
||||
.iter()
|
||||
.find(|version| version.version_id == Some(free_version) && version.tier_free_version())
|
||||
.expect("migrated free-version identity should remain readable from target disks");
|
||||
assert!(
|
||||
crate::store::tiered_data_movement_source_matches(&source_free, migrated_free)
|
||||
.expect("migrated free-version identity should decode")
|
||||
);
|
||||
let retained_w = target_versions
|
||||
.versions
|
||||
.iter()
|
||||
.find(|version| version.version_id == Some(target_w_version))
|
||||
.expect("unrelated target version should remain");
|
||||
assert!(!retained_w.deleted && !retained_w.tier_free_version());
|
||||
assert_eq!(retained_w.size, target_w.size);
|
||||
assert_eq!(retained_w.get_etag(), target_w.etag);
|
||||
assert!(
|
||||
target_versions
|
||||
.versions
|
||||
.iter()
|
||||
.all(|version| { version.tier_free_version() || !version.deleted })
|
||||
);
|
||||
assert!(
|
||||
source_set
|
||||
.load_file_info_versions_exact(&bucket, object)
|
||||
.await
|
||||
.expect("source versions should be readable after cleanup")
|
||||
.is_none(),
|
||||
"successful free-version migration should permit source cleanup"
|
||||
);
|
||||
let (heal_versions, _, _) = store
|
||||
.heal_walk_versions_page(1, 0, &bucket, "", None, 2, 16, true)
|
||||
.await
|
||||
.expect("heal walk should decode the migrated free version");
|
||||
let free_version_string = free_version.to_string();
|
||||
let healed_free = heal_versions
|
||||
.iter()
|
||||
.find(|version| version.version_id.as_deref() == Some(free_version_string.as_str()))
|
||||
.expect("heal walk should surface the migrated free version");
|
||||
let healed_info = healed_free
|
||||
.lifecycle_object_info
|
||||
.as_ref()
|
||||
.expect("heal walk should retain lifecycle identity for the migrated free version");
|
||||
assert!(healed_info.transitioned_object.free_version);
|
||||
assert_eq!(healed_info.transitioned_object.tier, source_free.transition_tier);
|
||||
assert_eq!(healed_info.transitioned_object.name, source_free.transitioned_objname);
|
||||
shutdown.cancel();
|
||||
}
|
||||
|
||||
#[cfg(feature = "test-util")]
|
||||
#[tokio::test(flavor = "multi_thread", worker_threads = 2)]
|
||||
#[serial_test::serial(storage_class_env)]
|
||||
async fn decommission_entry_allows_free_version_consumed_before_source_lock() {
|
||||
let temp_dir = tempfile::tempdir().expect("create consumed free-version store dir");
|
||||
let (ctx, store, shutdown) =
|
||||
without_storage_class_env(build_isolated_test_store(temp_dir.path(), "decommission-free-consumed", &[4, 4])).await;
|
||||
crate::bucket::metadata_sys::init_bucket_metadata_sys(store.clone(), Vec::new()).await;
|
||||
let bucket = format!("decom-free-consumed-{}", uuid::Uuid::new_v4());
|
||||
let object = "free-consumed-object";
|
||||
store
|
||||
.make_bucket(&bucket, &MakeBucketOptions::default())
|
||||
.await
|
||||
.expect("create consumed free-version bucket");
|
||||
let (_, free_version) = seed_transitioned_free_version(&ctx, &store, &bucket, object).await;
|
||||
|
||||
mark_test_pool_decommissioning(&store, 0).await;
|
||||
let source_set = store.pools[0].get_disks_by_key(object);
|
||||
let barrier = crate::store::object::DecommissionFreeVersionSourceRaceBarrier::install(&bucket, object);
|
||||
let decommission = tokio::spawn({
|
||||
let store = store.clone();
|
||||
let bucket = bucket.clone();
|
||||
let source_set = source_set.clone();
|
||||
async move {
|
||||
store
|
||||
.decommission_entry_for_test_with_bucket_incarnation(
|
||||
0,
|
||||
MetaCacheEntry {
|
||||
name: object.to_string(),
|
||||
..Default::default()
|
||||
},
|
||||
bucket,
|
||||
source_set,
|
||||
)
|
||||
.await
|
||||
}
|
||||
});
|
||||
|
||||
barrier.wait_until_paused().await;
|
||||
store.pools[0]
|
||||
.delete_object(
|
||||
&bucket,
|
||||
object,
|
||||
ObjectOptions {
|
||||
versioned: true,
|
||||
version_id: Some(free_version.to_string()),
|
||||
incl_free_versions: true,
|
||||
..Default::default()
|
||||
},
|
||||
)
|
||||
.await
|
||||
.expect("lifecycle should consume the source free version before decommission locks it");
|
||||
assert!(
|
||||
source_set
|
||||
.load_file_info_versions_exact(&bucket, object)
|
||||
.await
|
||||
.expect("consumed source metadata should remain readable")
|
||||
.is_none(),
|
||||
"the lifecycle delete should remove the source free version"
|
||||
);
|
||||
|
||||
barrier.release();
|
||||
decommission
|
||||
.await
|
||||
.expect("decommission task should join")
|
||||
.expect("a concurrently consumed free version should not fail source cleanup");
|
||||
assert!(
|
||||
store.pools[1]
|
||||
.get_disks_by_key(object)
|
||||
.load_file_info_versions_exact(&bucket, object)
|
||||
.await
|
||||
.expect("target metadata should remain readable")
|
||||
.is_none(),
|
||||
"an already consumed free version should not be recreated on the target"
|
||||
);
|
||||
shutdown.cancel();
|
||||
}
|
||||
|
||||
#[cfg(feature = "test-util")]
|
||||
#[tokio::test(flavor = "multi_thread", worker_threads = 2)]
|
||||
#[serial_test::serial(storage_class_env)]
|
||||
async fn decommission_entry_rejects_subquorum_free_version_conflict_and_retains_source() {
|
||||
let temp_dir = tempfile::tempdir().expect("create sub-quorum free-version store dir");
|
||||
let (ctx, store, shutdown) =
|
||||
without_storage_class_env(build_isolated_test_store(temp_dir.path(), "decommission-free-conflict", &[4, 4])).await;
|
||||
crate::bucket::metadata_sys::init_bucket_metadata_sys(store.clone(), Vec::new()).await;
|
||||
let bucket = format!("decom-free-conflict-{}", uuid::Uuid::new_v4());
|
||||
let object = "free-conflict-object";
|
||||
store
|
||||
.make_bucket(&bucket, &MakeBucketOptions::default())
|
||||
.await
|
||||
.expect("create sub-quorum conflict bucket");
|
||||
let (_, free_version) = seed_transitioned_free_version(&ctx, &store, &bucket, object).await;
|
||||
let source_free = store.pools[0]
|
||||
.get_disks_by_key(object)
|
||||
.load_file_info_versions_exact(&bucket, object)
|
||||
.await
|
||||
.expect("source free version should decode before crash replay setup")
|
||||
.and_then(|versions| {
|
||||
versions
|
||||
.versions
|
||||
.into_iter()
|
||||
.find(|version| version.version_id == Some(free_version))
|
||||
})
|
||||
.expect("source free version should be available for crash replay setup");
|
||||
|
||||
let mut target_reader = PutObjReader::from_vec(b"target ordinary bytes".to_vec());
|
||||
let target = store.pools[1]
|
||||
.put_object(
|
||||
&bucket,
|
||||
object,
|
||||
&mut target_reader,
|
||||
&ObjectOptions {
|
||||
versioned: true,
|
||||
..Default::default()
|
||||
},
|
||||
)
|
||||
.await
|
||||
.expect("seed ordinary target version");
|
||||
let target_version = target.version_id.expect("target version must have an ID");
|
||||
let target_disks = store.pools[1].get_disks_by_key(object).disks.read().await.clone();
|
||||
for disk in target_disks.iter().skip(1) {
|
||||
disk.as_ref()
|
||||
.expect("target crash replay quorum disk should be online")
|
||||
.write_metadata("", &bucket, object, source_free.clone())
|
||||
.await
|
||||
.expect("seed an equivalent free version on the target quorum");
|
||||
}
|
||||
let conflict_path = temp_dir
|
||||
.path()
|
||||
.join(format!("pool1/set0/disk0/{bucket}/{object}/{STORAGE_FORMAT_FILE}"));
|
||||
let encoded = tokio::fs::read(&conflict_path)
|
||||
.await
|
||||
.expect("target metadata should be readable");
|
||||
let mut metadata = FileMeta::load(&encoded).expect("target metadata should decode");
|
||||
let target_index = metadata
|
||||
.versions
|
||||
.iter()
|
||||
.position(|version| version.header.version_id == Some(target_version))
|
||||
.expect("target version should be present on the conflict disk");
|
||||
let mut target_meta = metadata.versions[target_index]
|
||||
.parse_version_meta()
|
||||
.expect("target version metadata should decode");
|
||||
target_meta
|
||||
.object
|
||||
.as_mut()
|
||||
.expect("target conflict must remain an ordinary object")
|
||||
.version_id = Some(free_version);
|
||||
metadata.versions[target_index] = target_meta.try_into().expect("conflict metadata should encode");
|
||||
let expected_conflict_meta = metadata.versions[target_index].meta.clone();
|
||||
let expected_conflict = metadata.versions[target_index]
|
||||
.into_fileinfo(&bucket, object, true)
|
||||
.expect("conflict metadata should decode as an ordinary object");
|
||||
let duplicate_free: rustfs_filemeta::FileMetaShallowVersion = rustfs_filemeta::FileMetaVersion::from(source_free.clone())
|
||||
.try_into()
|
||||
.expect("duplicate free metadata should encode");
|
||||
metadata.versions.insert(target_index, duplicate_free);
|
||||
tokio::fs::write(&conflict_path, metadata.marshal_msg().expect("conflict metadata should encode"))
|
||||
.await
|
||||
.expect("write sub-quorum conflict metadata");
|
||||
|
||||
mark_test_pool_decommissioning(&store, 0).await;
|
||||
let source_set = store.pools[0].get_disks_by_key(object);
|
||||
store
|
||||
.decommission_entry_for_test_with_bucket_incarnation(
|
||||
0,
|
||||
MetaCacheEntry {
|
||||
name: object.to_string(),
|
||||
..Default::default()
|
||||
},
|
||||
bucket.clone(),
|
||||
source_set.clone(),
|
||||
)
|
||||
.await
|
||||
.expect("conflicted decommission entry should retain the source and retry later");
|
||||
|
||||
let source_versions = source_set
|
||||
.load_file_info_versions_exact(&bucket, object)
|
||||
.await
|
||||
.expect("retained source versions should decode")
|
||||
.expect("source free version should be retained after conflict");
|
||||
assert!(
|
||||
source_versions
|
||||
.versions
|
||||
.iter()
|
||||
.any(|version| { version.version_id == Some(free_version) && version.tier_free_version() })
|
||||
);
|
||||
let post_encoded = tokio::fs::read(&conflict_path)
|
||||
.await
|
||||
.expect("conflict metadata should remain readable");
|
||||
let post_metadata = FileMeta::load(&post_encoded).expect("post-conflict metadata should decode");
|
||||
let same_id = post_metadata
|
||||
.versions
|
||||
.iter()
|
||||
.filter(|version| version.header.version_id == Some(free_version))
|
||||
.collect::<Vec<_>>();
|
||||
assert_eq!(same_id.len(), 2, "conflict metadata should retain both same-ID records");
|
||||
assert_eq!(same_id.iter().filter(|version| version.header.free_version()).count(), 1);
|
||||
assert_eq!(same_id.iter().filter(|version| !version.header.free_version()).count(), 1);
|
||||
let post_conflict = same_id
|
||||
.into_iter()
|
||||
.find(|version| !version.header.free_version())
|
||||
.expect("ordinary conflict version must remain addressable by the source ID");
|
||||
let post_conflict_info = post_conflict
|
||||
.into_fileinfo(&bucket, object, true)
|
||||
.expect("post-conflict ordinary metadata should decode");
|
||||
assert!(!post_conflict_info.deleted && !post_conflict_info.tier_free_version());
|
||||
assert_eq!(post_conflict.meta, expected_conflict_meta);
|
||||
assert_eq!(post_conflict_info.size, expected_conflict.size);
|
||||
assert_eq!(post_conflict_info.data_dir, expected_conflict.data_dir);
|
||||
assert_eq!(post_conflict_info.metadata, expected_conflict.metadata);
|
||||
assert_eq!(post_conflict_info.get_etag(), expected_conflict.get_etag());
|
||||
|
||||
for disk_index in 0..4 {
|
||||
let target_path = temp_dir
|
||||
.path()
|
||||
.join(format!("pool1/set0/disk{disk_index}/{bucket}/{object}/{STORAGE_FORMAT_FILE}"));
|
||||
let target_encoded = tokio::fs::read(&target_path)
|
||||
.await
|
||||
.expect("target metadata should remain readable");
|
||||
let target_meta = FileMeta::load(&target_encoded).expect("target metadata should decode");
|
||||
let same_id = target_meta
|
||||
.versions
|
||||
.iter()
|
||||
.filter(|version| version.header.version_id == Some(free_version))
|
||||
.collect::<Vec<_>>();
|
||||
if disk_index == 0 {
|
||||
assert_eq!(same_id.len(), 2);
|
||||
assert!(same_id[0].header.free_version());
|
||||
assert!(!same_id[1].header.free_version());
|
||||
} else {
|
||||
assert_eq!(same_id.len(), 1);
|
||||
assert!(same_id[0].header.free_version());
|
||||
}
|
||||
}
|
||||
let sweep_err = store
|
||||
.check_after_decommission_for_test(0)
|
||||
.await
|
||||
.expect_err("final sweep must report the retained free version");
|
||||
assert!(
|
||||
sweep_err.to_string().contains("version(s) were found"),
|
||||
"unexpected final sweep error: {sweep_err}"
|
||||
);
|
||||
shutdown.cancel();
|
||||
}
|
||||
|
||||
#[tokio::test(flavor = "multi_thread", worker_threads = 2)]
|
||||
#[serial_test::serial(storage_class_env)]
|
||||
async fn versioned_batch_delete_marker_skips_decommission_source() {
|
||||
|
||||
@@ -151,7 +151,7 @@ pub(crate) mod init_format;
|
||||
pub(crate) mod list_objects;
|
||||
mod multipart;
|
||||
mod object;
|
||||
pub(crate) use object::{ObjectLockDiagGuard, SourceCleanupMutationFence};
|
||||
pub(crate) use object::{ObjectLockDiagGuard, SourceCleanupMutationFence, tiered_data_movement_source_matches};
|
||||
pub use object::{
|
||||
PrepareSelectObjectSnapshotError, PreparedGetObjectReader, SelectObjectSnapshot, SelectObjectSnapshotReadError,
|
||||
SnapshotConsistencyError,
|
||||
|
||||
@@ -490,6 +490,82 @@ fn decommission_mutation_fence_for_test(
|
||||
.map(|hook| hook.fence.clone())
|
||||
}
|
||||
|
||||
#[cfg(test)]
|
||||
struct DecommissionFreeVersionSourceRaceState {
|
||||
bucket: String,
|
||||
object: String,
|
||||
arrived: tokio::sync::Notify,
|
||||
release: tokio::sync::Notify,
|
||||
}
|
||||
|
||||
#[cfg(test)]
|
||||
pub(crate) struct DecommissionFreeVersionSourceRaceBarrier {
|
||||
state: Arc<DecommissionFreeVersionSourceRaceState>,
|
||||
}
|
||||
|
||||
#[cfg(test)]
|
||||
static DECOMMISSION_FREE_VERSION_SOURCE_RACE_BARRIER: std::sync::OnceLock<
|
||||
std::sync::Mutex<Option<Arc<DecommissionFreeVersionSourceRaceState>>>,
|
||||
> = std::sync::OnceLock::new();
|
||||
|
||||
#[cfg(test)]
|
||||
impl DecommissionFreeVersionSourceRaceBarrier {
|
||||
pub(crate) fn install(bucket: &str, object: &str) -> Self {
|
||||
let state = Arc::new(DecommissionFreeVersionSourceRaceState {
|
||||
bucket: bucket.to_string(),
|
||||
object: object.to_string(),
|
||||
arrived: tokio::sync::Notify::new(),
|
||||
release: tokio::sync::Notify::new(),
|
||||
});
|
||||
let mut slot = DECOMMISSION_FREE_VERSION_SOURCE_RACE_BARRIER
|
||||
.get_or_init(|| std::sync::Mutex::new(None))
|
||||
.lock()
|
||||
.expect("decommission free-version source race barrier should not poison");
|
||||
assert!(slot.is_none(), "decommission free-version source race barrier must be unique");
|
||||
*slot = Some(Arc::clone(&state));
|
||||
Self { state }
|
||||
}
|
||||
|
||||
pub(crate) async fn wait_until_paused(&self) {
|
||||
tokio::time::timeout(Duration::from_secs(30), self.state.arrived.notified())
|
||||
.await
|
||||
.expect("decommission should pause before acquiring the free-version source lock");
|
||||
}
|
||||
|
||||
pub(crate) fn release(&self) {
|
||||
self.state.release.notify_one();
|
||||
}
|
||||
}
|
||||
|
||||
#[cfg(test)]
|
||||
impl Drop for DecommissionFreeVersionSourceRaceBarrier {
|
||||
fn drop(&mut self) {
|
||||
self.state.release.notify_one();
|
||||
let mut slot = DECOMMISSION_FREE_VERSION_SOURCE_RACE_BARRIER
|
||||
.get_or_init(|| std::sync::Mutex::new(None))
|
||||
.lock()
|
||||
.expect("decommission free-version source race barrier should not poison");
|
||||
if slot.as_ref().is_some_and(|state| Arc::ptr_eq(state, &self.state)) {
|
||||
*slot = None;
|
||||
}
|
||||
}
|
||||
}
|
||||
|
||||
#[cfg(test)]
|
||||
async fn pause_decommission_free_version_before_source_lock(bucket: &str, object: &str) {
|
||||
let state = DECOMMISSION_FREE_VERSION_SOURCE_RACE_BARRIER
|
||||
.get_or_init(|| std::sync::Mutex::new(None))
|
||||
.lock()
|
||||
.expect("decommission free-version source race barrier should not poison")
|
||||
.as_ref()
|
||||
.filter(|state| state.bucket == bucket && state.object == object)
|
||||
.cloned();
|
||||
if let Some(state) = state {
|
||||
state.arrived.notify_one();
|
||||
state.release.notified().await;
|
||||
}
|
||||
}
|
||||
|
||||
pub(crate) struct SourceCleanupMutationFence {
|
||||
guard: ObjectLockDiagGuard,
|
||||
source_lock_covered: bool,
|
||||
@@ -1494,13 +1570,15 @@ fn is_equivalent_data_movement_tiered_object(source: &rustfs_filemeta::FileInfo,
|
||||
&& source_actual_size == target_actual_size
|
||||
}
|
||||
|
||||
fn tiered_data_movement_source_matches(
|
||||
pub(crate) fn tiered_data_movement_source_matches(
|
||||
expected: &rustfs_filemeta::FileInfo,
|
||||
current: &rustfs_filemeta::FileInfo,
|
||||
) -> Result<bool> {
|
||||
let expected_backend = crate::services::tier::tier::tier_destination_id_from_metadata(&expected.metadata)?;
|
||||
let current_backend = crate::services::tier::tier::tier_destination_id_from_metadata(¤t.metadata)?;
|
||||
Ok(expected.version_id == current.version_id
|
||||
&& expected.deleted == current.deleted
|
||||
&& expected.tier_free_version() == current.tier_free_version()
|
||||
&& expected.data_dir == current.data_dir
|
||||
&& expected.mod_time == current.mod_time
|
||||
&& expected.size == current.size
|
||||
@@ -1514,6 +1592,15 @@ fn tiered_data_movement_source_matches(
|
||||
&& expected_backend == current_backend)
|
||||
}
|
||||
|
||||
fn decommission_free_version_overwrite_error(bucket: &str, object: &str, version_id: Option<Uuid>) -> Error {
|
||||
StorageError::DataMovementOverwriteErr(
|
||||
bucket.to_owned(),
|
||||
object.to_owned(),
|
||||
version_id.map(|id| id.to_string()).unwrap_or_default(),
|
||||
)
|
||||
.into()
|
||||
}
|
||||
|
||||
fn should_check_data_movement_resume_target(src_pool_idx: usize, target_pool_idx: usize) -> bool {
|
||||
target_pool_idx != src_pool_idx
|
||||
}
|
||||
@@ -2221,6 +2308,23 @@ impl ECStore {
|
||||
)
|
||||
}
|
||||
|
||||
async fn has_equivalent_data_movement_tier_free_version(
|
||||
&self,
|
||||
bucket: &str,
|
||||
object: &str,
|
||||
source: &rustfs_filemeta::FileInfo,
|
||||
opts: &ObjectOptions,
|
||||
target_pool_idx: usize,
|
||||
) -> Result<bool> {
|
||||
let pool = self
|
||||
.pools
|
||||
.get(target_pool_idx)
|
||||
.ok_or_else(|| Error::other(format!("invalid tiered data movement target pool {target_pool_idx}")))?;
|
||||
pool.get_disks_by_key(object)
|
||||
.has_decommission_tier_free_version_write_quorum(bucket, object, source, opts)
|
||||
.await
|
||||
}
|
||||
|
||||
fn resolve_decommission_target_pool_idx_result(result: Result<usize>, bucket: &str, object: &str) -> Result<usize> {
|
||||
result.map_err(|err| Error::other(format!("failed to select decommission target pool for {bucket}/{object}: {err}")))
|
||||
}
|
||||
@@ -2240,6 +2344,10 @@ impl ECStore {
|
||||
check_put_object_args(bucket, object)?;
|
||||
|
||||
let mut opts = opts.clone();
|
||||
let is_free_version = fi.tier_free_version();
|
||||
if is_free_version {
|
||||
opts.incl_free_versions = true;
|
||||
}
|
||||
let bucket_incarnation_fence = if is_meta_bucketname(bucket) {
|
||||
None
|
||||
} else {
|
||||
@@ -2277,6 +2385,10 @@ impl ECStore {
|
||||
&object,
|
||||
)?
|
||||
};
|
||||
#[cfg(test)]
|
||||
if is_free_version {
|
||||
pause_decommission_free_version_before_source_lock(bucket, logical_object).await;
|
||||
}
|
||||
let _object_guards = self
|
||||
.acquire_data_movement_object_write_locks(bucket, &object, opts.src_pool_idx, idx, &mut opts)
|
||||
.await?;
|
||||
@@ -2294,7 +2406,7 @@ impl ECStore {
|
||||
versions
|
||||
.versions
|
||||
.iter()
|
||||
.find(|current| current.version_id == fi.version_id && !current.tier_free_version())
|
||||
.find(|current| current.version_id == fi.version_id && current.tier_free_version() == is_free_version)
|
||||
})
|
||||
.ok_or_else(|| to_object_err(StorageError::FileNotFound, vec![bucket, object.as_str()]))?;
|
||||
if !tiered_data_movement_source_matches(fi, current_source)? {
|
||||
@@ -2309,24 +2421,40 @@ impl ECStore {
|
||||
.get_available_pool_idx_excluding(bucket, &object, fi.size, opts.src_pool_idx)
|
||||
.await;
|
||||
let target_pool_idx = resolve_data_movement_resume_target_pool(idx, resume_target_pool_idx, opts.src_pool_idx);
|
||||
if is_free_version && target_pool_idx == opts.src_pool_idx {
|
||||
return Err(Error::DiskFull);
|
||||
}
|
||||
let equivalent = if is_free_version {
|
||||
self.has_equivalent_data_movement_tier_free_version(bucket, &object, &fi, &opts, target_pool_idx)
|
||||
.await?
|
||||
} else {
|
||||
self.has_equivalent_data_movement_tiered_object(bucket, &object, &fi, &opts, target_pool_idx)
|
||||
.await?
|
||||
};
|
||||
if equivalent {
|
||||
return Ok(());
|
||||
}
|
||||
|
||||
return Err(decommission_free_version_overwrite_error(bucket, &object, fi.version_id));
|
||||
}
|
||||
|
||||
let result = if is_free_version {
|
||||
if self
|
||||
.has_equivalent_data_movement_tiered_object(bucket, &object, &fi, &opts, target_pool_idx)
|
||||
.has_equivalent_data_movement_tier_free_version(bucket, &object, &fi, &opts, idx)
|
||||
.await?
|
||||
{
|
||||
return Ok(());
|
||||
}
|
||||
|
||||
return Err(StorageError::DataMovementOverwriteErr(
|
||||
bucket.to_owned(),
|
||||
object.to_owned(),
|
||||
opts.version_id.clone().unwrap_or_default(),
|
||||
));
|
||||
}
|
||||
|
||||
let result = self.pools[idx]
|
||||
.get_disks_by_key(&object)
|
||||
.decommission_tiered_object(bucket, &object, &fi, &opts)
|
||||
.await;
|
||||
self.pools[idx]
|
||||
.get_disks_by_key(&object)
|
||||
.decommission_tier_free_version(bucket, &object, &fi, &opts)
|
||||
.await
|
||||
} else {
|
||||
self.pools[idx]
|
||||
.get_disks_by_key(&object)
|
||||
.decommission_tiered_object(bucket, &object, &fi, &opts)
|
||||
.await
|
||||
};
|
||||
if matches!(result, Err(Error::PreconditionFailed)) {
|
||||
if self
|
||||
.has_equivalent_data_movement_tiered_object(bucket, &object, &fi, &opts, idx)
|
||||
|
||||
@@ -90,6 +90,21 @@ fn legacy_data_key_for_version(version_id: Option<Uuid>) -> Option<String> {
|
||||
pub const TRANSITION_COMPLETE: &str = "complete";
|
||||
pub const TRANSITION_PENDING: &str = "pending";
|
||||
|
||||
/// xl.meta key marking a tier free-version record.
|
||||
///
|
||||
/// A free version is a delete-marker-shaped cleanup hint appended by
|
||||
/// [`MetaObject::delete_version`] when a version whose remote transition
|
||||
/// completed is removed from xl.meta; it carries the remote tier identity for
|
||||
/// an idempotent remote delete and is never a user-visible version
|
||||
/// (`num_versions` excludes it). While the record exists it is consumed by the
|
||||
/// lifecycle free-version recovery scan and the usage scanner, which re-enqueue
|
||||
/// the pending remote delete, and by heal metadata walks. On S3 and lifecycle
|
||||
/// delete paths the same obligation is also carried by a committed tier-journal
|
||||
/// entry; deletes without such an entry (for example a removed version whose
|
||||
/// transition state decodes as unknown) rely on this record alone until the
|
||||
/// worker removes it after a successful remote delete. Decommission preserves
|
||||
/// the record and its remote identity on the target pool before source cleanup
|
||||
/// — see docs/architecture/decommission-compatibility.md.
|
||||
pub const FREE_VERSION: &str = "free-version";
|
||||
|
||||
pub const TRANSITION_STATUS: &str = "transition-status";
|
||||
@@ -447,6 +462,10 @@ impl FileMeta {
|
||||
};
|
||||
|
||||
if let Some(fidx) = existing_idx {
|
||||
let existing = self.versions[fidx].parse_version_meta()?;
|
||||
if existing.free_version() != version.free_version() {
|
||||
return Err(Error::other("cannot replace a free version with a non-free version"));
|
||||
}
|
||||
return self.set_idx(fidx, version);
|
||||
}
|
||||
|
||||
|
||||
@@ -2725,6 +2725,15 @@ impl MetaObject {
|
||||
self.meta_sys.retain(|k, _| !k.starts_with("X-Amz-Restore"));
|
||||
}
|
||||
|
||||
/// Builds the free-version cleanup record appended when a transitioned
|
||||
/// version is removed from xl.meta. The record keeps the remote tier
|
||||
/// identity so the lifecycle worker can issue the idempotent remote delete
|
||||
/// and only then remove the record; until then the recovery scan and the
|
||||
/// usage scanner keep re-enqueueing it. S3 and lifecycle deletes also
|
||||
/// persist a committed tier-journal entry for the same remote delete. The
|
||||
/// decommission path copies this record unchanged before source cleanup,
|
||||
/// including when the transition state is unknown — see
|
||||
/// docs/architecture/decommission-compatibility.md.
|
||||
pub fn init_free_version(&self, fi: &FileInfo) -> Result<(FileMetaVersion, bool)> {
|
||||
if fi.skip_tier_free_version() {
|
||||
return Ok((FileMetaVersion::default(), false));
|
||||
|
||||
@@ -13,10 +13,10 @@
|
||||
// limitations under the License.
|
||||
|
||||
use crate::heal::{
|
||||
progress::{HealProgress, add_bytes, increment_counter},
|
||||
progress::HealProgress,
|
||||
resume::{
|
||||
CheckpointManager, CheckpointObjectOutcome, CheckpointObjectOutcomeRecord, ReplacementTargetIdentity, ResumeManager,
|
||||
ResumeUtils, compose_key, replacement_target_identities_match,
|
||||
CheckpointManager, ReplacementTargetIdentity, ResumeManager, ResumeUtils, compose_key,
|
||||
replacement_target_identities_match,
|
||||
},
|
||||
storage::{HealStorageAPI, next_heal_listing_token},
|
||||
task::{demote_to_debug_when, is_missing_object_dir_heal_result, take_failure_log_sample},
|
||||
@@ -410,9 +410,6 @@ impl ErasureSetHealer {
|
||||
&& state.successful_objects == 0
|
||||
&& state.failed_objects == 0
|
||||
&& state.skipped_objects == 0
|
||||
&& state.skipped_new_versions == 0
|
||||
&& state.skipped_ilm_expired == 0
|
||||
&& state.processed_bytes == 0
|
||||
{
|
||||
// schedule_retry persists the authoritative resume reset before
|
||||
// resetting the checkpoint. Reapply the checkpoint reset after
|
||||
@@ -477,23 +474,6 @@ impl ErasureSetHealer {
|
||||
|
||||
// 2. initialize progress
|
||||
self.initialize_progress(buckets, &state).await;
|
||||
let (baseline_known, baseline_count, baseline_size, baseline_generation) = {
|
||||
let baseline = self.progress.read().await;
|
||||
(
|
||||
baseline.baseline_known,
|
||||
baseline.objects_total_count,
|
||||
baseline.objects_total_size,
|
||||
baseline.baseline_generation,
|
||||
)
|
||||
};
|
||||
if baseline_known {
|
||||
resume_manager
|
||||
.set_progress_baseline(baseline_count, baseline_size, baseline_generation)
|
||||
.await?;
|
||||
checkpoint_manager
|
||||
.set_progress_baseline(baseline_count, baseline_size, baseline_generation)
|
||||
.await?;
|
||||
}
|
||||
|
||||
// 3. continue from checkpoint
|
||||
let current_bucket_index = checkpoint.current_bucket_index;
|
||||
@@ -503,66 +483,12 @@ impl ErasureSetHealer {
|
||||
let mut successful_objects = state.successful_objects;
|
||||
let mut failed_objects = state.failed_objects;
|
||||
let mut skipped_objects = state.skipped_objects;
|
||||
let checkpoint_has_progress = checkpoint.baseline_known
|
||||
|| checkpoint.successful_objects > 0
|
||||
|| checkpoint.failed_object_count > 0
|
||||
|| checkpoint.skipped_object_count > 0
|
||||
|| checkpoint.skipped_new_versions > 0
|
||||
|| checkpoint.skipped_ilm_expired > 0
|
||||
|| checkpoint.processed_bytes > 0
|
||||
|| checkpoint.total_objects > 0
|
||||
|| checkpoint.total_bytes > 0
|
||||
|| checkpoint.baseline_generation.is_some()
|
||||
|| checkpoint.counter_unknown;
|
||||
let checkpoint_generation_mismatch = checkpoint.baseline_known && checkpoint.baseline_generation != baseline_generation;
|
||||
let mut restored_counter_unknown = state.counter_unknown || checkpoint.counter_unknown;
|
||||
if checkpoint_has_progress {
|
||||
successful_objects = checkpoint.successful_objects;
|
||||
failed_objects = checkpoint.failed_object_count;
|
||||
skipped_objects = checkpoint.skipped_object_count;
|
||||
let restored_processed_objects = successful_objects
|
||||
.checked_add(failed_objects)
|
||||
.and_then(|value| value.checked_add(skipped_objects))
|
||||
.and_then(|value| value.checked_add(checkpoint.skipped_new_versions))
|
||||
.and_then(|value| value.checked_add(checkpoint.skipped_ilm_expired));
|
||||
let checkpoint_counter_overflow = restored_processed_objects.is_none();
|
||||
restored_counter_unknown |= checkpoint_counter_overflow;
|
||||
processed_objects = restored_processed_objects.unwrap_or(u64::MAX);
|
||||
let mut progress = self.progress.write().await;
|
||||
progress.objects_scanned = processed_objects;
|
||||
progress.objects_healed = successful_objects;
|
||||
progress.objects_failed = failed_objects;
|
||||
progress.skipped_objects = skipped_objects;
|
||||
progress.skipped_new_versions = checkpoint.skipped_new_versions;
|
||||
progress.skipped_ilm_expired = checkpoint.skipped_ilm_expired;
|
||||
if checkpoint.baseline_known && !checkpoint_generation_mismatch {
|
||||
progress.objects_total_count = checkpoint.total_objects;
|
||||
progress.objects_total_size = checkpoint.total_bytes;
|
||||
progress.baseline_generation = checkpoint.baseline_generation;
|
||||
progress.baseline_known = true;
|
||||
}
|
||||
progress.bytes_processed = checkpoint.processed_bytes;
|
||||
progress.counter_unknown = state.counter_unknown || checkpoint.counter_unknown;
|
||||
progress.refresh_progress_percentage();
|
||||
if checkpoint_generation_mismatch || checkpoint_counter_overflow || progress.counter_unknown {
|
||||
progress.mark_unknown();
|
||||
}
|
||||
}
|
||||
if checkpoint_generation_mismatch {
|
||||
restored_counter_unknown = true;
|
||||
}
|
||||
if restored_counter_unknown {
|
||||
checkpoint_manager.mark_counter_unknown().await?;
|
||||
resume_manager.mark_counter_unknown().await?;
|
||||
}
|
||||
let mut failed_buckets = 0u64;
|
||||
|
||||
// 4. process remaining buckets
|
||||
for (bucket_idx, bucket) in buckets.iter().enumerate().skip(current_bucket_index) {
|
||||
// check if completed
|
||||
if state.completed_buckets.contains(bucket) {
|
||||
checkpoint_manager.complete_bucket(bucket_idx.saturating_add(1)).await?;
|
||||
current_object_index = 0;
|
||||
continue;
|
||||
}
|
||||
|
||||
@@ -590,42 +516,13 @@ impl ErasureSetHealer {
|
||||
return bucket_result;
|
||||
}
|
||||
|
||||
// update progress
|
||||
let progress_snapshot = self.progress.read().await;
|
||||
let bytes_processed = progress_snapshot.bytes_processed;
|
||||
let skipped_new_versions = progress_snapshot.skipped_new_versions;
|
||||
let skipped_ilm_expired = progress_snapshot.skipped_ilm_expired;
|
||||
let counter_unknown = progress_snapshot.counter_unknown;
|
||||
drop(progress_snapshot);
|
||||
// The checkpoint is the recovery authority for object progress.
|
||||
// Publish its counters and fence before the resume summary so a
|
||||
// crash between the two stores cannot make recovery select newer
|
||||
// summary bytes with an older checkpoint ledger.
|
||||
if counter_unknown {
|
||||
checkpoint_manager.mark_counter_unknown().await?;
|
||||
}
|
||||
checkpoint_manager
|
||||
.update_progress(successful_objects, failed_objects, skipped_objects, bytes_processed)
|
||||
.await?;
|
||||
checkpoint_manager
|
||||
.set_skipped_version_counts(skipped_new_versions, skipped_ilm_expired)
|
||||
.await?;
|
||||
// update checkpoint position
|
||||
checkpoint_manager.update_position(bucket_idx, current_object_index).await?;
|
||||
|
||||
// update progress
|
||||
resume_manager
|
||||
.update_progress_with_bytes(
|
||||
processed_objects,
|
||||
successful_objects,
|
||||
failed_objects,
|
||||
skipped_objects,
|
||||
bytes_processed,
|
||||
)
|
||||
.update_progress(processed_objects, successful_objects, failed_objects, skipped_objects)
|
||||
.await?;
|
||||
resume_manager
|
||||
.set_skipped_version_counts(skipped_new_versions, skipped_ilm_expired)
|
||||
.await?;
|
||||
if counter_unknown {
|
||||
resume_manager.mark_counter_unknown().await?;
|
||||
}
|
||||
|
||||
// check cancel status
|
||||
if self.cancel_token.is_cancelled() {
|
||||
@@ -645,7 +542,6 @@ impl ErasureSetHealer {
|
||||
match bucket_result {
|
||||
Ok(_) => {
|
||||
resume_manager.complete_bucket(bucket).await?;
|
||||
checkpoint_manager.complete_bucket(bucket_idx.saturating_add(1)).await?;
|
||||
debug!(
|
||||
target: "rustfs::heal::erasure_healer",
|
||||
event = EVENT_HEAL_ERASURE_BUCKET_STATE,
|
||||
@@ -671,9 +567,7 @@ impl ErasureSetHealer {
|
||||
error = %e,
|
||||
"Erasure set bucket heal failed"
|
||||
);
|
||||
// A single durable cursor and ledger cannot safely preserve
|
||||
// this bucket while processing a later one.
|
||||
break;
|
||||
// continue to next bucket, do not interrupt the whole process
|
||||
}
|
||||
}
|
||||
|
||||
@@ -881,49 +775,20 @@ impl ErasureSetHealer {
|
||||
|
||||
// Per-version dedup identity — the single canonical key.
|
||||
let key = compose_key(&item.name, item.version_id.as_deref());
|
||||
if checkpoint.processed_objects.contains(&key)
|
||||
|| checkpoint.failed_objects.contains(&key)
|
||||
|| checkpoint.skipped_objects.contains(&key)
|
||||
{
|
||||
if checkpoint.processed_objects.contains(&key) || checkpoint.skipped_objects.contains(&key) {
|
||||
continue;
|
||||
}
|
||||
|
||||
if should_skip_new_version(item.mod_time_unix_nanos, started_at_secs) {
|
||||
let counter_ok = increment_counter(processed_objects);
|
||||
checkpoint_manager.add_processed_object(key).await?;
|
||||
*processed_objects = processed_objects.saturating_add(1);
|
||||
completed_in_page = completed_in_page.saturating_add(1);
|
||||
counter!("rustfs_heal_skipped_new_versions_total").increment(1);
|
||||
let (outcome_record, counter_unknown) = {
|
||||
{
|
||||
let mut progress = self.progress.write().await;
|
||||
progress.record_skipped_new_version();
|
||||
progress.set_current_object(Some(format!("skipped_new: {bucket}/{}", item.name)));
|
||||
progress.update_object_progress(
|
||||
*processed_objects,
|
||||
*successful_objects,
|
||||
*failed_objects,
|
||||
*skipped_objects,
|
||||
bytes_processed,
|
||||
);
|
||||
if !counter_ok {
|
||||
progress.mark_unknown();
|
||||
}
|
||||
(
|
||||
CheckpointObjectOutcomeRecord {
|
||||
object: key,
|
||||
outcome: CheckpointObjectOutcome::Processed,
|
||||
successful: progress.objects_healed,
|
||||
failed: progress.objects_failed,
|
||||
skipped: progress.skipped_objects,
|
||||
bytes: progress.bytes_processed,
|
||||
skipped_new_versions: progress.skipped_new_versions,
|
||||
skipped_ilm_expired: progress.skipped_ilm_expired,
|
||||
counter_unknown: progress.counter_unknown,
|
||||
},
|
||||
progress.counter_unknown,
|
||||
)
|
||||
};
|
||||
checkpoint_manager.record_object_outcome(outcome_record).await?;
|
||||
if counter_unknown {
|
||||
resume_manager.mark_counter_unknown().await?;
|
||||
progress.update_progress(*processed_objects, *successful_objects, *failed_objects, bytes_processed);
|
||||
}
|
||||
debug!(
|
||||
target: "rustfs::heal::erasure_healer",
|
||||
@@ -955,41 +820,15 @@ impl ErasureSetHealer {
|
||||
)
|
||||
.await?
|
||||
{
|
||||
let counter_ok = increment_counter(processed_objects);
|
||||
checkpoint_manager.add_processed_object(key).await?;
|
||||
*processed_objects = processed_objects.saturating_add(1);
|
||||
completed_in_page = completed_in_page.saturating_add(1);
|
||||
counter!("rustfs_heal_skipped_ilm_expired_total").increment(1);
|
||||
let (outcome_record, counter_unknown) = {
|
||||
{
|
||||
let mut progress = self.progress.write().await;
|
||||
progress.record_skipped_ilm_expired();
|
||||
progress.set_current_object(Some(format!("skipped_ilm: {bucket}/{}", item.name)));
|
||||
progress.update_object_progress(
|
||||
*processed_objects,
|
||||
*successful_objects,
|
||||
*failed_objects,
|
||||
*skipped_objects,
|
||||
bytes_processed,
|
||||
);
|
||||
if !counter_ok {
|
||||
progress.mark_unknown();
|
||||
}
|
||||
(
|
||||
CheckpointObjectOutcomeRecord {
|
||||
object: key,
|
||||
outcome: CheckpointObjectOutcome::Processed,
|
||||
successful: progress.objects_healed,
|
||||
failed: progress.objects_failed,
|
||||
skipped: progress.skipped_objects,
|
||||
bytes: progress.bytes_processed,
|
||||
skipped_new_versions: progress.skipped_new_versions,
|
||||
skipped_ilm_expired: progress.skipped_ilm_expired,
|
||||
counter_unknown: progress.counter_unknown,
|
||||
},
|
||||
progress.counter_unknown,
|
||||
)
|
||||
};
|
||||
checkpoint_manager.record_object_outcome(outcome_record).await?;
|
||||
if counter_unknown {
|
||||
resume_manager.mark_counter_unknown().await?;
|
||||
progress.update_progress(*processed_objects, *successful_objects, *failed_objects, bytes_processed);
|
||||
}
|
||||
debug!(
|
||||
target: "rustfs::heal::erasure_healer",
|
||||
@@ -1115,11 +954,11 @@ impl ErasureSetHealer {
|
||||
|
||||
while let Some((key, object, version_id, result)) = page_tasks.next().await {
|
||||
let (object_size, result) = result;
|
||||
let mut telemetry_unknown = false;
|
||||
let checkpoint_outcome = match result {
|
||||
match result {
|
||||
Ok(true) => {
|
||||
telemetry_unknown |= !increment_counter(successful_objects);
|
||||
telemetry_unknown |= !add_bytes(&mut bytes_processed, object_size);
|
||||
*successful_objects += 1;
|
||||
bytes_processed = bytes_processed.saturating_add(object_size);
|
||||
checkpoint_manager.add_processed_object(key).await?;
|
||||
debug!(
|
||||
target: "rustfs::heal::erasure_healer",
|
||||
event = EVENT_HEAL_ERASURE_OBJECT_STATE,
|
||||
@@ -1132,11 +971,11 @@ impl ErasureSetHealer {
|
||||
state = "healed",
|
||||
"Erasure set object healed"
|
||||
);
|
||||
CheckpointObjectOutcome::Processed
|
||||
}
|
||||
Ok(false) => {
|
||||
telemetry_unknown |= !increment_counter(successful_objects);
|
||||
telemetry_unknown |= !add_bytes(&mut bytes_processed, object_size);
|
||||
checkpoint_manager.add_processed_object(key).await?;
|
||||
*successful_objects += 1;
|
||||
bytes_processed = bytes_processed.saturating_add(object_size);
|
||||
debug!(
|
||||
target: "rustfs::heal::erasure_healer",
|
||||
event = EVENT_HEAL_ERASURE_OBJECT_STATE,
|
||||
@@ -1149,12 +988,12 @@ impl ErasureSetHealer {
|
||||
state = "missing_treated_as_ok",
|
||||
"Erasure set missing object treated as ok"
|
||||
);
|
||||
CheckpointObjectOutcome::Processed
|
||||
}
|
||||
Err(err @ Error::TaskCancelled) | Err(err @ Error::TaskTimeout) => return Err(err),
|
||||
Err(Error::TransientSkip { message }) => {
|
||||
telemetry_unknown |= !increment_counter(skipped_objects);
|
||||
telemetry_unknown |= !add_bytes(&mut bytes_processed, object_size);
|
||||
*skipped_objects += 1;
|
||||
bytes_processed = bytes_processed.saturating_add(object_size);
|
||||
checkpoint_manager.add_skipped_object(key).await?;
|
||||
demote_to_debug_when!(!take_failure_log_sample(&mut transient_skip_samples_logged), warn, target: "rustfs::heal::erasure_healer", {
|
||||
event = EVENT_HEAL_ERASURE_OBJECT_STATE,
|
||||
component = LOG_COMPONENT_HEAL,
|
||||
@@ -1167,11 +1006,11 @@ impl ErasureSetHealer {
|
||||
error = %message,
|
||||
"Erasure set object heal skipped due to transient error"
|
||||
});
|
||||
CheckpointObjectOutcome::Skipped
|
||||
}
|
||||
Err(err) => {
|
||||
telemetry_unknown |= !increment_counter(failed_objects);
|
||||
telemetry_unknown |= !add_bytes(&mut bytes_processed, object_size);
|
||||
*failed_objects += 1;
|
||||
bytes_processed = bytes_processed.saturating_add(object_size);
|
||||
checkpoint_manager.add_failed_object(key).await?;
|
||||
demote_to_debug_when!(!take_failure_log_sample(&mut failure_samples_logged), warn, target: "rustfs::heal::erasure_healer", {
|
||||
event = EVENT_HEAL_ERASURE_OBJECT_STATE,
|
||||
component = LOG_COMPONENT_HEAL,
|
||||
@@ -1184,43 +1023,15 @@ impl ErasureSetHealer {
|
||||
error = %err,
|
||||
"Erasure set object heal failed"
|
||||
});
|
||||
CheckpointObjectOutcome::Failed
|
||||
}
|
||||
};
|
||||
}
|
||||
|
||||
telemetry_unknown |= !increment_counter(processed_objects);
|
||||
*processed_objects += 1;
|
||||
completed_in_page += 1;
|
||||
let (outcome_record, counter_unknown) = {
|
||||
{
|
||||
let mut progress = self.progress.write().await;
|
||||
progress.set_current_object(Some(format!("{bucket}/{object}")));
|
||||
progress.update_object_progress(
|
||||
*processed_objects,
|
||||
*successful_objects,
|
||||
*failed_objects,
|
||||
*skipped_objects,
|
||||
bytes_processed,
|
||||
);
|
||||
if telemetry_unknown {
|
||||
progress.mark_unknown();
|
||||
}
|
||||
(
|
||||
CheckpointObjectOutcomeRecord {
|
||||
object: key,
|
||||
outcome: checkpoint_outcome,
|
||||
successful: progress.objects_healed,
|
||||
failed: progress.objects_failed,
|
||||
skipped: progress.skipped_objects,
|
||||
bytes: progress.bytes_processed,
|
||||
skipped_new_versions: progress.skipped_new_versions,
|
||||
skipped_ilm_expired: progress.skipped_ilm_expired,
|
||||
counter_unknown: progress.counter_unknown,
|
||||
},
|
||||
progress.counter_unknown,
|
||||
)
|
||||
};
|
||||
checkpoint_manager.record_object_outcome(outcome_record).await?;
|
||||
if counter_unknown {
|
||||
resume_manager.mark_counter_unknown().await?;
|
||||
progress.update_progress(*processed_objects, *successful_objects, *failed_objects, bytes_processed);
|
||||
}
|
||||
|
||||
if completed_in_page.is_multiple_of(100) {
|
||||
@@ -1230,22 +1041,16 @@ impl ErasureSetHealer {
|
||||
|
||||
*current_object_index = global_obj_idx;
|
||||
|
||||
// Persist the checkpoint ledger and page position before exposing
|
||||
// the next resume cursor. A crash before cursor publication keeps
|
||||
// the page identities available for exact-once replay.
|
||||
checkpoint_manager.advance_page(bucket_index, *current_object_index).await?;
|
||||
// Persist the authoritative cursor FIRST (points at the next page
|
||||
// boundary), then prune the per-version dedup sets. Both are
|
||||
// idempotent under crash: heal_object re-heals safely.
|
||||
let next_cursor = if is_truncated { next_token.clone() } else { None };
|
||||
resume_manager.set_resume_cursor(next_cursor.clone()).await?;
|
||||
checkpoint_manager.complete_page(bucket_index, *current_object_index).await?;
|
||||
// Check if there are more pages
|
||||
if !is_truncated {
|
||||
break;
|
||||
}
|
||||
continuation_token = next_heal_listing_token(bucket, "", next_token, is_truncated)?;
|
||||
if continuation_token.is_none() {
|
||||
// A truncated page without a continuation token is terminal.
|
||||
// Retain its ledger until bucket completion is durable.
|
||||
break;
|
||||
}
|
||||
resume_manager.set_resume_cursor(continuation_token.clone()).await?;
|
||||
checkpoint_manager.prune_completed_page().await?;
|
||||
|
||||
// Anti-loop guard: an empty page reported as truncated cannot advance
|
||||
// the cursor (there is no last identity to move past), so treat it as a
|
||||
@@ -1264,6 +1069,12 @@ impl ErasureSetHealer {
|
||||
)));
|
||||
}
|
||||
previous_page_last = page_last;
|
||||
|
||||
continuation_token = next_heal_listing_token(bucket, "", next_token, is_truncated)?;
|
||||
if continuation_token.is_none() {
|
||||
// Truncated but no continuation token: treat as end of listing.
|
||||
break;
|
||||
}
|
||||
}
|
||||
|
||||
Ok(())
|
||||
@@ -1272,66 +1083,10 @@ impl ErasureSetHealer {
|
||||
/// initialize progress tracking
|
||||
async fn initialize_progress(&self, _buckets: &[String], state: &crate::heal::resume::ResumeState) {
|
||||
let mut progress = self.progress.write().await;
|
||||
let existing_baseline = (
|
||||
progress.objects_total_count,
|
||||
progress.objects_total_size,
|
||||
progress.baseline_generation,
|
||||
progress.progress_state,
|
||||
progress.baseline_known,
|
||||
);
|
||||
let baseline_generation_mismatch =
|
||||
state.baseline_known && existing_baseline.4 && state.baseline_generation != existing_baseline.2;
|
||||
let use_persisted_baseline = state.baseline_known && !baseline_generation_mismatch;
|
||||
progress.objects_scanned = state.processed_objects;
|
||||
progress.objects_scanned = state.total_objects;
|
||||
progress.objects_healed = state.successful_objects;
|
||||
progress.objects_failed = state.failed_objects;
|
||||
progress.skipped_objects = state.skipped_objects;
|
||||
progress.skipped_new_versions = state.skipped_new_versions;
|
||||
progress.skipped_ilm_expired = state.skipped_ilm_expired;
|
||||
progress.bytes_processed = state.processed_bytes;
|
||||
progress.counter_unknown = state.counter_unknown;
|
||||
if use_persisted_baseline
|
||||
|| existing_baseline.0 > 0
|
||||
|| existing_baseline.1 > 0
|
||||
|| existing_baseline.2.is_some()
|
||||
|| existing_baseline.4
|
||||
{
|
||||
progress.objects_total_count = if use_persisted_baseline {
|
||||
state.total_objects
|
||||
} else {
|
||||
existing_baseline.0
|
||||
};
|
||||
progress.objects_total_size = if use_persisted_baseline {
|
||||
state.total_bytes
|
||||
} else {
|
||||
existing_baseline.1
|
||||
};
|
||||
progress.baseline_generation = if use_persisted_baseline {
|
||||
state.baseline_generation
|
||||
} else {
|
||||
existing_baseline.2
|
||||
};
|
||||
progress.baseline_known = use_persisted_baseline
|
||||
|| existing_baseline.0 > 0
|
||||
|| existing_baseline.1 > 0
|
||||
|| existing_baseline.2.is_some()
|
||||
|| existing_baseline.4;
|
||||
}
|
||||
progress.progress_state = if use_persisted_baseline
|
||||
|| existing_baseline.0 > 0
|
||||
|| existing_baseline.1 > 0
|
||||
|| existing_baseline.2.is_some()
|
||||
|| existing_baseline.4
|
||||
{
|
||||
crate::heal::progress::HealProgressState::Running
|
||||
} else {
|
||||
crate::heal::progress::HealProgressState::Indeterminate
|
||||
};
|
||||
if baseline_generation_mismatch || state.counter_unknown {
|
||||
progress.mark_unknown();
|
||||
}
|
||||
progress.ledger_complete = false;
|
||||
progress.refresh_progress_percentage();
|
||||
progress.bytes_processed = 0; // Resume state tracks object counts, not byte counters.
|
||||
progress.start_time = UNIX_EPOCH.checked_add(Duration::from_secs(state.start_time));
|
||||
progress.last_update_time = UNIX_EPOCH.checked_add(Duration::from_secs(state.last_update));
|
||||
progress.set_current_object(state.current_object.clone());
|
||||
@@ -1509,8 +1264,8 @@ mod resume_loop_tests {
|
||||
};
|
||||
use crate::heal::progress::HealProgress;
|
||||
use crate::heal::resume::{
|
||||
CheckpointManager, CheckpointObjectOutcome, CheckpointObjectOutcomeRecord, RESUME_CHECKPOINT_FILE,
|
||||
ReplacementTargetIdentity, ResumeDeleteFailure, ResumeManager, ResumeUtils, compose_key,
|
||||
CheckpointManager, RESUME_CHECKPOINT_FILE, ReplacementTargetIdentity, ResumeDeleteFailure, ResumeManager, ResumeUtils,
|
||||
compose_key,
|
||||
};
|
||||
use crate::heal::storage::{HealLifecycleExpiryContext, HealListItem, HealObjectInfo, HealStorageAPI};
|
||||
use crate::heal::storage_api::status::BucketInfo;
|
||||
@@ -1650,7 +1405,6 @@ mod resume_loop_tests {
|
||||
list_include_lifecycle_object_info: Mutex<Vec<bool>>,
|
||||
replacement_target_identity_sequences: Mutex<VecDeque<Vec<ReplacementTargetIdentity>>>,
|
||||
fail_listing: AtomicBool,
|
||||
fail_listing_buckets: Mutex<HashSet<String>>,
|
||||
}
|
||||
|
||||
impl FakeStorage {
|
||||
@@ -1687,9 +1441,6 @@ mod resume_loop_tests {
|
||||
fn fail_listing(&self) {
|
||||
self.fail_listing.store(true, Ordering::SeqCst);
|
||||
}
|
||||
fn fail_bucket_listing(&self, bucket: &str) {
|
||||
self.fail_listing_buckets.lock().unwrap().insert(bucket.to_string());
|
||||
}
|
||||
}
|
||||
|
||||
#[async_trait::async_trait]
|
||||
@@ -1780,7 +1531,7 @@ mod resume_loop_tests {
|
||||
}
|
||||
async fn list_objects_for_heal_page(
|
||||
&self,
|
||||
bucket: &str,
|
||||
_bucket: &str,
|
||||
_prefix: &str,
|
||||
continuation_token: Option<&str>,
|
||||
include_lifecycle_object_info: bool,
|
||||
@@ -1789,7 +1540,7 @@ mod resume_loop_tests {
|
||||
.lock()
|
||||
.unwrap()
|
||||
.push(include_lifecycle_object_info);
|
||||
if self.fail_listing.load(Ordering::SeqCst) || self.fail_listing_buckets.lock().unwrap().contains(bucket) {
|
||||
if self.fail_listing.load(Ordering::SeqCst) {
|
||||
return Err(Error::other("injected listing failure"));
|
||||
}
|
||||
let key = continuation_token.map(str::to_string);
|
||||
@@ -2167,49 +1918,6 @@ mod resume_loop_tests {
|
||||
assert!(state.completed_buckets.is_empty(), "the failed bucket must remain resumable");
|
||||
}
|
||||
|
||||
#[tokio::test]
|
||||
async fn bucket_failure_stops_before_a_later_bucket_checkpoint() {
|
||||
let env = make_env().await;
|
||||
let task_id = ResumeUtils::generate_task_id();
|
||||
let buckets = vec!["a".to_string(), "b".to_string()];
|
||||
let resume = ResumeManager::new(
|
||||
env.healer.disk.clone(),
|
||||
task_id.clone(),
|
||||
"erasure_set".to_string(),
|
||||
"pool_0_set_0".to_string(),
|
||||
buckets.clone(),
|
||||
)
|
||||
.await
|
||||
.unwrap();
|
||||
let checkpoint = CheckpointManager::new(env.healer.disk.clone(), task_id.clone())
|
||||
.await
|
||||
.unwrap();
|
||||
env.storage.fail_bucket_listing("a");
|
||||
for _ in 0..3 {
|
||||
assert!(resume.schedule_retry().await.unwrap());
|
||||
}
|
||||
|
||||
env.healer
|
||||
.execute_heal_with_resume(&buckets, "pool_0_set_0", &resume, &checkpoint)
|
||||
.await
|
||||
.expect_err("the first bucket failure must keep the pass incomplete");
|
||||
let persisted = checkpoint.get_checkpoint().await;
|
||||
assert_eq!(persisted.current_bucket_index, 0);
|
||||
assert!(resume.get_state().await.completed_buckets.is_empty());
|
||||
|
||||
let resumed = ResumeManager::load_from_disk(env.healer.disk.clone(), &task_id)
|
||||
.await
|
||||
.unwrap();
|
||||
let checkpoint = CheckpointManager::load_from_disk(env.healer.disk.clone(), &task_id)
|
||||
.await
|
||||
.unwrap();
|
||||
env.healer
|
||||
.execute_heal_with_resume(&buckets, "pool_0_set_0", &resumed, &checkpoint)
|
||||
.await
|
||||
.expect_err("recovery must retry the earlier failed bucket");
|
||||
assert!(!resumed.get_state().await.completed);
|
||||
}
|
||||
|
||||
#[tokio::test]
|
||||
async fn completed_resume_state_is_not_selected_for_a_new_heal() {
|
||||
let env = make_env().await;
|
||||
@@ -2399,175 +2107,8 @@ mod resume_loop_tests {
|
||||
let mut names: Vec<String> = env.storage.calls().into_iter().map(|(n, _)| n).collect();
|
||||
names.sort();
|
||||
assert_eq!(names, vec!["a", "b", "c", "d"], "every object exactly once, none dropped/doubled");
|
||||
// Keep the final page cursor until the outer loop durably completes the
|
||||
// bucket, so a crash can replay only this page against its identities.
|
||||
assert_eq!(env.resume.resume_cursor().await, Some("t1".to_string()));
|
||||
}
|
||||
|
||||
#[tokio::test]
|
||||
async fn persisted_failure_waits_for_the_bounded_retry_after_page_replay() {
|
||||
let env = make_env().await;
|
||||
env.storage.set_page(
|
||||
None,
|
||||
Page {
|
||||
items: vec![item("object", Some("v1"), false)],
|
||||
next: None,
|
||||
truncated: false,
|
||||
},
|
||||
);
|
||||
env.checkpoint
|
||||
.record_object_outcome(CheckpointObjectOutcomeRecord {
|
||||
object: compose_key("object", Some("v1")),
|
||||
outcome: CheckpointObjectOutcome::Failed,
|
||||
successful: 0,
|
||||
failed: 1,
|
||||
skipped: 0,
|
||||
bytes: 0,
|
||||
skipped_new_versions: 0,
|
||||
skipped_ilm_expired: 0,
|
||||
counter_unknown: false,
|
||||
})
|
||||
.await
|
||||
.unwrap();
|
||||
env.checkpoint.advance_page(0, 1).await.unwrap();
|
||||
|
||||
let resumed = ResumeManager::load_from_disk(env.healer.disk.clone(), &env.task_id)
|
||||
.await
|
||||
.unwrap();
|
||||
let checkpoint = CheckpointManager::load_from_disk(env.healer.disk.clone(), &env.task_id)
|
||||
.await
|
||||
.unwrap();
|
||||
|
||||
env.healer
|
||||
.execute_heal_with_resume(&["b".to_string()], "pool_0_set_0", &resumed, &checkpoint)
|
||||
.await
|
||||
.expect_err("the persisted failure must schedule a bounded retry");
|
||||
assert!(
|
||||
env.storage.calls().is_empty(),
|
||||
"the failed identity must not be repeated in the same pass"
|
||||
);
|
||||
|
||||
env.healer
|
||||
.execute_heal_with_resume(&["b".to_string()], "pool_0_set_0", &resumed, &checkpoint)
|
||||
.await
|
||||
.expect("the bounded retry must heal the object");
|
||||
assert_eq!(env.storage.calls(), vec![("object".to_string(), Some("v1".to_string()))]);
|
||||
let state = resumed.get_state().await;
|
||||
assert_eq!(state.successful_objects, 1);
|
||||
assert_eq!(state.failed_objects, 0);
|
||||
}
|
||||
|
||||
#[tokio::test]
|
||||
async fn final_page_crash_replays_only_the_retained_page_identities() {
|
||||
let env = make_env().await;
|
||||
env.storage.set_page(
|
||||
None,
|
||||
Page {
|
||||
items: vec![item("first", Some("v1"), false)],
|
||||
next: Some("final-page".to_string()),
|
||||
truncated: true,
|
||||
},
|
||||
);
|
||||
env.storage.set_page(
|
||||
Some("final-page"),
|
||||
Page {
|
||||
items: vec![item("last", Some("v1"), false)],
|
||||
next: None,
|
||||
truncated: false,
|
||||
},
|
||||
);
|
||||
|
||||
let (processed, successful, failed, skipped, result) = run(&env).await;
|
||||
result.expect("the bucket pass must finish before the simulated crash");
|
||||
assert_eq!((processed, successful, failed, skipped), (2, 2, 0, 0));
|
||||
|
||||
let resumed = ResumeManager::load_from_disk(env.healer.disk.clone(), &env.task_id)
|
||||
.await
|
||||
.unwrap();
|
||||
let checkpoint = CheckpointManager::load_from_disk(env.healer.disk.clone(), &env.task_id)
|
||||
.await
|
||||
.unwrap();
|
||||
env.healer
|
||||
.execute_heal_with_resume(&["b".to_string()], "pool_0_set_0", &resumed, &checkpoint)
|
||||
.await
|
||||
.expect("the retained final-page ledger must make recovery exact");
|
||||
|
||||
assert_eq!(
|
||||
env.storage.calls(),
|
||||
vec![
|
||||
("first".to_string(), Some("v1".to_string())),
|
||||
("last".to_string(), Some("v1".to_string()))
|
||||
]
|
||||
);
|
||||
let state = resumed.get_state().await;
|
||||
assert_eq!(state.successful_objects, 2);
|
||||
assert_eq!(state.processed_objects, 2);
|
||||
}
|
||||
|
||||
#[tokio::test]
|
||||
async fn truncated_page_without_token_retains_its_replay_ledger() {
|
||||
let env = make_env().await;
|
||||
env.storage.set_page(
|
||||
None,
|
||||
Page {
|
||||
items: vec![item("object", Some("v1"), false)],
|
||||
next: None,
|
||||
truncated: true,
|
||||
},
|
||||
);
|
||||
|
||||
let (processed, successful, failed, skipped, result) = run(&env).await;
|
||||
result.expect("the tokenless truncated page is a terminal page");
|
||||
assert_eq!((processed, successful, failed, skipped), (1, 1, 0, 0));
|
||||
|
||||
let resumed = ResumeManager::load_from_disk(env.healer.disk.clone(), &env.task_id)
|
||||
.await
|
||||
.unwrap();
|
||||
let checkpoint = CheckpointManager::load_from_disk(env.healer.disk.clone(), &env.task_id)
|
||||
.await
|
||||
.unwrap();
|
||||
env.healer
|
||||
.execute_heal_with_resume(&["b".to_string()], "pool_0_set_0", &resumed, &checkpoint)
|
||||
.await
|
||||
.expect("terminal-page recovery must not replay a durable identity");
|
||||
|
||||
assert_eq!(env.storage.calls(), vec![("object".to_string(), Some("v1".to_string()))]);
|
||||
let state = resumed.get_state().await;
|
||||
assert_eq!(state.successful_objects, 1);
|
||||
assert_eq!(state.processed_objects, 1);
|
||||
}
|
||||
|
||||
#[tokio::test]
|
||||
async fn completed_bucket_reconciles_its_final_page_checkpoint_after_crash() {
|
||||
let env = make_env().await;
|
||||
env.storage.set_page(
|
||||
None,
|
||||
Page {
|
||||
items: vec![item("object", Some("v1"), false)],
|
||||
next: None,
|
||||
truncated: false,
|
||||
},
|
||||
);
|
||||
|
||||
let (_, _, _, _, result) = run(&env).await;
|
||||
result.expect("the bucket pass must finish before the simulated crash");
|
||||
env.resume.complete_bucket("b").await.unwrap();
|
||||
|
||||
let resumed = ResumeManager::load_from_disk(env.healer.disk.clone(), &env.task_id)
|
||||
.await
|
||||
.unwrap();
|
||||
let checkpoint = CheckpointManager::load_from_disk(env.healer.disk.clone(), &env.task_id)
|
||||
.await
|
||||
.unwrap();
|
||||
env.healer
|
||||
.execute_heal_with_resume(&["b".to_string()], "pool_0_set_0", &resumed, &checkpoint)
|
||||
.await
|
||||
.expect("recovery must finish the checkpoint transition without replaying the bucket");
|
||||
|
||||
assert_eq!(env.storage.calls(), vec![("object".to_string(), Some("v1".to_string()))]);
|
||||
let checkpoint = checkpoint.get_checkpoint().await;
|
||||
assert_eq!(checkpoint.current_bucket_index, 1);
|
||||
assert!(checkpoint.processed_objects.is_empty());
|
||||
// Final page not truncated => cursor cleared.
|
||||
assert_eq!(env.resume.resume_cursor().await, None);
|
||||
}
|
||||
|
||||
#[tokio::test]
|
||||
|
||||
@@ -2011,11 +2011,34 @@ impl HealManager {
|
||||
return None;
|
||||
}
|
||||
|
||||
let mut progresses = Vec::with_capacity(active_tasks.len());
|
||||
let mut snapshot = HealProgress::default();
|
||||
for task in active_tasks {
|
||||
progresses.push(task.get_progress().await);
|
||||
let progress = task.get_progress().await;
|
||||
snapshot.objects_scanned = snapshot.objects_scanned.saturating_add(progress.objects_scanned);
|
||||
snapshot.objects_healed = snapshot.objects_healed.saturating_add(progress.objects_healed);
|
||||
snapshot.objects_failed = snapshot.objects_failed.saturating_add(progress.objects_failed);
|
||||
snapshot.skipped_new_versions = snapshot.skipped_new_versions.saturating_add(progress.skipped_new_versions);
|
||||
snapshot.skipped_ilm_expired = snapshot.skipped_ilm_expired.saturating_add(progress.skipped_ilm_expired);
|
||||
snapshot.objects_total_count = snapshot.objects_total_count.saturating_add(progress.objects_total_count);
|
||||
snapshot.objects_total_size = snapshot.objects_total_size.saturating_add(progress.objects_total_size);
|
||||
snapshot.bytes_processed = snapshot.bytes_processed.saturating_add(progress.bytes_processed);
|
||||
snapshot.start_time = match (snapshot.start_time, progress.start_time) {
|
||||
(Some(current), Some(next)) => Some(current.min(next)),
|
||||
(None, next) => next,
|
||||
(current, None) => current,
|
||||
};
|
||||
snapshot.last_update_time = match (snapshot.last_update_time, progress.last_update_time) {
|
||||
(Some(current), Some(next)) => Some(current.max(next)),
|
||||
(None, next) => next,
|
||||
(current, None) => current,
|
||||
};
|
||||
if progress.current_object.is_some() {
|
||||
snapshot.current_object = progress.current_object;
|
||||
}
|
||||
}
|
||||
crate::heal::progress::aggregate_heal_progress(progresses)
|
||||
snapshot.refresh_progress_percentage();
|
||||
snapshot.refresh_estimated_completion_time();
|
||||
Some(snapshot)
|
||||
}
|
||||
}
|
||||
|
||||
|
||||
@@ -15,91 +15,15 @@
|
||||
use serde::{Deserialize, Serialize};
|
||||
use std::time::{Duration, SystemTime};
|
||||
|
||||
pub(crate) fn stable_generation(parts: &[&[u8]]) -> u64 {
|
||||
let mut hash = 0xcbf29ce484222325u64;
|
||||
for part in parts {
|
||||
for byte in (part.len() as u64).to_be_bytes().into_iter().chain(part.iter().copied()) {
|
||||
hash ^= u64::from(byte);
|
||||
hash = hash.wrapping_mul(0x100000001b3);
|
||||
}
|
||||
}
|
||||
hash
|
||||
}
|
||||
|
||||
#[cfg(test)]
|
||||
mod stable_generation_tests {
|
||||
use super::stable_generation;
|
||||
|
||||
#[test]
|
||||
fn stable_generation_has_a_fixed_vector() {
|
||||
assert_eq!(stable_generation(&[b"rustfs", b"heal", b"42"]), 11_007_672_338_488_385_056);
|
||||
}
|
||||
}
|
||||
|
||||
pub(crate) fn increment_counter(counter: &mut u64) -> bool {
|
||||
match counter.checked_add(1) {
|
||||
Some(next) => {
|
||||
*counter = next;
|
||||
true
|
||||
}
|
||||
None => {
|
||||
*counter = u64::MAX;
|
||||
false
|
||||
}
|
||||
}
|
||||
}
|
||||
|
||||
pub(crate) fn add_bytes(total: &mut u64, amount: u64) -> bool {
|
||||
match total.checked_add(amount) {
|
||||
Some(next) => {
|
||||
*total = next;
|
||||
true
|
||||
}
|
||||
None => {
|
||||
*total = u64::MAX;
|
||||
false
|
||||
}
|
||||
}
|
||||
}
|
||||
|
||||
#[derive(Debug, Default, Clone, Copy, PartialEq, Eq, Serialize, Deserialize)]
|
||||
#[derive(Debug, Default, Clone, Serialize, Deserialize)]
|
||||
#[serde(rename_all = "camelCase")]
|
||||
pub enum HealProgressKind {
|
||||
#[default]
|
||||
Unknown,
|
||||
Stage,
|
||||
ObjectSweep,
|
||||
}
|
||||
|
||||
/// Whether the object ledger can produce a meaningful percentage.
|
||||
///
|
||||
/// A zero-valued baseline is not a completed scan: it means that no complete
|
||||
/// usage snapshot was available. Keep this state explicit so callers do not
|
||||
/// mistake the legacy `0.0` wire value for a measured zero-percent result.
|
||||
#[derive(Debug, Default, Clone, Copy, PartialEq, Eq, Serialize, Deserialize)]
|
||||
#[serde(rename_all = "camelCase")]
|
||||
pub enum HealProgressState {
|
||||
#[default]
|
||||
Unknown,
|
||||
Indeterminate,
|
||||
Running,
|
||||
Completed,
|
||||
}
|
||||
|
||||
#[derive(Debug, Default, Clone, PartialEq, Serialize, Deserialize)]
|
||||
#[serde(default, rename_all = "camelCase")]
|
||||
pub struct HealProgress {
|
||||
#[serde(default)]
|
||||
pub kind: HealProgressKind,
|
||||
/// Objects scanned
|
||||
pub objects_scanned: u64,
|
||||
/// Objects healed
|
||||
pub objects_healed: u64,
|
||||
/// Objects failed
|
||||
pub objects_failed: u64,
|
||||
/// Versions deferred for a later retry pass.
|
||||
#[serde(default)]
|
||||
pub skipped_objects: u64,
|
||||
/// Versions skipped because they were written after this heal started
|
||||
pub skipped_new_versions: u64,
|
||||
/// Versions skipped because lifecycle already selected them for expiry
|
||||
@@ -120,38 +44,11 @@ pub struct HealProgress {
|
||||
pub last_update_time: Option<SystemTime>,
|
||||
/// Estimated completion time
|
||||
pub estimated_completion_time: Option<SystemTime>,
|
||||
/// Current stage number. Stage updates are intentionally independent from
|
||||
/// the object ledger below.
|
||||
#[serde(default)]
|
||||
pub stage_current: u64,
|
||||
/// Number of stages in the current task.
|
||||
#[serde(default)]
|
||||
pub stage_total: u64,
|
||||
/// Explicitly distinguishes a missing usage baseline from measured 0%.
|
||||
#[serde(default)]
|
||||
pub progress_state: HealProgressState,
|
||||
/// True only after the task's durable completion ledger was committed.
|
||||
#[serde(default)]
|
||||
pub ledger_complete: bool,
|
||||
/// Generation of the usage snapshot used for the baseline, if available.
|
||||
#[serde(default)]
|
||||
pub baseline_generation: Option<u64>,
|
||||
/// Whether the baseline was explicitly observed. This is separate from
|
||||
/// the counters so a known empty scope (0 objects, 0 bytes) is not
|
||||
/// confused with a legacy snapshot that omitted the baseline fields.
|
||||
#[serde(default)]
|
||||
pub baseline_known: bool,
|
||||
/// Internal telemetry fence set when an aggregate counter overflows or
|
||||
/// becomes inconsistent. It prevents a later refresh from fabricating a
|
||||
/// percentage from the poisoned values.
|
||||
#[serde(default)]
|
||||
pub counter_unknown: bool,
|
||||
}
|
||||
|
||||
impl HealProgress {
|
||||
pub fn new() -> Self {
|
||||
Self {
|
||||
kind: HealProgressKind::Unknown,
|
||||
start_time: Some(SystemTime::now()),
|
||||
last_update_time: Some(SystemTime::now()),
|
||||
..Default::default()
|
||||
@@ -159,87 +56,12 @@ impl HealProgress {
|
||||
}
|
||||
|
||||
pub fn update_progress(&mut self, scanned: u64, healed: u64, failed: u64, bytes: u64) {
|
||||
self.update_object_sweep_progress(scanned, healed, failed, bytes);
|
||||
}
|
||||
|
||||
pub fn update_object_sweep_progress(&mut self, scanned: u64, healed: u64, failed: u64, bytes: u64) {
|
||||
self.kind = HealProgressKind::ObjectSweep;
|
||||
self.objects_scanned = scanned;
|
||||
self.objects_healed = healed;
|
||||
self.objects_failed = failed;
|
||||
self.bytes_processed = bytes;
|
||||
self.last_update_time = Some(SystemTime::now());
|
||||
|
||||
let explicit_skipped = match self.skipped_new_versions.checked_add(self.skipped_ilm_expired) {
|
||||
Some(value) => value,
|
||||
None => {
|
||||
self.mark_unknown();
|
||||
0
|
||||
}
|
||||
};
|
||||
let skipped = healed
|
||||
.checked_add(failed)
|
||||
.and_then(|value| value.checked_add(explicit_skipped))
|
||||
.and_then(|value| scanned.checked_sub(value))
|
||||
.unwrap_or(0);
|
||||
self.update_object_progress(scanned, healed, failed, skipped, bytes);
|
||||
}
|
||||
|
||||
/// Update task stage progress without modifying object counters.
|
||||
pub fn update_stage(&mut self, current: u64, total: u64) {
|
||||
let object_sweep_active = matches!(self.kind, HealProgressKind::ObjectSweep);
|
||||
if !object_sweep_active {
|
||||
self.kind = HealProgressKind::Stage;
|
||||
}
|
||||
self.ledger_complete = false;
|
||||
self.stage_current = current.min(total);
|
||||
self.stage_total = total;
|
||||
if object_sweep_active {
|
||||
self.last_update_time = Some(SystemTime::now());
|
||||
self.refresh_progress_percentage();
|
||||
return;
|
||||
}
|
||||
self.progress_state = if total == 0 {
|
||||
HealProgressState::Indeterminate
|
||||
} else {
|
||||
HealProgressState::Running
|
||||
};
|
||||
self.progress_percentage = if total == 0 {
|
||||
0.0
|
||||
} else {
|
||||
(current as f64 / total as f64 * 100.0).min(100.0)
|
||||
};
|
||||
self.last_update_time = Some(SystemTime::now());
|
||||
}
|
||||
|
||||
/// Update the disjoint object ledger. `scanned` is the number of terminal
|
||||
/// object outcomes and must equal healed + failed + deferred skipped plus
|
||||
/// the two terminal skip classes. Overflow is a corrupt/unknown counter
|
||||
/// state, not a reason to abort a completed heal.
|
||||
pub fn update_object_progress(&mut self, scanned: u64, healed: u64, failed: u64, skipped: u64, bytes: u64) {
|
||||
self.kind = HealProgressKind::ObjectSweep;
|
||||
// `skipped` is the transient/deferred class. The two explicit skip
|
||||
// counters are terminal classifications too, so include them in the
|
||||
// same ledger without making callers maintain a second aggregate.
|
||||
let outcomes = healed
|
||||
.checked_add(failed)
|
||||
.and_then(|value| value.checked_add(skipped))
|
||||
.and_then(|value| value.checked_add(self.skipped_new_versions))
|
||||
.and_then(|value| value.checked_add(self.skipped_ilm_expired));
|
||||
self.objects_scanned = scanned;
|
||||
self.objects_healed = healed;
|
||||
self.objects_failed = failed;
|
||||
self.skipped_objects = skipped;
|
||||
self.bytes_processed = bytes;
|
||||
self.last_update_time = Some(SystemTime::now());
|
||||
self.ledger_complete = false;
|
||||
if outcomes != Some(scanned) {
|
||||
// Telemetry corruption must not abort a heal. Preserve the
|
||||
// counters for diagnostics, but do not derive a percentage from a
|
||||
// double-counted or overflowing ledger.
|
||||
self.mark_unknown();
|
||||
return;
|
||||
}
|
||||
self.refresh_progress_percentage();
|
||||
self.refresh_estimated_completion_time();
|
||||
}
|
||||
@@ -247,88 +69,50 @@ impl HealProgress {
|
||||
pub fn set_total_baseline(&mut self, objects_total_count: u64, objects_total_size: u64) {
|
||||
self.objects_total_count = objects_total_count;
|
||||
self.objects_total_size = objects_total_size;
|
||||
self.baseline_known = true;
|
||||
self.last_update_time = Some(SystemTime::now());
|
||||
self.refresh_progress_percentage();
|
||||
self.refresh_estimated_completion_time();
|
||||
}
|
||||
|
||||
pub fn set_total_baseline_with_generation(&mut self, objects_total_count: u64, objects_total_size: u64, generation: u64) {
|
||||
self.baseline_generation = Some(generation);
|
||||
self.set_total_baseline(objects_total_count, objects_total_size);
|
||||
}
|
||||
|
||||
pub fn record_skipped_new_version(&mut self) {
|
||||
let Some(next) = self.skipped_new_versions.checked_add(1) else {
|
||||
self.mark_unknown();
|
||||
return;
|
||||
};
|
||||
self.skipped_new_versions = next;
|
||||
self.skipped_new_versions = self.skipped_new_versions.saturating_add(1);
|
||||
self.last_update_time = Some(SystemTime::now());
|
||||
self.refresh_progress_percentage();
|
||||
self.refresh_estimated_completion_time();
|
||||
}
|
||||
|
||||
pub fn record_skipped_ilm_expired(&mut self) {
|
||||
let Some(next) = self.skipped_ilm_expired.checked_add(1) else {
|
||||
self.mark_unknown();
|
||||
return;
|
||||
};
|
||||
self.skipped_ilm_expired = next;
|
||||
self.skipped_ilm_expired = self.skipped_ilm_expired.saturating_add(1);
|
||||
self.last_update_time = Some(SystemTime::now());
|
||||
self.refresh_progress_percentage();
|
||||
self.refresh_estimated_completion_time();
|
||||
}
|
||||
|
||||
fn completed_for_baseline(&self) -> Option<u64> {
|
||||
fn completed_for_baseline(&self) -> u64 {
|
||||
self.objects_healed
|
||||
.checked_add(self.objects_failed)?
|
||||
.checked_add(self.skipped_objects)?
|
||||
.checked_add(self.skipped_new_versions)?
|
||||
.checked_add(self.skipped_ilm_expired)
|
||||
.saturating_add(self.objects_failed)
|
||||
.saturating_add(self.skipped_new_versions)
|
||||
.saturating_add(self.skipped_ilm_expired)
|
||||
}
|
||||
|
||||
pub(crate) fn refresh_progress_percentage(&mut self) {
|
||||
if self.ledger_complete {
|
||||
self.progress_state = HealProgressState::Completed;
|
||||
self.progress_percentage = 100.0;
|
||||
return;
|
||||
}
|
||||
if self.counter_unknown {
|
||||
self.progress_state = HealProgressState::Unknown;
|
||||
self.progress_percentage = 0.0;
|
||||
return;
|
||||
}
|
||||
if !self.baseline_known {
|
||||
self.progress_state = HealProgressState::Indeterminate;
|
||||
self.progress_percentage = 0.0;
|
||||
self.estimated_completion_time = None;
|
||||
return;
|
||||
}
|
||||
if self.objects_total_size > 0 {
|
||||
self.progress_percentage = ((self.bytes_processed as f64 / self.objects_total_size as f64) * 100.0).min(100.0);
|
||||
self.progress_percentage = self.progress_percentage.min(99.999);
|
||||
self.progress_state = HealProgressState::Running;
|
||||
return;
|
||||
}
|
||||
if self.objects_total_count > 0 {
|
||||
let Some(completed) = self.completed_for_baseline() else {
|
||||
self.progress_state = HealProgressState::Unknown;
|
||||
self.progress_percentage = 0.0;
|
||||
return;
|
||||
};
|
||||
let completed = self.completed_for_baseline();
|
||||
self.progress_percentage = ((completed as f64 / self.objects_total_count as f64) * 100.0).min(100.0);
|
||||
self.progress_percentage = self.progress_percentage.min(99.999);
|
||||
self.progress_state = HealProgressState::Running;
|
||||
return;
|
||||
}
|
||||
if self.baseline_known {
|
||||
self.progress_state = HealProgressState::Running;
|
||||
self.progress_percentage = 0.0;
|
||||
return;
|
||||
|
||||
let total = self
|
||||
.objects_scanned
|
||||
.saturating_add(self.objects_healed)
|
||||
.saturating_add(self.objects_failed);
|
||||
if total > 0 {
|
||||
self.progress_percentage = (self.objects_healed as f64 / total as f64) * 100.0;
|
||||
}
|
||||
self.progress_state = HealProgressState::Indeterminate;
|
||||
self.progress_percentage = 0.0;
|
||||
}
|
||||
|
||||
pub fn set_current_object(&mut self, object: Option<String>) {
|
||||
@@ -341,11 +125,7 @@ impl HealProgress {
|
||||
self.estimated_completion_time = None;
|
||||
return;
|
||||
};
|
||||
if self.is_completed()
|
||||
|| self.progress_percentage <= 0.0
|
||||
|| self.progress_percentage >= 100.0
|
||||
|| self.bytes_processed == 0
|
||||
{
|
||||
if self.is_completed() || !(0.0..100.0).contains(&self.progress_percentage) || self.bytes_processed == 0 {
|
||||
self.estimated_completion_time = None;
|
||||
return;
|
||||
}
|
||||
@@ -362,39 +142,18 @@ impl HealProgress {
|
||||
}
|
||||
|
||||
pub fn is_completed(&self) -> bool {
|
||||
self.ledger_complete
|
||||
}
|
||||
|
||||
/// Mark telemetry unknown while allowing the underlying heal operation to
|
||||
/// continue. This is used for corrupt/overflowing counters at the
|
||||
/// observability boundary; it must never turn a successful heal into an
|
||||
/// execution error.
|
||||
pub fn mark_unknown(&mut self) {
|
||||
self.counter_unknown = true;
|
||||
self.progress_state = HealProgressState::Unknown;
|
||||
self.ledger_complete = false;
|
||||
self.progress_percentage = 0.0;
|
||||
self.estimated_completion_time = None;
|
||||
self.last_update_time = Some(SystemTime::now());
|
||||
}
|
||||
|
||||
/// Mark the object ledger terminal only after the enclosing task has
|
||||
/// committed all durable resume state and cleanup fences.
|
||||
pub fn mark_completed(&mut self) {
|
||||
let telemetry_unknown = self.counter_unknown || self.progress_state == HealProgressState::Unknown;
|
||||
self.ledger_complete = true;
|
||||
if !telemetry_unknown {
|
||||
self.progress_state = HealProgressState::Completed;
|
||||
if self.progress_percentage >= 100.0 {
|
||||
return true;
|
||||
}
|
||||
self.progress_percentage = 100.0;
|
||||
self.last_update_time = Some(SystemTime::now());
|
||||
self.estimated_completion_time = None;
|
||||
if self.objects_total_count > 0 || self.objects_total_size > 0 {
|
||||
return false;
|
||||
}
|
||||
|
||||
self.objects_scanned > 0 && self.objects_healed.saturating_add(self.objects_failed) >= self.objects_scanned
|
||||
}
|
||||
|
||||
pub fn get_success_rate(&self) -> f64 {
|
||||
let Some(total) = self.objects_healed.checked_add(self.objects_failed) else {
|
||||
return 0.0;
|
||||
};
|
||||
let total = self.objects_healed + self.objects_failed;
|
||||
if total > 0 {
|
||||
(self.objects_healed as f64 / total as f64) * 100.0
|
||||
} else {
|
||||
@@ -403,101 +162,6 @@ impl HealProgress {
|
||||
}
|
||||
}
|
||||
|
||||
pub fn aggregate_heal_progress(progresses: impl IntoIterator<Item = HealProgress>) -> Option<HealProgress> {
|
||||
let mut snapshot = HealProgress::default();
|
||||
let mut found = false;
|
||||
let mut has_object_sweep = false;
|
||||
let mut all_object_baselines_known = true;
|
||||
let mut baseline_generation = None;
|
||||
let mut baseline_generation_consistent = true;
|
||||
let mut all_ledgers_complete = true;
|
||||
let mut counter_overflow = false;
|
||||
|
||||
for progress in progresses {
|
||||
found = true;
|
||||
let object_sweep = matches!(progress.kind, HealProgressKind::ObjectSweep);
|
||||
has_object_sweep |= object_sweep;
|
||||
all_ledgers_complete &= progress.ledger_complete;
|
||||
if object_sweep {
|
||||
all_object_baselines_known &= progress.baseline_known;
|
||||
match baseline_generation {
|
||||
None => baseline_generation = Some(progress.baseline_generation),
|
||||
Some(generation) => baseline_generation_consistent &= generation == progress.baseline_generation,
|
||||
}
|
||||
}
|
||||
counter_overflow |= progress.counter_unknown || matches!(progress.progress_state, HealProgressState::Unknown);
|
||||
for (target, value) in [
|
||||
(&mut snapshot.objects_scanned, progress.objects_scanned),
|
||||
(&mut snapshot.objects_healed, progress.objects_healed),
|
||||
(&mut snapshot.objects_failed, progress.objects_failed),
|
||||
(&mut snapshot.skipped_objects, progress.skipped_objects),
|
||||
(&mut snapshot.skipped_new_versions, progress.skipped_new_versions),
|
||||
(&mut snapshot.skipped_ilm_expired, progress.skipped_ilm_expired),
|
||||
(&mut snapshot.objects_total_count, progress.objects_total_count),
|
||||
(&mut snapshot.objects_total_size, progress.objects_total_size),
|
||||
(&mut snapshot.bytes_processed, progress.bytes_processed),
|
||||
(&mut snapshot.stage_current, progress.stage_current),
|
||||
(&mut snapshot.stage_total, progress.stage_total),
|
||||
] {
|
||||
match target.checked_add(value) {
|
||||
Some(sum) => *target = sum,
|
||||
None => {
|
||||
*target = u64::MAX;
|
||||
counter_overflow = true;
|
||||
}
|
||||
}
|
||||
}
|
||||
snapshot.start_time = match (snapshot.start_time, progress.start_time) {
|
||||
(Some(current), Some(next)) => Some(current.min(next)),
|
||||
(None, next) => next,
|
||||
(current, None) => current,
|
||||
};
|
||||
snapshot.last_update_time = match (snapshot.last_update_time, progress.last_update_time) {
|
||||
(Some(current), Some(next)) => Some(current.max(next)),
|
||||
(None, next) => next,
|
||||
(current, None) => current,
|
||||
};
|
||||
if progress.current_object.is_some() {
|
||||
snapshot.current_object = progress.current_object;
|
||||
}
|
||||
}
|
||||
|
||||
if !found {
|
||||
return None;
|
||||
}
|
||||
|
||||
snapshot.kind = if has_object_sweep {
|
||||
HealProgressKind::ObjectSweep
|
||||
} else {
|
||||
HealProgressKind::Stage
|
||||
};
|
||||
snapshot.baseline_known = has_object_sweep && all_object_baselines_known && baseline_generation_consistent;
|
||||
snapshot.baseline_generation = if snapshot.baseline_known && baseline_generation_consistent {
|
||||
baseline_generation.flatten()
|
||||
} else {
|
||||
None
|
||||
};
|
||||
snapshot.ledger_complete = all_ledgers_complete;
|
||||
snapshot.counter_unknown = counter_overflow;
|
||||
if counter_overflow {
|
||||
snapshot.progress_state = HealProgressState::Unknown;
|
||||
snapshot.progress_percentage = if snapshot.ledger_complete { 100.0 } else { 0.0 };
|
||||
} else if snapshot.ledger_complete {
|
||||
snapshot.progress_state = HealProgressState::Completed;
|
||||
snapshot.progress_percentage = 100.0;
|
||||
} else if has_object_sweep {
|
||||
snapshot.refresh_progress_percentage();
|
||||
} else if snapshot.stage_total == 0 {
|
||||
snapshot.progress_state = HealProgressState::Indeterminate;
|
||||
snapshot.progress_percentage = 0.0;
|
||||
} else {
|
||||
snapshot.progress_state = HealProgressState::Running;
|
||||
snapshot.progress_percentage = ((snapshot.stage_current as f64 / snapshot.stage_total as f64) * 100.0).min(99.999);
|
||||
}
|
||||
snapshot.refresh_estimated_completion_time();
|
||||
Some(snapshot)
|
||||
}
|
||||
|
||||
#[derive(Debug, Clone, Serialize, Deserialize)]
|
||||
pub struct HealStatistics {
|
||||
/// Total heal tasks
|
||||
@@ -566,7 +230,6 @@ mod tests {
|
||||
assert_eq!(progress.objects_scanned, 0);
|
||||
assert_eq!(progress.objects_healed, 0);
|
||||
assert_eq!(progress.objects_failed, 0);
|
||||
assert_eq!(progress.skipped_objects, 0);
|
||||
assert_eq!(progress.skipped_new_versions, 0);
|
||||
assert_eq!(progress.skipped_ilm_expired, 0);
|
||||
assert_eq!(progress.objects_total_count, 0);
|
||||
@@ -587,8 +250,10 @@ mod tests {
|
||||
assert_eq!(progress.objects_healed, 8);
|
||||
assert_eq!(progress.objects_failed, 2);
|
||||
assert_eq!(progress.bytes_processed, 1024);
|
||||
assert_eq!(progress.progress_state, HealProgressState::Indeterminate);
|
||||
assert_eq!(progress.progress_percentage, 0.0);
|
||||
// Progress percentage should be calculated based on healed/total
|
||||
// total = scanned + healed + failed = 10 + 8 + 2 = 20
|
||||
// healed/total = 8/20 = 0.4 = 40%
|
||||
assert!((progress.progress_percentage - 40.0).abs() < 0.001);
|
||||
assert!(progress.last_update_time.is_some());
|
||||
}
|
||||
|
||||
@@ -597,8 +262,7 @@ mod tests {
|
||||
let mut progress = HealProgress::new();
|
||||
progress.start_time = Some(SystemTime::now() - Duration::from_secs(10));
|
||||
|
||||
progress.set_total_baseline(100, 16384);
|
||||
progress.update_progress(25, 25, 0, 4096);
|
||||
progress.update_progress(100, 25, 0, 4096);
|
||||
|
||||
let eta = progress
|
||||
.estimated_completion_time
|
||||
@@ -611,7 +275,7 @@ mod tests {
|
||||
let mut progress = HealProgress::new();
|
||||
progress.set_total_baseline(10, 8192);
|
||||
|
||||
progress.update_progress(25, 25, 0, 4096);
|
||||
progress.update_progress(100, 25, 0, 4096);
|
||||
|
||||
assert!((progress.progress_percentage - 50.0).abs() < 0.001);
|
||||
}
|
||||
@@ -621,7 +285,7 @@ mod tests {
|
||||
let mut progress = HealProgress::new();
|
||||
progress.set_total_baseline(10, 0);
|
||||
|
||||
progress.update_progress(5, 3, 2, 0);
|
||||
progress.update_progress(100, 3, 2, 0);
|
||||
|
||||
assert!((progress.progress_percentage - 50.0).abs() < 0.001);
|
||||
}
|
||||
@@ -631,7 +295,7 @@ mod tests {
|
||||
let mut progress = HealProgress::new();
|
||||
progress.set_total_baseline(10, 0);
|
||||
|
||||
progress.update_progress(5, 3, 2, 0);
|
||||
progress.update_progress(100, 3, 2, 0);
|
||||
progress.record_skipped_new_version();
|
||||
|
||||
assert_eq!(progress.skipped_new_versions, 1);
|
||||
@@ -672,8 +336,7 @@ mod tests {
|
||||
fn test_heal_progress_update_progress_all_healed() {
|
||||
let mut progress = HealProgress::new();
|
||||
// When scanned=0, healed=10, failed=0: total=10, progress = 10/10 = 100%
|
||||
progress.update_progress(10, 10, 0, 2048);
|
||||
progress.mark_completed();
|
||||
progress.update_progress(0, 10, 0, 2048);
|
||||
|
||||
// All healed, should be 100%
|
||||
assert!((progress.progress_percentage - 100.0).abs() < 0.001);
|
||||
@@ -731,7 +394,6 @@ mod tests {
|
||||
assert_eq!(json["objectsScanned"], 10);
|
||||
assert_eq!(json["objectsHealed"], 8);
|
||||
assert_eq!(json["objectsFailed"], 2);
|
||||
assert_eq!(json["skippedObjects"], 0);
|
||||
assert_eq!(json["skippedNewVersions"], 0);
|
||||
assert_eq!(json["skippedIlmExpired"], 0);
|
||||
assert_eq!(json["bytesProcessed"], 1024);
|
||||
@@ -743,7 +405,6 @@ mod tests {
|
||||
fn test_heal_progress_is_completed_by_percentage() {
|
||||
let mut progress = HealProgress::new();
|
||||
progress.update_progress(10, 10, 0, 1024);
|
||||
progress.mark_completed();
|
||||
|
||||
assert!(progress.is_completed());
|
||||
}
|
||||
@@ -754,7 +415,7 @@ mod tests {
|
||||
progress.objects_scanned = 10;
|
||||
progress.objects_healed = 8;
|
||||
progress.objects_failed = 2;
|
||||
progress.mark_completed();
|
||||
// healed + failed = 8 + 2 = 10 >= scanned = 10
|
||||
assert!(progress.is_completed());
|
||||
}
|
||||
|
||||
@@ -794,108 +455,6 @@ mod tests {
|
||||
assert!((progress.get_success_rate() - 100.0).abs() < 0.001);
|
||||
}
|
||||
|
||||
#[test]
|
||||
fn single_object_progress_reaches_terminal_100() {
|
||||
let mut progress = HealProgress::new();
|
||||
progress.update_object_progress(1, 1, 0, 0, 128);
|
||||
assert!(!progress.is_completed());
|
||||
progress.mark_completed();
|
||||
assert!(progress.is_completed());
|
||||
assert_eq!(progress.progress_percentage, 100.0);
|
||||
}
|
||||
|
||||
#[test]
|
||||
fn progress_without_baseline_is_indeterminate() {
|
||||
let mut progress = HealProgress::new();
|
||||
progress.update_object_progress(1, 1, 0, 0, 128);
|
||||
assert_eq!(progress.progress_state, HealProgressState::Indeterminate);
|
||||
assert_eq!(progress.progress_percentage, 0.0);
|
||||
assert!(progress.estimated_completion_time.is_none());
|
||||
}
|
||||
|
||||
#[test]
|
||||
fn progress_retry_is_exactly_once() {
|
||||
let mut progress = HealProgress::new();
|
||||
progress.set_total_baseline(1, 128);
|
||||
progress.update_object_progress(1, 1, 0, 0, 128);
|
||||
progress.update_object_progress(1, 1, 0, 0, 128);
|
||||
assert_eq!(progress.objects_scanned, 1);
|
||||
assert_eq!(progress.objects_healed, 1);
|
||||
assert_eq!(progress.bytes_processed, 128);
|
||||
}
|
||||
|
||||
#[test]
|
||||
fn progress_never_triggers_cleanup_before_terminal_ledger_empty() {
|
||||
let mut progress = HealProgress::new();
|
||||
progress.progress_percentage = 100.0;
|
||||
assert!(!progress.is_completed());
|
||||
progress.mark_completed();
|
||||
assert!(progress.is_completed());
|
||||
}
|
||||
|
||||
#[test]
|
||||
fn progress_counter_overflow_is_marked_unknown_without_aborting_completed_heal() {
|
||||
let mut progress = HealProgress::new();
|
||||
progress.update_object_progress(u64::MAX, u64::MAX, 1, 0, 0);
|
||||
assert_eq!(progress.progress_state, HealProgressState::Unknown);
|
||||
progress.mark_completed();
|
||||
assert!(progress.is_completed());
|
||||
assert_eq!(progress.progress_state, HealProgressState::Unknown);
|
||||
|
||||
let aggregate = aggregate_heal_progress([progress]).expect("progress should aggregate");
|
||||
assert!(aggregate.ledger_complete);
|
||||
assert!(aggregate.counter_unknown);
|
||||
assert_eq!(aggregate.progress_state, HealProgressState::Unknown);
|
||||
assert_eq!(aggregate.progress_percentage, 100.0);
|
||||
}
|
||||
|
||||
#[test]
|
||||
fn aggregate_rejects_mixed_baseline_generations() {
|
||||
let progress = |generation| HealProgress {
|
||||
kind: HealProgressKind::ObjectSweep,
|
||||
objects_scanned: 5,
|
||||
objects_total_count: 10,
|
||||
progress_state: HealProgressState::Running,
|
||||
baseline_generation: Some(generation),
|
||||
baseline_known: true,
|
||||
..Default::default()
|
||||
};
|
||||
|
||||
let aggregate = aggregate_heal_progress([progress(1), progress(2)]).expect("progress should aggregate");
|
||||
assert!(!aggregate.baseline_known);
|
||||
assert_eq!(aggregate.baseline_generation, None);
|
||||
assert_eq!(aggregate.progress_state, HealProgressState::Indeterminate);
|
||||
assert_eq!(aggregate.progress_percentage, 0.0);
|
||||
}
|
||||
|
||||
#[test]
|
||||
fn aggregate_accepts_multiple_sets_from_one_snapshot_generation() {
|
||||
let progress = |objects_scanned| HealProgress {
|
||||
kind: HealProgressKind::ObjectSweep,
|
||||
objects_scanned,
|
||||
objects_total_count: 10,
|
||||
progress_state: HealProgressState::Running,
|
||||
baseline_generation: Some(7),
|
||||
baseline_known: true,
|
||||
..Default::default()
|
||||
};
|
||||
|
||||
let aggregate = aggregate_heal_progress([progress(5), progress(3)]).expect("progress should aggregate");
|
||||
assert!(aggregate.baseline_known);
|
||||
assert_eq!(aggregate.baseline_generation, Some(7));
|
||||
}
|
||||
|
||||
#[test]
|
||||
fn stage_updates_do_not_double_count_object_outcomes() {
|
||||
let mut progress = HealProgress::new();
|
||||
progress.update_object_progress(2, 1, 0, 1, 256);
|
||||
progress.update_stage(3, 4);
|
||||
assert_eq!(progress.kind, HealProgressKind::ObjectSweep);
|
||||
assert_eq!(progress.objects_scanned, 2);
|
||||
assert_eq!(progress.objects_healed, 1);
|
||||
assert_eq!(progress.skipped_objects, 1);
|
||||
}
|
||||
|
||||
#[test]
|
||||
fn test_heal_statistics_new() {
|
||||
let stats = HealStatistics::new();
|
||||
|
||||
@@ -31,7 +31,7 @@ mod checkpoint;
|
||||
mod replacement;
|
||||
mod utils;
|
||||
|
||||
pub use checkpoint::{CheckpointManager, CheckpointObjectOutcome, CheckpointObjectOutcomeRecord, ResumeCheckpoint};
|
||||
pub use checkpoint::{CheckpointManager, ResumeCheckpoint};
|
||||
pub(crate) use replacement::replacement_target_identities_match;
|
||||
use replacement::replacement_targets_match_identities;
|
||||
pub use replacement::{
|
||||
@@ -340,12 +340,6 @@ pub struct ResumeState {
|
||||
pub failed_objects: u64,
|
||||
/// skipped objects
|
||||
pub skipped_objects: u64,
|
||||
/// Terminal versions skipped because they were newer than the heal start.
|
||||
#[serde(default)]
|
||||
pub skipped_new_versions: u64,
|
||||
/// Terminal versions handed to lifecycle expiry.
|
||||
#[serde(default)]
|
||||
pub skipped_ilm_expired: u64,
|
||||
/// current bucket
|
||||
pub current_bucket: Option<String>,
|
||||
/// current object
|
||||
@@ -360,24 +354,6 @@ pub struct ResumeState {
|
||||
pub retry_count: u32,
|
||||
/// max retries
|
||||
pub max_retries: u32,
|
||||
/// Bytes accounted by the object ledger; additive for old snapshots.
|
||||
#[serde(default)]
|
||||
pub processed_bytes: u64,
|
||||
/// Total bytes from a complete usage snapshot, when available.
|
||||
#[serde(default)]
|
||||
pub total_bytes: u64,
|
||||
/// Generation of the usage snapshot used for the baseline.
|
||||
#[serde(default)]
|
||||
pub baseline_generation: Option<u64>,
|
||||
/// Whether the usage baseline is known. Missing in old snapshots means
|
||||
/// indeterminate rather than a measured zero baseline.
|
||||
#[serde(default)]
|
||||
pub baseline_known: bool,
|
||||
/// Persistent telemetry fence for counter/byte overflow or corruption.
|
||||
/// It must survive a restart so a saturated snapshot is never presented as
|
||||
/// a measured percentage on the next resume.
|
||||
#[serde(default)]
|
||||
pub counter_unknown: bool,
|
||||
}
|
||||
|
||||
impl ResumeState {
|
||||
@@ -401,8 +377,6 @@ impl ResumeState {
|
||||
successful_objects: 0,
|
||||
failed_objects: 0,
|
||||
skipped_objects: 0,
|
||||
skipped_new_versions: 0,
|
||||
skipped_ilm_expired: 0,
|
||||
current_bucket: None,
|
||||
current_object: None,
|
||||
completed_buckets: Vec::new(),
|
||||
@@ -410,11 +384,6 @@ impl ResumeState {
|
||||
error_message: None,
|
||||
retry_count: 0,
|
||||
max_retries: 3,
|
||||
processed_bytes: 0,
|
||||
total_bytes: 0,
|
||||
baseline_generation: None,
|
||||
baseline_known: false,
|
||||
counter_unknown: false,
|
||||
}
|
||||
}
|
||||
|
||||
@@ -443,39 +412,6 @@ impl ResumeState {
|
||||
self.last_update = SystemTime::now().duration_since(UNIX_EPOCH).unwrap_or_default().as_secs();
|
||||
}
|
||||
|
||||
pub fn update_progress_with_bytes(
|
||||
&mut self,
|
||||
processed: u64,
|
||||
successful: u64,
|
||||
failed: u64,
|
||||
skipped: u64,
|
||||
processed_bytes: u64,
|
||||
) {
|
||||
self.update_progress(processed, successful, failed, skipped);
|
||||
self.processed_bytes = processed_bytes;
|
||||
}
|
||||
|
||||
pub fn set_skipped_version_counts(&mut self, new_versions: u64, ilm_expired: u64) {
|
||||
self.skipped_new_versions = new_versions;
|
||||
self.skipped_ilm_expired = ilm_expired;
|
||||
self.last_update = SystemTime::now().duration_since(UNIX_EPOCH).unwrap_or_default().as_secs();
|
||||
}
|
||||
|
||||
pub fn set_progress_baseline(&mut self, total_objects: u64, total_bytes: u64, generation: Option<u64>) {
|
||||
self.total_objects = total_objects;
|
||||
self.total_bytes = total_bytes;
|
||||
self.baseline_generation = generation;
|
||||
// This method is called only after a complete usage snapshot has been
|
||||
// validated. A complete but empty snapshot is still a known baseline.
|
||||
self.baseline_known = true;
|
||||
self.last_update = SystemTime::now().duration_since(UNIX_EPOCH).unwrap_or_default().as_secs();
|
||||
}
|
||||
|
||||
pub fn mark_counter_unknown(&mut self) {
|
||||
self.counter_unknown = true;
|
||||
self.last_update = SystemTime::now().duration_since(UNIX_EPOCH).unwrap_or_default().as_secs();
|
||||
}
|
||||
|
||||
pub fn set_current_item(&mut self, bucket: Option<String>, object: Option<String>) {
|
||||
self.current_bucket = bucket;
|
||||
self.current_object = object;
|
||||
@@ -501,7 +437,6 @@ impl ResumeState {
|
||||
if let Some(pos) = self.pending_buckets.iter().position(|b| b == bucket) {
|
||||
self.pending_buckets.remove(pos);
|
||||
}
|
||||
self.resume_cursor = None;
|
||||
self.last_update = SystemTime::now().duration_since(UNIX_EPOCH).unwrap_or_default().as_secs();
|
||||
}
|
||||
|
||||
@@ -519,10 +454,6 @@ impl ResumeState {
|
||||
self.successful_objects = 0;
|
||||
self.failed_objects = 0;
|
||||
self.skipped_objects = 0;
|
||||
self.skipped_new_versions = 0;
|
||||
self.skipped_ilm_expired = 0;
|
||||
self.processed_bytes = 0;
|
||||
self.counter_unknown = false;
|
||||
self.completed = false;
|
||||
// A retry re-scans every bucket from the beginning, so the version
|
||||
// cursor must be cleared too — otherwise the retry would resume mid-scan.
|
||||
@@ -545,28 +476,14 @@ impl ResumeState {
|
||||
}
|
||||
|
||||
pub fn get_progress_percentage(&self) -> f64 {
|
||||
if self.completed {
|
||||
return 100.0;
|
||||
}
|
||||
if self.counter_unknown {
|
||||
return 0.0;
|
||||
}
|
||||
if !self.baseline_known {
|
||||
return 0.0;
|
||||
}
|
||||
if self.total_bytes > 0 {
|
||||
return ((self.processed_bytes as f64 / self.total_bytes as f64) * 100.0).min(99.999);
|
||||
}
|
||||
if self.total_objects == 0 {
|
||||
return 0.0;
|
||||
}
|
||||
((self.processed_objects as f64 / self.total_objects as f64) * 100.0).min(99.999)
|
||||
(self.processed_objects as f64 / self.total_objects as f64) * 100.0
|
||||
}
|
||||
|
||||
pub fn get_success_rate(&self) -> f64 {
|
||||
let Some(total) = self.successful_objects.checked_add(self.failed_objects) else {
|
||||
return 0.0;
|
||||
};
|
||||
let total = self.successful_objects + self.failed_objects;
|
||||
if total == 0 {
|
||||
return 0.0;
|
||||
}
|
||||
@@ -837,14 +754,6 @@ impl ResumeManager {
|
||||
state.successful_objects = 0;
|
||||
state.failed_objects = 0;
|
||||
state.skipped_objects = 0;
|
||||
state.skipped_new_versions = 0;
|
||||
state.skipped_ilm_expired = 0;
|
||||
state.processed_bytes = 0;
|
||||
state.total_objects = 0;
|
||||
state.total_bytes = 0;
|
||||
state.baseline_generation = None;
|
||||
state.baseline_known = false;
|
||||
state.counter_unknown = false;
|
||||
state.completed = false;
|
||||
state.completed_buckets.clear();
|
||||
state.schema_version = CURRENT_RESUME_SCHEMA;
|
||||
@@ -929,41 +838,6 @@ impl ResumeManager {
|
||||
self.save_state_throttled().await
|
||||
}
|
||||
|
||||
pub async fn update_progress_with_bytes(
|
||||
&self,
|
||||
processed: u64,
|
||||
successful: u64,
|
||||
failed: u64,
|
||||
skipped: u64,
|
||||
processed_bytes: u64,
|
||||
) -> Result<()> {
|
||||
let mut state = self.state.write().await;
|
||||
state.update_progress_with_bytes(processed, successful, failed, skipped, processed_bytes);
|
||||
drop(state);
|
||||
self.save_state_throttled().await
|
||||
}
|
||||
|
||||
pub async fn set_progress_baseline(&self, total_objects: u64, total_bytes: u64, generation: Option<u64>) -> Result<()> {
|
||||
let mut state = self.state.write().await;
|
||||
state.set_progress_baseline(total_objects, total_bytes, generation);
|
||||
drop(state);
|
||||
self.save_state_throttled().await
|
||||
}
|
||||
|
||||
pub async fn mark_counter_unknown(&self) -> Result<()> {
|
||||
let mut state = self.state.write().await;
|
||||
state.mark_counter_unknown();
|
||||
drop(state);
|
||||
self.save_state().await
|
||||
}
|
||||
|
||||
pub async fn set_skipped_version_counts(&self, new_versions: u64, ilm_expired: u64) -> Result<()> {
|
||||
let mut state = self.state.write().await;
|
||||
state.set_skipped_version_counts(new_versions, ilm_expired);
|
||||
drop(state);
|
||||
self.save_state_throttled().await
|
||||
}
|
||||
|
||||
/// Set current item. Called once per healed object, so persistence is
|
||||
/// throttled: the in-memory state always updates, but the snapshot is only
|
||||
/// written every `PERSIST_EVERY_MUTATIONS` calls or `PERSIST_INTERVAL`.
|
||||
@@ -1008,7 +882,7 @@ impl ResumeManager {
|
||||
let mut state = self.state.write().await;
|
||||
state.complete_bucket(bucket);
|
||||
drop(state);
|
||||
self.save_state().await
|
||||
self.save_state_throttled().await
|
||||
}
|
||||
|
||||
/// mark task completed
|
||||
|
||||
@@ -29,30 +29,10 @@ use super::{
|
||||
|
||||
const EVENT_HEAL_CHECKPOINT_STATE: &str = "heal_checkpoint_state";
|
||||
|
||||
/// Current on-disk schema version for `ResumeCheckpoint`. Schema 5 could
|
||||
/// persist dedup identities without the aggregate counters needed to restore
|
||||
/// them safely, so stale checkpoints are discarded and replayed.
|
||||
pub(super) const CURRENT_CHECKPOINT_SCHEMA: u32 = 6;
|
||||
|
||||
#[derive(Debug, Clone, Copy)]
|
||||
pub enum CheckpointObjectOutcome {
|
||||
Processed,
|
||||
Failed,
|
||||
Skipped,
|
||||
}
|
||||
|
||||
#[derive(Debug)]
|
||||
pub struct CheckpointObjectOutcomeRecord {
|
||||
pub object: String,
|
||||
pub outcome: CheckpointObjectOutcome,
|
||||
pub successful: u64,
|
||||
pub failed: u64,
|
||||
pub skipped: u64,
|
||||
pub bytes: u64,
|
||||
pub skipped_new_versions: u64,
|
||||
pub skipped_ilm_expired: u64,
|
||||
pub counter_unknown: bool,
|
||||
}
|
||||
/// Current on-disk schema version for `ResumeCheckpoint`. Same rationale as
|
||||
/// `CURRENT_RESUME_SCHEMA`: pre-per-version dedup identities are not comparable
|
||||
/// to the new `compose_key` identities, so a stale checkpoint is discarded.
|
||||
pub(super) const CURRENT_CHECKPOINT_SCHEMA: u32 = 5;
|
||||
|
||||
/// resume checkpoint
|
||||
#[derive(Debug, Clone, Serialize, Deserialize)]
|
||||
@@ -77,30 +57,6 @@ pub struct ResumeCheckpoint {
|
||||
pub failed_objects: HashSet<String>,
|
||||
/// skipped objects
|
||||
pub skipped_objects: HashSet<String>,
|
||||
/// Aggregate object ledger counters restored alongside the dedup sets.
|
||||
#[serde(default)]
|
||||
pub successful_objects: u64,
|
||||
#[serde(default)]
|
||||
pub failed_object_count: u64,
|
||||
#[serde(default)]
|
||||
pub skipped_object_count: u64,
|
||||
#[serde(default)]
|
||||
pub skipped_new_versions: u64,
|
||||
#[serde(default)]
|
||||
pub skipped_ilm_expired: u64,
|
||||
#[serde(default)]
|
||||
pub processed_bytes: u64,
|
||||
#[serde(default)]
|
||||
pub total_objects: u64,
|
||||
#[serde(default)]
|
||||
pub total_bytes: u64,
|
||||
#[serde(default)]
|
||||
pub baseline_generation: Option<u64>,
|
||||
#[serde(default)]
|
||||
pub baseline_known: bool,
|
||||
/// Persistent telemetry fence for counter/byte overflow or corruption.
|
||||
#[serde(default)]
|
||||
pub counter_unknown: bool,
|
||||
}
|
||||
|
||||
impl ResumeCheckpoint {
|
||||
@@ -114,17 +70,6 @@ impl ResumeCheckpoint {
|
||||
processed_objects: HashSet::new(),
|
||||
failed_objects: HashSet::new(),
|
||||
skipped_objects: HashSet::new(),
|
||||
successful_objects: 0,
|
||||
failed_object_count: 0,
|
||||
skipped_object_count: 0,
|
||||
skipped_new_versions: 0,
|
||||
skipped_ilm_expired: 0,
|
||||
processed_bytes: 0,
|
||||
total_objects: 0,
|
||||
total_bytes: 0,
|
||||
baseline_generation: None,
|
||||
baseline_known: false,
|
||||
counter_unknown: false,
|
||||
}
|
||||
}
|
||||
|
||||
@@ -146,34 +91,6 @@ impl ResumeCheckpoint {
|
||||
self.skipped_objects.insert(object);
|
||||
}
|
||||
|
||||
pub fn update_progress(&mut self, successful: u64, failed: u64, skipped: u64, bytes: u64) {
|
||||
self.successful_objects = successful;
|
||||
self.failed_object_count = failed;
|
||||
self.skipped_object_count = skipped;
|
||||
self.processed_bytes = bytes;
|
||||
}
|
||||
|
||||
pub fn set_progress_baseline(&mut self, total_objects: u64, total_bytes: u64, generation: Option<u64>) {
|
||||
self.total_objects = total_objects;
|
||||
self.total_bytes = total_bytes;
|
||||
self.baseline_generation = generation;
|
||||
// The caller has already validated that this is a complete snapshot;
|
||||
// preserve the distinction between a known empty scope and an old
|
||||
// checkpoint that omitted all baseline fields.
|
||||
self.baseline_known = true;
|
||||
}
|
||||
|
||||
pub fn mark_counter_unknown(&mut self) {
|
||||
self.counter_unknown = true;
|
||||
self.checkpoint_time = SystemTime::now().duration_since(UNIX_EPOCH).unwrap_or_default().as_secs();
|
||||
}
|
||||
|
||||
pub fn set_skipped_version_counts(&mut self, new_versions: u64, ilm_expired: u64) {
|
||||
self.skipped_new_versions = new_versions;
|
||||
self.skipped_ilm_expired = ilm_expired;
|
||||
self.checkpoint_time = SystemTime::now().duration_since(UNIX_EPOCH).unwrap_or_default().as_secs();
|
||||
}
|
||||
|
||||
/// Advance past a fully-processed page: objects below `object_index` are
|
||||
/// skipped by position on resume, so the per-object sets no longer need
|
||||
/// their entries and would otherwise grow with the whole bucket.
|
||||
@@ -190,17 +107,6 @@ impl ResumeCheckpoint {
|
||||
self.update_position(0, 0);
|
||||
self.processed_objects.clear();
|
||||
self.skipped_objects.clear();
|
||||
self.successful_objects = 0;
|
||||
self.failed_object_count = 0;
|
||||
self.skipped_object_count = 0;
|
||||
self.skipped_new_versions = 0;
|
||||
self.skipped_ilm_expired = 0;
|
||||
self.processed_bytes = 0;
|
||||
self.total_objects = 0;
|
||||
self.total_bytes = 0;
|
||||
self.baseline_generation = None;
|
||||
self.baseline_known = false;
|
||||
self.counter_unknown = false;
|
||||
self.failed_objects.clear();
|
||||
}
|
||||
}
|
||||
@@ -252,9 +158,10 @@ impl CheckpointManager {
|
||||
});
|
||||
}
|
||||
|
||||
// Older checkpoints can contain identities that are not comparable to
|
||||
// the current keys or lack their corresponding aggregate counters.
|
||||
// Discard the stale sets and position so the scan restarts cleanly.
|
||||
// A checkpoint from an older schema stored latest-only dedup identities
|
||||
// that are not comparable to the new per-version `compose_key`
|
||||
// identities. Discard the stale sets and position, then stamp the
|
||||
// current schema so the scan restarts cleanly.
|
||||
if checkpoint.schema_version > CURRENT_CHECKPOINT_SCHEMA {
|
||||
return Err(Error::TaskExecutionFailed {
|
||||
message: format!(
|
||||
@@ -278,17 +185,6 @@ impl CheckpointManager {
|
||||
checkpoint.processed_objects.clear();
|
||||
checkpoint.failed_objects.clear();
|
||||
checkpoint.skipped_objects.clear();
|
||||
checkpoint.successful_objects = 0;
|
||||
checkpoint.failed_object_count = 0;
|
||||
checkpoint.skipped_object_count = 0;
|
||||
checkpoint.skipped_new_versions = 0;
|
||||
checkpoint.skipped_ilm_expired = 0;
|
||||
checkpoint.processed_bytes = 0;
|
||||
checkpoint.total_objects = 0;
|
||||
checkpoint.total_bytes = 0;
|
||||
checkpoint.baseline_generation = None;
|
||||
checkpoint.baseline_known = false;
|
||||
checkpoint.counter_unknown = false;
|
||||
checkpoint.current_bucket_index = 0;
|
||||
checkpoint.current_object_index = 0;
|
||||
checkpoint.schema_version = CURRENT_CHECKPOINT_SCHEMA;
|
||||
@@ -329,7 +225,7 @@ impl CheckpointManager {
|
||||
self.save_checkpoint_throttled().await
|
||||
}
|
||||
|
||||
/// Persist a completed page position while retaining its identities.
|
||||
/// Advance past a completed page and prune the per-object sets, then persist.
|
||||
pub async fn complete_page(&self, bucket_index: usize, object_index: usize) -> Result<()> {
|
||||
let mut checkpoint = self.checkpoint.write().await;
|
||||
checkpoint.complete_page(bucket_index, object_index);
|
||||
@@ -337,35 +233,6 @@ impl CheckpointManager {
|
||||
self.save_checkpoint_throttled().await
|
||||
}
|
||||
|
||||
/// Persist the page position while retaining identities until the resume
|
||||
/// cursor is durable.
|
||||
pub async fn advance_page(&self, bucket_index: usize, object_index: usize) -> Result<()> {
|
||||
let mut checkpoint = self.checkpoint.write().await;
|
||||
checkpoint.update_position(bucket_index, object_index);
|
||||
drop(checkpoint);
|
||||
self.save_checkpoint().await
|
||||
}
|
||||
|
||||
/// Remove the previous page's dedup identities only after its resume cursor
|
||||
/// has been durably exposed.
|
||||
pub async fn prune_completed_page(&self) -> Result<()> {
|
||||
let mut checkpoint = self.checkpoint.write().await;
|
||||
checkpoint.processed_objects.clear();
|
||||
checkpoint.skipped_objects.clear();
|
||||
checkpoint.failed_objects.clear();
|
||||
drop(checkpoint);
|
||||
self.save_checkpoint().await
|
||||
}
|
||||
|
||||
/// Advance to the next bucket and clear the final page identities after the
|
||||
/// resume state has durably recorded the completed bucket.
|
||||
pub async fn complete_bucket(&self, next_bucket_index: usize) -> Result<()> {
|
||||
let mut checkpoint = self.checkpoint.write().await;
|
||||
checkpoint.complete_page(next_bucket_index, 0);
|
||||
drop(checkpoint);
|
||||
self.save_checkpoint().await
|
||||
}
|
||||
|
||||
/// Reset the checkpoint to the start of the scan for a retry, then persist.
|
||||
pub async fn reset_for_retry(&self) -> Result<()> {
|
||||
let mut checkpoint = self.checkpoint.write().await;
|
||||
@@ -400,62 +267,6 @@ impl CheckpointManager {
|
||||
self.save_checkpoint_if_due().await
|
||||
}
|
||||
|
||||
/// Atomically persist an object's dedup identity with its aggregate result.
|
||||
pub async fn record_object_outcome(&self, record: CheckpointObjectOutcomeRecord) -> Result<()> {
|
||||
let CheckpointObjectOutcomeRecord {
|
||||
object,
|
||||
outcome,
|
||||
successful,
|
||||
failed,
|
||||
skipped,
|
||||
bytes,
|
||||
skipped_new_versions,
|
||||
skipped_ilm_expired,
|
||||
counter_unknown,
|
||||
} = record;
|
||||
let mut checkpoint = self.checkpoint.write().await;
|
||||
match outcome {
|
||||
CheckpointObjectOutcome::Processed => checkpoint.add_processed_object(object),
|
||||
CheckpointObjectOutcome::Failed => checkpoint.add_failed_object(object),
|
||||
CheckpointObjectOutcome::Skipped => checkpoint.add_skipped_object(object),
|
||||
}
|
||||
checkpoint.update_progress(successful, failed, skipped, bytes);
|
||||
checkpoint.set_skipped_version_counts(skipped_new_versions, skipped_ilm_expired);
|
||||
if counter_unknown {
|
||||
checkpoint.mark_counter_unknown();
|
||||
}
|
||||
drop(checkpoint);
|
||||
self.save_checkpoint_if_due().await
|
||||
}
|
||||
|
||||
pub async fn update_progress(&self, successful: u64, failed: u64, skipped: u64, bytes: u64) -> Result<()> {
|
||||
let mut checkpoint = self.checkpoint.write().await;
|
||||
checkpoint.update_progress(successful, failed, skipped, bytes);
|
||||
drop(checkpoint);
|
||||
self.save_checkpoint_if_due().await
|
||||
}
|
||||
|
||||
pub async fn set_progress_baseline(&self, total_objects: u64, total_bytes: u64, generation: Option<u64>) -> Result<()> {
|
||||
let mut checkpoint = self.checkpoint.write().await;
|
||||
checkpoint.set_progress_baseline(total_objects, total_bytes, generation);
|
||||
drop(checkpoint);
|
||||
self.save_checkpoint_throttled().await
|
||||
}
|
||||
|
||||
pub async fn mark_counter_unknown(&self) -> Result<()> {
|
||||
let mut checkpoint = self.checkpoint.write().await;
|
||||
checkpoint.mark_counter_unknown();
|
||||
drop(checkpoint);
|
||||
self.save_checkpoint().await
|
||||
}
|
||||
|
||||
pub async fn set_skipped_version_counts(&self, new_versions: u64, ilm_expired: u64) -> Result<()> {
|
||||
let mut checkpoint = self.checkpoint.write().await;
|
||||
checkpoint.set_skipped_version_counts(new_versions, ilm_expired);
|
||||
drop(checkpoint);
|
||||
self.save_checkpoint_throttled().await
|
||||
}
|
||||
|
||||
async fn save_checkpoint_if_due(&self) -> Result<()> {
|
||||
let should_save = self.throttle.lock().map(|mut throttle| throttle.record()).unwrap_or(true);
|
||||
if !should_save {
|
||||
|
||||
@@ -1296,7 +1296,6 @@ async fn test_resume_state_progress() {
|
||||
assert_eq!(progress, 0.0); // total_objects is 0
|
||||
|
||||
state.total_objects = 100;
|
||||
state.baseline_known = true;
|
||||
let progress = state.get_progress_percentage();
|
||||
assert_eq!(progress, 10.0);
|
||||
}
|
||||
@@ -1476,40 +1475,6 @@ fn test_checkpoint_object_sets_dedupe_and_prune() {
|
||||
assert!(checkpoint.failed_objects.is_empty());
|
||||
}
|
||||
|
||||
#[tokio::test]
|
||||
async fn checkpoint_page_commit_keeps_ledger_until_cursor_is_durable() {
|
||||
let (_temp_dir, disk) = schema_test_disk().await;
|
||||
let task_id = ResumeUtils::generate_task_id();
|
||||
let checkpoint = CheckpointManager::new(disk.clone(), task_id.clone()).await.unwrap();
|
||||
|
||||
checkpoint
|
||||
.record_object_outcome(CheckpointObjectOutcomeRecord {
|
||||
object: "bucket/object:v1".to_string(),
|
||||
outcome: CheckpointObjectOutcome::Processed,
|
||||
successful: 1,
|
||||
failed: 0,
|
||||
skipped: 0,
|
||||
bytes: 128,
|
||||
skipped_new_versions: 0,
|
||||
skipped_ilm_expired: 0,
|
||||
counter_unknown: false,
|
||||
})
|
||||
.await
|
||||
.unwrap();
|
||||
checkpoint.advance_page(0, 1).await.unwrap();
|
||||
|
||||
let reloaded = CheckpointManager::load_from_disk(disk.clone(), &task_id).await.unwrap();
|
||||
let snapshot = reloaded.get_checkpoint().await;
|
||||
assert_eq!(snapshot.current_object_index, 1);
|
||||
assert_eq!(snapshot.successful_objects, 1);
|
||||
assert_eq!(snapshot.processed_bytes, 128);
|
||||
assert!(snapshot.processed_objects.contains("bucket/object:v1"));
|
||||
|
||||
checkpoint.prune_completed_page().await.unwrap();
|
||||
let reloaded = CheckpointManager::load_from_disk(disk, &task_id).await.unwrap();
|
||||
assert!(reloaded.get_checkpoint().await.processed_objects.is_empty());
|
||||
}
|
||||
|
||||
#[test]
|
||||
fn test_checkpoint_loads_legacy_vec_format() {
|
||||
// Checkpoints written before the HashSet migration stored the object
|
||||
@@ -1603,14 +1568,14 @@ async fn test_resumestate_schema_v0_discarded_on_load() {
|
||||
}
|
||||
|
||||
#[tokio::test]
|
||||
async fn test_checkpoint_schema_v5_discarded_on_load() {
|
||||
async fn test_checkpoint_schema_v4_discarded_on_load() {
|
||||
let (temp_dir, disk) = schema_test_disk().await;
|
||||
|
||||
// Schema v5 can persist failed identities without the aggregate counters
|
||||
// that make those identities safe to deduplicate after an upgrade.
|
||||
// The previous checkpoint schema is unsafe once its paired resume
|
||||
// state is discarded: retaining either position would skip work.
|
||||
let task_id = "00000000-0000-4000-8000-000000000002";
|
||||
let legacy = r#"{
|
||||
"schema_version": 5,
|
||||
"schema_version": 4,
|
||||
"task_id": "00000000-0000-4000-8000-000000000002",
|
||||
"checkpoint_time": 1700000000,
|
||||
"current_bucket_index": 2,
|
||||
@@ -1674,120 +1639,6 @@ async fn current_normal_resume_schema_preserves_progress() {
|
||||
temp_dir.close().expect("remove schema test directory");
|
||||
}
|
||||
|
||||
#[test]
|
||||
fn progress_checkpoint_restores_bytes_and_generation() {
|
||||
let mut checkpoint = ResumeCheckpoint::new("progress-checkpoint".to_string());
|
||||
checkpoint.set_progress_baseline(9, 4096, Some(77));
|
||||
checkpoint.update_progress(4, 1, 2, 2048);
|
||||
checkpoint.set_skipped_version_counts(3, 1);
|
||||
checkpoint.mark_counter_unknown();
|
||||
|
||||
let restored: ResumeCheckpoint =
|
||||
serde_json::from_slice(&serde_json::to_vec(&checkpoint).expect("serialize checkpoint")).expect("deserialize checkpoint");
|
||||
assert_eq!(restored.processed_bytes, 2048);
|
||||
assert_eq!(restored.total_objects, 9);
|
||||
assert_eq!(restored.total_bytes, 4096);
|
||||
assert_eq!(restored.baseline_generation, Some(77));
|
||||
assert!(restored.baseline_known);
|
||||
assert_eq!(restored.skipped_new_versions, 3);
|
||||
assert_eq!(restored.skipped_ilm_expired, 1);
|
||||
assert!(restored.counter_unknown);
|
||||
}
|
||||
|
||||
#[test]
|
||||
fn old_progress_schema_migrates_missing_fields_to_unknown() {
|
||||
let state = ResumeState::new(
|
||||
"legacy-progress".to_string(),
|
||||
"erasure_set".to_string(),
|
||||
"pool_0_set_0".to_string(),
|
||||
Vec::new(),
|
||||
);
|
||||
let mut value = serde_json::to_value(state).expect("serialize legacy-compatible state");
|
||||
let object = value.as_object_mut().expect("state must be an object");
|
||||
for field in [
|
||||
"processed_bytes",
|
||||
"total_bytes",
|
||||
"baseline_generation",
|
||||
"baseline_known",
|
||||
"skipped_new_versions",
|
||||
"skipped_ilm_expired",
|
||||
] {
|
||||
object.remove(field);
|
||||
}
|
||||
object.insert("total_objects".to_string(), serde_json::json!(10));
|
||||
object.insert("processed_objects".to_string(), serde_json::json!(5));
|
||||
let restored: ResumeState = serde_json::from_value(value).expect("deserialize old progress state");
|
||||
assert_eq!(restored.processed_bytes, 0);
|
||||
assert_eq!(restored.total_bytes, 0);
|
||||
assert_eq!(restored.baseline_generation, None);
|
||||
assert!(!restored.baseline_known, "missing baseline must remain unknown");
|
||||
assert_eq!(restored.get_progress_percentage(), 0.0);
|
||||
assert_eq!(restored.skipped_new_versions, 0);
|
||||
assert_eq!(restored.skipped_ilm_expired, 0);
|
||||
}
|
||||
|
||||
#[test]
|
||||
fn progress_counter_unknown_survives_resume_round_trip() {
|
||||
let mut state = ResumeState::new(
|
||||
"overflow-progress".to_string(),
|
||||
"erasure_set".to_string(),
|
||||
"pool_0_set_0".to_string(),
|
||||
Vec::new(),
|
||||
);
|
||||
state.mark_counter_unknown();
|
||||
|
||||
let restored: ResumeState =
|
||||
serde_json::from_slice(&serde_json::to_vec(&state).expect("serialize resume state")).expect("deserialize resume state");
|
||||
assert!(restored.counter_unknown);
|
||||
}
|
||||
|
||||
#[tokio::test]
|
||||
async fn checkpoint_progress_survives_a_torn_resume_summary_write() {
|
||||
let (_temp_dir, disk) = schema_test_disk().await;
|
||||
let task_id = ResumeUtils::generate_task_id();
|
||||
let _resume = ResumeManager::new(
|
||||
disk.clone(),
|
||||
task_id.clone(),
|
||||
"erasure_set".to_string(),
|
||||
"pool_0_set_0".to_string(),
|
||||
vec!["bucket".to_string()],
|
||||
)
|
||||
.await
|
||||
.expect("resume state should persist");
|
||||
let checkpoint = CheckpointManager::new(disk.clone(), task_id.clone())
|
||||
.await
|
||||
.expect("checkpoint should persist");
|
||||
|
||||
// This is the ordering used by the erasure-set loop: the checkpoint is
|
||||
// durable before the summary write. Stop here to model a crash in the
|
||||
// inter-store window and verify that the recovery authority retains the
|
||||
// telemetry fence and bytes.
|
||||
checkpoint
|
||||
.update_progress(3, 0, 0, 1024)
|
||||
.await
|
||||
.expect("checkpoint progress should persist");
|
||||
checkpoint.mark_counter_unknown().await.expect("unknown fence should persist");
|
||||
checkpoint
|
||||
.update_position(0, 3)
|
||||
.await
|
||||
.expect("checkpoint position should persist");
|
||||
|
||||
let restored_checkpoint = CheckpointManager::load_from_disk(disk.clone(), &task_id)
|
||||
.await
|
||||
.expect("checkpoint should reload")
|
||||
.get_checkpoint()
|
||||
.await;
|
||||
let restored_resume = ResumeManager::load_from_disk(disk, &task_id)
|
||||
.await
|
||||
.expect("resume summary should reload")
|
||||
.get_state()
|
||||
.await;
|
||||
assert!(restored_checkpoint.counter_unknown);
|
||||
assert_eq!(restored_checkpoint.processed_bytes, 1024);
|
||||
assert_eq!(restored_checkpoint.current_object_index, 3);
|
||||
assert!(!restored_resume.counter_unknown, "summary is intentionally the torn/older store");
|
||||
}
|
||||
|
||||
#[tokio::test]
|
||||
async fn future_resume_and_checkpoint_schemas_are_rejected() {
|
||||
let (temp_dir, disk) = schema_test_disk().await;
|
||||
|
||||
@@ -22,7 +22,6 @@ use serde::{Deserialize, Serialize};
|
||||
use std::sync::Arc;
|
||||
use tracing::{debug, error, warn};
|
||||
|
||||
use super::progress::stable_generation;
|
||||
use super::storage_api::owner::{EcstoreHealLifecycleExpiryContext, ecstore_load_admin_data_usage_from_backend_cached};
|
||||
use super::storage_api::storage::{
|
||||
BucketInfo, BucketOperations, DiskSetSelector, HealOperations as _, ListOperations as _, ObjectIO as _,
|
||||
@@ -35,9 +34,6 @@ pub use super::{HealObjectInfo, HealObjectOptions, HealPutObjReader};
|
||||
pub struct HealBucketUsageBaseline {
|
||||
pub objects_count: u64,
|
||||
pub bytes: u64,
|
||||
/// Stable identity of the validated usage snapshot and selected scope.
|
||||
/// `None` is retained for test/legacy providers that cannot expose one.
|
||||
pub generation: Option<u64>,
|
||||
}
|
||||
|
||||
pub struct HealLifecycleExpiryContext {
|
||||
@@ -789,52 +785,11 @@ impl HealStorageAPI for ECStoreHealStorage {
|
||||
let mut baseline = HealBucketUsageBaseline::default();
|
||||
for bucket in buckets {
|
||||
if let Some(usage) = info.buckets_usage.get(bucket) {
|
||||
baseline.objects_count = match baseline.objects_count.checked_add(usage.objects_count) {
|
||||
Some(total) => total,
|
||||
// A corrupt/overflowing usage snapshot is not a usable
|
||||
// denominator. Leave progress indeterminate instead of
|
||||
// turning saturation into a plausible percentage.
|
||||
None => return Ok(None),
|
||||
};
|
||||
baseline.bytes = match baseline.bytes.checked_add(usage.size) {
|
||||
Some(total) => total,
|
||||
None => return Ok(None),
|
||||
};
|
||||
baseline.objects_count = baseline.objects_count.saturating_add(usage.objects_count);
|
||||
baseline.bytes = baseline.bytes.saturating_add(usage.size);
|
||||
}
|
||||
}
|
||||
|
||||
let identity = info.snapshot_identity();
|
||||
let mut canonical = Vec::new();
|
||||
match identity.last_update {
|
||||
Some(last_update) => {
|
||||
canonical.push(1);
|
||||
canonical.extend_from_slice(
|
||||
&last_update
|
||||
.duration_since(std::time::UNIX_EPOCH)
|
||||
.unwrap_or_default()
|
||||
.as_nanos()
|
||||
.to_be_bytes(),
|
||||
);
|
||||
}
|
||||
None => canonical.push(0),
|
||||
}
|
||||
for value in [identity.scanner_cycle, identity.scanner_epoch] {
|
||||
match value {
|
||||
Some(value) => {
|
||||
canonical.push(1);
|
||||
canonical.extend_from_slice(&value.to_be_bytes());
|
||||
}
|
||||
None => canonical.push(0),
|
||||
}
|
||||
}
|
||||
let mut scope = buckets.to_vec();
|
||||
scope.sort_unstable();
|
||||
for bucket in scope {
|
||||
canonical.extend_from_slice(&(bucket.len() as u64).to_be_bytes());
|
||||
canonical.extend_from_slice(bucket.as_bytes());
|
||||
}
|
||||
baseline.generation = Some(stable_generation(&[&canonical]));
|
||||
|
||||
Ok(Some(baseline))
|
||||
}
|
||||
|
||||
|
||||
@@ -649,7 +649,7 @@ impl HealTask {
|
||||
|
||||
let mut progress = self.progress.write().await;
|
||||
progress.set_current_object(Some(format!("skipped: {bucket}/{object}")));
|
||||
progress.update_stage(1, 1);
|
||||
progress.update_progress(0, 1, 0, 0);
|
||||
Ok(())
|
||||
}
|
||||
|
||||
@@ -733,7 +733,7 @@ impl HealTask {
|
||||
"Heal object skipped for data usage cache after transient error"
|
||||
);
|
||||
let mut progress = self.progress.write().await;
|
||||
progress.update_stage(3, 3);
|
||||
progress.update_progress(3, 3, 0, 0);
|
||||
true
|
||||
}
|
||||
|
||||
@@ -757,7 +757,7 @@ impl HealTask {
|
||||
);
|
||||
let mut progress = self.progress.write().await;
|
||||
progress.set_current_object(Some(format!("skipped: {bucket}/{object}")));
|
||||
progress.update_stage(4, 4);
|
||||
progress.update_progress(4, 4, 0, 0);
|
||||
true
|
||||
}
|
||||
|
||||
@@ -831,10 +831,6 @@ impl HealTask {
|
||||
|
||||
match &result {
|
||||
Ok(_) => {
|
||||
// A stage can reach its final step before the durable resume
|
||||
// ledger and cleanup fences commit. Publish terminal 100 only
|
||||
// after the enclosing operation has returned success.
|
||||
self.progress.write().await.mark_completed();
|
||||
let mut status = self.status.write().await;
|
||||
*status = HealTaskStatus::Completed;
|
||||
demote_to_debug_when!(self.heal_type.is_per_object(), info, target: "rustfs::heal::task", {
|
||||
|
||||
@@ -13,7 +13,6 @@
|
||||
// limitations under the License.
|
||||
/// bucket/cluster/prefix heal: the recursive bucket-objects sweep and the erasure-set usage baseline
|
||||
use super::*;
|
||||
use crate::heal::progress::{add_bytes, increment_counter, stable_generation};
|
||||
|
||||
impl HealTask {
|
||||
pub(super) async fn heal_bucket(&self, bucket: &str) -> Result<()> {
|
||||
@@ -33,7 +32,7 @@ impl HealTask {
|
||||
{
|
||||
let mut progress = self.progress.write().await;
|
||||
progress.set_current_object(Some(format!("bucket: {bucket}")));
|
||||
progress.update_stage(0, 3);
|
||||
progress.update_progress(0, 3, 0, 0);
|
||||
}
|
||||
|
||||
// Step 1: Check if bucket exists
|
||||
@@ -67,7 +66,7 @@ impl HealTask {
|
||||
|
||||
{
|
||||
let mut progress = self.progress.write().await;
|
||||
progress.update_stage(1, 3);
|
||||
progress.update_progress(1, 3, 0, 0);
|
||||
}
|
||||
|
||||
// Step 2: Perform bucket heal using ecstore
|
||||
@@ -123,7 +122,7 @@ impl HealTask {
|
||||
|
||||
if !self.options.recursive {
|
||||
let mut progress = self.progress.write().await;
|
||||
progress.update_stage(3, 3);
|
||||
progress.update_progress(3, 3, 0, 0);
|
||||
}
|
||||
Ok(())
|
||||
}
|
||||
@@ -143,7 +142,7 @@ impl HealTask {
|
||||
);
|
||||
{
|
||||
let mut progress = self.progress.write().await;
|
||||
progress.update_stage(3, 3);
|
||||
progress.update_progress(3, 3, 0, 0);
|
||||
}
|
||||
Err(Error::TaskExecutionFailed {
|
||||
message: format!("Failed to heal bucket {bucket}: {e}"),
|
||||
@@ -246,7 +245,6 @@ impl HealTask {
|
||||
let mut scanned = 0u64;
|
||||
let mut healed = 0u64;
|
||||
let mut failed = 0u64;
|
||||
let mut skipped = 0u64;
|
||||
let mut retryable_failed = 0u64;
|
||||
let mut permanent_failed = 0u64;
|
||||
let mut bytes = 0u64;
|
||||
@@ -288,14 +286,16 @@ impl HealTask {
|
||||
let mut retry = Vec::with_capacity(pending.len());
|
||||
for item in pending {
|
||||
self.check_control_flags().await?;
|
||||
let mut telemetry_unknown = false;
|
||||
let object = item.name.as_str();
|
||||
if retry_attempt == 0 {
|
||||
scanned = scanned.saturating_add(1);
|
||||
}
|
||||
{
|
||||
let mut progress = self.progress.write().await;
|
||||
progress.set_current_object(Some(format!("{bucket}/{object}")));
|
||||
progress.update_progress(scanned, healed, failed, bytes);
|
||||
}
|
||||
|
||||
let mut terminal_outcome = true;
|
||||
let error = match self
|
||||
.await_with_control(
|
||||
self.storage
|
||||
@@ -304,13 +304,13 @@ impl HealTask {
|
||||
.await
|
||||
{
|
||||
Ok((result, None)) => {
|
||||
telemetry_unknown |= !increment_counter(&mut healed);
|
||||
telemetry_unknown |= !add_bytes(&mut bytes, u64::try_from(result.object_size).unwrap_or(u64::MAX));
|
||||
healed = healed.saturating_add(1);
|
||||
bytes = bytes.saturating_add(u64::try_from(result.object_size).unwrap_or_default());
|
||||
self.record_result_item(result).await;
|
||||
None
|
||||
}
|
||||
Ok((_, Some(err))) if is_missing_object_dir_heal_result(object, &err) => {
|
||||
telemetry_unknown |= !increment_counter(&mut healed);
|
||||
healed = healed.saturating_add(1);
|
||||
debug!(
|
||||
target: "rustfs::heal::task",
|
||||
event = EVENT_HEAL_BUCKET_RESULT,
|
||||
@@ -329,7 +329,6 @@ impl HealTask {
|
||||
|
||||
if let Some(err) = error {
|
||||
if Self::should_skip_data_usage_cache_heal_error(bucket, object, &err) {
|
||||
telemetry_unknown |= !increment_counter(&mut skipped);
|
||||
warn!(
|
||||
target: "rustfs::heal::task",
|
||||
event = EVENT_HEAL_BUCKET_RESULT,
|
||||
@@ -343,7 +342,6 @@ impl HealTask {
|
||||
"Heal bucket object repair skipped due to transient metadata error"
|
||||
);
|
||||
} else if err.is_recoverable_heal() && retry_attempt < MAX_BUCKET_OBJECT_HEAL_RETRIES {
|
||||
terminal_outcome = false;
|
||||
debug!(
|
||||
target: "rustfs::heal::task",
|
||||
event = EVENT_HEAL_BUCKET_RESULT,
|
||||
@@ -359,7 +357,7 @@ impl HealTask {
|
||||
);
|
||||
retry.push(item);
|
||||
} else {
|
||||
telemetry_unknown |= !increment_counter(&mut failed);
|
||||
failed = failed.saturating_add(1);
|
||||
if err.is_recoverable_heal() {
|
||||
retryable_failed = retryable_failed.saturating_add(1);
|
||||
} else {
|
||||
@@ -385,19 +383,8 @@ impl HealTask {
|
||||
}
|
||||
}
|
||||
|
||||
if terminal_outcome {
|
||||
telemetry_unknown |= !increment_counter(&mut scanned);
|
||||
}
|
||||
|
||||
if !terminal_outcome {
|
||||
continue;
|
||||
}
|
||||
|
||||
let mut progress = self.progress.write().await;
|
||||
progress.update_object_progress(scanned, healed, failed, skipped, bytes);
|
||||
if telemetry_unknown {
|
||||
progress.mark_unknown();
|
||||
}
|
||||
progress.update_progress(scanned, healed, failed, bytes);
|
||||
}
|
||||
pending = retry;
|
||||
retry_attempt = retry_attempt.saturating_add(1);
|
||||
@@ -444,10 +431,7 @@ impl HealTask {
|
||||
Ok(())
|
||||
}
|
||||
|
||||
pub(super) async fn apply_erasure_set_usage_baseline(&self, buckets: &[String], _set_disk_id: &str) -> Result<()> {
|
||||
if matches!(self.options.scan_mode, HealScanMode::Deep) || matches!(self.source, HealRequestSource::AutoHeal) {
|
||||
return Ok(());
|
||||
}
|
||||
pub(super) async fn apply_erasure_set_usage_baseline(&self, buckets: &[String]) -> Result<()> {
|
||||
let baseline = match self
|
||||
.await_with_control(self.storage.erasure_set_usage_baseline(buckets))
|
||||
.await
|
||||
@@ -458,18 +442,9 @@ impl HealTask {
|
||||
Err(_) => return Ok(()),
|
||||
};
|
||||
|
||||
let HealBucketUsageBaseline {
|
||||
objects_count,
|
||||
bytes,
|
||||
generation,
|
||||
} = baseline;
|
||||
let generation = generation.map(|snapshot_generation| stable_generation(&[&snapshot_generation.to_be_bytes()]));
|
||||
let HealBucketUsageBaseline { objects_count, bytes } = baseline;
|
||||
let mut progress = self.progress.write().await;
|
||||
if let Some(generation) = generation {
|
||||
progress.set_total_baseline_with_generation(objects_count, bytes, generation);
|
||||
} else {
|
||||
progress.set_total_baseline(objects_count, bytes);
|
||||
}
|
||||
progress.set_total_baseline(objects_count, bytes);
|
||||
Ok(())
|
||||
}
|
||||
}
|
||||
|
||||
@@ -32,7 +32,7 @@ impl HealTask {
|
||||
{
|
||||
let mut progress = self.progress.write().await;
|
||||
progress.set_current_object(Some(format!("erasure_set: {} ({} buckets)", set_disk_id, buckets.len())));
|
||||
progress.update_stage(0, 4);
|
||||
progress.update_progress(0, 4, 0, 0);
|
||||
}
|
||||
|
||||
let is_auto_replacement = matches!(self.source, HealRequestSource::AutoHeal) && !self.heal_endpoints.is_empty();
|
||||
@@ -158,7 +158,7 @@ impl HealTask {
|
||||
None
|
||||
};
|
||||
|
||||
self.apply_erasure_set_usage_baseline(&buckets, &set_disk_id).await?;
|
||||
self.apply_erasure_set_usage_baseline(&buckets).await?;
|
||||
|
||||
let healing_marker = format!("{set_disk_id}:{}", self.id);
|
||||
if let Some((disk, resume_manager, _)) = replacement_resume.as_ref() {
|
||||
@@ -248,7 +248,7 @@ impl HealTask {
|
||||
);
|
||||
{
|
||||
let mut progress = self.progress.write().await;
|
||||
progress.update_stage(4, 4);
|
||||
progress.update_progress(4, 4, 0, 0);
|
||||
}
|
||||
return Err(Error::TaskExecutionFailed {
|
||||
message: format!("Failed to heal disk format for {set_disk_id}: {error}"),
|
||||
@@ -304,7 +304,7 @@ impl HealTask {
|
||||
);
|
||||
{
|
||||
let mut progress = self.progress.write().await;
|
||||
progress.update_stage(4, 4);
|
||||
progress.update_progress(4, 4, 0, 0);
|
||||
}
|
||||
return Err(Error::TaskExecutionFailed {
|
||||
message: format!("Failed to heal disk format for {set_disk_id}: {e}"),
|
||||
@@ -314,7 +314,7 @@ impl HealTask {
|
||||
|
||||
{
|
||||
let mut progress = self.progress.write().await;
|
||||
progress.update_stage(1, 4);
|
||||
progress.update_progress(1, 4, 0, 0);
|
||||
}
|
||||
|
||||
// The rebuilt disks are formatted now: mark them as healing so
|
||||
@@ -343,7 +343,7 @@ impl HealTask {
|
||||
|
||||
{
|
||||
let mut progress = self.progress.write().await;
|
||||
progress.update_stage(2, 4);
|
||||
progress.update_progress(2, 4, 0, 0);
|
||||
}
|
||||
|
||||
// Step 3: Heal bucket structure
|
||||
@@ -427,7 +427,7 @@ impl HealTask {
|
||||
|
||||
{
|
||||
let mut progress = self.progress.write().await;
|
||||
progress.update_stage(3, 4);
|
||||
progress.update_progress(3, 4, 0, 0);
|
||||
}
|
||||
|
||||
// Step 4: Execute erasure set heal with resume
|
||||
@@ -470,7 +470,9 @@ impl HealTask {
|
||||
};
|
||||
|
||||
{
|
||||
self.progress.write().await.update_stage(4, 4);
|
||||
let mut progress = self.progress.write().await;
|
||||
let bytes_processed = progress.bytes_processed;
|
||||
progress.update_progress(4, 4, 0, bytes_processed);
|
||||
}
|
||||
|
||||
match result {
|
||||
|
||||
@@ -32,7 +32,7 @@ impl HealTask {
|
||||
{
|
||||
let mut progress = self.progress.write().await;
|
||||
progress.set_current_object(Some(format!("metadata: {bucket}/{object}")));
|
||||
progress.update_stage(0, 3);
|
||||
progress.update_progress(0, 3, 0, 0);
|
||||
}
|
||||
|
||||
// Step 1: Check if object exists
|
||||
@@ -74,7 +74,7 @@ impl HealTask {
|
||||
|
||||
{
|
||||
let mut progress = self.progress.write().await;
|
||||
progress.update_stage(1, 3);
|
||||
progress.update_progress(1, 3, 0, 0);
|
||||
}
|
||||
|
||||
// Step 2: Perform metadata heal using ecstore
|
||||
@@ -122,7 +122,7 @@ impl HealTask {
|
||||
);
|
||||
{
|
||||
let mut progress = self.progress.write().await;
|
||||
progress.update_stage(3, 3);
|
||||
progress.update_progress(3, 3, 0, 0);
|
||||
}
|
||||
return Err(Error::TaskExecutionFailed {
|
||||
message: format!("Failed to heal metadata {bucket}/{object}: {e}"),
|
||||
@@ -145,7 +145,7 @@ impl HealTask {
|
||||
|
||||
{
|
||||
let mut progress = self.progress.write().await;
|
||||
progress.update_stage(3, 3);
|
||||
progress.update_progress(3, 3, 0, 0);
|
||||
}
|
||||
self.record_result_item(result).await;
|
||||
Ok(())
|
||||
@@ -167,7 +167,7 @@ impl HealTask {
|
||||
);
|
||||
{
|
||||
let mut progress = self.progress.write().await;
|
||||
progress.update_stage(3, 3);
|
||||
progress.update_progress(3, 3, 0, 0);
|
||||
}
|
||||
Err(Error::TaskExecutionFailed {
|
||||
message: format!("Failed to heal metadata {bucket}/{object}: {e}"),
|
||||
@@ -194,7 +194,7 @@ impl HealTask {
|
||||
{
|
||||
let mut progress = self.progress.write().await;
|
||||
progress.set_current_object(Some(format!("ec_decode: {bucket}/{object}")));
|
||||
progress.update_stage(0, 3);
|
||||
progress.update_progress(0, 3, 0, 0);
|
||||
}
|
||||
|
||||
// Step 1: Check if object exists
|
||||
@@ -236,7 +236,7 @@ impl HealTask {
|
||||
|
||||
{
|
||||
let mut progress = self.progress.write().await;
|
||||
progress.update_stage(1, 3);
|
||||
progress.update_progress(1, 3, 0, 0);
|
||||
}
|
||||
|
||||
// Step 2: Perform EC decode heal using ecstore
|
||||
@@ -284,7 +284,7 @@ impl HealTask {
|
||||
);
|
||||
{
|
||||
let mut progress = self.progress.write().await;
|
||||
progress.update_stage(3, 3);
|
||||
progress.update_progress(3, 3, 0, 0);
|
||||
}
|
||||
return Err(Error::TaskExecutionFailed {
|
||||
message: format!("Failed to heal EC decode {bucket}/{object}: {e}"),
|
||||
@@ -309,7 +309,7 @@ impl HealTask {
|
||||
|
||||
{
|
||||
let mut progress = self.progress.write().await;
|
||||
progress.update_object_progress(1, 1, 0, 0, object_size);
|
||||
progress.update_progress(3, 3, 0, object_size);
|
||||
}
|
||||
self.record_result_item(result).await;
|
||||
Ok(())
|
||||
@@ -331,7 +331,7 @@ impl HealTask {
|
||||
);
|
||||
{
|
||||
let mut progress = self.progress.write().await;
|
||||
progress.update_stage(3, 3);
|
||||
progress.update_progress(3, 3, 0, 0);
|
||||
}
|
||||
Err(Error::TaskExecutionFailed {
|
||||
message: format!("Failed to heal EC decode {bucket}/{object}: {e}"),
|
||||
|
||||
@@ -36,7 +36,7 @@ impl HealTask {
|
||||
{
|
||||
let mut progress = self.progress.write().await;
|
||||
progress.set_current_object(Some(format!("{bucket}/{object}")));
|
||||
progress.update_stage(0, 4);
|
||||
progress.update_progress(0, 4, 0, 0);
|
||||
}
|
||||
|
||||
// Step 1: Check if object exists and get metadata
|
||||
@@ -132,7 +132,7 @@ impl HealTask {
|
||||
|
||||
{
|
||||
let mut progress = self.progress.write().await;
|
||||
progress.update_stage(1, 3);
|
||||
progress.update_progress(1, 3, 0, 0);
|
||||
}
|
||||
|
||||
// Step 2: directly call ecstore to perform heal
|
||||
@@ -187,7 +187,7 @@ impl HealTask {
|
||||
);
|
||||
{
|
||||
let mut progress = self.progress.write().await;
|
||||
progress.update_stage(3, 3);
|
||||
progress.update_progress(3, 3, 0, 0);
|
||||
}
|
||||
return Ok(());
|
||||
}
|
||||
@@ -207,7 +207,7 @@ impl HealTask {
|
||||
|
||||
{
|
||||
let mut progress = self.progress.write().await;
|
||||
progress.update_stage(3, 3);
|
||||
progress.update_progress(3, 3, 0, 0);
|
||||
}
|
||||
|
||||
if Self::should_return_typed_heal_error(&e) {
|
||||
@@ -249,7 +249,7 @@ impl HealTask {
|
||||
|
||||
{
|
||||
let mut progress = self.progress.write().await;
|
||||
progress.update_object_progress(1, 1, 0, 0, object_size);
|
||||
progress.update_progress(3, 3, 0, object_size);
|
||||
}
|
||||
self.record_result_item(result).await;
|
||||
Ok(())
|
||||
@@ -275,7 +275,7 @@ impl HealTask {
|
||||
);
|
||||
{
|
||||
let mut progress = self.progress.write().await;
|
||||
progress.update_stage(3, 3);
|
||||
progress.update_progress(3, 3, 0, 0);
|
||||
}
|
||||
return Ok(());
|
||||
}
|
||||
@@ -295,7 +295,7 @@ impl HealTask {
|
||||
|
||||
{
|
||||
let mut progress = self.progress.write().await;
|
||||
progress.update_stage(3, 3);
|
||||
progress.update_progress(3, 3, 0, 0);
|
||||
}
|
||||
|
||||
if Self::should_return_typed_heal_error(&e) {
|
||||
@@ -414,7 +414,7 @@ impl HealTask {
|
||||
|
||||
{
|
||||
let mut progress = self.progress.write().await;
|
||||
progress.update_object_progress(1, 1, 0, 0, object_size);
|
||||
progress.update_progress(4, 4, 0, object_size);
|
||||
}
|
||||
self.record_result_item(result).await;
|
||||
Ok(())
|
||||
|
||||
@@ -22,7 +22,6 @@ use std::sync::Mutex;
|
||||
use tempfile::TempDir;
|
||||
|
||||
use super::super::storage_api::status::BucketInfo;
|
||||
use crate::heal::progress::HealProgressState;
|
||||
|
||||
#[tokio::test]
|
||||
async fn retry_request_carries_remaining_timeout_budget() {
|
||||
@@ -2125,7 +2124,6 @@ async fn erasure_set_heal_applies_usage_baseline_to_progress() {
|
||||
usage_baseline: Mutex::new(Some(HealBucketUsageBaseline {
|
||||
objects_count: 10,
|
||||
bytes: 8,
|
||||
generation: Some(1),
|
||||
})),
|
||||
..Default::default()
|
||||
});
|
||||
@@ -2149,55 +2147,10 @@ async fn erasure_set_heal_applies_usage_baseline_to_progress() {
|
||||
let progress = task.get_progress().await;
|
||||
assert_eq!(progress.objects_total_count, 10);
|
||||
assert_eq!(progress.objects_total_size, 8);
|
||||
assert!(progress.baseline_generation.is_some());
|
||||
assert!(progress.baseline_known);
|
||||
assert_eq!(progress.bytes_processed, 2);
|
||||
assert!((progress.progress_percentage - 25.0).abs() < 0.001);
|
||||
}
|
||||
|
||||
#[tokio::test]
|
||||
async fn erasure_set_disk_walk_keeps_cluster_usage_baseline_indeterminate() {
|
||||
for (scan_mode, source) in [
|
||||
(HealScanMode::Deep, HealRequestSource::Admin),
|
||||
(HealScanMode::Normal, HealRequestSource::AutoHeal),
|
||||
] {
|
||||
let temp = TempDir::new().expect("temporary directory should be created");
|
||||
let disk = make_resume_disk(&temp).await;
|
||||
let storage = Arc::new(MockStorage {
|
||||
resume_disk: Mutex::new(Some(disk)),
|
||||
usage_baseline: Mutex::new(Some(HealBucketUsageBaseline {
|
||||
objects_count: 10,
|
||||
bytes: 8,
|
||||
generation: Some(1),
|
||||
})),
|
||||
..Default::default()
|
||||
});
|
||||
let mut request = HealRequest::new(
|
||||
HealType::ErasureSet {
|
||||
buckets: vec!["bucket-a".to_string()],
|
||||
set_disk_id: "pool_0_set_0".to_string(),
|
||||
},
|
||||
HealOptions {
|
||||
scan_mode,
|
||||
timeout: None,
|
||||
..Default::default()
|
||||
},
|
||||
HealPriority::Normal,
|
||||
);
|
||||
request.source = source;
|
||||
let task = HealTask::from_request(request, storage);
|
||||
|
||||
task.heal_erasure_set(vec!["bucket-a".to_string()], "pool_0_set_0".to_string())
|
||||
.await
|
||||
.expect("erasure set heal should complete");
|
||||
|
||||
let progress = task.get_progress().await;
|
||||
assert!(!progress.baseline_known);
|
||||
assert_eq!(progress.baseline_generation, None);
|
||||
assert_eq!(progress.progress_state, HealProgressState::Indeterminate);
|
||||
}
|
||||
}
|
||||
|
||||
#[tokio::test]
|
||||
async fn erasure_set_heal_ignores_usage_baseline_errors() {
|
||||
let temp = TempDir::new().expect("temporary directory should be created");
|
||||
|
||||
@@ -19,7 +19,7 @@ pub use error::{Error, Result};
|
||||
pub use heal::{
|
||||
HealManager, HealOperationsSnapshot, HealOptions, HealPriority, HealPriorityCounts, HealRequest, HealSourceCounts, HealType,
|
||||
channel::HealChannelProcessor,
|
||||
progress::{HealProgress, aggregate_heal_progress},
|
||||
progress::HealProgress,
|
||||
resume::{ReplacementRecoveryRecord, ReplacementRecoveryState, ResumeUtils},
|
||||
};
|
||||
use rustfs_concurrency::WorkloadAdmissionSnapshotProvider;
|
||||
|
||||
@@ -16,14 +16,14 @@
|
||||
//!
|
||||
//! `scripts/test/vault_ha_kms_live.sh` owns the official Vault containers and
|
||||
//! kills the active node while this test continuously decrypts through a
|
||||
//! surviving standby. KV2 and Transit requests must remain successful, use a
|
||||
//! bounded number of attempts, and leave the circuit and in-flight gauges at
|
||||
//! zero after a new leader is elected.
|
||||
//! surviving standby. KV2 and Transit must recover after the bounded circuit
|
||||
//! interval, use a bounded number of attempts, and leave the circuit and
|
||||
//! in-flight gauges at zero after a new leader is elected.
|
||||
|
||||
use std::collections::HashMap;
|
||||
use std::path::{Path, PathBuf};
|
||||
use std::sync::Arc;
|
||||
use std::sync::atomic::{AtomicBool, AtomicU64, Ordering};
|
||||
use std::sync::{Arc, Mutex};
|
||||
use std::time::Duration;
|
||||
|
||||
use metrics_util::MetricKind;
|
||||
@@ -43,6 +43,11 @@ const OPERATION_ATTEMPTS: &str = "rustfs_kms_backend_operation_attempts";
|
||||
const IN_FLIGHT: &str = "rustfs_kms_backend_in_flight";
|
||||
const CIRCUIT_OPEN: &str = "rustfs_kms_backend_circuit_open";
|
||||
const MAX_ATTEMPTS: u32 = 10;
|
||||
const ATTEMPT_TIMEOUT: Duration = Duration::from_secs(2);
|
||||
const HEALTHY_PROGRESS_TIMEOUT: Duration = Duration::from_secs(20);
|
||||
// The circuit remains open for 30s after five failed attempts.
|
||||
const POST_FAILOVER_PROGRESS_TIMEOUT: Duration = Duration::from_secs(35);
|
||||
const FAILOVER_ERROR_POLL_INTERVAL: Duration = Duration::from_millis(100);
|
||||
|
||||
type MetricEntry = (
|
||||
metrics_util::CompositeKey,
|
||||
@@ -64,7 +69,7 @@ fn config(backend: KmsBackend, backend_config: BackendConfig) -> KmsConfig {
|
||||
backend,
|
||||
backend_config,
|
||||
allow_insecure_dev_defaults: true,
|
||||
timeout: Duration::from_secs(2),
|
||||
timeout: ATTEMPT_TIMEOUT,
|
||||
retry_attempts: MAX_ATTEMPTS,
|
||||
enable_cache: false,
|
||||
..KmsConfig::default()
|
||||
@@ -164,14 +169,31 @@ fn retryable_failures(snapshot: &[MetricEntry], operation: &str) -> u64 {
|
||||
.sum()
|
||||
}
|
||||
|
||||
async fn wait_for_count(counter: &AtomicU64, minimum: u64, description: &str) {
|
||||
tokio::time::timeout(Duration::from_secs(20), async {
|
||||
async fn wait_for_count(
|
||||
counter: &AtomicU64,
|
||||
failure: &Mutex<Option<String>>,
|
||||
minimum: u64,
|
||||
description: &str,
|
||||
timeout: Duration,
|
||||
) {
|
||||
tokio::time::timeout(timeout, async {
|
||||
while counter.load(Ordering::SeqCst) < minimum {
|
||||
if let Some(error) = failure.lock().expect("decrypt failure lock poisoned").as_ref() {
|
||||
panic!(
|
||||
"{description} worker failed after {} successful decrypts: {error}",
|
||||
counter.load(Ordering::SeqCst)
|
||||
);
|
||||
}
|
||||
tokio::time::sleep(Duration::from_millis(25)).await;
|
||||
}
|
||||
})
|
||||
.await
|
||||
.unwrap_or_else(|_| panic!("timed out waiting for {description}"));
|
||||
.unwrap_or_else(|_| {
|
||||
panic!(
|
||||
"timed out after {timeout:?} waiting for {description}: completed {}, expected {minimum}",
|
||||
counter.load(Ordering::SeqCst)
|
||||
)
|
||||
});
|
||||
}
|
||||
|
||||
async fn wait_for_file(path: &Path, description: &str) {
|
||||
@@ -189,7 +211,8 @@ async fn decrypt_loop<B: KmsBackendTrait + Send + Sync + 'static>(
|
||||
request: DecryptRequest,
|
||||
expected: Vec<u8>,
|
||||
completed: Arc<AtomicU64>,
|
||||
failed: Arc<AtomicBool>,
|
||||
allow_failover_errors: Arc<AtomicBool>,
|
||||
failure: Arc<Mutex<Option<String>>>,
|
||||
stop: CancellationToken,
|
||||
) {
|
||||
while !stop.is_cancelled() {
|
||||
@@ -197,8 +220,18 @@ async fn decrypt_loop<B: KmsBackendTrait + Send + Sync + 'static>(
|
||||
Ok(response) if response.plaintext == expected => {
|
||||
completed.fetch_add(1, Ordering::SeqCst);
|
||||
}
|
||||
Ok(_) | Err(_) => {
|
||||
failed.store(true, Ordering::SeqCst);
|
||||
Ok(_) => {
|
||||
*failure.lock().expect("decrypt failure lock poisoned") =
|
||||
Some("decrypt returned unexpected plaintext".to_string());
|
||||
return;
|
||||
}
|
||||
Err(rustfs_kms::KmsError::BackendError { .. } | rustfs_kms::KmsError::OperationTimedOut { .. })
|
||||
if allow_failover_errors.load(Ordering::SeqCst) =>
|
||||
{
|
||||
tokio::time::sleep(FAILOVER_ERROR_POLL_INTERVAL).await;
|
||||
}
|
||||
Err(error) => {
|
||||
*failure.lock().expect("decrypt failure lock poisoned") = Some(error.to_string());
|
||||
return;
|
||||
}
|
||||
}
|
||||
@@ -296,7 +329,9 @@ async fn exercise_failover(snapshotter: &Snapshotter) {
|
||||
);
|
||||
|
||||
let stop = CancellationToken::new();
|
||||
let failed = Arc::new(AtomicBool::new(false));
|
||||
let allow_failover_errors = Arc::new(AtomicBool::new(false));
|
||||
let kv2_failure = Arc::new(Mutex::new(None));
|
||||
let transit_failure = Arc::new(Mutex::new(None));
|
||||
let kv2_completed = Arc::new(AtomicU64::new(0));
|
||||
let transit_completed = Arc::new(AtomicU64::new(0));
|
||||
let kv2_worker = tokio::spawn(decrypt_loop(
|
||||
@@ -304,7 +339,8 @@ async fn exercise_failover(snapshotter: &Snapshotter) {
|
||||
kv2_request,
|
||||
kv2_data_key.plaintext_key,
|
||||
Arc::clone(&kv2_completed),
|
||||
Arc::clone(&failed),
|
||||
Arc::clone(&allow_failover_errors),
|
||||
Arc::clone(&kv2_failure),
|
||||
stop.clone(),
|
||||
));
|
||||
let transit_worker = tokio::spawn(decrypt_loop(
|
||||
@@ -312,12 +348,21 @@ async fn exercise_failover(snapshotter: &Snapshotter) {
|
||||
transit_request,
|
||||
transit_data_key.plaintext_key,
|
||||
Arc::clone(&transit_completed),
|
||||
Arc::clone(&failed),
|
||||
Arc::clone(&allow_failover_errors),
|
||||
Arc::clone(&transit_failure),
|
||||
stop.clone(),
|
||||
));
|
||||
|
||||
wait_for_count(&kv2_completed, 2, "two healthy KV2 decrypts").await;
|
||||
wait_for_count(&transit_completed, 2, "two healthy Transit decrypts").await;
|
||||
wait_for_count(&kv2_completed, &kv2_failure, 2, "two healthy KV2 decrypts", HEALTHY_PROGRESS_TIMEOUT).await;
|
||||
wait_for_count(
|
||||
&transit_completed,
|
||||
&transit_failure,
|
||||
2,
|
||||
"two healthy Transit decrypts",
|
||||
HEALTHY_PROGRESS_TIMEOUT,
|
||||
)
|
||||
.await;
|
||||
allow_failover_errors.store(true, Ordering::SeqCst);
|
||||
std::fs::write(&marker, b"ready").expect("publish failover readiness marker");
|
||||
|
||||
wait_for_file(&elected, "the replacement Vault leader").await;
|
||||
@@ -326,18 +371,39 @@ async fn exercise_failover(snapshotter: &Snapshotter) {
|
||||
|
||||
let kv2_after_election = kv2_completed.load(Ordering::SeqCst) + 2;
|
||||
let transit_after_election = transit_completed.load(Ordering::SeqCst) + 2;
|
||||
wait_for_count(&kv2_completed, kv2_after_election, "post-failover KV2 decrypts").await;
|
||||
wait_for_count(&transit_completed, transit_after_election, "post-failover Transit decrypts").await;
|
||||
wait_for_count(
|
||||
&kv2_completed,
|
||||
&kv2_failure,
|
||||
kv2_after_election,
|
||||
"post-failover KV2 decrypts",
|
||||
POST_FAILOVER_PROGRESS_TIMEOUT,
|
||||
)
|
||||
.await;
|
||||
wait_for_count(
|
||||
&transit_completed,
|
||||
&transit_failure,
|
||||
transit_after_election,
|
||||
"post-failover Transit decrypts",
|
||||
POST_FAILOVER_PROGRESS_TIMEOUT,
|
||||
)
|
||||
.await;
|
||||
|
||||
stop.cancel();
|
||||
kv2_worker.await.expect("KV2 decrypt worker must join");
|
||||
transit_worker.await.expect("Transit decrypt worker must join");
|
||||
assert!(!failed.load(Ordering::SeqCst), "no decrypt may fail or return different plaintext");
|
||||
assert!(
|
||||
kv2_failure.lock().expect("KV2 failure lock poisoned").is_none(),
|
||||
"no KV2 decrypt may fail or return different plaintext"
|
||||
);
|
||||
assert!(
|
||||
transit_failure.lock().expect("Transit failure lock poisoned").is_none(),
|
||||
"no Transit decrypt may fail or return different plaintext"
|
||||
);
|
||||
}
|
||||
|
||||
#[test]
|
||||
#[ignore = "requires a real three-node Vault Raft cluster; run scripts/test/vault_ha_kms_live.sh"]
|
||||
fn vault_raft_leader_failure_preserves_kv2_and_transit_decrypts() {
|
||||
fn vault_raft_leader_failure_recovers_kv2_and_transit_decrypts() {
|
||||
let recorder = DebuggingRecorder::new();
|
||||
let snapshotter = recorder.snapshotter();
|
||||
metrics::with_local_recorder(&recorder, || {
|
||||
@@ -349,11 +415,6 @@ fn vault_raft_leader_failure_preserves_kv2_and_transit_decrypts() {
|
||||
});
|
||||
let snapshot = snapshotter.snapshot().into_vec();
|
||||
|
||||
assert_eq!(
|
||||
counter_value(&snapshot, OPERATIONS_TOTAL, &[("outcome", "circuit_open")]),
|
||||
0,
|
||||
"a bounded leader election must not open the circuit"
|
||||
);
|
||||
assert_eq!(
|
||||
counter_value(&snapshot, OPERATIONS_TOTAL, &[("outcome", "budget_exhausted")]),
|
||||
0,
|
||||
|
||||
@@ -1215,10 +1215,7 @@ pub struct ScannerActivityResponse {
|
||||
pub dirty_usage_pending: bool,
|
||||
}
|
||||
#[derive(Clone, Copy, PartialEq, Eq, Hash, ::prost::Message)]
|
||||
pub struct BackgroundHealStatusRequest {
|
||||
#[prost(uint32, tag = "1")]
|
||||
pub protocol_version: u32,
|
||||
}
|
||||
pub struct BackgroundHealStatusRequest {}
|
||||
#[derive(Clone, PartialEq, Eq, Hash, ::prost::Message)]
|
||||
pub struct BackgroundHealStatusResponse {
|
||||
#[prost(bool, tag = "1")]
|
||||
|
||||
@@ -170,7 +170,6 @@ pub fn internode_rpc_max_message_size() -> usize {
|
||||
pub const HEAL_CONTROL_RPC_MAX_MESSAGE_SIZE: usize = heal_control::RESULT_MAX_SIZE + 1024;
|
||||
pub const HEAL_CONTROL_PROTOCOL_VERSION: u32 = 3;
|
||||
pub const DYNAMIC_CONFIG_PROTOCOL_VERSION: u32 = 1;
|
||||
pub const BACKGROUND_HEAL_STATUS_PROTOCOL_VERSION: u32 = 2;
|
||||
pub const HEAL_CONTROL_CAPABILITY_PROBE_PREFIX: &[u8] = b"rustfs-heal-control-capability-v3\0";
|
||||
pub const REMOTE_VERSION_STATE_CAPABILITY_PROBE_PREFIX: &[u8] = b"rustfs-tier-remote-version-state-capability-v1\0";
|
||||
pub const CROSS_POOL_FENCE_CAPABILITY_PROBE_PREFIX: &[u8] = b"rustfs-cross-pool-fence-capability-v1\0";
|
||||
@@ -2347,28 +2346,10 @@ pub async fn evict_failed_connection_with_log_level(addr: &str, log_level: Conne
|
||||
#[cfg(test)]
|
||||
mod tests {
|
||||
use super::*;
|
||||
use prost::Message as _;
|
||||
use std::sync::Mutex;
|
||||
|
||||
static INTERNODE_RPC_MSGPACK_ONLY_ENV_LOCK: Mutex<()> = Mutex::new(());
|
||||
|
||||
#[derive(Clone, PartialEq, prost::Message)]
|
||||
struct BackgroundHealStatusRequestV1 {}
|
||||
|
||||
#[test]
|
||||
fn background_heal_status_request_remains_rolling_upgrade_compatible() {
|
||||
let current = proto_gen::node_service::BackgroundHealStatusRequest {
|
||||
protocol_version: BACKGROUND_HEAL_STATUS_PROTOCOL_VERSION,
|
||||
};
|
||||
let encoded = current.encode_to_vec();
|
||||
BackgroundHealStatusRequestV1::decode(encoded.as_slice()).expect("v1 server should ignore the version field");
|
||||
|
||||
let encoded = BackgroundHealStatusRequestV1 {}.encode_to_vec();
|
||||
let decoded = proto_gen::node_service::BackgroundHealStatusRequest::decode(encoded.as_slice())
|
||||
.expect("v2 server should accept a v1 request");
|
||||
assert_eq!(decoded.protocol_version, 0);
|
||||
}
|
||||
|
||||
#[derive(Clone, Copy, Debug, Eq, Ord, PartialEq, PartialOrd)]
|
||||
struct CompatPayloadField {
|
||||
message: &'static str,
|
||||
|
||||
@@ -846,9 +846,7 @@ message ScannerActivityResponse {
|
||||
bool dirty_usage_pending = 9;
|
||||
}
|
||||
|
||||
message BackgroundHealStatusRequest {
|
||||
uint32 protocol_version = 1;
|
||||
}
|
||||
message BackgroundHealStatusRequest {}
|
||||
|
||||
message BackgroundHealStatusResponse {
|
||||
bool success = 1;
|
||||
|
||||
@@ -153,6 +153,99 @@ No migration step is required for these decisions because this note documents th
|
||||
current RustFS behavior. Changing either decision later requires an operator
|
||||
compatibility note and updated characterization tests.
|
||||
|
||||
## Tier Free Versions During Decommission
|
||||
|
||||
A tier free version is an internal xl.meta record (`rustfs_filemeta::FREE_VERSION`,
|
||||
flagged `XL_FLAG_FREE_VERSION`) shaped like a delete marker. It is created by
|
||||
`MetaObject::init_free_version` when a version whose remote transition completed is
|
||||
deleted locally: the visible version is removed and the record keeps the remote-tier
|
||||
identity (tier, object name, version id, state, destination id) needed for an
|
||||
idempotent remote delete. Free versions are not user-visible versions; `num_versions`
|
||||
and all listing/GET paths exclude them.
|
||||
|
||||
### Lifecycle And Consumers
|
||||
|
||||
Creation: any local delete that removes a version whose transition status is
|
||||
`complete` appends the record via `MetaObject::delete_version` →
|
||||
`init_free_version` (skipped only when `skip_tier_free_version` is set, as on
|
||||
data-movement copies). The same deletes also persist a durable tier-journal
|
||||
entry on every user-facing path: S3 single deletes (`execute_delete_object` →
|
||||
`delete_object_with_tier_delete_journal`), S3 batch deletes, lifecycle expiry,
|
||||
and lifecycle delete-all all prepare and commit a journal entry around the
|
||||
delete. A journal entry is omitted when the removed version's transition state
|
||||
decodes as `TransitionVersionState::Unknown`, or on internal journal-less
|
||||
delete paths that never touch transitioned user objects.
|
||||
|
||||
Consumption while the record exists: the background recovery loop started by
|
||||
`init_background_expiry` (spawned by `spawn_tier_free_version_recovery_once`,
|
||||
enabled by default) scans disks for pending records and re-enqueues them; the
|
||||
usage scanner does the same; the lifecycle worker then deletes the remote tier
|
||||
object idempotently and only afterwards removes the local record. Heal walks
|
||||
include free-version records in metadata healing. Transition planning,
|
||||
replication, restore, GET, listings, and usage aggregation never depend on
|
||||
them.
|
||||
|
||||
### Decommission Handling
|
||||
|
||||
The exact decommission inventory loader (`load_file_info_versions_exact` via
|
||||
`get_all_file_info_versions`) keeps free-version records inline in `versions`.
|
||||
The migration loop handles them before lifecycle expiry and delete-marker
|
||||
shortcuts. It selects a target pool using the free-version-aware lookup, then
|
||||
writes the original free record to every target disk with the normal metadata
|
||||
write quorum. The free-version marker, local version id, transition identity,
|
||||
transition state, and destination id are preserved at the FileInfo/metadata
|
||||
boundary.
|
||||
|
||||
The source record is physically removed only after the target write quorum has
|
||||
committed and the source cleanup preflight still matches the exact inventory.
|
||||
If the lifecycle worker has already completed the remote delete and removed the
|
||||
source record before decommission acquires the source lock, decommission records
|
||||
that identity as already consumed and treats the missing source record as safe.
|
||||
If target capacity, metadata validation, lock fencing, or quorum fails, the
|
||||
source record remains and the entry records `state = "free_version_retained"`
|
||||
with reason `tier_free_version_migration_failed`; the worker retries the
|
||||
operation on a later pass. A target record with the same version id is accepted
|
||||
only when its free-version identity matches; a conflicting ordinary version or
|
||||
different free record is an overwrite error. This makes retries idempotent and
|
||||
prevents a free record from replacing a user-visible version.
|
||||
|
||||
### Reference-Audit Result
|
||||
|
||||
After migration, user-facing GET/list/transition/replication/restore paths still
|
||||
exclude the record. Recovery, usage scanning, lifecycle tier cleanup, and heal
|
||||
continue to see it when they request free versions, so an unresolved remote
|
||||
delete remains actionable on the target pool. The committed tier journal remains
|
||||
an independent retry source where one exists; it is not used as a reason to drop
|
||||
the xl.meta record. In particular, `Unknown` transition state records are
|
||||
migrated unchanged rather than discarded: the lifecycle worker retains them if
|
||||
remote identity validation cannot make a delete request.
|
||||
|
||||
Each migrated record emits `state = "free_version_migrated"` with reason
|
||||
`tier_free_version_migrated`. A record consumed before migration emits
|
||||
`state = "free_version_consumed"` with reason
|
||||
`tier_free_version_already_consumed`. Each failed record emits the retained state
|
||||
and failure reason above. The entry also emits a disposition summary with
|
||||
migrated, consumed, retained, and total counts. The final decommission sweep uses
|
||||
the exact loader, counts free records still present, and emits one retained
|
||||
record/reason for each unresolved free version before failing the sweep. This
|
||||
makes successful migration, completed cleanup, and retained cleanup obligations
|
||||
visible instead of silently omitting free records.
|
||||
|
||||
No new S3-visible version or admin response field is needed: free versions remain
|
||||
internal and are never counted as user-visible versions. The structured
|
||||
`decommission_entry` events are the operational status surface for the
|
||||
free-version disposition; the existing decommission item/failed counters still
|
||||
report the enclosing object migration result.
|
||||
|
||||
Regression guard:
|
||||
|
||||
- `decommission_tier_free_version_preserves_remote_identity`
|
||||
- `decommission_tier_free_version_resume_requires_write_quorum`
|
||||
- `decommission_tier_free_version_commit_rejects_lost_fence`
|
||||
- `test_decommission_cleanup_preflight_accepts_migrated_free_version_consumed_from_source`
|
||||
- `decommission_entry_skips_cleanup_only_marker_when_free_version_is_present`
|
||||
- `decommission_entry_rejects_subquorum_free_version_conflict_and_retains_source`
|
||||
|
||||
## Regression Guard
|
||||
|
||||
The queued multi-pool contract is guarded by:
|
||||
|
||||
@@ -20,7 +20,7 @@ use crate::admin::storage_api::bucket::utils::is_valid_object_prefix;
|
||||
use crate::server::ADMIN_PREFIX;
|
||||
use crate::server::RemoteAddr;
|
||||
use crate::storage::rpc::node_service::heal::{
|
||||
HealControlCoordinator, NodeHealStatusSnapshot, capture_node_heal_status, decode_node_heal_status,
|
||||
HealControlCoordinator, NodeHealProgress, NodeHealStatusSnapshot, capture_node_heal_status, decode_node_heal_status,
|
||||
decode_node_replacement_recovery_status, heal_control_coordinator, heal_topology_fingerprint,
|
||||
};
|
||||
use bytes::Bytes;
|
||||
@@ -298,7 +298,14 @@ fn background_heal_runtime_state(
|
||||
}
|
||||
}
|
||||
|
||||
type BackgroundHealProgress = rustfs_heal::HealProgress;
|
||||
#[derive(Debug, Serialize)]
|
||||
#[serde(rename_all = "camelCase")]
|
||||
struct BackgroundHealProgress {
|
||||
objects_scanned: u64,
|
||||
objects_healed: u64,
|
||||
objects_failed: u64,
|
||||
bytes_processed: u64,
|
||||
}
|
||||
|
||||
#[derive(Debug)]
|
||||
struct ClusterHealStatusSnapshot {
|
||||
@@ -337,10 +344,17 @@ fn add_operations(total: &mut rustfs_heal::HealOperationsSnapshot, next: rustfs_
|
||||
add_source_counts(&mut total.retrying_by_source, next.retrying_by_source);
|
||||
}
|
||||
|
||||
fn add_progress(total: &mut BackgroundHealProgress, next: NodeHealProgress) {
|
||||
total.objects_scanned = total.objects_scanned.saturating_add(next.objects_scanned);
|
||||
total.objects_healed = total.objects_healed.saturating_add(next.objects_healed);
|
||||
total.objects_failed = total.objects_failed.saturating_add(next.objects_failed);
|
||||
total.bytes_processed = total.bytes_processed.saturating_add(next.bytes_processed);
|
||||
}
|
||||
|
||||
fn aggregate_cluster_heal_status(snapshots: Vec<NodeHealStatusSnapshot>) -> ClusterHealStatusSnapshot {
|
||||
let mut info = BackgroundHealInfo::default();
|
||||
let mut operations = rustfs_heal::HealOperationsSnapshot::default();
|
||||
let mut progress = Vec::new();
|
||||
let mut progress = None;
|
||||
let mut any_services_enabled = false;
|
||||
let mut any_initialized = false;
|
||||
|
||||
@@ -357,12 +371,18 @@ fn aggregate_cluster_heal_status(snapshots: Vec<NodeHealStatusSnapshot>) -> Clus
|
||||
}
|
||||
add_operations(&mut operations, snapshot.operations);
|
||||
if let Some(next) = snapshot.progress {
|
||||
progress.push(next);
|
||||
add_progress(
|
||||
progress.get_or_insert(BackgroundHealProgress {
|
||||
objects_scanned: 0,
|
||||
objects_healed: 0,
|
||||
objects_failed: 0,
|
||||
bytes_processed: 0,
|
||||
}),
|
||||
next,
|
||||
);
|
||||
}
|
||||
}
|
||||
|
||||
let progress = rustfs_heal::aggregate_heal_progress(progress);
|
||||
|
||||
let state = if operations.queue_length > 0 || operations.active_tasks > 0 || operations.retrying_tasks > 0 {
|
||||
HealRuntimeState::Active
|
||||
} else if any_initialized {
|
||||
@@ -2181,19 +2201,10 @@ mod tests {
|
||||
};
|
||||
|
||||
let progress = BackgroundHealProgress {
|
||||
kind: rustfs_heal::heal::progress::HealProgressKind::ObjectSweep,
|
||||
objects_scanned: 7,
|
||||
objects_healed: 3,
|
||||
objects_failed: 1,
|
||||
skipped_objects: 3,
|
||||
objects_total_count: 10,
|
||||
objects_total_size: 8192,
|
||||
bytes_processed: 4096,
|
||||
progress_percentage: 50.0,
|
||||
progress_state: rustfs_heal::heal::progress::HealProgressState::Running,
|
||||
baseline_generation: Some(42),
|
||||
baseline_known: true,
|
||||
..Default::default()
|
||||
};
|
||||
|
||||
let encoded = encode_background_heal_status(
|
||||
@@ -2209,14 +2220,7 @@ mod tests {
|
||||
assert_eq!(json["progress"]["objectsScanned"], 7);
|
||||
assert_eq!(json["progress"]["objectsHealed"], 3);
|
||||
assert_eq!(json["progress"]["objectsFailed"], 1);
|
||||
assert_eq!(json["progress"]["skippedObjects"], 3);
|
||||
assert_eq!(json["progress"]["objectsTotalCount"], 10);
|
||||
assert_eq!(json["progress"]["objectsTotalSize"], 8192);
|
||||
assert_eq!(json["progress"]["bytesProcessed"], 4096);
|
||||
assert_eq!(json["progress"]["progressState"], "running");
|
||||
assert_eq!(json["progress"]["baselineGeneration"], 42);
|
||||
assert_eq!(json["progress"]["baselineKnown"], true);
|
||||
assert_eq!(json["progress"]["counterUnknown"], false);
|
||||
}
|
||||
|
||||
#[test]
|
||||
@@ -2238,18 +2242,10 @@ mod tests {
|
||||
..Default::default()
|
||||
},
|
||||
Some(NodeHealProgress {
|
||||
kind: rustfs_heal::heal::progress::HealProgressKind::ObjectSweep,
|
||||
objects_scanned: 3,
|
||||
objects_healed: 1,
|
||||
objects_failed: 0,
|
||||
skipped_objects: 2,
|
||||
objects_total_count: 6,
|
||||
objects_total_size: 400,
|
||||
bytes_processed: 100,
|
||||
progress_state: rustfs_heal::heal::progress::HealProgressState::Running,
|
||||
baseline_generation: Some(9),
|
||||
baseline_known: true,
|
||||
..Default::default()
|
||||
}),
|
||||
);
|
||||
let peer = NodeHealStatusSnapshot::for_test(
|
||||
@@ -2269,17 +2265,10 @@ mod tests {
|
||||
..Default::default()
|
||||
},
|
||||
Some(NodeHealProgress {
|
||||
kind: rustfs_heal::heal::progress::HealProgressKind::ObjectSweep,
|
||||
objects_scanned: 5,
|
||||
objects_healed: 4,
|
||||
objects_failed: 1,
|
||||
objects_total_count: 4,
|
||||
objects_total_size: 1600,
|
||||
bytes_processed: 900,
|
||||
progress_state: rustfs_heal::heal::progress::HealProgressState::Running,
|
||||
baseline_generation: Some(9),
|
||||
baseline_known: true,
|
||||
..Default::default()
|
||||
}),
|
||||
);
|
||||
|
||||
@@ -2298,15 +2287,7 @@ mod tests {
|
||||
assert_eq!(progress.objects_scanned, 8);
|
||||
assert_eq!(progress.objects_healed, 5);
|
||||
assert_eq!(progress.objects_failed, 1);
|
||||
assert_eq!(progress.skipped_objects, 2);
|
||||
assert_eq!(progress.objects_total_count, 10);
|
||||
assert_eq!(progress.objects_total_size, 2000);
|
||||
assert_eq!(progress.bytes_processed, 1000);
|
||||
assert_eq!(progress.progress_percentage, 50.0);
|
||||
assert_eq!(progress.progress_state, rustfs_heal::heal::progress::HealProgressState::Running);
|
||||
assert_eq!(progress.baseline_generation, Some(9));
|
||||
assert!(progress.baseline_known);
|
||||
assert!(!progress.counter_unknown);
|
||||
|
||||
assert_eq!(peer_first.state, HealRuntimeState::Active);
|
||||
assert_eq!(peer_first.operations, local_first.operations);
|
||||
@@ -2346,7 +2327,6 @@ mod tests {
|
||||
objects_healed: value,
|
||||
objects_failed: value,
|
||||
bytes_processed: value,
|
||||
..Default::default()
|
||||
};
|
||||
let saturated = NodeHealStatusSnapshot::for_test(
|
||||
true,
|
||||
|
||||
@@ -1912,7 +1912,7 @@ impl Node for NodeService {
|
||||
|
||||
async fn background_heal_status(
|
||||
&self,
|
||||
request: Request<BackgroundHealStatusRequest>,
|
||||
_request: Request<BackgroundHealStatusRequest>,
|
||||
) -> Result<Response<BackgroundHealStatusResponse>, Status> {
|
||||
if self.resolve_object_store().is_none() {
|
||||
return Ok(Response::new(BackgroundHealStatusResponse {
|
||||
@@ -1922,7 +1922,7 @@ impl Node for NodeService {
|
||||
}));
|
||||
}
|
||||
let snapshot = heal::capture_node_heal_status(rustfs_scanner::scanner::BackgroundHealInfo::default()).await;
|
||||
match heal::encode_node_heal_status(&snapshot, request.into_inner().protocol_version) {
|
||||
match heal::encode_node_heal_status(&snapshot) {
|
||||
Ok(bg_heal_state) => Ok(Response::new(BackgroundHealStatusResponse {
|
||||
success: true,
|
||||
bg_heal_state: bg_heal_state.into(),
|
||||
|
||||
@@ -25,8 +25,7 @@ use std::io::Cursor;
|
||||
|
||||
use super::super::encode_msgpack_map;
|
||||
|
||||
const NODE_HEAL_STATUS_PREVIOUS_VERSION: u8 = 1;
|
||||
const NODE_HEAL_STATUS_VERSION: u8 = 2;
|
||||
const NODE_HEAL_STATUS_VERSION: u8 = 1;
|
||||
const NODE_HEAL_STATUS_MAX_SIZE: usize = 64 * 1024;
|
||||
const NODE_REPLACEMENT_RECOVERY_STATUS_VERSION: u8 = 1;
|
||||
const NODE_REPLACEMENT_RECOVERY_STATUS_MAX_SIZE: usize = 64 * 1024;
|
||||
@@ -173,38 +172,13 @@ pub(crate) fn heal_topology_fingerprint(endpoint_pools: &EndpointServerPools) ->
|
||||
Ok(hex_simd::encode_to_string(hasher.finalize(), hex_simd::AsciiCase::Lower))
|
||||
}
|
||||
|
||||
pub(crate) type NodeHealProgress = rustfs_heal::HealProgress;
|
||||
|
||||
#[derive(Debug, Clone, Serialize, Deserialize)]
|
||||
#[derive(Debug, Clone, Default, PartialEq, Eq, Serialize, Deserialize)]
|
||||
#[serde(rename_all = "camelCase", deny_unknown_fields)]
|
||||
struct NodeHealProgressV1 {
|
||||
objects_scanned: u64,
|
||||
objects_healed: u64,
|
||||
objects_failed: u64,
|
||||
bytes_processed: u64,
|
||||
}
|
||||
|
||||
impl From<&NodeHealProgress> for NodeHealProgressV1 {
|
||||
fn from(progress: &NodeHealProgress) -> Self {
|
||||
Self {
|
||||
objects_scanned: progress.objects_scanned,
|
||||
objects_healed: progress.objects_healed,
|
||||
objects_failed: progress.objects_failed,
|
||||
bytes_processed: progress.bytes_processed,
|
||||
}
|
||||
}
|
||||
}
|
||||
|
||||
impl From<NodeHealProgressV1> for NodeHealProgress {
|
||||
fn from(progress: NodeHealProgressV1) -> Self {
|
||||
Self {
|
||||
objects_scanned: progress.objects_scanned,
|
||||
objects_healed: progress.objects_healed,
|
||||
objects_failed: progress.objects_failed,
|
||||
bytes_processed: progress.bytes_processed,
|
||||
..Default::default()
|
||||
}
|
||||
}
|
||||
pub(crate) struct NodeHealProgress {
|
||||
pub objects_scanned: u64,
|
||||
pub objects_healed: u64,
|
||||
pub objects_failed: u64,
|
||||
pub bytes_processed: u64,
|
||||
}
|
||||
|
||||
#[derive(Debug, Clone, Serialize, Deserialize)]
|
||||
@@ -246,48 +220,6 @@ pub(crate) struct NodeHealStatusSnapshot {
|
||||
pub progress: Option<NodeHealProgress>,
|
||||
}
|
||||
|
||||
#[derive(Debug, Clone, Serialize, Deserialize)]
|
||||
#[serde(rename_all = "camelCase", deny_unknown_fields)]
|
||||
struct NodeHealStatusSnapshotV1 {
|
||||
version: u8,
|
||||
services_enabled: bool,
|
||||
initialized: bool,
|
||||
info: NodeHealInfo,
|
||||
operations: HealOperationsSnapshot,
|
||||
progress: Option<NodeHealProgressV1>,
|
||||
}
|
||||
|
||||
impl From<&NodeHealStatusSnapshot> for NodeHealStatusSnapshotV1 {
|
||||
fn from(snapshot: &NodeHealStatusSnapshot) -> Self {
|
||||
Self {
|
||||
version: NODE_HEAL_STATUS_PREVIOUS_VERSION,
|
||||
services_enabled: snapshot.services_enabled,
|
||||
initialized: snapshot.initialized,
|
||||
info: snapshot.info.clone(),
|
||||
operations: snapshot.operations,
|
||||
progress: snapshot.progress.as_ref().map(NodeHealProgressV1::from),
|
||||
}
|
||||
}
|
||||
}
|
||||
|
||||
impl From<NodeHealStatusSnapshotV1> for NodeHealStatusSnapshot {
|
||||
fn from(snapshot: NodeHealStatusSnapshotV1) -> Self {
|
||||
Self {
|
||||
version: snapshot.version,
|
||||
services_enabled: snapshot.services_enabled,
|
||||
initialized: snapshot.initialized,
|
||||
info: snapshot.info,
|
||||
operations: snapshot.operations,
|
||||
progress: snapshot.progress.map(NodeHealProgress::from),
|
||||
}
|
||||
}
|
||||
}
|
||||
|
||||
#[derive(Deserialize)]
|
||||
struct NodeHealStatusVersion {
|
||||
version: u8,
|
||||
}
|
||||
|
||||
impl NodeHealStatusSnapshot {
|
||||
#[cfg(test)]
|
||||
pub(crate) fn for_test(
|
||||
@@ -317,7 +249,14 @@ impl NodeHealStatusSnapshot {
|
||||
}
|
||||
|
||||
pub(crate) async fn capture_node_heal_status(info: BackgroundHealInfo) -> NodeHealStatusSnapshot {
|
||||
let progress = rustfs_heal::current_heal_progress_snapshot().await;
|
||||
let progress = rustfs_heal::current_heal_progress_snapshot()
|
||||
.await
|
||||
.map(|progress| NodeHealProgress {
|
||||
objects_scanned: progress.objects_scanned,
|
||||
objects_healed: progress.objects_healed,
|
||||
objects_failed: progress.objects_failed,
|
||||
bytes_processed: progress.bytes_processed,
|
||||
});
|
||||
|
||||
NodeHealStatusSnapshot {
|
||||
version: NODE_HEAL_STATUS_VERSION,
|
||||
@@ -329,44 +268,23 @@ pub(crate) async fn capture_node_heal_status(info: BackgroundHealInfo) -> NodeHe
|
||||
}
|
||||
}
|
||||
|
||||
pub(crate) fn encode_node_heal_status(snapshot: &NodeHealStatusSnapshot, protocol_version: u32) -> Result<Vec<u8>, String> {
|
||||
let encoded = if protocol_version < rustfs_protos::BACKGROUND_HEAL_STATUS_PROTOCOL_VERSION {
|
||||
encode_msgpack_map(&NodeHealStatusSnapshotV1::from(snapshot))
|
||||
} else {
|
||||
let mut snapshot = snapshot.clone();
|
||||
snapshot.version = NODE_HEAL_STATUS_VERSION;
|
||||
encode_msgpack_map(&snapshot)
|
||||
};
|
||||
encoded.map_err(|err| format!("failed to encode node heal status: {err}"))
|
||||
pub(crate) fn encode_node_heal_status(snapshot: &NodeHealStatusSnapshot) -> Result<Vec<u8>, String> {
|
||||
encode_msgpack_map(snapshot).map_err(|err| format!("failed to encode node heal status: {err}"))
|
||||
}
|
||||
|
||||
pub(crate) fn decode_node_heal_status(data: &[u8]) -> Result<NodeHealStatusSnapshot, String> {
|
||||
if data.len() > NODE_HEAL_STATUS_MAX_SIZE {
|
||||
return Err("node heal status exceeds size limit".to_string());
|
||||
}
|
||||
let decode_version = || {
|
||||
let mut deserializer = Deserializer::new(Cursor::new(data));
|
||||
NodeHealStatusVersion::deserialize(&mut deserializer)
|
||||
.map(|version| (version, deserializer))
|
||||
.map_err(|err| format!("failed to decode node heal status: {err}"))
|
||||
};
|
||||
let (version, deserializer) = decode_version()?;
|
||||
if usize::try_from(deserializer.get_ref().position()).ok() != Some(data.len()) {
|
||||
return Err("node heal status contains trailing data".to_string());
|
||||
}
|
||||
|
||||
let mut deserializer = Deserializer::new(Cursor::new(data));
|
||||
let snapshot = match version.version {
|
||||
NODE_HEAL_STATUS_PREVIOUS_VERSION => {
|
||||
NodeHealStatusSnapshotV1::deserialize(&mut deserializer).map(NodeHealStatusSnapshot::from)
|
||||
}
|
||||
NODE_HEAL_STATUS_VERSION => NodeHealStatusSnapshot::deserialize(&mut deserializer),
|
||||
version => return Err(format!("unsupported node heal status version: {version}")),
|
||||
}
|
||||
.map_err(|err| format!("failed to decode node heal status: {err}"))?;
|
||||
let snapshot = NodeHealStatusSnapshot::deserialize(&mut deserializer)
|
||||
.map_err(|err| format!("failed to decode node heal status: {err}"))?;
|
||||
if usize::try_from(deserializer.get_ref().position()).ok() != Some(data.len()) {
|
||||
return Err("node heal status contains trailing data".to_string());
|
||||
}
|
||||
if snapshot.version != NODE_HEAL_STATUS_VERSION {
|
||||
return Err(format!("unsupported node heal status version: {}", snapshot.version));
|
||||
}
|
||||
Ok(snapshot)
|
||||
}
|
||||
|
||||
@@ -469,10 +387,9 @@ pub(crate) fn decode_node_replacement_recovery_status(data: &[u8]) -> Result<Nod
|
||||
#[cfg(test)]
|
||||
mod tests {
|
||||
use super::{
|
||||
NODE_HEAL_STATUS_MAX_SIZE, NODE_HEAL_STATUS_PREVIOUS_VERSION, NODE_HEAL_STATUS_VERSION, NodeHealProgress,
|
||||
NodeHealStatusSnapshot, NodeReplacementRecoveryStatusSnapshot, decode_node_heal_status,
|
||||
decode_node_replacement_recovery_status, encode_node_heal_status, encode_node_replacement_recovery_status,
|
||||
heal_control_coordinator, heal_topology_fingerprint,
|
||||
NODE_HEAL_STATUS_MAX_SIZE, NODE_HEAL_STATUS_VERSION, NodeHealProgress, NodeHealStatusSnapshot,
|
||||
NodeReplacementRecoveryStatusSnapshot, decode_node_heal_status, decode_node_replacement_recovery_status,
|
||||
encode_node_heal_status, encode_node_replacement_recovery_status, heal_control_coordinator, heal_topology_fingerprint,
|
||||
};
|
||||
use crate::storage::storage_api::{
|
||||
Endpoint,
|
||||
@@ -616,72 +533,20 @@ mod tests {
|
||||
..Default::default()
|
||||
},
|
||||
Some(NodeHealProgress {
|
||||
kind: rustfs_heal::heal::progress::HealProgressKind::ObjectSweep,
|
||||
objects_scanned: 7,
|
||||
objects_healed: 5,
|
||||
objects_failed: 1,
|
||||
skipped_objects: 1,
|
||||
objects_total_count: 10,
|
||||
objects_total_size: 2048,
|
||||
bytes_processed: 1024,
|
||||
progress_percentage: 50.0,
|
||||
progress_state: rustfs_heal::heal::progress::HealProgressState::Running,
|
||||
baseline_generation: Some(42),
|
||||
baseline_known: true,
|
||||
..Default::default()
|
||||
}),
|
||||
);
|
||||
|
||||
let encoded = encode_node_heal_status(&snapshot, rustfs_protos::BACKGROUND_HEAL_STATUS_PROTOCOL_VERSION)
|
||||
.expect("snapshot should encode");
|
||||
let encoded = encode_node_heal_status(&snapshot).expect("snapshot should encode");
|
||||
let decoded = decode_node_heal_status(&encoded).expect("snapshot should decode");
|
||||
assert_eq!(decoded.version, NODE_HEAL_STATUS_VERSION);
|
||||
assert_eq!(decoded.operations.queue_length, 2);
|
||||
assert_eq!(decoded.progress, snapshot.progress);
|
||||
}
|
||||
|
||||
#[test]
|
||||
fn node_heal_status_v1_encoding_preserves_rolling_compatibility() {
|
||||
let snapshot = NodeHealStatusSnapshot::for_test(
|
||||
true,
|
||||
true,
|
||||
BackgroundHealInfo::default(),
|
||||
HealOperationsSnapshot::default(),
|
||||
Some(NodeHealProgress {
|
||||
objects_scanned: 7,
|
||||
objects_healed: 5,
|
||||
objects_failed: 1,
|
||||
skipped_objects: 3,
|
||||
bytes_processed: 1024,
|
||||
progress_state: rustfs_heal::heal::progress::HealProgressState::Running,
|
||||
baseline_known: true,
|
||||
..Default::default()
|
||||
}),
|
||||
);
|
||||
|
||||
let encoded =
|
||||
encode_node_heal_status(&snapshot, u32::from(NODE_HEAL_STATUS_PREVIOUS_VERSION)).expect("v1 snapshot should encode");
|
||||
let wire: serde_json::Value = rmp_serde::from_slice(&encoded).expect("v1 snapshot should decode as JSON");
|
||||
let progress = wire["progress"].as_object().expect("v1 progress should be a map");
|
||||
assert_eq!(wire["version"], NODE_HEAL_STATUS_PREVIOUS_VERSION);
|
||||
assert_eq!(progress.len(), 4);
|
||||
assert_eq!(progress["objectsScanned"], 7);
|
||||
assert!(!progress.contains_key("skippedObjects"));
|
||||
|
||||
let decoded = decode_node_heal_status(&encoded).expect("v1 snapshot should decode");
|
||||
let progress = decoded.progress.as_ref().expect("v1 progress should be present");
|
||||
assert_eq!(decoded.version, NODE_HEAL_STATUS_PREVIOUS_VERSION);
|
||||
assert_eq!(progress.objects_scanned, 7);
|
||||
assert_eq!(progress.progress_state, rustfs_heal::heal::progress::HealProgressState::Unknown);
|
||||
assert!(!progress.baseline_known);
|
||||
|
||||
let upgraded = encode_node_heal_status(&decoded, rustfs_protos::BACKGROUND_HEAL_STATUS_PROTOCOL_VERSION)
|
||||
.expect("decoded v1 snapshot should upgrade to v2");
|
||||
let upgraded = decode_node_heal_status(&upgraded).expect("upgraded snapshot should decode");
|
||||
assert_eq!(upgraded.version, NODE_HEAL_STATUS_VERSION);
|
||||
assert_eq!(upgraded.progress.as_ref(), Some(progress));
|
||||
}
|
||||
|
||||
#[test]
|
||||
fn node_heal_status_rejects_unknown_version() {
|
||||
let mut snapshot = NodeHealStatusSnapshot::for_test(
|
||||
@@ -693,7 +558,7 @@ mod tests {
|
||||
);
|
||||
snapshot.version += 1;
|
||||
|
||||
let encoded = rmp_serde::to_vec_named(&snapshot).expect("snapshot should encode");
|
||||
let encoded = encode_node_heal_status(&snapshot).expect("snapshot should encode");
|
||||
let err = decode_node_heal_status(&encoded).expect_err("unknown version should fail closed");
|
||||
assert!(err.contains("unsupported node heal status version"));
|
||||
}
|
||||
@@ -714,22 +579,13 @@ mod tests {
|
||||
"activeBySource": {"scanner": 0, "admin": 1, "autoHeal": 0, "internal": 0, "readRepair": 0},
|
||||
"retryingBySource": {"scanner": 0, "admin": 0, "autoHeal": 0, "internal": 0, "readRepair": 0}
|
||||
},
|
||||
"progress": {
|
||||
"objectsScanned": 7,
|
||||
"objectsHealed": 5,
|
||||
"objectsFailed": 1,
|
||||
"bytesProcessed": 1024
|
||||
}
|
||||
"progress": null
|
||||
});
|
||||
let encoded = rmp_serde::to_vec_named(&fixture).expect("fixture should encode");
|
||||
let decoded = decode_node_heal_status(&encoded).expect("fixed v1 fixture should decode");
|
||||
assert_eq!(decoded.info().bitrot_start_cycle, 9);
|
||||
assert_eq!(decoded.operations.queue_length, 2);
|
||||
assert_eq!(decoded.operations.queued_by_source.mrf, 0);
|
||||
let progress = decoded.progress.expect("legacy progress should decode");
|
||||
assert_eq!(progress.objects_scanned, 7);
|
||||
assert!(!progress.baseline_known);
|
||||
assert_eq!(progress.progress_state, rustfs_heal::heal::progress::HealProgressState::Unknown);
|
||||
}
|
||||
|
||||
#[test]
|
||||
@@ -775,8 +631,7 @@ mod tests {
|
||||
HealOperationsSnapshot::default(),
|
||||
None,
|
||||
);
|
||||
let encoded = encode_node_heal_status(&snapshot, rustfs_protos::BACKGROUND_HEAL_STATUS_PROTOCOL_VERSION)
|
||||
.expect("snapshot should encode");
|
||||
let encoded = encode_node_heal_status(&snapshot).expect("snapshot should encode");
|
||||
let encoded_json: serde_json::Value = rmp_serde::from_slice(&encoded).expect("encoded snapshot should decode as JSON");
|
||||
assert_eq!(encoded_json["info"]["bitrotStartTime"], serde_json::json!("2023-11-14T22:13:20.123456Z"));
|
||||
}
|
||||
|
||||
@@ -241,7 +241,7 @@ env \
|
||||
RUSTFS_TEST_VAULT_FAILOVER_MARKER="$MARKER" \
|
||||
RUSTFS_TEST_VAULT_OLD_LEADER="$OLD_LEADER" \
|
||||
cargo test -p rustfs-kms --test vault_ha_failover_live \
|
||||
vault_raft_leader_failure_preserves_kv2_and_transit_decrypts -- \
|
||||
vault_raft_leader_failure_recovers_kv2_and_transit_decrypts -- \
|
||||
--ignored --nocapture --test-threads=1 &
|
||||
TEST_PID=$!
|
||||
|
||||
|
||||
Reference in New Issue
Block a user