Compare commits

..

9 Commits

Author SHA1 Message Date
overtrue c49c7e9ad9 test(scanner): settle fixture writes before activity baseline 2026-09-06 17:07:30 +08:00
cxymds 0b72f39023 fix(tier): avoid re-fencing published mutations (#7274) 2026-09-06 16:57:03 +08:00
Zhengchao An 30a0937a7d fix(ecstore): retain single-delete physical namespace ownership (#7287) 2026-09-06 16:56:24 +08:00
houseme 5b962b6c58 feat(heal): expose compatible canonical v3 outcomes (#7256)
* feat(heal): expose compatible canonical v3 outcomes

Serialize the existing canonical heal outcome, retain the v3 summary vocabulary, and reject or conservatively adapt contradictory peer success responses. Preserve progress and bounded result cursors without treating legacy storage responses as repair proof.

Add optional SDK outcome and cursor support with shared Rust fixtures, pinned legacy Go decoder and mc polling checks, and explicit compatibility limits.

Co-Authored-By: heihutu <heihutu@gmail.com>
Co-Authored-By: zhi22915 <qiuzgang@gmail.com>

* fix(madmin): box heal stop task status outcome

Co-Authored-By: heihutu <heihutu@gmail.com>

Co-Authored-By: zhi22915 <qiuzgang@gmail.com>

---------

Co-authored-by: heihutu <heihutu@gmail.com>
Co-authored-by: zhi22915 <qiuzgang@gmail.com>
2026-09-06 16:46:42 +08:00
houseme 0ee5408b94 feat(scanner): preserve bounded bootstrap admission fairness (#7260)
feat(scanner): retain bounded bootstrap admission fairness

Keep a leader-local bounded cohort across scanner retries and preserve
waiting bucket priority during dirty arrivals and capacity overflow.
Order source permits in the dispatcher without changing result identity,
parent budgets, explicit cycle timing, or persistent coverage evidence.

Co-authored-by: heihutu <heihutu@gmail.com>
Co-authored-by: zhi22915 <qiuzgang@gmail.com>
2026-09-06 16:45:57 +08:00
houseme cb3100a252 fix(scanner): visit compacted subtrees during deep scans (#7270)
Co-authored-by: heihutu <heihutu@gmail.com>
Co-authored-by: zhi22915 <qiuzgang@gmail.com>
2026-09-06 16:45:17 +08:00
houseme 3a4afe9b38 fix(heal): bound cross-page object retry delays (#7273)
Retain failed identities in an execution-local count and byte bounded window so healthy later pages can advance. Preserve retry jitter, deadlines, terminal accounting and pressure pacing, with deterministic head-of-line and capacity regressions.

Co-authored-by: heihutu <heihutu@gmail.com>
Co-authored-by: zhi22915 <qiuzgang@gmail.com>
2026-09-06 16:44:59 +08:00
houseme 71859ff83c fix(scanner): resume committed cleanup when scanning is disabled (#7281)
Run one supervised cleanup attempt for an existing operator reset, with
strict phase and revision checks under the original leader lock. Keep v3
reset authorization and responses unchanged, report deferred status, and
bound probe and shutdown waits without aborting in-flight reset ownership.

Co-authored-by: heihutu <heihutu@gmail.com>
Co-authored-by: zhi22915 <qiuzgang@gmail.com>
2026-09-06 16:44:45 +08:00
houseme cb72df269a fix(heal): retain hints without verified repair receipts (#7275)
Stop task completion and legacy notices from discharging scanner retry hints. Preserve existing hints and their retry due time across admission observations, bound retry scheduling, and synchronize changed batches once even on cancellation.

Exercise the production MRF consumer, manager, event channel and scanner ledger. Document producer durability gaps without enabling successor activation or garbage collection.

Co-authored-by: heihutu <heihutu@gmail.com>
Co-authored-by: zhi22915 <qiuzgang@gmail.com>
2026-09-06 16:44:30 +08:00
51 changed files with 6300 additions and 698 deletions
Generated
+35 -34
View File
@@ -2527,18 +2527,18 @@ checksum = "790eea4361631c5e7d22598ecd5723ff611904e3344ce8720784c93e3d83d40b"
[[package]]
name = "crossbeam-channel"
version = "0.5.17"
version = "0.5.16"
source = "registry+https://github.com/rust-lang/crates.io-index"
checksum = "98b0cc327b5bc766e7fda9c9260cc0fa81b43a8e240440422dff70788e3f9ef1"
checksum = "d85363c37faeca707aef026efa9f3b34d077bce547e48f770770625c6013679e"
dependencies = [
"crossbeam-utils",
]
[[package]]
name = "crossbeam-deque"
version = "0.8.8"
version = "0.8.7"
source = "registry+https://github.com/rust-lang/crates.io-index"
checksum = "622f3fc73690be383c7214310406f28a90e6edeadc3cea882f9d71e495b9711a"
checksum = "5181e0de7b61eb03a81e347d6dd8797bae9da5146707b51077e2d71a54ec0ceb"
dependencies = [
"crossbeam-epoch",
"crossbeam-utils",
@@ -2546,27 +2546,27 @@ dependencies = [
[[package]]
name = "crossbeam-epoch"
version = "0.9.21"
version = "0.9.20"
source = "registry+https://github.com/rust-lang/crates.io-index"
checksum = "dc74980687109a3b14c72fd458107bf0baa1da1a1a805e178d15501ba9b86d9d"
checksum = "2d6914041f254d6e9176c01941b21115dcfb7089e55135a35411081bd106ef3f"
dependencies = [
"crossbeam-utils",
]
[[package]]
name = "crossbeam-queue"
version = "0.3.14"
version = "0.3.13"
source = "registry+https://github.com/rust-lang/crates.io-index"
checksum = "03e8bd762f7479489c70ed6c768ddca99d7296857de437a68dcb2a94365b3fae"
checksum = "803d13fb3b09d88be9f4dbc29062c66b19bf7170867ceb746d2a8689bf6c7a26"
dependencies = [
"crossbeam-utils",
]
[[package]]
name = "crossbeam-utils"
version = "0.8.23"
version = "0.8.22"
source = "registry+https://github.com/rust-lang/crates.io-index"
checksum = "a31eee39dddec8330830986fcd7625edb5a24ec90ea038215273bbc3adb08ac6"
checksum = "61803da095bee82a81bb1a452ecc25d3b2f1416d1897eb86430c6159ef717c17"
[[package]]
name = "crunchy"
@@ -3673,9 +3673,9 @@ dependencies = [
[[package]]
name = "der"
version = "0.8.2"
version = "0.8.1"
source = "registry+https://github.com/rust-lang/crates.io-index"
checksum = "a878c850e9e421b20262e9b41f9c860e4785fa07541c266b62ff9d1ef998a80a"
checksum = "a69dedd701da44b0536442edf09c81a64b0ab97a7a4a5e3d1971f00027cbc63d"
dependencies = [
"const-oid 0.10.2",
"pem-rfc7468 1.0.0",
@@ -3946,7 +3946,7 @@ dependencies = [
"libc",
"option-ext",
"redox_users 0.5.2",
"windows-sys 0.59.0",
"windows-sys 0.61.2",
]
[[package]]
@@ -4090,7 +4090,7 @@ version = "0.17.0"
source = "registry+https://github.com/rust-lang/crates.io-index"
checksum = "c0681a4fc24c767085329728d8dfba959af91228aa4610cca4f8ce317ba46ae0"
dependencies = [
"der 0.8.2",
"der 0.8.1",
"digest 0.11.3",
"elliptic-curve 0.14.1",
"rfc6979 0.6.0",
@@ -4295,7 +4295,7 @@ source = "registry+https://github.com/rust-lang/crates.io-index"
checksum = "39cab71617ae0d63f51a36d69f866391735b51691dbda63cf6f96d042b63efeb"
dependencies = [
"libc",
"windows-sys 0.59.0",
"windows-sys 0.61.2",
]
[[package]]
@@ -5693,7 +5693,7 @@ source = "registry+https://github.com/rust-lang/crates.io-index"
checksum = "20fd6de4ccfcc187e38bc21cfa543cb5a302cb86a8b114eb7f0bf0dc9f8ac00f"
dependencies = [
"io-lifetimes 3.0.1",
"windows-sys 0.59.0",
"windows-sys 0.60.2",
]
[[package]]
@@ -5734,9 +5734,9 @@ dependencies = [
[[package]]
name = "ipnet"
version = "2.12.2"
version = "2.12.1"
source = "registry+https://github.com/rust-lang/crates.io-index"
checksum = "791930b43c0d5973160d90a8f3894509f2b273430f5c5c73b668636d0287c5c0"
checksum = "6a756c3fac73139e83f14c2d742155dd2b78d3ee56597b419a0579b7bdd6dd78"
dependencies = [
"serde",
]
@@ -5758,7 +5758,7 @@ checksum = "3640c1c38b8e4e43584d8df18be5fc6b0aa314ce6ebf51b53313d4306cca8e46"
dependencies = [
"hermit-abi",
"libc",
"windows-sys 0.59.0",
"windows-sys 0.61.2",
]
[[package]]
@@ -6955,7 +6955,7 @@ version = "0.50.3"
source = "registry+https://github.com/rust-lang/crates.io-index"
checksum = "7957b9740744892f114936ab4a57b3f487491bbeafaf8083688b16841a4240e5"
dependencies = [
"windows-sys 0.59.0",
"windows-sys 0.61.2",
]
[[package]]
@@ -7933,7 +7933,7 @@ version = "0.8.0-rc.4"
source = "registry+https://github.com/rust-lang/crates.io-index"
checksum = "986d2e952779af96ea048f160fd9194e1751b4faea78bcf3ceb456efe008088e"
dependencies = [
"der 0.8.2",
"der 0.8.1",
"spki 0.8.0",
]
@@ -7976,7 +7976,7 @@ dependencies = [
"aes 0.9.3",
"aes-gcm",
"cbc 0.2.1",
"der 0.8.2",
"der 0.8.1",
"pbkdf2 0.13.0",
"rand_core 0.10.1",
"scrypt 0.12.0",
@@ -8000,7 +8000,7 @@ version = "0.11.0"
source = "registry+https://github.com/rust-lang/crates.io-index"
checksum = "451913da69c775a56034ea8d9003d27ee8948e12443eae7c038ba100a4f21cb7"
dependencies = [
"der 0.8.2",
"der 0.8.1",
"pkcs5 0.8.1",
"rand_core 0.10.1",
"spki 0.8.0",
@@ -8706,7 +8706,7 @@ dependencies = [
"once_cell",
"socket2",
"tracing",
"windows-sys 0.59.0",
"windows-sys 0.61.2",
]
[[package]]
@@ -8942,9 +8942,9 @@ dependencies = [
[[package]]
name = "redis"
version = "1.7.0"
version = "1.6.0"
source = "registry+https://github.com/rust-lang/crates.io-index"
checksum = "2acbc41a996f7652b2ddd9dfd98cc4ff602cfd742ae35382f07f608405ab50ed"
checksum = "e37a4ca5c6ca42aa3e6df2fd32b987a65d32a4c2159a6f3fe0fd1df306a2658f"
dependencies = [
"arc-swap",
"arcstr",
@@ -9326,7 +9326,7 @@ dependencies = [
"curve25519-dalek 5.0.0",
"data-encoding",
"delegate",
"der 0.8.2",
"der 0.8.1",
"digest 0.11.3",
"ecdsa 0.17.0",
"ed25519-dalek 3.0.0",
@@ -10745,6 +10745,7 @@ dependencies = [
"rustfs-data-usage",
"rustfs-ecstore",
"rustfs-filemeta",
"rustfs-heal",
"rustfs-heal-contracts",
"rustfs-lifecycle",
"rustfs-lock",
@@ -11065,7 +11066,7 @@ dependencies = [
"errno",
"libc",
"linux-raw-sys",
"windows-sys 0.59.0",
"windows-sys 0.61.2",
]
[[package]]
@@ -11148,7 +11149,7 @@ dependencies = [
"security-framework",
"security-framework-sys",
"webpki-root-certs",
"windows-sys 0.59.0",
"windows-sys 0.61.2",
]
[[package]]
@@ -11419,7 +11420,7 @@ checksum = "d56d437c2f19203ce5f7122e507831de96f3d2d4d3be5af44a0b0a09d8a80e4d"
dependencies = [
"base16ct 1.0.0",
"ctutils",
"der 0.8.2",
"der 0.8.1",
"hybrid-array",
"subtle",
"zeroize",
@@ -11993,7 +11994,7 @@ source = "registry+https://github.com/rust-lang/crates.io-index"
checksum = "1d9efca8738c78ee9484207732f728b1ef517bbb1833d6fc0879ca898a522f6f"
dependencies = [
"base64ct",
"der 0.8.2",
"der 0.8.1",
]
[[package]]
@@ -12405,10 +12406,10 @@ source = "registry+https://github.com/rust-lang/crates.io-index"
checksum = "32497e9a4c7b38532efcdebeef879707aa9f794296a4f0244f6f69e9bc8574bd"
dependencies = [
"fastrand",
"getrandom 0.3.4",
"getrandom 0.4.3",
"once_cell",
"rustix",
"windows-sys 0.59.0",
"windows-sys 0.61.2",
]
[[package]]
@@ -13527,7 +13528,7 @@ version = "0.1.11"
source = "registry+https://github.com/rust-lang/crates.io-index"
checksum = "c2a7b1c03c876122aa43f3020e6c3c3ee5c05081c9a00739faf7503aeba10d22"
dependencies = [
"windows-sys 0.59.0",
"windows-sys 0.61.2",
]
[[package]]
+5 -5
View File
@@ -256,10 +256,10 @@ clap = { version = "4.6.6" }
const-str = { version = "1.1.0" }
convert_case = "0.12.0"
criterion = { version = "0.8" }
crossbeam-queue = "0.3.14"
crossbeam-channel = "0.5.17"
crossbeam-deque = "0.8.8"
crossbeam-utils = "0.8.23"
crossbeam-queue = "0.3.13"
crossbeam-channel = "0.5.16"
crossbeam-deque = "0.8.7"
crossbeam-utils = "0.8.22"
datafusion = { default-features = false, version = "55.0.0" }
derive_builder = "0.20.2"
enumset = "1.1.14"
@@ -306,7 +306,7 @@ rustfs-erasure-codec = { version = "8.0.2" }
reed-solomon-simd = "3.1.0"
regex = { version = "1.13.1" }
rumqttc = { package = "rumqttc-next", version = "0.34.0" }
redis = { version = "1.7.0" }
redis = { version = "1.6.0" }
rustify = { version = "0.7", default-features = false }
rustix = { version = "1.1.4" }
rust-embed = { version = "8.12.0" }
+8 -5
View File
@@ -422,9 +422,9 @@ fn unix_now_ms() -> u64 {
.unwrap_or(0)
}
/// A repair the MRF consumer landed, fanned out so retry ledgers can drop
/// entries the journal no longer tracks (backlog#1894 axis B). The payload
/// mirrors the intent identity so consumers match without re-parsing.
/// Legacy, unverified repair notice. Its identity lacks kind, set scope,
/// bucket incarnation and responsibility generation. Consumers must not use
/// it to discharge persisted repair responsibility.
#[derive(Debug, Clone, PartialEq, Eq)]
pub struct MrfRepairedEvent {
pub bucket: Arc<str>,
@@ -439,8 +439,8 @@ const MRF_REPAIRED_EVENT_CAP: usize = 4096;
static MRF_REPAIRED_EVENTS: OnceLock<std::sync::Mutex<std::collections::VecDeque<MrfRepairedEvent>>> = OnceLock::new();
/// Record that the MRF consumer landed a repair. Never blocks: the critical
/// section is a deque push under a std mutex.
/// Record a legacy notification for compatibility. This is not an
/// acknowledgement of storage verification or durable repair completion.
pub fn note_mrf_repaired(bucket: &str, object: &str, version_id: Option<[u8; 16]>) {
let registry = MRF_REPAIRED_EVENTS.get_or_init(|| std::sync::Mutex::new(std::collections::VecDeque::new()));
let Ok(mut events) = registry.lock() else {
@@ -515,6 +515,9 @@ mod tests {
}
coalescer_release(&key, Some(lease));
let retry_lease = coalescer_admit(key.clone()).expect("released identity must admit a retry");
assert_ne!(lease, retry_lease);
coalescer_release(&key, Some(lease));
assert_eq!(coalescer_admit(key.clone()), Err(MrfIngressResult::Coalesced));
coalescer_release(&key, Some(retry_lease));
}
+40
View File
@@ -324,6 +324,46 @@ impl DiskStoreRenameDataExt for LocalDiskWrapper {
}
impl LocalDiskWrapper {
pub(in crate::disk) async fn delete_version_with_namespace_owner(
&self,
volume: &str,
path: &str,
fi: FileInfo,
force_del_marker: bool,
opts: DeleteOptions,
namespace_owner: Option<Arc<dyn Send + Sync>>,
) -> Result<()> {
self.track_disk_health_mutation(
"delete_version",
DiskMetricMutation::Delete,
|| async {
Box::pin(
self.disk
.delete_version_with_namespace_owner(volume, path, fi, force_del_marker, opts, namespace_owner),
)
.await
},
get_max_timeout_duration(),
)
.await
}
pub(in crate::disk) async fn delete_with_namespace_owner(
&self,
volume: &str,
path: &str,
opts: DeleteOptions,
namespace_owner: Option<Arc<dyn Send + Sync>>,
) -> Result<()> {
self.track_disk_health_mutation(
"delete",
DiskMetricMutation::Delete,
|| async { Box::pin(self.disk.delete_with_namespace_owner(volume, path, opts, namespace_owner)).await },
get_max_timeout_duration(),
)
.await
}
pub(in crate::disk) async fn undo_write_with_namespace_owner(
&self,
volume: &str,
+458 -108
View File
@@ -191,11 +191,33 @@ fn restore_part_transaction_file(current: &Path, backup: &Path, absent: &Path, r
}
async fn write_metadata_rollback_backup(object_dir: &Path, rollback_dir: Uuid, data: &[u8]) -> Result<()> {
write_delete_rollback_file(object_dir, rollback_dir, STORAGE_FORMAT_FILE_BACKUP, data, None).await
}
async fn write_delete_rollback_file(
object_dir: &Path,
rollback_dir: Uuid,
name: &str,
data: &[u8],
namespace_owner: Option<Arc<dyn Send + Sync>>,
) -> Result<()> {
let backup_dir = object_dir.join(rollback_dir.to_string());
fs::create_dir_all(&backup_dir).await.map_err(to_file_error)?;
fs::write(backup_dir.join(STORAGE_FORMAT_FILE_BACKUP), data)
.await
.map_err(to_file_error)?;
let path = backup_dir.join(name);
if namespace_owner.is_none() {
fs::create_dir_all(&backup_dir).await.map_err(to_file_error)?;
fs::write(path, data).await.map_err(to_file_error)?;
return Ok(());
}
let lease = os::acquire_namespace_mutation_lease_with_owner(&path, namespace_owner).await;
let data = data.to_vec();
os::run_blocking_namespace_operation(lease, move || {
std::fs::create_dir_all(&backup_dir)?;
#[cfg(test)]
run_owned_file_write_before_open(&path);
std::fs::write(path, data)
})
.await
.map_err(to_file_error)?;
Ok(())
}
@@ -342,6 +364,7 @@ struct DeleteVersionMutation {
struct DeleteRollbackFailure {
stage: &'static str,
error: DiskError,
namespace_owner: Option<Arc<dyn Send + Sync>>,
}
async fn restore_delete_rollback_after_error(
@@ -353,12 +376,18 @@ async fn restore_delete_rollback_after_error(
failure: DeleteRollbackFailure,
publication_root: &os::PublicationRoot,
) -> DiskError {
let DeleteRollbackFailure { stage, error } = failure;
let DeleteRollbackFailure {
stage,
error,
namespace_owner,
} = failure;
let Some(rollback_dir) = rollback_dir else {
return error;
};
if let Err(restore_err) = restore_delete_rollback(object_dir, xl_path, rollback_dir, publication_root).await {
if let Err(restore_err) =
restore_delete_rollback_with_namespace_owner(object_dir, xl_path, rollback_dir, publication_root, namespace_owner).await
{
warn!(
volume,
path,
@@ -5654,6 +5683,123 @@ impl LocalDisk {
// })
// }
#[tracing::instrument(name = "delete_version", level = "trace", skip_all)]
pub(in crate::disk) async fn delete_version_with_namespace_owner(
&self,
volume: &str,
path: &str,
fi: FileInfo,
force_del_marker: bool,
opts: DeleteOptions,
namespace_owner: Option<Arc<dyn Send + Sync>>,
) -> Result<()> {
self.delete_version_inner(
volume,
path,
fi,
DeleteVersionMutation {
force_del_marker,
opts,
namespace_owner,
},
)
.await
}
#[tracing::instrument(name = "write_metadata", level = "trace", skip_all)]
async fn write_metadata_with_namespace_owner(
&self,
volume: &str,
path: &str,
fi: FileInfo,
namespace_owner: Option<Arc<dyn Send + Sync>>,
) -> Result<()> {
crate::hp_guard!("LocalDisk::write_metadata");
fi.validate_for_metadata_read()?;
let p = self.io_get_object_path(volume, format!("{path}/{STORAGE_FORMAT_FILE}").as_str())?;
let mut meta = FileMeta::new();
if !fi.fresh {
let (buf, _) = read_file_exists(&p).await?;
if !buf.is_empty() {
let _ = meta.unmarshal_msg(&buf).map_err(|_| {
meta = FileMeta::new();
});
}
}
meta.add_version(fi)?;
let fm_data = meta.marshal_msg()?;
// Atomic temp+rename: this path also rewrites live xl.meta (delete markers,
// decommission), where an in-place truncate would expose torn metadata.
self.write_all_meta_with_namespace_owner(
volume,
format!("{path}/{STORAGE_FORMAT_FILE}").as_str(),
&fm_data,
true,
namespace_owner,
)
.await?;
Ok(())
}
async fn delete_data_dir_with_namespace_owner(
&self,
volume: &str,
path: &str,
opts: DeleteOptions,
namespace_owner: Option<Arc<dyn Send + Sync>>,
) -> Result<DataDirDeleteStatus> {
let key = SnapshotLeaseKey {
volume: volume.to_string(),
path: path.to_string(),
};
{
let mut registry = self.snapshot_leases.lock().await;
if let Some(entry) = registry.entries.get_mut(&key) {
if !entry.tokens.is_empty() {
entry.pending_delete.get_or_insert_with(|| opts.clone());
return Ok(DataDirDeleteStatus::Deferred);
}
if entry.deleting {
entry.pending_delete.get_or_insert_with(|| opts.clone());
return Ok(DataDirDeleteStatus::Deferred);
}
entry.deleting = true;
entry.pending_delete.get_or_insert_with(|| opts.clone());
} else {
registry.entries.insert(
key.clone(),
SnapshotLeaseEntry {
pending_delete: Some(opts.clone()),
deleting: true,
..Default::default()
},
);
}
}
let result = self
.delete_unleased_with_namespace_owner(volume, path, &opts, namespace_owner)
.await;
let mut registry = self.snapshot_leases.lock().await;
match result {
Ok(()) => {
registry.entries.remove(&key);
Ok(DataDirDeleteStatus::Deleted)
}
Err(err) => {
if let Some(entry) = registry.entries.get_mut(&key) {
entry.deleting = false;
}
Err(err)
}
}
}
async fn delete_version_inner(&self, volume: &str, path: &str, fi: FileInfo, mutation: DeleteVersionMutation) -> Result<()> {
let DeleteVersionMutation {
force_del_marker,
@@ -5696,7 +5842,7 @@ impl LocalDisk {
if fi.deleted && force_del_marker {
return self
.write_missing_delete_marker(volume, path, fi, file_path.as_path(), &xl_path, rollback_dir)
.write_missing_delete_marker(volume, path, fi, file_path.as_path(), rollback_dir, namespace_owner.clone())
.await;
}
@@ -5712,7 +5858,14 @@ impl LocalDisk {
let old_dir = meta.delete_version(&fi)?;
let mut reserved_version_delete = false;
if let Some(rollback_dir) = rollback_dir {
write_metadata_rollback_backup(file_path.as_path(), rollback_dir, &buf).await?;
write_delete_rollback_file(
file_path.as_path(),
rollback_dir,
STORAGE_FORMAT_FILE_BACKUP,
&buf,
namespace_owner.clone(),
)
.await?;
}
if let Some(uuid) = old_dir {
@@ -5728,6 +5881,7 @@ impl LocalDisk {
DeleteRollbackFailure {
stage: "delete_version_metadata_update",
error: err,
namespace_owner: namespace_owner.clone(),
},
&self.publication_root,
)
@@ -5745,6 +5899,7 @@ impl LocalDisk {
DeleteRollbackFailure {
stage: "delete_version_data_path",
error: err,
namespace_owner: namespace_owner.clone(),
},
&self.publication_root,
)
@@ -5753,7 +5908,7 @@ impl LocalDisk {
if let Some(rollback_dir) = rollback_dir {
let rollback_path = file_path.join(rollback_dir.to_string());
if let Err(err) = fs::create_dir_all(&rollback_path).await {
if let Err(err) = os::create_dir_all_with_namespace_owner(&rollback_path, namespace_owner.clone()).await {
let err: DiskError = to_file_error(err).into();
return Err(restore_delete_rollback_after_error(
file_path.as_path(),
@@ -5764,12 +5919,16 @@ impl LocalDisk {
DeleteRollbackFailure {
stage: "delete_version_rollback_dir",
error: err,
namespace_owner: namespace_owner.clone(),
},
&self.publication_root,
)
.await);
}
reserved_version_delete = match self.reserve_version_delete(volume, path, uuid, rollback_dir).await {
reserved_version_delete = match self
.reserve_version_delete_with_namespace_owner(volume, path, uuid, rollback_dir, namespace_owner.clone())
.await
{
Ok(reserved) => reserved,
Err(err) => {
return Err(restore_delete_rollback_after_error(
@@ -5781,6 +5940,7 @@ impl LocalDisk {
DeleteRollbackFailure {
stage: "delete_version_reserve_data",
error: err,
namespace_owner: namespace_owner.clone(),
},
&self.publication_root,
)
@@ -5789,9 +5949,14 @@ impl LocalDisk {
};
let rollback_data_path = rollback_path.join(uuid.to_string());
if !reserved_version_delete
&& let Err(err) =
rename_all_ignore_missing_source(&old_path, &rollback_data_path, &rollback_path, &self.publication_root)
.await
&& let Err(err) = os::rename_all_ignore_missing_source_with_owner(
&old_path,
&rollback_data_path,
&rollback_path,
&self.publication_root,
namespace_owner.clone(),
)
.await
{
return Err(restore_delete_rollback_after_error(
file_path.as_path(),
@@ -5802,6 +5967,7 @@ impl LocalDisk {
DeleteRollbackFailure {
stage: "delete_version_stage_data",
error: err,
namespace_owner: namespace_owner.clone(),
},
&self.publication_root,
)
@@ -5810,13 +5976,16 @@ impl LocalDisk {
if should_fail_after_delete_data_staged(path) {
if reserved_version_delete {
return Err(self
.abort_reserved_version_delete(
.abort_reserved_version_delete_with_failure(
file_path.as_path(),
rollback_dir,
volume,
path,
"delete_version_test_after_stage",
DiskError::Unexpected,
DeleteRollbackFailure {
stage: "delete_version_test_after_stage",
error: DiskError::Unexpected,
namespace_owner: namespace_owner.clone(),
},
)
.await);
}
@@ -5829,6 +5998,7 @@ impl LocalDisk {
DeleteRollbackFailure {
stage: "delete_version_test_after_stage",
error: DiskError::Unexpected,
namespace_owner: namespace_owner.clone(),
},
&self.publication_root,
)
@@ -5858,13 +6028,16 @@ impl LocalDisk {
let err: DiskError = err.into();
if reserved_version_delete && let Some(rollback_dir) = rollback_dir {
return Err(self
.abort_reserved_version_delete(
.abort_reserved_version_delete_with_failure(
file_path.as_path(),
rollback_dir,
volume,
path,
"delete_version_metadata_encode",
err,
DeleteRollbackFailure {
stage: "delete_version_metadata_encode",
error: err,
namespace_owner: namespace_owner.clone(),
},
)
.await);
}
@@ -5877,6 +6050,7 @@ impl LocalDisk {
DeleteRollbackFailure {
stage: "delete_version_metadata_encode",
error: err,
namespace_owner: namespace_owner.clone(),
},
&self.publication_root,
)
@@ -5899,7 +6073,17 @@ impl LocalDisk {
if let Err(err) = commit_result {
if reserved_version_delete && let Some(rollback_dir) = rollback_dir {
return Err(self
.abort_reserved_version_delete(file_path.as_path(), rollback_dir, volume, path, "delete_version_commit", err)
.abort_reserved_version_delete_with_failure(
file_path.as_path(),
rollback_dir,
volume,
path,
DeleteRollbackFailure {
stage: "delete_version_commit",
error: err,
namespace_owner: namespace_owner.clone(),
},
)
.await);
}
return Err(restore_delete_rollback_after_error(
@@ -5911,6 +6095,7 @@ impl LocalDisk {
DeleteRollbackFailure {
stage: "delete_version_commit",
error: err,
namespace_owner: namespace_owner.clone(),
},
&self.publication_root,
)
@@ -5919,16 +6104,21 @@ impl LocalDisk {
if reserved_version_delete
&& let Some(rollback_dir) = rollback_dir
&& let Err(err) = self.commit_reserved_version_delete(volume, path, rollback_dir).await
&& let Err(err) = self
.commit_reserved_version_delete_with_namespace_owner(volume, path, rollback_dir, namespace_owner.clone())
.await
{
return Err(self
.abort_reserved_version_delete(
.abort_reserved_version_delete_with_failure(
file_path.as_path(),
rollback_dir,
volume,
path,
"delete_version_commit_intent",
err,
DeleteRollbackFailure {
stage: "delete_version_commit_intent",
error: err,
namespace_owner: namespace_owner.clone(),
},
)
.await);
}
@@ -6098,7 +6288,7 @@ impl LocalDisk {
}
#[tracing::instrument(name = "delete", level = "trace", skip_all)]
async fn delete_with_namespace_owner(
pub(in crate::disk) async fn delete_with_namespace_owner(
&self,
volume: &str,
path: &str,
@@ -6111,7 +6301,8 @@ impl LocalDisk {
&& let Some((object, transaction_id)) = path.rsplit_once('/')
&& let Ok(transaction_id) = Uuid::parse_str(transaction_id)
{
self.finish_version_delete(volume, object, transaction_id).await?
self.finish_version_delete(volume, object, transaction_id, namespace_owner.clone())
.await?
} else {
false
};
@@ -6453,19 +6644,27 @@ impl LocalDisk {
path: &str,
fi: FileInfo,
object_dir: &Path,
xl_path: &Path,
rollback_dir: Option<Uuid>,
namespace_owner: Option<Arc<dyn Send + Sync>>,
) -> Result<()> {
let xl_path = object_dir.join(STORAGE_FORMAT_FILE);
if let Some(rollback_dir) = rollback_dir {
let rollback_path = object_dir.join(rollback_dir.to_string());
fs::create_dir_all(&rollback_path).await.map_err(to_file_error)?;
fs::write(rollback_path.join(DELETE_MARKER_ROLLBACK_FILE), [])
.await
.map_err(to_file_error)?;
write_delete_rollback_file(object_dir, rollback_dir, DELETE_MARKER_ROLLBACK_FILE, &[], namespace_owner.clone())
.await?;
}
if let Err(err) = self.write_metadata("", volume, path, fi).await {
if let Err(err) = self
.write_metadata_with_namespace_owner(volume, path, fi, namespace_owner.clone())
.await
{
if let Some(rollback_dir) = rollback_dir
&& let Err(restore_err) = restore_delete_rollback(object_dir, xl_path, rollback_dir, &self.publication_root).await
&& let Err(restore_err) = restore_delete_rollback_with_namespace_owner(
object_dir,
&xl_path,
rollback_dir,
&self.publication_root,
namespace_owner,
)
.await
{
warn!(
event = EVENT_DISK_LOCAL_DELETE_ROLLBACK_FAILED,
@@ -6510,7 +6709,7 @@ impl LocalDisk {
return Err(DiskError::FileNotFound);
};
return self
.write_missing_delete_marker(volume, path, delete_marker, object_dir, &xlpath, opts.old_data_dir)
.write_missing_delete_marker(volume, path, delete_marker, object_dir, opts.old_data_dir, None)
.await;
}
Err(err) => return Err(err),
@@ -6559,6 +6758,7 @@ impl LocalDisk {
DeleteRollbackFailure {
stage: "delete_versions_metadata_update",
error: err,
namespace_owner: None,
},
&self.publication_root,
)
@@ -6594,6 +6794,7 @@ impl LocalDisk {
DeleteRollbackFailure {
stage: "delete_versions_data_path",
error: err,
namespace_owner: None,
},
&self.publication_root,
)
@@ -6625,6 +6826,7 @@ impl LocalDisk {
DeleteRollbackFailure {
stage: "delete_versions_rollback_dir",
error: err,
namespace_owner: None,
},
&self.publication_root,
)
@@ -6665,6 +6867,7 @@ impl LocalDisk {
DeleteRollbackFailure {
stage: "delete_versions_stage_data",
error: err,
namespace_owner: None,
},
&self.publication_root,
)
@@ -6692,6 +6895,7 @@ impl LocalDisk {
DeleteRollbackFailure {
stage: "delete_versions_test_after_stage",
error: DiskError::Unexpected,
namespace_owner: None,
},
&self.publication_root,
)
@@ -6734,6 +6938,7 @@ impl LocalDisk {
DeleteRollbackFailure {
stage: "delete_versions_commit_delete",
error: err,
namespace_owner: None,
},
&self.publication_root,
)
@@ -6780,6 +6985,7 @@ impl LocalDisk {
DeleteRollbackFailure {
stage: "delete_versions_metadata_encode",
error: err,
namespace_owner: None,
},
&self.publication_root,
)
@@ -6805,6 +7011,7 @@ impl LocalDisk {
DeleteRollbackFailure {
stage: "delete_versions_commit_write",
error: err,
namespace_owner: None,
},
&self.publication_root,
)
@@ -8015,6 +8222,18 @@ impl LocalDisk {
}
async fn reserve_version_delete(&self, volume: &str, object: &str, data_dir: Uuid, rollback_dir: Uuid) -> Result<bool> {
self.reserve_version_delete_with_namespace_owner(volume, object, data_dir, rollback_dir, None)
.await
}
async fn reserve_version_delete_with_namespace_owner(
&self,
volume: &str,
object: &str,
data_dir: Uuid,
rollback_dir: Uuid,
namespace_owner: Option<Arc<dyn Send + Sync>>,
) -> Result<bool> {
let path = format!("{object}/{data_dir}");
let data_path = self.io_get_object_path(volume, &path)?;
match fs::metadata(&data_path).await {
@@ -8024,6 +8243,28 @@ impl LocalDisk {
Err(err) => return Err(to_file_error(err).into()),
}
let marker_path = data_path.join(format!("{RESERVED_DELETE_DATA_DIR_MARKER_PREFIX}{rollback_dir}"));
if namespace_owner.is_some() {
let lease = os::acquire_namespace_mutation_lease_with_owner(&marker_path, namespace_owner.clone()).await;
let volume = volume.to_string();
let sync = os::run_blocking_namespace_operation(lease, move || {
#[cfg(test)]
run_owned_file_write_before_open(&marker_path);
let marker = std::fs::File::create(marker_path)?;
let sync = effective_durability(&volume).syncs_commit_metadata();
if sync {
marker.sync_all()?;
}
Ok(sync)
})
.await
.map_err(to_file_error)?;
if sync {
os::fsync_dir_with_owner(&data_path, namespace_owner)
.await
.map_err(to_file_error)?;
}
return Ok(true);
}
let marker = File::create(marker_path).await.map_err(to_file_error)?;
if effective_durability(volume).syncs_commit_metadata() {
marker.sync_all().await.map_err(to_file_error)?;
@@ -8033,6 +8274,17 @@ impl LocalDisk {
}
async fn commit_reserved_version_delete(&self, volume: &str, object: &str, rollback_dir: Uuid) -> Result<()> {
self.commit_reserved_version_delete_with_namespace_owner(volume, object, rollback_dir, None)
.await
}
async fn commit_reserved_version_delete_with_namespace_owner(
&self,
volume: &str,
object: &str,
rollback_dir: Uuid,
namespace_owner: Option<Arc<dyn Send + Sync>>,
) -> Result<()> {
let object_path = self.io_get_object_path(volume, object)?;
let mut entries = match fs::read_dir(object_path).await {
Ok(entries) => entries,
@@ -8048,10 +8300,14 @@ impl LocalDisk {
continue;
}
let reserved_path = entry.path().join(&reserved_name);
match fs::rename(&reserved_path, entry.path().join(&committed_name)).await {
match os::rename_with_namespace_owner(&reserved_path, &entry.path().join(&committed_name), namespace_owner.clone())
.await
{
Ok(()) => {
if effective_durability(volume).syncs_commit_metadata() {
os::fsync_dir(&entry.path()).await.map_err(to_file_error)?;
os::fsync_dir_with_owner(&entry.path(), namespace_owner.clone())
.await
.map_err(to_file_error)?;
}
}
Err(err) if err.kind() == ErrorKind::NotFound => {}
@@ -8061,7 +8317,13 @@ impl LocalDisk {
Ok(())
}
async fn finish_version_delete(&self, volume: &str, object: &str, rollback_dir: Uuid) -> Result<bool> {
async fn finish_version_delete(
&self,
volume: &str,
object: &str,
rollback_dir: Uuid,
namespace_owner: Option<Arc<dyn Send + Sync>>,
) -> Result<bool> {
let object_path = self.io_get_object_path(volume, object)?;
let mut entries = match fs::read_dir(object_path).await {
Ok(entries) => entries,
@@ -8082,13 +8344,14 @@ impl LocalDisk {
Err(err) => return Err(to_file_error(err).into()),
}
if let Err(err) = self
.delete_data_dir(
.delete_data_dir_with_namespace_owner(
volume,
&format!("{object}/{data_dir}"),
DeleteOptions {
recursive: true,
..Default::default()
},
namespace_owner.clone(),
)
.await
&& first_err.is_none()
@@ -8109,6 +8372,28 @@ impl LocalDisk {
object: &str,
stage: &'static str,
err: DiskError,
) -> DiskError {
self.abort_reserved_version_delete_with_failure(
object_dir,
rollback_dir,
volume,
object,
DeleteRollbackFailure {
stage,
error: err,
namespace_owner: None,
},
)
.await
}
async fn abort_reserved_version_delete_with_failure(
&self,
object_dir: &Path,
rollback_dir: Uuid,
volume: &str,
object: &str,
failure: DeleteRollbackFailure,
) -> DiskError {
let xl_path = object_dir.join(STORAGE_FORMAT_FILE);
restore_delete_rollback_after_error(
@@ -8117,7 +8402,7 @@ impl LocalDisk {
Some(rollback_dir),
volume,
object,
DeleteRollbackFailure { stage, error: err },
failure,
&self.publication_root,
)
.await
@@ -9608,49 +9893,7 @@ impl DiskAPI for LocalDisk {
}
async fn delete_data_dir(&self, volume: &str, path: &str, opts: DeleteOptions) -> Result<DataDirDeleteStatus> {
let key = SnapshotLeaseKey {
volume: volume.to_string(),
path: path.to_string(),
};
{
let mut registry = self.snapshot_leases.lock().await;
if let Some(entry) = registry.entries.get_mut(&key) {
if !entry.tokens.is_empty() {
entry.pending_delete.get_or_insert_with(|| opts.clone());
return Ok(DataDirDeleteStatus::Deferred);
}
if entry.deleting {
entry.pending_delete.get_or_insert_with(|| opts.clone());
return Ok(DataDirDeleteStatus::Deferred);
}
entry.deleting = true;
entry.pending_delete.get_or_insert_with(|| opts.clone());
} else {
registry.entries.insert(
key.clone(),
SnapshotLeaseEntry {
pending_delete: Some(opts.clone()),
deleting: true,
..Default::default()
},
);
}
}
let result = self.delete_unleased(volume, path, &opts).await;
let mut registry = self.snapshot_leases.lock().await;
match result {
Ok(()) => {
registry.entries.remove(&key);
Ok(DataDirDeleteStatus::Deleted)
}
Err(err) => {
if let Some(entry) = registry.entries.get_mut(&key) {
entry.deleting = false;
}
Err(err)
}
}
self.delete_data_dir_with_namespace_owner(volume, path, opts, None).await
}
#[tracing::instrument(level = "trace", skip_all)]
@@ -9689,32 +9932,8 @@ impl DiskAPI for LocalDisk {
Err(Error::other("Invalid Argument"))
}
#[tracing::instrument(level = "trace", skip_all)]
async fn write_metadata(&self, _org_volume: &str, volume: &str, path: &str, fi: FileInfo) -> Result<()> {
crate::hp_guard!("LocalDisk::write_metadata");
fi.validate_for_metadata_read()?;
let p = self.io_get_object_path(volume, format!("{path}/{STORAGE_FORMAT_FILE}").as_str())?;
let mut meta = FileMeta::new();
if !fi.fresh {
let (buf, _) = read_file_exists(&p).await?;
if !buf.is_empty() {
let _ = meta.unmarshal_msg(&buf).map_err(|_| {
meta = FileMeta::new();
});
}
}
meta.add_version(fi)?;
let fm_data = meta.marshal_msg()?;
// Atomic temp+rename: this path also rewrites live xl.meta (delete markers,
// decommission), where an in-place truncate would expose torn metadata.
self.write_all_meta(volume, format!("{path}/{STORAGE_FORMAT_FILE}").as_str(), &fm_data, true)
.await?;
Ok(())
self.write_metadata_with_namespace_owner(volume, path, fi, None).await
}
#[tracing::instrument(level = "trace", skip_all)]
@@ -22177,4 +22396,135 @@ mod test {
assert_eq!(mount_id_from_mountinfo_contents(mountinfo, Path::new("/mnt/replacement disk")), Some(202));
assert_eq!(mount_id_from_mountinfo_contents(mountinfo, Path::new("/mnt/replacement")), None);
}
#[cfg(not(windows))]
#[tokio::test]
#[serial_test::serial(capacity_dirty_scope)]
async fn single_delete_internal_restore_keeps_owner_after_cancellation() {
use crate::disk::os::prepared_publication_test_hooks as hooks;
use futures::FutureExt;
let dir = tempfile::tempdir().expect("fixture directory");
let endpoint = Endpoint::try_from(dir.path().to_str().expect("UTF-8 fixture path")).expect("endpoint");
let disk = Arc::new(LocalDisk::new(&endpoint, false).await.expect("local disk"));
let bucket = "single-delete-internal-restore";
let object = format!("object-{}", Uuid::new_v4());
ensure_test_volume(&disk, bucket).await;
let version = Uuid::new_v4();
let data_dir = Uuid::new_v4();
let rollback_dir = Uuid::new_v4();
let fi = test_file_info(&object, version, Some(data_dir), None);
let original = test_meta(fi.clone());
let object_dir = disk.io_get_object_path(bucket, &object).expect("object IO path");
let part = object_dir.join(data_dir.to_string()).join("part.1");
let metadata = object_dir.join(STORAGE_FORMAT_FILE);
let backup = object_dir.join(rollback_dir.to_string()).join(STORAGE_FORMAT_FILE_BACKUP);
fs::create_dir_all(part.parent().expect("data parent"))
.await
.expect("data directory");
fs::write(&part, b"x").await.expect("real shard");
fs::write(&metadata, &original).await.expect("real version metadata");
set_delete_version_fail_after_data_staged(&object);
let (entered_tx, entered_rx) = tokio::sync::oneshot::channel();
let (release, release_rx) = std::sync::mpsc::channel::<()>();
let hook = hooks::install_at(hooks::Stage::Rename, &metadata, move || {
let _ = entered_tx.send(());
let _ = release_rx.recv();
});
let ctx = Arc::new(crate::runtime::instance::InstanceContext::new());
let before = ctx.namespace_commit_generation();
let owner = ctx.begin_namespace_commit();
let deleting_disk = Arc::clone(&disk);
let deleting_object = object.clone();
let mut delete = tokio::spawn(async move {
deleting_disk
.delete_version_inner(
bucket,
&deleting_object,
fi,
DeleteVersionMutation {
force_del_marker: false,
opts: DeleteOptions {
old_data_dir: Some(rollback_dir),
..Default::default()
},
namespace_owner: Some(owner),
},
)
.await
});
let mut joined = false;
let mut entered = false;
let mut counts = None;
let observations = std::panic::AssertUnwindSafe(async {
tokio::time::timeout(Duration::from_secs(10), async {
tokio::select! {
result = entered_rx => {
result.expect("actual internal restore entry");
entered = true;
}
result = &mut delete => {
joined = true;
panic!("delete returned before internal physical restore: {result:?}");
}
}
})
.await
.expect("internal restore must reach the physical rename");
assert_eq!(std::fs::read(&backup).expect("real undo backup"), original);
assert_eq!(std::fs::read(&part).expect("reserved shard"), b"x");
delete.abort();
let result = tokio::time::timeout(Duration::from_secs(5), &mut delete).await;
joined = result.is_ok();
assert!(
result
.expect("cancelled caller joins")
.expect_err("cancelled caller")
.is_cancelled()
);
counts = Some((ctx.namespace_commits_pending(), ctx.namespace_commit_generation()));
assert!(hooks::drain_namespace_key(&metadata).now_or_never().is_none());
})
.catch_unwind()
.await;
drop(release);
drop(hook);
let coordinator_drained = joined || tokio::time::timeout(Duration::from_secs(10), &mut delete).await.is_ok();
if !coordinator_drained {
delete.abort();
let _ = tokio::time::timeout(Duration::from_secs(5), &mut delete).await;
}
let physical_drained = tokio::time::timeout(Duration::from_secs(5), hooks::drain_namespace_key(&metadata))
.await
.is_ok();
let owner_drained = tokio::time::timeout(Duration::from_secs(5), async {
while ctx.namespace_commits_pending() {
tokio::task::yield_now().await;
}
})
.await
.is_ok();
if !entered || !coordinator_drained || !physical_drained || !owner_drained {
eprintln!("internal restore cleanup incomplete; retained root: {:?}", dir.keep());
if let Err(panic) = observations {
std::panic::resume_unwind(panic);
}
panic!("internal restore cleanup must drain before removing its root");
}
if let Err(panic) = observations {
std::panic::resume_unwind(panic);
}
assert_eq!(std::fs::read(&metadata).expect("late restored metadata"), original);
assert!(!backup.exists(), "the actual backup rename must have completed");
assert_eq!(std::fs::read(&part).expect("old shard survives"), b"x");
disk.read_version("", bucket, &object, &version.to_string(), &ReadOptions::default())
.await
.expect("restored version");
let (pending, generation) = counts.expect("observations completed");
assert!(pending, "internal error recovery lost the physical namespace owner");
assert_eq!(generation, before + 1);
assert_eq!(ctx.namespace_commit_generation(), before + 2);
assert!(!ctx.namespace_commits_pending());
}
}
+40
View File
@@ -732,6 +732,46 @@ impl Disk {
}
}
pub(crate) async fn delete_version_with_namespace_owner(
&self,
volume: &str,
path: &str,
fi: FileInfo,
force_del_marker: bool,
opts: DeleteOptions,
namespace_owner: Option<Arc<dyn Send + Sync>>,
) -> Result<()> {
match self {
Self::Local(disk) => {
disk.delete_version_with_namespace_owner(volume, path, fi, force_del_marker, opts, namespace_owner)
.await
}
Self::Remote(disk) => {
let result = disk.delete_version(volume, path, fi, force_del_marker, opts).await;
// This is sender lifetime only, not proof of a remote physical drain.
drop(namespace_owner);
result
}
}
}
pub(crate) async fn delete_with_namespace_owner(
&self,
volume: &str,
path: &str,
opts: DeleteOptions,
namespace_owner: Option<Arc<dyn Send + Sync>>,
) -> Result<()> {
match self {
Self::Local(disk) => disk.delete_with_namespace_owner(volume, path, opts, namespace_owner).await,
Self::Remote(disk) => {
let result = disk.delete(volume, path, opts).await;
drop(namespace_owner);
result
}
}
}
/// Keep local undo publication owned independently of the wrapper deadline.
/// Remote undo retains its existing RPC contract; this is not a remote drain proof.
pub(crate) async fn undo_write_with_namespace_owner(
+79 -1
View File
@@ -288,6 +288,46 @@ pub(crate) mod prepared_publication_test_hooks {
hook();
}
}
#[cfg(test)]
type RenameDestinationHook = Box<dyn FnOnce(&Path) + Send>;
#[cfg(test)]
static RENAME_DESTINATIONS: LazyLock<Mutex<HashMap<PathBuf, RenameDestinationHook>>> =
LazyLock::new(|| Mutex::new(HashMap::new()));
#[cfg(test)]
pub(crate) struct RenameDestinationGuard(PathBuf);
#[cfg(test)]
impl Drop for RenameDestinationGuard {
fn drop(&mut self) {
RENAME_DESTINATIONS.lock().remove(&self.0);
}
}
#[cfg(test)]
pub(crate) fn observe_rename_destination(source: &Path, hook: impl FnOnce(&Path) + Send + 'static) -> RenameDestinationGuard {
assert!(
RENAME_DESTINATIONS
.lock()
.insert(source.to_path_buf(), Box::new(hook))
.is_none()
);
RenameDestinationGuard(source.to_path_buf())
}
#[cfg(test)]
pub(crate) async fn drain_namespace_key(path: &Path) {
drop(super::acquire_namespace_mutation_lease(path).await);
}
#[cfg(test)]
pub(super) fn run_rename_destination(source: &Path, destination: &Path) {
let hook = RENAME_DESTINATIONS.lock().remove(source);
if let Some(hook) = hook {
hook(destination);
}
}
}
#[cfg(all(test, windows))]
@@ -1361,7 +1401,7 @@ async fn acquire_namespace_mutation_lease(path: &Path) -> Arc<NamespaceMutationL
acquire_namespace_mutation_lease_with_owner(path, None).await
}
async fn acquire_namespace_mutation_lease_with_owner(
pub(in crate::disk) async fn acquire_namespace_mutation_lease_with_owner(
path: &Path,
namespace_owner: Option<Arc<dyn Send + Sync>>,
) -> Arc<NamespaceMutationLease> {
@@ -1936,6 +1976,42 @@ pub(crate) async fn remove_dir_with_owner(
run_blocking_namespace_operation(lease, move || std::fs::remove_dir(path)).await
}
/// Preserve raw rename semantics while retaining a counted owner in the syscall.
/// Unlike reliable rename, this never creates parents or retries a missing source.
pub(in crate::disk) async fn rename_with_namespace_owner(
src: &Path,
dst: &Path,
namespace_owner: Option<Arc<dyn Send + Sync>>,
) -> io::Result<()> {
if namespace_owner.is_none() {
return tokio::fs::rename(src, dst).await;
}
let src = src.to_path_buf();
let dst = dst.to_path_buf();
let lease = acquire_namespace_mutation_lease_with_owner(&dst, namespace_owner).await;
run_blocking_namespace_operation(lease, move || {
#[cfg(all(test, not(windows)))]
{
prepared_publication_test_hooks::run(prepared_publication_test_hooks::Stage::Rename, &src);
prepared_publication_test_hooks::run(prepared_publication_test_hooks::Stage::Rename, &dst);
}
std::fs::rename(src, dst)
})
.await
}
pub(in crate::disk) async fn create_dir_all_with_namespace_owner(
path: &Path,
namespace_owner: Option<Arc<dyn Send + Sync>>,
) -> io::Result<()> {
if namespace_owner.is_none() {
return tokio::fs::create_dir_all(path).await;
}
let path = path.to_path_buf();
let lease = acquire_namespace_mutation_lease_with_owner(&path, namespace_owner).await;
run_blocking_namespace_operation(lease, move || std::fs::create_dir_all(path)).await
}
#[tracing::instrument(name = "rename_all", level = "debug", skip_all)]
pub(crate) async fn rename_all_with_owner(
src_file_path: impl AsRef<Path>,
@@ -2272,6 +2348,8 @@ async fn reliable_rename_inner_with_lease(
move || {
let preparation = prepare_rename_with_retry(&src_file_path, &dst_file_path, &base_dir, &publication_root)?;
#[cfg(all(test, not(windows)))]
prepared_publication_test_hooks::run_rename_destination(&src_file_path, &dst_file_path);
#[cfg(all(test, not(windows)))]
{
prepared_publication_test_hooks::run(prepared_publication_test_hooks::Stage::Rename, &src_file_path);
prepared_publication_test_hooks::run(prepared_publication_test_hooks::Stage::Rename, &dst_file_path);
+142 -14
View File
@@ -5458,7 +5458,7 @@ impl TierConfigMgr {
let manager = handle.read().await;
let published_digest = if intents
.iter()
.any(|recovered| recovered.is_peer_only_terminal() && recovered.intent.state == TierMutationIntentState::Committed)
.any(|recovered| recovered.intent.state == TierMutationIntentState::Committed)
{
Some(tier_config_candidate_digest(&manager).map_err(|err| {
let mut admin_err = ERR_TIER_INVALID_CONFIG.clone();
@@ -5468,18 +5468,29 @@ impl TierConfigMgr {
} else {
None
};
let locally_published_committed_mutations = intents
.iter()
.filter(|recovered| {
recovered.intent.state == TierMutationIntentState::Committed
&& published_digest == Some(recovered.intent.candidate_digest)
})
.map(|recovered| recovered.intent.mutation_id)
.collect::<HashSet<_>>();
let mut prepared_mutation_blocks = HashMap::new();
let mut committed_mutation_blocks: HashMap<String, HashSet<uuid::Uuid>> = HashMap::new();
for recovered in intents {
let settled_tombstone = recovered.is_peer_only_terminal()
&& match recovered.intent.state {
TierMutationIntentState::Aborted => true,
TierMutationIntentState::Committed => {
!retain_missing_mutation_blocks || published_digest == Some(recovered.intent.candidate_digest)
}
TierMutationIntentState::Prepared => false,
};
if settled_tombstone {
// A matching in-memory manager has already crossed the local
// publication boundary. Keep replaying and durably cleaning the
// record, but do not re-fence object operations while that
// terminal work finishes.
let skip_runtime_fence = locally_published_committed_mutations.contains(&recovered.intent.mutation_id)
|| (recovered.is_peer_only_terminal()
&& match recovered.intent.state {
TierMutationIntentState::Aborted => true,
TierMutationIntentState::Committed => !retain_missing_mutation_blocks,
TierMutationIntentState::Prepared => false,
});
if skip_runtime_fence {
continue;
}
Self::collect_prepared_mutation_intent_block(&mut prepared_mutation_blocks, &recovered.intent)?;
@@ -5492,6 +5503,9 @@ impl TierConfigMgr {
}
if retain_missing_mutation_blocks {
for (tier_name, mutation_id) in &runtime.prepared_mutation_blocks {
if locally_published_committed_mutations.contains(mutation_id) {
continue;
}
match prepared_mutation_blocks.entry(tier_name.clone()) {
Entry::Vacant(entry) => {
entry.insert(*mutation_id);
@@ -5505,10 +5519,15 @@ impl TierConfigMgr {
}
}
for (tier_name, mutation_ids) in &runtime.committed_mutation_blocks {
committed_mutation_blocks
.entry(tier_name.clone())
.or_default()
.extend(mutation_ids);
for mutation_id in mutation_ids {
if locally_published_committed_mutations.contains(mutation_id) {
continue;
}
committed_mutation_blocks
.entry(tier_name.clone())
.or_default()
.insert(*mutation_id);
}
}
}
let changed = runtime.prepared_mutation_blocks != prepared_mutation_blocks
@@ -11298,6 +11317,115 @@ mod tests {
);
}
#[tokio::test]
async fn published_dual_terminal_intent_does_not_restore_local_runtime_fence_during_replay() {
use crate::services::tier::tier_mutation_intent::save_tier_mutation_intent_record;
let store = Arc::new(CasConfigStore::default());
let mut persisted = empty_mgr();
persisted.tiers.insert("COLD-A".to_string(), build_rustfs_tier("COLD-A"));
persisted
.save_tiering_config_if_current(store.clone(), None)
.await
.expect("published tier config fixture should persist");
let (_, current_etag) = load_tier_config_for_update(store.clone())
.await
.expect("published tier config fixture should load with metadata");
let current_etag = current_etag.expect("published tier config fixture should have an ETag");
let affected_targets = build_tier_mutation_affected_targets(
TierMutationIntentKind::Add,
HashSet::from(["COLD-A".to_string()]),
&empty_mgr(),
&persisted,
)
.expect("published AddTier targets should build");
let mut intent = build_coordinator_tier_mutation_intent(TierMutationIntentKind::Add, None, &persisted, affected_targets)
.expect("published AddTier intent should build")
.expect("published AddTier should require a durable intent");
intent
.advance(TierMutationIntentState::Committed, Some(current_etag))
.expect("published AddTier intent should commit");
save_tier_coordinator_mutation_intent_record_if_absent(store.clone(), &intent)
.await
.expect("published coordinator intent should persist");
save_tier_mutation_intent_record(store.clone(), &intent)
.await
.expect("published peer intent should persist");
let manager = TierConfigMgr::new();
{
let mut guard = manager.write().await;
install_lease_backend(&mut guard, "COLD-A", LeaseTestBackend::ready("published"));
}
{
let guard = manager.read().await;
assert_eq!(
tier_config_candidate_digest(&guard).expect("published manager digest should build"),
intent.candidate_digest
);
}
TierConfigMgr::apply_committed_mutation_intent_block(&manager, &intent)
.await
.expect("pre-existing committed runtime fence should install");
assert!(
TierConfigMgr::acquire_operation_lease(&manager, "COLD-A").await.is_err(),
"fixture must begin with the committed runtime fence installed"
);
let started = Arc::new(Notify::new());
let release = Arc::new(tokio::sync::Semaphore::new(0));
TIER_MUTATION_TEST_PEERS
.scope(
vec![Arc::new(BlockingCommitTierMutationPeer {
started: started.clone(),
release: release.clone(),
})],
async {
let reload = TierConfigMgr::reload_handle_with(&manager, store.clone());
tokio::pin!(reload);
tokio::time::timeout(Duration::from_secs(5), async {
tokio::select! {
result = &mut reload => panic!("reload finished before terminal replay was released: {result:?}"),
_ = started.notified() => {}
}
})
.await
.expect("terminal replay should reach the blocking peer");
let lease = TierConfigMgr::acquire_operation_lease(&manager, "COLD-A")
.await
.expect("terminal cleanup must not re-fence an already-published tier");
drop(lease);
release.add_permits(1);
tokio::time::timeout(Duration::from_secs(5), &mut reload)
.await
.expect("terminal replay should finish after the peer responds")
.expect("terminal replay should succeed after the peer responds");
},
)
.await;
assert!(manager.read().await.tiers.contains_key("COLD-A"));
assert!(
TierConfigMgr::load_coordinator_mutation_intents(store.clone())
.await
.expect("coordinator cleanup should be readable")
.is_empty()
);
assert_eq!(
TierConfigMgr::load_tier_mutation_intents(store)
.await
.expect("retained peer tombstone should be readable"),
vec![intent]
);
let guard = manager.read().await;
let runtime = registered_tier_driver_runtime(&guard).expect("runtime should remain registered");
assert!(
lock_unpoisoned(&runtime).committed_mutation_blocks.is_empty(),
"retained terminal evidence must not restore the published runtime fence"
);
}
#[tokio::test]
async fn peer_terminal_tombstone_gc_uses_etag_and_retains_racing_replacement() {
use crate::services::tier::tier_mutation_intent::{
+424 -3
View File
@@ -7497,6 +7497,7 @@ impl crate::storage_api_contracts::object::ObjectOperations for SetDisks {
let transported = delete_file_info_with_replication_transport_metadata(fi);
let fi = &transported;
let disks = self.disk_inventory().await;
let namespace_owner = (!is_meta_bucketname(bucket)).then(|| self.ctx.begin_namespace_commit());
let write_quorum = disks.len() / 2 + 1;
let rollback_dir = Uuid::new_v4();
@@ -7504,10 +7505,11 @@ impl crate::storage_api_contracts::object::ObjectOperations for SetDisks {
let mut errs = Vec::with_capacity(disks.len());
for disk in disks.iter() {
let disk_namespace_owner = namespace_owner.clone().map(|owner| owner as Arc<dyn Send + Sync>);
futures.push(async move {
if let Some(disk) = disk {
match disk
.delete_version(
.delete_version_with_namespace_owner(
bucket,
object,
fi.clone(),
@@ -7516,6 +7518,7 @@ impl crate::storage_api_contracts::object::ObjectOperations for SetDisks {
old_data_dir: Some(rollback_dir),
..Default::default()
},
disk_namespace_owner,
)
.await
{
@@ -7563,10 +7566,11 @@ impl crate::storage_api_contracts::object::ObjectOperations for SetDisks {
let bucket = bucket.to_string();
let object = object.to_string();
let fi = fi.clone();
let disk_namespace_owner = namespace_owner.clone().map(|owner| owner as Arc<dyn Send + Sync>);
rollback_futures.push(async move {
if should_rollback {
if let Err(err) = disk
.delete_version(
.delete_version_with_namespace_owner(
&bucket,
&object,
fi,
@@ -7577,6 +7581,7 @@ impl crate::storage_api_contracts::object::ObjectOperations for SetDisks {
old_data_dir: Some(rollback_dir),
..Default::default()
},
disk_namespace_owner,
)
.await
{
@@ -7591,7 +7596,7 @@ impl crate::storage_api_contracts::object::ObjectOperations for SetDisks {
} else {
let rollback_path = format!("{object}/{rollback_dir}");
if let Err(err) = disk
.delete(
.delete_with_namespace_owner(
&bucket,
&rollback_path,
DeleteOptions {
@@ -7599,6 +7604,7 @@ impl crate::storage_api_contracts::object::ObjectOperations for SetDisks {
immediate: true,
..Default::default()
},
disk_namespace_owner,
)
.await
&& err != DiskError::FileNotFound
@@ -7617,6 +7623,7 @@ impl crate::storage_api_contracts::object::ObjectOperations for SetDisks {
}
join_all(rollback_futures).await;
drop(namespace_owner);
quorum_result
}
@@ -21044,3 +21051,417 @@ mod body_cache_hook_e2e_tests {
);
}
}
#[cfg(test)]
mod single_delete_namespace_owner_tests {
use super::hermetic_set_disks_support::hermetic_set_disks_isolated;
use super::*;
use crate::disk::ReadOptions;
#[cfg(not(windows))]
use crate::disk::STORAGE_FORMAT_FILE;
use crate::object_api::WriteCompletion;
#[cfg(not(windows))]
use tokio::io::AsyncReadExt;
async fn seed_version(set: &Arc<SetDisks>, bucket: &str, object: &str, version: Uuid, body: &[u8]) {
set.put_object(
bucket,
object,
&mut PutObjReader::from_vec(body.to_vec()),
&ObjectOptions {
versioned: true,
version_id: Some(version.to_string()),
write_completion: WriteCompletion::TailDrained,
..Default::default()
},
)
.await
.expect("seed a complete real object version");
}
#[tokio::test]
#[serial_test::serial(capacity_dirty_scope)]
async fn single_delete_advances_namespace_generation_through_cleanup() {
let (dirs, disks, set) = hermetic_set_disks_isolated(4).await;
let bucket = "single-delete-namespace";
let object = "last-version";
for disk in &disks {
disk.make_volume(bucket).await.expect("fixture bucket");
}
let version = Uuid::new_v4();
seed_version(&set, bucket, object, version, &vec![0x41; 256 * 1024]).await;
let before = set.ctx.namespace_commit_generation();
assert!(!set.ctx.namespace_commits_pending());
let request = FileInfo {
name: object.to_string(),
version_id: Some(version),
mod_time: Some(OffsetDateTime::now_utc()),
..Default::default()
};
let result =
tokio::time::timeout(Duration::from_secs(10), set.delete_object_version(bucket, object, &request, false)).await;
if !matches!(result, Ok(Ok(()))) {
let retained = dirs.into_iter().map(tempfile::TempDir::keep).collect::<Vec<_>>();
panic!("single delete and cleanup did not finish: {result:?}; retained roots: {retained:?}");
}
for (disk, dir) in disks.iter().zip(&dirs) {
let result = disk
.read_version("", bucket, object, &version.to_string(), &ReadOptions::default())
.await;
assert!(matches!(result, Err(DiskError::FileNotFound | DiskError::FileVersionNotFound)));
assert!(
!dir.path().join(bucket).join(object).exists(),
"immediate cleanup must remove the rollback object tree"
);
}
assert!(!set.ctx.namespace_commits_pending());
assert_eq!(
set.ctx.namespace_commit_generation(),
before + 2,
"single delete must count one complete root lifetime"
);
}
#[cfg(not(windows))]
async fn assert_single_delete_physical_owner(case: &'static str) {
use crate::disk::os::prepared_publication_test_hooks as hooks;
use futures::FutureExt;
temp_env::async_with_vars([(rustfs_config::ENV_DRIVE_MAX_TIMEOUT_DURATION, Some("60"))], async {
let (dirs, disks, set) = hermetic_set_disks_isolated(4).await;
let bucket = "single-delete-physical-owner";
let first = Uuid::new_v4();
let second = Uuid::new_v4();
let first_body = vec![0x51; 256 * 1024];
let second_body = vec![0x62; 4096];
let missing = case == "missing-marker";
let rollback = case == "rollback";
let last = case == "last-version";
let cleanup = case == "immediate-cleanup";
for disk in &disks {
disk.make_volume(bucket).await.expect("fixture bucket");
}
if !missing {
seed_version(&set, bucket, case, first, &first_body).await;
if !last && !cleanup {
seed_version(&set, bucket, case, second, &second_body).await;
}
}
let request = FileInfo {
name: case.to_string(),
version_id: Some(first),
deleted: missing,
mark_deleted: missing,
mod_time: Some(OffsetDateTime::now_utc()),
..Default::default()
};
let before = set.ctx.namespace_commit_generation();
assert!(!set.ctx.namespace_commits_pending());
let mut metadata_paths = Vec::new();
let mut originals = Vec::new();
let mut cleanup_sources = Vec::new();
let mut cleanup_parts = Vec::new();
for disk in &disks {
let crate::disk::Disk::Local(local) = disk.as_ref() else {
panic!("local fixture required");
};
let path = local
.get_disk()
.get_object_path_for_io(bucket, case)
.expect("leased IO path")
.join(STORAGE_FORMAT_FILE);
originals.push(if missing {
None
} else {
Some(std::fs::read(&path).expect("seeded raw metadata"))
});
if cleanup {
let fi = disk.read_version("", bucket, case, &first.to_string(), &ReadOptions::default())
.await.expect("real non-inline data directory");
assert!(!fi.inline_data(), "cleanup fixture must have real shard files");
let data = path.parent().expect("object parent").join(fi.data_dir.expect("data directory").to_string());
cleanup_parts.push(std::fs::read(data.join("part.1")).expect("real pre-delete shard"));
cleanup_sources.push(data);
}
metadata_paths.push(path);
}
if rollback {
// Two disks apply the real deletion and then error. Undo must
// restore all four disks, including these post-apply failures.
for disk in disks.iter().take(2) {
crate::disk::local::set_delete_version_fail_after_commit(disk.path().as_path(), case);
}
}
let (entered_tx, mut entered_rx) = tokio::sync::mpsc::unbounded_channel();
let mut guards = Vec::new();
let mut destination_guards = Vec::new();
let later_guards = Arc::new(std::sync::Mutex::new(Vec::new()));
let mut releases = Vec::new();
for (index, path) in metadata_paths.iter().enumerate() {
let tx = entered_tx.clone();
let (release, rx) = std::sync::mpsc::channel::<()>();
if last || cleanup {
let source = if cleanup { &cleanup_sources[index] } else { path };
destination_guards.push(hooks::observe_rename_destination(source, move |destination| {
let _ = tx.send((index, destination.to_path_buf()));
let _ = rx.recv();
}));
} else {
let hook_path = path.clone();
let path = path.clone();
let pause_path = path.clone();
let later_guards = Arc::clone(&later_guards);
guards.push(hooks::install_at(hooks::Stage::Rename, &hook_path, move || {
let pause = move || {
let _ = tx.send((index, pause_path));
let _ = rx.recv();
};
if rollback {
// This first callback precedes forward metadata publication.
// Arm only the subsequent real backup-restore rename.
let next = hooks::install_at(hooks::Stage::Rename, &path, pause);
later_guards.lock().expect("fixture hook guards").push(next);
} else {
pause();
}
}));
}
releases.push(release);
}
drop(entered_tx);
let deleting_set = Arc::clone(&set);
let mut delete =
tokio::spawn(async move { deleting_set.delete_object_version(bucket, case, &request, missing).await });
let mut joined = false;
let mut counts = None;
let mut physical_keys = std::collections::BTreeMap::new();
let observations = std::panic::AssertUnwindSafe(async {
tokio::time::timeout(Duration::from_secs(10), async {
while physical_keys.len() < 4 {
tokio::select! {
entry = entered_rx.recv() => {
let (index, key) = entry.expect("actual physical delete entry");
assert!(physical_keys.insert(index, key).is_none());
}
result = &mut delete => {
joined = true;
panic!("delete returned before physical entry: {result:?}");
}
}
}
})
.await
.expect("all four physical mutations must enter");
let pending_at_entry = set.ctx.namespace_commits_pending();
let generation_at_entry = set.ctx.namespace_commit_generation();
for (path, original) in metadata_paths.iter().zip(&originals) {
if missing {
assert!(!path.exists(), "missing marker must still be unpublished at entry");
} else if cleanup {
assert!(!path.exists(), "cleanup must follow the actual last-version deletion");
} else {
let bytes = std::fs::read(path).expect("paused metadata is readable");
let metadata = rustfs_filemeta::FileMeta::load(&bytes).expect("real metadata must parse");
if !last && !cleanup {
assert!(metadata.find_version(Some(second)).is_ok());
}
assert_eq!(
metadata.find_version(Some(first)).is_err(),
rollback,
"undo entry must follow actual deletion"
);
if !rollback {
assert_eq!(Some(&bytes), original.as_ref());
}
}
}
if rollback {
tokio::time::pause();
tokio::time::advance(Duration::from_secs(61)).await;
tokio::time::resume();
let result = tokio::time::timeout(Duration::from_secs(5), &mut delete).await;
joined = result.is_ok();
let result = result
.expect("ordinary undo deadlines must return")
.expect("delete coordinator must not panic");
assert!(
matches!(&result, Err(StorageError::InsufficientWriteQuorum(error_bucket, error_object)) if error_bucket == bucket && error_object == case),
"keep the original failed delete quorum: {result:?}"
);
} else {
delete.abort();
let result = tokio::time::timeout(Duration::from_secs(5), &mut delete).await;
joined = result.is_ok();
assert!(
result
.expect("cancelled caller must join")
.expect_err("the caller must be cancelled")
.is_cancelled()
);
}
counts = Some((
pending_at_entry,
generation_at_entry,
set.ctx.namespace_commits_pending(),
set.ctx.namespace_commit_generation(),
));
for path in physical_keys.values() {
assert!(
hooks::drain_namespace_key(path)
.now_or_never()
.is_none(),
"the physical metadata executor must still own its exact key"
);
}
})
.catch_unwind()
.await;
drop(releases);
drop(guards);
drop(destination_guards);
let coordinator_drained = joined || tokio::time::timeout(Duration::from_secs(10), &mut delete).await.is_ok();
if !coordinator_drained {
delete.abort();
let _ = tokio::time::timeout(Duration::from_secs(5), &mut delete).await;
}
later_guards.lock().unwrap_or_else(std::sync::PoisonError::into_inner).clear();
let drains = futures::future::join_all(physical_keys.values().map(|path| {
tokio::time::timeout(Duration::from_secs(5), hooks::drain_namespace_key(path))
})).await;
let owner_drained = tokio::time::timeout(Duration::from_secs(5), async {
while set.ctx.namespace_commits_pending() {
tokio::task::yield_now().await;
}
})
.await
.is_ok();
if physical_keys.len() != 4 || !coordinator_drained || !owner_drained || drains.iter().any(|result| result.is_err()) {
let retained = dirs.into_iter().map(tempfile::TempDir::keep).collect::<Vec<_>>();
eprintln!("single delete cleanup incomplete; retained roots: {retained:?}");
if let Err(panic) = observations {
std::panic::resume_unwind(panic);
}
panic!("single delete physical cleanup did not drain");
}
if let Err(panic) = observations {
std::panic::resume_unwind(panic);
}
for (index, (disk, (path, original))) in disks.iter().zip(metadata_paths.iter().zip(&originals)).enumerate() {
if cleanup {
assert!(!path.exists(), "metadata must remain deleted after cleanup cancellation");
assert!(!cleanup_sources[index].exists(), "physical cleanup must remove the shard directory");
assert_eq!(
std::fs::read(physical_keys[&index].join("part.1")).expect("actual trashed shard"),
cleanup_parts[index],
"trash must contain the exact original shard"
);
continue;
}
if last {
assert!(!path.exists(), "late trash rename must remove the last metadata");
assert_eq!(
Some(std::fs::read(&physical_keys[&index]).expect("actual trash destination")),
*original,
"last-version trash must contain the exact old metadata"
);
continue;
}
let bytes = std::fs::read(path).expect("late metadata publication must finish");
let metadata = rustfs_filemeta::FileMeta::load(&bytes).expect("final metadata must parse");
if missing {
assert!(
metadata
.find_version(Some(first))
.expect("the marker must be published")
.1
.delete_marker
.is_some()
);
} else {
assert!(metadata.find_version(Some(second)).is_ok());
assert_eq!(metadata.find_version(Some(first)).is_ok(), rollback);
if rollback {
assert_eq!(Some(&bytes), original.as_ref(), "physical undo must restore exact old metadata");
}
let fi = disk
.read_version("", bucket, case, &second.to_string(), &ReadOptions { read_data: true, ..Default::default() })
.await
.expect("remaining version");
if fi.inline_data() {
assert!(fi.data.as_ref().is_some_and(|data| !data.is_empty()), "remaining inline shard must survive");
} else {
let parts = disk.check_parts(bucket, case, &fi).await.expect("remaining shard check");
assert_eq!(parts.results, vec![crate::disk::CHECK_PART_SUCCESS; fi.parts.len()]);
}
}
}
if !missing && !last && !cleanup {
let mut actual = Vec::new();
let read_opts = ObjectOptions {
version_id: Some(if rollback { first } else { second }.to_string()),
versioned: true,
..Default::default()
};
let mut reader = tokio::time::timeout(
Duration::from_secs(5),
set.get_object_reader(bucket, case, None, HeaderMap::new(), &read_opts),
)
.await
.expect("final GET must finish")
.expect("the surviving version must be readable");
tokio::time::timeout(Duration::from_secs(5), reader.stream.read_to_end(&mut actual))
.await
.expect("body must drain")
.expect("read surviving body");
assert_eq!(actual, if rollback { first_body } else { second_body });
}
let (pending_at_entry, generation_at_entry, pending_after_return, generation_after_return) =
counts.expect("complete observations");
assert!(
pending_at_entry && pending_after_return,
"physical single delete outlived namespace accounting: {case}"
);
assert_eq!(generation_at_entry, before + 1);
assert_eq!(generation_after_return, generation_at_entry);
assert_eq!(set.ctx.namespace_commit_generation(), before + 2);
assert!(!set.ctx.namespace_commits_pending());
})
.await;
}
#[cfg(not(windows))]
#[tokio::test]
#[serial_test::serial(capacity_dirty_scope)]
async fn single_delete_cancel_keeps_owner_until_immediate_data_cleanup() {
assert_single_delete_physical_owner("immediate-cleanup").await;
}
#[cfg(not(windows))]
#[tokio::test]
#[serial_test::serial(capacity_dirty_scope)]
async fn single_delete_cancel_keeps_owner_until_last_version_trash() {
assert_single_delete_physical_owner("last-version").await;
}
#[cfg(not(windows))]
#[tokio::test]
#[serial_test::serial(capacity_dirty_scope)]
async fn single_delete_cancel_keeps_owner_until_metadata_rewrite() {
assert_single_delete_physical_owner("remaining-version").await;
}
#[cfg(not(windows))]
#[tokio::test]
#[serial_test::serial(capacity_dirty_scope)]
async fn single_delete_cancel_keeps_owner_until_missing_marker_publication() {
assert_single_delete_physical_owner("missing-marker").await;
}
#[cfg(not(windows))]
#[tokio::test]
#[serial_test::serial(capacity_dirty_scope)]
async fn single_delete_failed_quorum_keeps_owner_until_physical_undo() {
assert_single_delete_physical_owner("rollback").await;
}
}
+155 -19
View File
@@ -76,6 +76,8 @@ struct HealTaskStatusPayload<'a> {
min_seq: u64,
#[serde(skip_serializing_if = "Option::is_none")]
progress: Option<&'a HealProgress>,
#[serde(skip_serializing_if = "Option::is_none")]
outcome: Option<&'a super::outcome::HealTaskOutcome>,
}
fn u64_is_zero(value: &u64) -> bool {
@@ -87,17 +89,18 @@ fn encode_heal_task_status_payload(
mut items: Vec<HealResultItem>,
progress: Option<&HealProgress>,
mut truncated: bool,
next_seq: u64,
min_seq: u64,
sequence: (u64, u64),
outcome: Option<&super::outcome::HealTaskOutcome>,
) -> Result<(Vec<u8>, bool)> {
loop {
let data = serde_json::to_vec(&HealTaskStatusPayload {
summary,
items: &items,
truncated,
next_seq,
min_seq,
next_seq: sequence.0,
min_seq: sequence.1,
progress,
outcome,
})
.map_err(|e| Error::Serialization(format!("failed to serialize heal task status: {e}")))?;
if data.len() <= MAX_HEAL_STATUS_PAYLOAD_SIZE {
@@ -111,25 +114,21 @@ fn encode_heal_task_status_payload(
}
}
fn heal_status_detail(detail: Option<String>, truncated: bool) -> Option<String> {
if !truncated {
return detail;
}
let truncation = "heal result items were truncated";
Some(detail.map_or_else(|| truncation.to_string(), |detail| format!("{detail}; {truncation}")))
}
fn encode_heal_status_response(
summary: &str,
items: Vec<HealResultItem>,
progress: Option<&HealProgress>,
detail: Option<String>,
truncated: bool,
next_seq: u64,
min_seq: u64,
sequence: (u64, u64),
outcome: Option<&super::outcome::HealTaskOutcome>,
) -> Result<(Vec<u8>, Option<String>)> {
let (data, truncated) = encode_heal_task_status_payload(summary, items, progress, truncated, next_seq, min_seq)?;
Ok((data, heal_status_detail(detail, truncated)))
let (summary, detail) = match outcome {
Some(outcome) => outcome.legacy_status(summary, detail),
None => (summary, detail),
};
let (data, truncated) = encode_heal_task_status_payload(summary, items, progress, truncated, sequence, outcome)?;
Ok((data, super::outcome::heal_status_detail(detail, truncated)))
}
impl HealChannelProcessor {
@@ -439,6 +438,7 @@ impl HealChannelProcessor {
.await
};
let outcome = report.as_ref().ok().and_then(|report| report.outcome.clone());
let (summary, detail, items, truncated, progress, next_seq, min_seq) = match report {
Ok(HealTaskReport {
status: HealTaskStatus::Pending | HealTaskStatus::Running,
@@ -576,8 +576,15 @@ impl HealChannelProcessor {
}
};
let (data, detail) =
encode_heal_status_response(&summary, items, progress.as_ref(), detail, truncated, next_seq, min_seq)?;
let (data, detail) = encode_heal_status_response(
&summary,
items,
progress.as_ref(),
detail,
truncated,
(next_seq, min_seq),
outcome.as_deref(),
)?;
let response = HealChannelResponse {
request_id: client_token,
@@ -866,7 +873,7 @@ mod tests {
..Default::default()
}];
let (data, detail) = encode_heal_status_response("running", items, None, None, false, 0, 0).unwrap();
let (data, detail) = encode_heal_status_response("running", items, None, None, false, (0, 0), None).unwrap();
assert!(data.len() <= MAX_HEAL_STATUS_PAYLOAD_SIZE);
let payload: serde_json::Value = serde_json::from_slice(&data).unwrap();
@@ -875,6 +882,135 @@ mod tests {
assert_eq!(detail.as_deref(), Some("heal result items were truncated"));
}
#[test]
fn outcome_v3_fixture_matches_canonical_owner_and_preserves_legacy_terminals() {
use crate::heal::outcome::*;
let cases: serde_json::Value = serde_json::from_str(include_str!("../../../madmin/tests/fixtures/heal-outcome-v3.json"))
.expect("shared client fixtures");
for case in cases.as_array().expect("fixture cases") {
if case.get("remoteResponse").is_some() {
continue;
}
let mut outcome = HealTaskOutcome::default();
let name = case["name"].as_str().expect("case name");
if matches!(name, "unknown" | "completed_with_errors") {
let disposition = if name == "unknown" {
HealObjectDisposition::Unknown
} else {
outcome.attempt_failed();
HealObjectDisposition::Failed(HealFailureClass::RetryExhausted)
};
outcome.record(HealObjectOutcome {
identity: HealObjectIdentity {
kind: HealObjectKind::Object,
bucket: "bucket".into(),
object: "object".into(),
version_id: None,
bucket_incarnation_id: None,
pool_index: None,
set_index: None,
},
disposition,
detail: None,
});
}
let abort = match name {
"cancelled" => Some(HealAbortReason::Cancelled),
"deadline" => Some(HealAbortReason::Deadline),
"untraversable" => Some(HealAbortReason::Untraversable),
_ => None,
};
outcome.finish(abort);
let expected = &case["response"];
let initial_detail = abort.map(|reason| {
match reason {
HealAbortReason::Cancelled => "heal task cancelled",
HealAbortReason::Deadline => "heal task timed out",
HealAbortReason::Untraversable => "heal listing is untraversable",
}
.to_string()
});
let (bytes, detail) = encode_heal_status_response(
if abort.is_some() { "stopped" } else { "finished" },
Vec::new(),
None,
initial_detail,
true,
(9, 4),
Some(&outcome),
)
.expect("canonical owner encoding");
let decoded: serde_json::Value = serde_json::from_slice(&bytes).expect("wire payload");
assert_eq!(decoded["summary"], expected["summary"], "{name}");
assert_eq!(detail.unwrap_or_default(), expected["detail"].as_str().expect("detail"), "{name}");
assert_eq!(decoded["outcome"], expected["outcome"], "{name}");
assert_eq!((decoded["next_seq"].as_u64(), decoded["min_seq"].as_u64()), (Some(9), Some(4)));
assert!(decoded["outcome"].get("retainedObjectBytes").is_none());
assert!(decoded["outcome"].get("untraversable").is_none());
}
}
#[test]
fn outcome_v3_abort_cannot_be_hidden_by_a_finished_status() {
use crate::heal::outcome::{HealAbortReason, HealTaskOutcome};
for reason in [
HealAbortReason::Cancelled,
HealAbortReason::Deadline,
HealAbortReason::Untraversable,
] {
let mut outcome = HealTaskOutcome::default();
outcome.finish(Some(reason));
let (data, detail) = encode_heal_status_response("finished", Vec::new(), None, None, false, (0, 0), Some(&outcome))
.expect("canonical abort adapter");
let json: serde_json::Value = serde_json::from_slice(&data).expect("public state");
assert_eq!(json["summary"], "stopped");
assert_eq!(json["outcome"]["execution"]["state"], "aborted");
assert!(detail.is_some());
}
}
#[test]
fn outcome_v3_payload_bound_keeps_cumulative_outcome_and_cursors() {
use crate::heal::outcome::*;
let mut outcome = HealTaskOutcome::default();
outcome.start();
for index in 0..256 {
outcome.record(HealObjectOutcome {
identity: HealObjectIdentity {
kind: HealObjectKind::Object,
bucket: "bucket".into(),
object: format!("object-{index}"),
version_id: None,
bucket_incarnation_id: None,
pool_index: None,
set_index: None,
},
disposition: HealObjectDisposition::Unknown,
detail: Some("\"".repeat(1024)),
});
}
let retained = outcome.objects.len();
let items = vec![
HealResultItem::default(),
HealResultItem {
detail: "x".repeat(MAX_HEAL_STATUS_PAYLOAD_SIZE + 1),
..Default::default()
},
];
let (bytes, detail) = encode_heal_status_response("running", items, None, None, false, (9, 4), Some(&outcome))
.expect("bounded status with cumulative outcome");
assert!(bytes.len() <= MAX_HEAL_STATUS_PAYLOAD_SIZE);
let wire: serde_json::Value = serde_json::from_slice(&bytes).expect("bounded payload");
assert_eq!(wire["items"].as_array().expect("items").len(), 1);
assert_eq!(wire["truncated"], true);
assert_eq!((wire["next_seq"].as_u64(), wire["min_seq"].as_u64()), (Some(9), Some(4)));
assert_eq!(wire["outcome"]["counters"]["processed"], 256);
assert_eq!(wire["outcome"]["counters"]["healed"], 0);
assert_eq!(wire["outcome"]["objects"].as_array().expect("outcome window").len(), retained);
assert!(retained < 256 && outcome.objects_truncated);
assert_eq!(detail.as_deref(), Some("heal result items were truncated"));
}
#[test]
fn admission_response_preserves_all_admission_outcomes() {
let cases = [
+5 -20
View File
@@ -313,7 +313,6 @@ impl HealManager {
completed_status_entry.outcome = Some(Arc::new(task.get_outcome().await));
}
let terminal_completion = !matches!(completed_status, HealTaskStatus::Retrying { .. });
let successful_completion = matches!(completed_status, HealTaskStatus::Completed);
// Keep retry ownership continuous: status snapshots acquire
// these locks in the same active -> retrying order.
let mut retrying_heals_guard = if let (Some((request, _, error)), Some(cancel_token)) =
@@ -375,11 +374,11 @@ impl HealManager {
drop(stats);
if terminal_completion {
let notice_targets = take_mrf_repair_notice_targets(&mrf_repair_notice_targets_clone, &task_id);
if successful_completion {
emit_mrf_repaired_events(notice_targets);
} else {
release_mrf_repair_notice_targets(notice_targets);
}
// Neither task status nor the diagnostic outcome
// window supplies a storage-owned repair receipt.
// Release only the ingress lease for rediscovery;
// preserve the producer's existing retry hints.
release_mrf_repair_notice_targets(notice_targets);
}
}
@@ -706,20 +705,6 @@ fn move_mrf_repair_notice_targets(
}
}
fn emit_mrf_repaired_events(targets: Vec<MrfRepairNoticeTarget>) {
for target in targets {
rustfs_common::mrf_channel::note_mrf_repaired(&target.bucket, &target.object, target.version_id);
rustfs_common::mrf_channel::release_mrf_identity(
target.kind,
&target.bucket,
&target.object,
target.version_id,
target.scope,
target.lease,
);
}
}
fn release_mrf_repair_notice_targets(targets: Vec<MrfRepairNoticeTarget>) {
for target in targets {
rustfs_common::mrf_channel::release_mrf_identity(
+72 -12
View File
@@ -3096,7 +3096,7 @@ async fn test_cancel_task_removes_queued_request() {
}
#[tokio::test]
async fn test_mrf_repaired_notice_waits_for_successful_completion() {
async fn mrf_ownership_unverified_completion_does_not_emit_repaired() {
let bucket = "mrf-completion-success";
let object = "object";
let version_id = Some([9u8; 16]);
@@ -3126,21 +3126,81 @@ async fn test_mrf_repaired_notice_waits_for_successful_completion() {
);
process_manager_queue_once(&manager).await;
for _ in 0..100 {
let events = rustfs_common::mrf_channel::take_mrf_repaired_events_for(bucket);
if !events.is_empty() {
assert_eq!(events.len(), 1);
assert_eq!(events[0].object.as_ref(), object);
assert_eq!(events[0].version_id, version_id);
return;
tokio::time::timeout(Duration::from_secs(5), async {
loop {
let stats = manager.get_statistics().await;
if stats.successful_tasks + stats.failed_tasks > 0 {
break;
}
tokio::task::yield_now().await;
}
tokio::time::sleep(Duration::from_millis(10)).await;
}
panic!("successful MRF-owned heal should emit one repaired event");
})
.await
.expect("scheduler completes the task");
assert!(rustfs_common::mrf_channel::take_mrf_repaired_events_for(bucket).is_empty());
assert!(!lock_mrf_repair_notice_targets(&manager.mrf_repair_notice_targets).contains_key(&receipt.task_id));
}
#[tokio::test]
async fn test_mrf_repaired_notice_removed_on_queued_cancel_without_event() {
async fn mrf_ownership_dry_run_and_empty_window_do_not_emit_repaired() {
for empty_window in [false, true] {
let bucket = if empty_window {
"mrf-empty-outcome"
} else {
"mrf-dry-run-outcome"
};
let manager = HealManager::new(Arc::new(MockStorage), None);
let request = HealRequest::new(
if empty_window {
HealType::Cluster
} else {
HealType::Object {
bucket: bucket.to_string(),
object: "object".to_string(),
version_id: None,
}
},
HealOptions {
recursive: true,
dry_run: !empty_window,
recreate_missing: true,
..Default::default()
},
HealPriority::Normal,
);
let receipt = manager
.submit_mrf_heal_request_with_receipt(request, Arc::from(bucket), Arc::from("object"), None)
.await
.expect("notice target registered");
process_manager_queue_once(&manager).await;
tokio::time::timeout(Duration::from_secs(5), async {
loop {
let stats = manager.get_statistics().await;
if stats.successful_tasks + stats.failed_tasks > 0 {
break;
}
tokio::task::yield_now().await;
}
})
.await
.expect("scheduler completed");
let report = manager.get_task_report(&receipt.task_id).await.expect("completed report");
assert_eq!(report.status, HealTaskStatus::Completed);
let outcome = report.outcome.expect("canonical outcome");
if empty_window {
assert!(outcome.objects.is_empty());
} else {
assert_eq!(
outcome.objects[0].disposition,
crate::heal::outcome::HealObjectDisposition::DryRunObserved
);
}
assert!(rustfs_common::mrf_channel::take_mrf_repaired_events_for(bucket).is_empty());
}
}
#[tokio::test]
async fn mrf_ownership_queued_cancel_does_not_emit_repaired() {
let bucket = "mrf-completion-cancel";
let object = "object";
let _ = rustfs_common::mrf_channel::take_mrf_repaired_events_for(bucket);
+9 -8
View File
@@ -25,12 +25,13 @@
//! set, rewritten on a group-commit cadence (every flush interval or flush
//! threshold new intents). A rewrite is atomic at the record level only — a
//! torn tail simply truncates during replay because every record carries its
//! own CRC32. Losing the last flush window (≤500 ms) is acceptable because
//! every producer keeps its own safety net: read-repair re-detects on the
//! next failing read, and the scanner's corrupt-metadata branch leaves a
//! pending-ledger entry behind even when its MRF intent is accepted
//! (backlog#1894 axis A), so a lost intent is retried by the ledger rather
//! than waiting for the failed-object TTL to re-scan the path.
//! own CRC32. Neither ingress nor manager admission is a durable ownership
//! receipt. The last flush window can be lost. Read-repair can rediscover a
//! failed read; the scanner retains bounded, expiring retry hints. Partial
//! writes also use a best-effort in-memory fast path, not a durable successor.
//! These mechanisms must not be reported as verified repair completion.
//! The partial-write caller's restart-survival requirement remains unmet by
//! admission alone; a verified durable handoff is still required.
use super::{DiskStore, HealDiskExt as _, local_disk_map_read};
use crate::heal::manager::{HealManager, MrfRepairNoticeTarget};
@@ -585,8 +586,8 @@ impl MrfRuntime {
self.dirty = true;
match submit_mrf_heal_request(manager, &intent).await {
// Accepted intents leave the pending set; the next flush persists the
// smaller snapshot. The scanner ledger is cleared later, when the
// canonical heal task reaches a successful terminal completion.
// smaller snapshot. This is not a durable successor receipt and
// does not discharge the producer's existing retry hints.
Ok(HealAdmissionResult::Accepted) | Ok(HealAdmissionResult::Merged) => {}
Ok(HealAdmissionResult::Full) | Ok(HealAdmissionResult::Dropped(HealAdmissionDropReason::QueueFull)) => {
intent.attempts = intent.attempts.saturating_add(1);
+179 -11
View File
@@ -15,6 +15,7 @@
//! Execution results are separate from repair responsibility. A legacy
//! successful storage call supplies no authoritative repair receipt.
use serde::{Deserialize, Serialize};
use std::{collections::VecDeque, time::SystemTime};
use uuid::Uuid;
@@ -22,14 +23,16 @@ const MAX_OUTCOME_ITEMS: usize = 128;
const MAX_OUTCOME_BYTES: usize = 64 * 1024;
const MAX_OUTCOME_DETAIL_BYTES: usize = 1024;
#[derive(Debug, Clone, Copy, PartialEq, Eq)]
#[derive(Debug, Clone, Copy, PartialEq, Eq, Serialize)]
#[serde(rename_all = "snake_case")]
pub enum HealObjectKind {
Object,
Metadata,
Decode,
}
#[derive(Debug, Clone, PartialEq, Eq)]
#[derive(Debug, Clone, PartialEq, Eq, Serialize)]
#[serde(rename_all = "camelCase")]
pub struct HealObjectIdentity {
pub kind: HealObjectKind,
pub bucket: String,
@@ -41,7 +44,8 @@ pub struct HealObjectIdentity {
pub set_index: Option<usize>,
}
#[derive(Debug, Clone, Copy, PartialEq, Eq)]
#[derive(Debug, Clone, Copy, PartialEq, Eq, Serialize)]
#[serde(rename_all = "snake_case")]
pub enum HealDeferredReason {
DanglingDeleteGrace,
TransientUsageCache,
@@ -49,14 +53,21 @@ pub enum HealDeferredReason {
Deadline,
}
#[derive(Debug, Clone, Copy, PartialEq, Eq)]
#[derive(Debug, Clone, Copy, PartialEq, Eq, Serialize)]
#[serde(rename_all = "snake_case")]
pub enum HealFailureClass {
Recoverable,
RetryExhausted,
Permanent,
}
#[derive(Debug, Clone, PartialEq, Eq)]
#[derive(Debug, Clone, PartialEq, Eq, Serialize)]
#[serde(
tag = "state",
content = "details",
rename_all = "snake_case",
rename_all_fields = "camelCase"
)]
pub enum HealObjectDisposition {
/// The legacy storage response does not prove the requested check or commit.
Unknown,
@@ -72,7 +83,8 @@ pub enum HealObjectDisposition {
DryRunObserved,
}
#[derive(Debug, Clone, PartialEq, Eq)]
#[derive(Debug, Clone, PartialEq, Eq, Serialize)]
#[serde(rename_all = "camelCase")]
pub struct HealObjectOutcome {
pub identity: HealObjectIdentity,
pub disposition: HealObjectDisposition,
@@ -89,7 +101,8 @@ impl HealObjectOutcome {
}
}
#[derive(Debug, Clone, Copy, Default, PartialEq, Eq)]
#[derive(Debug, Clone, Copy, Default, PartialEq, Eq, Serialize)]
#[serde(rename_all = "snake_case")]
pub enum HealTraversalCoverage {
#[default]
Unknown,
@@ -97,14 +110,16 @@ pub enum HealTraversalCoverage {
Complete,
}
#[derive(Debug, Clone, Copy, PartialEq, Eq)]
#[derive(Debug, Clone, Copy, PartialEq, Eq, Serialize, Deserialize)]
#[serde(rename_all = "snake_case")]
pub enum HealAbortReason {
Cancelled,
Deadline,
Untraversable,
}
#[derive(Debug, Clone, Copy, Default, PartialEq, Eq)]
#[derive(Debug, Clone, Copy, Default, PartialEq, Eq, Serialize, Deserialize)]
#[serde(tag = "state", content = "reason", rename_all = "snake_case")]
pub enum HealExecutionOutcome {
#[default]
Pending,
@@ -114,7 +129,8 @@ pub enum HealExecutionOutcome {
Aborted(HealAbortReason),
}
#[derive(Debug, Clone, Default, PartialEq, Eq)]
#[derive(Debug, Clone, Default, PartialEq, Eq, Serialize, Deserialize)]
#[serde(rename_all = "camelCase")]
pub struct HealOutcomeCounters {
pub processed: u64,
pub healed: u64,
@@ -127,7 +143,8 @@ pub struct HealOutcomeCounters {
pub overflowed: bool,
}
#[derive(Debug, Clone, Default, PartialEq, Eq)]
#[derive(Debug, Clone, Default, PartialEq, Eq, Serialize)]
#[serde(rename_all = "camelCase")]
pub struct HealTaskOutcome {
pub execution: HealExecutionOutcome,
pub coverage: HealTraversalCoverage,
@@ -135,11 +152,99 @@ pub struct HealTaskOutcome {
/// A bounded diagnostic window, not a complete responsibility ledger.
pub objects: VecDeque<HealObjectOutcome>,
pub objects_truncated: bool,
#[serde(skip)]
retained_object_bytes: usize,
#[serde(skip)]
untraversable: bool,
}
#[derive(Debug, thiserror::Error)]
pub enum HealOutcomeWireError {
#[error("heal outcome is missing execution or counters")]
MissingFields,
#[error("heal outcome has invalid or unsupported execution fields")]
InvalidFields(#[from] serde_json::Error),
#[error("finished heal summary contradicts its canonical outcome")]
ContradictoryCompletion,
}
/// Reconcile a peer's successful legacy summary using the canonical owner types.
/// A running retry may legitimately retain the preceding attempt's outcome.
pub fn legacy_wire_status<'a>(
summary: &'a str,
wire: &serde_json::Value,
truncated: bool,
) -> Result<(&'a str, Option<String>), HealOutcomeWireError> {
if summary != "finished" {
return Ok((summary, None));
}
let execution = HealExecutionOutcome::deserialize(wire.get("execution").ok_or(HealOutcomeWireError::MissingFields)?)?;
let counters = HealOutcomeCounters::deserialize(wire.get("counters").ok_or(HealOutcomeWireError::MissingFields)?)?;
if matches!(execution, HealExecutionOutcome::Pending | HealExecutionOutcome::Running)
|| (execution == HealExecutionOutcome::Completed && counters.failed > 0)
{
return Err(HealOutcomeWireError::ContradictoryCompletion);
}
let (adapted, detail) = legacy_execution_status(summary, None, execution, &counters);
Ok((
adapted,
if adapted != summary {
heal_status_detail(detail, truncated)
} else {
None
},
))
}
pub(crate) fn heal_status_detail(detail: Option<String>, truncated: bool) -> Option<String> {
if !truncated {
return detail;
}
let truncation = "heal result items were truncated";
Some(detail.map_or_else(|| truncation.to_string(), |detail| format!("{detail}; {truncation}")))
}
fn legacy_execution_status<'a>(
summary: &'a str,
detail: Option<String>,
execution: HealExecutionOutcome,
counters: &HealOutcomeCounters,
) -> (&'a str, Option<String>) {
if summary != "finished" {
return (summary, detail);
}
match execution {
HealExecutionOutcome::CompletedWithErrors => (
"stopped",
Some(format!("heal traversal completed with errors: {} failed objects", counters.failed)),
),
HealExecutionOutcome::Aborted(reason) => {
let reason = match reason {
HealAbortReason::Cancelled => "cancelled",
HealAbortReason::Deadline => "timed out",
HealAbortReason::Untraversable => "untraversable",
};
("stopped", Some(format!("heal task {reason}")))
}
HealExecutionOutcome::Completed if counters.unknown > 0 => (
summary,
Some(format!(
"heal traversal completed; authoritative storage proof is unavailable for {} objects",
counters.unknown
)),
),
HealExecutionOutcome::Pending | HealExecutionOutcome::Running => {
("running", Some("heal execution has not reached a terminal outcome".to_string()))
}
HealExecutionOutcome::Completed => (summary, detail),
}
}
impl HealTaskOutcome {
pub(crate) fn legacy_status<'a>(&self, summary: &'a str, detail: Option<String>) -> (&'a str, Option<String>) {
legacy_execution_status(summary, detail, self.execution, &self.counters)
}
pub(crate) fn start(&mut self) {
if self.execution != HealExecutionOutcome::Aborted(HealAbortReason::Cancelled) {
self.execution = HealExecutionOutcome::Running;
@@ -292,6 +397,69 @@ mod canonical_outcome_tests {
assert!(outcome.objects.len() < MAX_OUTCOME_ITEMS);
}
#[test]
fn outcome_v3_serialization_keeps_unverified_dispositions_and_window_bounds() {
let mut outcome = HealTaskOutcome::default();
for disposition in [
HealObjectDisposition::Unknown,
HealObjectDisposition::Deferred {
reason: HealDeferredReason::DanglingDeleteGrace,
retry_not_before: None,
},
HealObjectDisposition::DryRunObserved,
] {
outcome.record(item(disposition));
}
outcome.finish(None);
let wire = serde_json::to_value(&outcome).expect("canonical wire view");
assert_eq!(wire["execution"]["state"], "completed");
assert_eq!(wire["counters"]["healed"], 0);
assert_eq!(wire["counters"]["skipped"], 3);
assert_eq!(wire["objects"][1]["disposition"]["details"]["reason"], "dangling_delete_grace");
assert!(wire["objects"][1]["identity"]["bucketIncarnationId"].is_null());
for _ in 0..MAX_OUTCOME_ITEMS + 1 {
let mut result = item(HealObjectDisposition::Unknown);
result.detail = Some("\"".repeat(MAX_OUTCOME_DETAIL_BYTES));
outcome.record(result);
}
let bytes = serde_json::to_vec(&outcome).expect("bounded canonical samples");
assert!(
bytes.len() < 8 * MAX_OUTCOME_BYTES,
"JSON escaping remains bounded independently of object count"
);
assert!(outcome.objects_truncated);
}
#[test]
fn outcome_v3_wire_consistency_rejects_unknown_success_without_rejecting_extensions() {
let mut outcome = HealTaskOutcome::default();
outcome.finish(None);
let mut wire = serde_json::to_value(&outcome).expect("canonical snapshot");
wire["execution"]["futureField"] = serde_json::json!({"new": true});
wire["counters"]["futureCounter"] = serde_json::json!(42);
assert_eq!(
legacy_wire_status("finished", &wire, false).expect("unknown extension fields"),
("finished", None)
);
wire["execution"]["state"] = serde_json::json!("future_execution");
assert!(legacy_wire_status("finished", &wire, false).is_err());
assert_eq!(
legacy_wire_status("running", &wire, false).expect("unknown nonterminal outcome"),
("running", None)
);
wire["execution"] = serde_json::json!({"state":"completed"});
wire["counters"]["failed"] = serde_json::json!(1);
assert!(matches!(
legacy_wire_status("finished", &wire, false),
Err(HealOutcomeWireError::ContradictoryCompletion)
));
wire.as_object_mut().expect("object").remove("execution");
assert!(matches!(
legacy_wire_status("finished", &wire, false),
Err(HealOutcomeWireError::MissingFields)
));
}
#[test]
fn canonical_outcome_counter_overflow_cannot_claim_complete_coverage() {
let mut outcome = HealTaskOutcome::default();
+378 -204
View File
@@ -14,8 +14,107 @@
/// bucket/cluster/prefix heal: the recursive bucket-objects sweep and the erasure-set usage baseline
use super::*;
use crate::heal::progress::{add_bytes, increment_counter, stable_generation};
use crate::heal::storage::HealListItem;
use crate::heal::utils::format_set_disk_id;
const MAX_DEFERRED_OBJECTS: usize = 256;
const MAX_DEFERRED_BYTES: usize = 256 * 1024;
const MAX_DEFERRED_FORWARD_PAGES: u64 = 2;
const MAX_DEFERRED_AGE: Duration = Duration::from_secs(30);
struct DeferredObject {
name: String,
version_id: Option<String>,
attempt: u32,
page: u64,
first_failure: Option<tokio::time::Instant>,
due: tokio::time::Instant,
}
impl DeferredObject {
fn new(item: HealListItem, page: u64) -> Self {
Self {
name: item.name,
version_id: item.version_id,
attempt: 0,
page,
first_failure: None,
due: tokio::time::Instant::now(),
}
}
fn payload_bytes(&self) -> usize {
self.name
.capacity()
.saturating_add(self.version_id.as_ref().map_or(0, String::capacity))
}
fn expired(&self) -> bool {
self.first_failure.is_some_and(|first| first.elapsed() >= MAX_DEFERRED_AGE)
}
fn defer(&mut self, delay: Duration) {
let now = tokio::time::Instant::now();
let first = *self.first_failure.get_or_insert(now);
self.attempt += 1;
self.due = (now + delay).min(first + MAX_DEFERRED_AGE);
}
}
// Only failed identities are retained. The current listing page remains owned
// by the caller; capacity pressure stops fetching, never discards that page.
struct DeferredWindow {
objects: VecDeque<DeferredObject>,
bytes: usize,
}
impl Default for DeferredWindow {
fn default() -> Self {
Self {
objects: VecDeque::new(),
// Charge every possible slot up front, including spare capacity.
bytes: MAX_DEFERRED_OBJECTS * size_of::<DeferredObject>(),
}
}
}
impl DeferredWindow {
fn push(&mut self, item: DeferredObject) -> std::result::Result<(), DeferredObject> {
let bytes = item.payload_bytes();
if self.objects.len() >= MAX_DEFERRED_OBJECTS || bytes > MAX_DEFERRED_BYTES.saturating_sub(self.bytes) {
return Err(item);
}
self.bytes += bytes;
self.objects.push_back(item);
Ok(())
}
fn pop_due(&mut self) -> Option<DeferredObject> {
let now = tokio::time::Instant::now();
let index = self.objects.iter().position(|item| item.due <= now)?;
let item = self.objects.remove(index)?;
self.bytes -= item.payload_bytes();
Some(item)
}
fn next_due(&self) -> Option<tokio::time::Instant> {
self.objects.iter().map(|item| item.due).min()
}
fn can_advance(&self, page: u64) -> bool {
self.objects.len() < MAX_DEFERRED_OBJECTS
&& self.bytes < MAX_DEFERRED_BYTES
&& self
.objects
.iter()
.all(|item| page.saturating_sub(item.page) < MAX_DEFERRED_FORWARD_PAGES)
}
}
#[cfg(test)]
#[path = "tests/deferred_retry_window.rs"]
mod deferred_retry_window;
fn unavailable_recreate_error(result: &HealResultItem, opts: &HealOpts) -> Option<Error> {
if opts.dry_run || !opts.recreate {
return None;
@@ -305,83 +404,122 @@ impl HealTask {
for (set_disk_id, heal_opts) in listing_scopes {
let mut continuation_token: Option<String> = None;
loop {
self.check_control_flags().await?;
let mut listing_attempt = 0;
let (objects, next_token, is_truncated) = loop {
let mut deferred = DeferredWindow::default();
let mut inline_retry: Option<DeferredObject> = None;
let mut page_number = 0_u64;
let mut aborted_progress_unknown = false;
let mut pending = Vec::<HealListItem>::new().into_iter();
let mut listing_finished = false;
let mut listing_attempt = 0;
let mut listing_due = tokio::time::Instant::now();
let scope_result: Result<()> = async {
loop {
self.check_control_flags().await?;
if listing_finished && pending.as_slice().is_empty() && deferred.objects.is_empty() && inline_retry.is_none()
{
break;
}
self.pace_mainline().await?;
let page = if let Some(set_disk_id) = set_disk_id.as_deref() {
self.await_with_control(self.storage.list_versions_for_heal_page_disk_walk(
set_disk_id,
bucket,
prefix,
continuation_token.as_deref(),
false,
))
.await
} else {
self.await_with_control(self.storage.list_objects_for_heal_page(
bucket,
prefix,
continuation_token.as_deref(),
false,
))
.await
};
match page {
Ok(page) => break page,
Err(error @ (Error::TaskCancelled | Error::TaskTimeout)) => return Err(error),
Err(error) => {
self.outcome.write().await.attempt_failed();
if error.is_recoverable_heal() && listing_attempt < MAX_BUCKET_OBJECT_HEAL_RETRIES {
listing_attempt += 1;
// Listing and object retries share this safe boundary. A
// failed listing never hides an already-due object retry.
let item = deferred.pop_due().or_else(|| {
if inline_retry
.as_ref()
.is_some_and(|item| item.due <= tokio::time::Instant::now())
{
inline_retry.take()
} else if inline_retry.is_none() {
pending.next().map(|item| DeferredObject::new(item, page_number))
} else {
None
}
});
let Some(mut item) = item else {
let can_list = !listing_finished && inline_retry.is_none() && deferred.can_advance(page_number);
if can_list && listing_due <= tokio::time::Instant::now() {
let page = if let Some(set_disk_id) = set_disk_id.as_deref() {
self.await_with_control(self.storage.list_versions_for_heal_page_disk_walk(
set_disk_id,
bucket,
prefix,
continuation_token.as_deref(),
false,
))
.await
} else {
self.await_with_control(self.storage.list_objects_for_heal_page(
bucket,
prefix,
continuation_token.as_deref(),
false,
))
.await
};
match page {
Ok((objects, next_token, is_truncated)) => {
page_number = page_number.saturating_add(1);
continuation_token = next_heal_listing_token(bucket, prefix, next_token, is_truncated)?;
listing_finished = continuation_token.is_none();
listing_attempt = 0;
listing_due = tokio::time::Instant::now();
pending = objects.into_iter();
}
Err(error @ (Error::TaskCancelled | Error::TaskTimeout)) => return Err(error),
Err(error) => {
self.outcome.write().await.attempt_failed();
if error.is_recoverable_heal() && listing_attempt < MAX_BUCKET_OBJECT_HEAL_RETRIES {
listing_attempt += 1;
listing_due =
tokio::time::Instant::now() + self.bucket_object_retry_delay(listing_attempt);
continue;
}
self.outcome.write().await.mark_untraversable();
return Err(Error::HealListingFailed {
bucket: bucket.to_string(),
source: Box::new(error),
});
}
}
continue;
} else {
let due = deferred
.next_due()
.into_iter()
.chain(inline_retry.as_ref().map(|item| item.due))
.chain(can_list.then_some(listing_due))
.min();
if let Some(due) = due {
self.await_with_control(async {
tokio::time::sleep(self.bucket_object_retry_delay(listing_attempt)).await;
tokio::time::sleep_until(due).await;
Ok(())
})
.await?;
continue;
}
self.outcome.write().await.mark_untraversable();
return Err(Error::HealListingFailed {
bucket: bucket.to_string(),
source: Box::new(error),
});
}
continue;
};
let retry_attempt = item.attempt;
let mut telemetry_unknown = false;
let object = item.name.as_str();
let identity =
self.outcome_identity(bucket, object, item.version_id.as_deref(), heal_opts.pool, heal_opts.set);
let mut disposition = if heal_opts.dry_run {
HealObjectDisposition::DryRunObserved
} else {
HealObjectDisposition::Unknown
};
let mut detail = None;
{
let mut progress = self.progress.write().await;
progress.set_current_object(Some(format!("{bucket}/{object}")));
}
};
let mut pending = objects;
let mut retry_attempt = 0_u32;
while !pending.is_empty() {
if retry_attempt > 0 {
self.await_with_control(async {
tokio::time::sleep(self.bucket_object_retry_delay(retry_attempt)).await;
Ok(())
})
.await?;
}
let mut retry = Vec::with_capacity(pending.len());
for item in pending {
self.check_control_flags().await?;
self.pace_mainline().await?;
let mut telemetry_unknown = false;
let object = item.name.as_str();
let identity =
self.outcome_identity(bucket, object, item.version_id.as_deref(), heal_opts.pool, heal_opts.set);
let mut disposition = if heal_opts.dry_run {
HealObjectDisposition::DryRunObserved
} else {
HealObjectDisposition::Unknown
};
let mut detail = None;
{
let mut progress = self.progress.write().await;
progress.set_current_object(Some(format!("{bucket}/{object}")));
}
let mut terminal_outcome = true;
let error = match self
let mut terminal_outcome = true;
let age_exhausted = item.expired();
let error = if age_exhausted {
Some(Error::other("heal object retry age exhausted"))
} else {
match self
.await_with_control(
self.storage
.heal_object(bucket, object, item.version_id.as_deref(), &heal_opts),
@@ -414,152 +552,188 @@ impl HealTask {
None
}
Ok((_, Some(err))) | Err(err) => Some(err),
};
}
};
if let Some(err) = error {
match err {
Error::TaskCancelled | Error::TaskTimeout => {
let disposition = if matches!(err, Error::TaskCancelled) {
HealObjectDisposition::Cancelled
} else {
HealObjectDisposition::Deferred {
reason: HealDeferredReason::Deadline,
retry_not_before: None,
}
};
self.outcome.write().await.record(HealObjectOutcome {
identity,
disposition,
detail: None,
});
return Err(err);
}
_ => self.outcome.write().await.attempt_failed(),
}
detail = Some(err.to_string());
if Self::is_dangling_delete_grace_error(&err) {
disposition = HealObjectDisposition::Deferred {
reason: HealDeferredReason::DanglingDeleteGrace,
retry_not_before: None,
};
telemetry_unknown |= !increment_counter(&mut skipped);
warn!(
target: "rustfs::heal::task",
event = EVENT_HEAL_BUCKET_RESULT,
component = LOG_COMPONENT_HEAL,
subsystem = LOG_SUBSYSTEM_TASK,
task_id = %self.id,
bucket,
object,
result = "dangling_delete_grace_skip",
error = %err,
"Heal bucket object dangling cleanup deferred by grace window"
);
} else if Self::should_skip_data_usage_cache_heal_error(bucket, object, &err) {
disposition = HealObjectDisposition::Deferred {
reason: HealDeferredReason::TransientUsageCache,
retry_not_before: None,
};
telemetry_unknown |= !increment_counter(&mut skipped);
warn!(
target: "rustfs::heal::task",
event = EVENT_HEAL_BUCKET_RESULT,
component = LOG_COMPONENT_HEAL,
subsystem = LOG_SUBSYSTEM_TASK,
task_id = %self.id,
bucket,
object,
result = "transient_skip",
error = %err,
"Heal bucket object repair skipped due to transient metadata error"
);
} else if err.is_recoverable_heal() && retry_attempt < MAX_BUCKET_OBJECT_HEAL_RETRIES {
terminal_outcome = false;
debug!(
target: "rustfs::heal::task",
event = EVENT_HEAL_BUCKET_RESULT,
component = LOG_COMPONENT_HEAL,
subsystem = LOG_SUBSYSTEM_TASK,
task_id = %self.id,
bucket,
object,
retry_attempt = retry_attempt.saturating_add(1),
error = %err,
result = "object_retry_scheduled",
"Heal bucket object retry scheduled"
);
retry.push(item);
} else {
disposition = HealObjectDisposition::Failed(if err.is_recoverable_heal() {
HealFailureClass::RetryExhausted
if let Some(err) = error {
match err {
Error::TaskCancelled | Error::TaskTimeout => {
let disposition = if matches!(err, Error::TaskCancelled) {
HealObjectDisposition::Cancelled
} else {
HealFailureClass::Permanent
HealObjectDisposition::Deferred {
reason: HealDeferredReason::Deadline,
retry_not_before: None,
}
};
self.outcome.write().await.record(HealObjectOutcome {
identity,
disposition,
detail: None,
});
telemetry_unknown |= !increment_counter(&mut failed);
if err.is_recoverable_heal() {
retryable_failed = retryable_failed.saturating_add(1);
} else {
permanent_failed = permanent_failed.saturating_add(1);
}
first_failed_object.get_or_insert_with(|| object.to_string());
first_error.get_or_insert_with(|| err.to_string());
if take_failure_log_sample(&mut failure_samples_logged) {
warn!(
target: "rustfs::heal::task",
event = EVENT_HEAL_BUCKET_RESULT,
component = LOG_COMPONENT_HEAL,
subsystem = LOG_SUBSYSTEM_TASK,
task_id = %self.id,
bucket,
object,
retry_attempt,
error = %err,
result = "object_failed",
"Heal bucket object repair failed"
);
}
aborted_progress_unknown |= !increment_counter(&mut scanned);
aborted_progress_unknown |= !increment_counter(&mut skipped);
return Err(err);
}
_ if !age_exhausted => self.outcome.write().await.attempt_failed(),
_ => {}
}
if terminal_outcome {
telemetry_unknown |= !increment_counter(&mut scanned);
}
if !terminal_outcome {
continue;
}
self.outcome.write().await.record(HealObjectOutcome {
identity,
disposition,
detail,
});
let mut progress = self.progress.write().await;
progress.update_object_progress(
previous_progress.objects_scanned.saturating_add(scanned),
previous_progress.objects_healed.saturating_add(healed),
previous_progress.objects_failed.saturating_add(failed),
previous_progress.skipped_objects.saturating_add(skipped),
previous_progress.bytes_processed.saturating_add(bytes),
);
if telemetry_unknown {
progress.mark_unknown();
detail = Some(err.to_string());
if Self::is_dangling_delete_grace_error(&err) {
disposition = HealObjectDisposition::Deferred {
reason: HealDeferredReason::DanglingDeleteGrace,
retry_not_before: None,
};
telemetry_unknown |= !increment_counter(&mut skipped);
warn!(
target: "rustfs::heal::task",
event = EVENT_HEAL_BUCKET_RESULT,
component = LOG_COMPONENT_HEAL,
subsystem = LOG_SUBSYSTEM_TASK,
task_id = %self.id,
bucket,
object,
result = "dangling_delete_grace_skip",
error = %err,
"Heal bucket object dangling cleanup deferred by grace window"
);
} else if Self::should_skip_data_usage_cache_heal_error(bucket, object, &err) {
disposition = HealObjectDisposition::Deferred {
reason: HealDeferredReason::TransientUsageCache,
retry_not_before: None,
};
telemetry_unknown |= !increment_counter(&mut skipped);
warn!(
target: "rustfs::heal::task",
event = EVENT_HEAL_BUCKET_RESULT,
component = LOG_COMPONENT_HEAL,
subsystem = LOG_SUBSYSTEM_TASK,
task_id = %self.id,
bucket,
object,
result = "transient_skip",
error = %err,
"Heal bucket object repair skipped due to transient metadata error"
);
} else if !age_exhausted && err.is_recoverable_heal() && retry_attempt < MAX_BUCKET_OBJECT_HEAL_RETRIES {
terminal_outcome = false;
debug!(
target: "rustfs::heal::task",
event = EVENT_HEAL_BUCKET_RESULT,
component = LOG_COMPONENT_HEAL,
subsystem = LOG_SUBSYSTEM_TASK,
task_id = %self.id,
bucket,
object,
retry_attempt = retry_attempt.saturating_add(1),
error = %err,
result = "object_retry_scheduled",
"Heal bucket object retry scheduled"
);
item.defer(self.bucket_object_retry_delay(retry_attempt + 1));
if let Err(item) = deferred.push(item) {
inline_retry = Some(item);
}
} else {
disposition = HealObjectDisposition::Failed(if age_exhausted || err.is_recoverable_heal() {
HealFailureClass::RetryExhausted
} else {
HealFailureClass::Permanent
});
telemetry_unknown |= !increment_counter(&mut failed);
if age_exhausted || err.is_recoverable_heal() {
retryable_failed = retryable_failed.saturating_add(1);
} else {
permanent_failed = permanent_failed.saturating_add(1);
}
first_failed_object.get_or_insert_with(|| object.to_string());
first_error.get_or_insert_with(|| err.to_string());
if take_failure_log_sample(&mut failure_samples_logged) {
warn!(
target: "rustfs::heal::task",
event = EVENT_HEAL_BUCKET_RESULT,
component = LOG_COMPONENT_HEAL,
subsystem = LOG_SUBSYSTEM_TASK,
task_id = %self.id,
bucket,
object,
retry_attempt,
error = %err,
result = "object_failed",
"Heal bucket object repair failed"
);
}
}
}
pending = retry;
retry_attempt = retry_attempt.saturating_add(1);
}
if !is_truncated {
break;
}
if terminal_outcome {
telemetry_unknown |= !increment_counter(&mut scanned);
}
continuation_token = next_heal_listing_token(bucket, prefix, next_token, is_truncated)?;
if continuation_token.is_none() {
// Truncated without a continuation token is a compatibility EOF.
break;
if !terminal_outcome {
continue;
}
self.outcome.write().await.record(HealObjectOutcome {
identity,
disposition,
detail,
});
let mut progress = self.progress.write().await;
progress.update_object_progress(
previous_progress.objects_scanned.saturating_add(scanned),
previous_progress.objects_healed.saturating_add(healed),
previous_progress.objects_failed.saturating_add(failed),
previous_progress.skipped_objects.saturating_add(skipped),
previous_progress.bytes_processed.saturating_add(bytes),
);
if telemetry_unknown {
progress.mark_unknown();
}
}
Ok(())
}
.await;
if let Err(error) = scope_result {
let disposition = match error {
Error::TaskCancelled => HealObjectDisposition::Cancelled,
Error::TaskTimeout => HealObjectDisposition::Deferred {
reason: HealDeferredReason::Deadline,
retry_not_before: None,
},
_ => HealObjectDisposition::Unknown,
};
// Only attempted identities have terminal outcomes. Unstarted
// page tails remain unprocessed under the task's partial coverage.
// No detached sleepers survive abort.
for item in deferred.objects.into_iter().chain(inline_retry) {
self.outcome.write().await.record(HealObjectOutcome {
identity: self.outcome_identity(
bucket,
&item.name,
item.version_id.as_deref(),
heal_opts.pool,
heal_opts.set,
),
disposition: disposition.clone(),
detail: None,
});
aborted_progress_unknown |= !increment_counter(&mut scanned);
aborted_progress_unknown |= !increment_counter(&mut skipped);
}
let mut progress = self.progress.write().await;
progress.update_object_progress(
previous_progress.objects_scanned.saturating_add(scanned),
previous_progress.objects_healed.saturating_add(healed),
previous_progress.objects_failed.saturating_add(failed),
previous_progress.skipped_objects.saturating_add(skipped),
previous_progress.bytes_processed.saturating_add(bytes),
);
if aborted_progress_unknown {
progress.mark_unknown();
}
return Err(error);
}
}
+38
View File
@@ -15,6 +15,8 @@
use super::super::{DiskOption, DiskStore, Endpoint, new_disk};
use super::*;
mod deferred_retry;
mod canonical_outcome {
use super::*;
use crate::heal::outcome::{HealExecutionOutcome, HealTraversalCoverage};
@@ -939,6 +941,10 @@ async fn verified_recovery_keeps_state_when_marker_clear_fails() {
#[derive(Default)]
struct MockStorage {
retry_test_pages: Option<Vec<Vec<HealListItem>>>,
retry_test_delays: HashMap<String, Duration>,
retry_test_listing_delays: Mutex<VecDeque<Duration>>,
retry_test_events: Mutex<Vec<String>>,
listed: Mutex<bool>,
list_each_bucket: bool,
fail_second_listing_page: bool,
@@ -1109,6 +1115,7 @@ fn replacement_identity(
}
enum MockHealObjectOutcome {
RetryableLock,
OkWithOtherError(&'static str),
ErrOther(&'static str),
DanglingGraceDeferred,
@@ -1213,6 +1220,10 @@ impl HealStorageAPI for MockStorage {
opts: &HealOpts,
) -> Result<(HealResultItem, Option<Error>)> {
self.heal_object_calls.lock().unwrap().push(object.to_string());
self.retry_test_events.lock().expect("events").push(format!("heal:{object}"));
if let Some(delay) = self.retry_test_delays.get(object) {
tokio::time::sleep(*delay).await;
}
self.heal_object_version_ids
.lock()
.unwrap()
@@ -1241,6 +1252,13 @@ impl HealStorageAPI for MockStorage {
bucket.to_string(),
object.to_string(),
))),
MockHealObjectOutcome::RetryableLock => Ok((
HealResultItem::default(),
Some(Error::Storage(EcstoreError::Lock(rustfs_lock::LockError::AlreadyLocked {
resource: object.to_string(),
owner: "competing-writer".to_string(),
}))),
)),
MockHealObjectOutcome::RetryableSlowDown => {
Ok((HealResultItem::default(), Some(Error::Storage(EcstoreError::SlowDown))))
}
@@ -1266,6 +1284,13 @@ impl HealStorageAPI for MockStorage {
bucket.to_string(),
object.to_string(),
))),
MockHealObjectOutcome::RetryableLock => Ok((
HealResultItem::default(),
Some(Error::Storage(EcstoreError::Lock(rustfs_lock::LockError::AlreadyLocked {
resource: object.to_string(),
owner: "competing-writer".to_string(),
}))),
)),
MockHealObjectOutcome::RetryableSlowDown => {
Ok((HealResultItem::default(), Some(Error::Storage(EcstoreError::SlowDown))))
}
@@ -1361,6 +1386,19 @@ impl HealStorageAPI for MockStorage {
.lock()
.expect("listing tokens")
.push(continuation_token.map(ToOwned::to_owned));
self.retry_test_events
.lock()
.expect("events")
.push(format!("list:{}", continuation_token.unwrap_or("first")));
let delay = self.retry_test_listing_delays.lock().expect("listing delays").pop_front();
if let Some(delay) = delay {
tokio::time::sleep(delay).await;
}
if let Some(pages) = &self.retry_test_pages {
let page = continuation_token.map_or(0, |token| token.parse::<usize>().expect("test page token"));
let next = (page + 1 < pages.len()).then(|| (page + 1).to_string());
return Ok((pages[page].clone(), next.clone(), next.is_some()));
}
if let Some(remaining) = self
.recoverable_second_page_failures
.lock()
@@ -0,0 +1,487 @@
// Copyright 2024 RustFS Team
//
// Licensed under the Apache License, Version 2.0 (the "License");
// you may not use this file except in compliance with the License.
// You may obtain a copy of the License at
//
// http://www.apache.org/licenses/LICENSE-2.0
//
// Unless required by applicable law or agreed to in writing, software
// distributed under the License is distributed on an "AS IS" BASIS,
// WITHOUT WARRANTIES OR CONDITIONS OF ANY KIND, either express or implied.
// See the License for the specific language governing permissions and
// limitations under the License.
use super::*;
fn bucket_task(storage: Arc<MockStorage>) -> HealTask {
HealTask::from_request(
HealRequest::new(
HealType::Bucket {
bucket: "bucket-a".to_string(),
},
HealOptions {
recursive: true,
timeout: None,
..Default::default()
},
HealPriority::Normal,
),
storage,
)
}
fn pages_storage(pages: &[&[&str]]) -> MockStorage {
MockStorage {
retry_test_pages: Some(
pages
.iter()
.map(|page| page.iter().map(|name| heal_item(name)).collect())
.collect(),
),
..Default::default()
}
}
fn fail_once(storage: &MockStorage, name: &str) {
storage
.heal_object_outcomes
.lock()
.expect("outcomes")
.insert(name.to_string(), VecDeque::from([MockHealObjectOutcome::RetryableLock]));
}
#[tokio::test(start_paused = true)]
async fn slow_listing_retry_services_due_object_then_age_before_next_listing() {
let storage = Arc::new(MockStorage {
recoverable_second_page_failures: Mutex::new(Some(1)),
retry_test_listing_delays: Mutex::new(VecDeque::from([Duration::ZERO, Duration::from_secs(29)])),
..Default::default()
});
storage.heal_object_outcomes.lock().expect("outcomes").insert(
"object-a".to_string(),
VecDeque::from([
MockHealObjectOutcome::RetryableSlowDown,
MockHealObjectOutcome::RetryableSlowDown,
]),
);
let task = bucket_task(storage.clone());
let execution = task.execute();
tokio::pin!(execution);
assert!(
tokio::time::timeout(Duration::from_millis(30_500), &mut execution)
.await
.is_err()
);
assert_eq!(
storage.retry_test_events.lock().expect("events").as_slice(),
["list:first", "heal:object-a", "list:second", "heal:object-a"]
);
let outcome = task.get_outcome().await;
assert_eq!(outcome.counters.processed, 1);
assert_eq!(
outcome.objects[0].disposition,
HealObjectDisposition::Failed(HealFailureClass::RetryExhausted)
);
execution.await.expect_err("age exhausted object must remain a batch failure");
assert_eq!(
storage.retry_test_events.lock().expect("events").as_slice(),
[
"list:first",
"heal:object-a",
"list:second",
"heal:object-a",
"list:second",
"heal:object-b"
]
);
let outcome = task.get_outcome().await;
assert_eq!((outcome.counters.processed, outcome.counters.attempt_failures), (2, 3));
}
#[tokio::test(start_paused = true)]
async fn listing_return_after_age_expires_does_not_start_another_heal_attempt() {
let storage = Arc::new(MockStorage {
recoverable_second_page_failures: Mutex::new(Some(1)),
retry_test_listing_delays: Mutex::new(VecDeque::from([Duration::ZERO, Duration::from_secs(31)])),
..Default::default()
});
fail_once(&storage, "object-a");
let task = bucket_task(storage.clone());
let execution = task.execute();
tokio::pin!(execution);
assert!(
tokio::time::timeout(Duration::from_millis(31_500), &mut execution)
.await
.is_err()
);
assert_eq!(
storage.retry_test_events.lock().expect("events").as_slice(),
["list:first", "heal:object-a", "list:second"]
);
assert_eq!(task.get_outcome().await.counters.failed, 1);
execution.await.expect_err("age exhaustion remains a failure");
assert_eq!(
storage.retry_test_events.lock().expect("events").as_slice(),
["list:first", "heal:object-a", "list:second", "list:second", "heal:object-b"]
);
}
#[tokio::test(start_paused = true)]
async fn full_window_abort_accounts_inline_once_and_leaves_unstarted_tail_unprocessed() {
for cancel in [true, false] {
let names: Vec<String> = (0..258).map(|index| format!("blocked-{index}")).collect();
let mut page: Vec<HealListItem> = names.iter().map(|name| heal_item(name)).collect();
page[256].version_id = Some("inline-version".to_string());
let storage = Arc::new(MockStorage {
retry_test_pages: Some(vec![page, vec![heal_item("healthy")]]),
..Default::default()
});
for name in &names {
fail_once(&storage, name);
}
let mut task = bucket_task(storage.clone());
if !cancel {
task.options.timeout = Some(Duration::from_secs(1));
}
let execution = task.execute();
tokio::pin!(execution);
assert!(
tokio::time::timeout(Duration::from_millis(500), &mut execution)
.await
.is_err()
);
assert_eq!(storage.heal_object_calls.lock().expect("calls").len(), 257);
assert_eq!(storage.listing_tokens.lock().expect("tokens").len(), 1);
if cancel {
task.cancel().await.expect("cancel");
}
let result = execution.await;
assert!(matches!(
(&result, cancel),
(Err(Error::TaskCancelled), true) | (Err(Error::TaskTimeout), false)
));
let outcome = task.get_outcome().await;
assert_eq!(
(
outcome.counters.processed,
outcome.counters.skipped,
outcome.counters.failed,
outcome.counters.healed
),
(257, 257, 0, 0)
);
assert_eq!(outcome.coverage, crate::heal::outcome::HealTraversalCoverage::Partial);
assert_eq!(
outcome.execution,
crate::heal::outcome::HealExecutionOutcome::Aborted(if cancel {
HealAbortReason::Cancelled
} else {
HealAbortReason::Deadline
})
);
let inline: Vec<_> = outcome
.objects
.iter()
.filter(|item| item.identity.object == "blocked-256")
.collect();
assert_eq!(inline.len(), 1);
assert_eq!(inline[0].identity.version_id.as_deref(), Some("inline-version"));
assert_eq!(
inline[0].disposition,
if cancel {
HealObjectDisposition::Cancelled
} else {
HealObjectDisposition::Deferred {
reason: HealDeferredReason::Deadline,
retry_not_before: None,
}
}
);
let progress = task.get_progress().await;
assert_eq!(
(
progress.objects_scanned,
progress.skipped_objects,
progress.objects_failed,
progress.objects_healed
),
(257, 257, 0, 0)
);
assert!(
!outcome
.objects
.iter()
.any(|item| item.identity.object == "blocked-257" || item.identity.object == "healthy")
);
tokio::time::advance(Duration::from_secs(60)).await;
assert_eq!(storage.heal_object_calls.lock().expect("calls").len(), 257);
assert_eq!(storage.listing_tokens.lock().expect("tokens").len(), 1);
}
}
#[tokio::test(start_paused = true)]
async fn repeated_slowdown_keeps_attempts_and_forward_pages_bounded() {
let storage = Arc::new(pages_storage(&[&["a"], &["b"], &["c"], &["d"]]));
for name in ["a", "b", "c", "d"] {
storage
.heal_object_outcomes
.lock()
.expect("outcomes")
.insert(name.to_string(), (0..4).map(|_| MockHealObjectOutcome::RetryableSlowDown).collect());
}
let task = bucket_task(storage.clone());
let execution = task.execute();
tokio::pin!(execution);
assert!(tokio::time::timeout(Duration::from_secs(1), &mut execution).await.is_err());
assert_eq!(storage.listing_tokens.lock().expect("tokens").len(), 3);
execution.await.expect_err("all four objects exhaust retries");
let outcome = task.get_outcome().await;
assert_eq!(
(outcome.counters.processed, outcome.counters.failed, outcome.counters.attempt_failures),
(4, 4, 16)
);
assert_eq!(storage.heal_object_calls.lock().expect("calls").len(), 16);
for name in ["a", "b", "c", "d"] {
assert_eq!(outcome.objects.iter().filter(|item| item.identity.object == name).count(), 1);
}
}
#[tokio::test(start_paused = true)]
async fn listing_retry_keeps_cursor_and_does_not_replay_successful_objects() {
let storage = Arc::new(MockStorage {
recoverable_second_page_failures: Mutex::new(Some(1)),
..Default::default()
});
fail_once(&storage, "object-a");
let task = bucket_task(storage.clone());
task.execute().await.expect("both retries complete");
assert_eq!(
storage.listing_tokens.lock().expect("tokens").as_slice(),
[None, Some("second".to_string()), Some("second".to_string())]
);
assert_eq!(
storage.heal_object_calls.lock().expect("calls").as_slice(),
["object-a", "object-a", "object-b"]
);
let outcome = task.get_outcome().await;
assert_eq!((outcome.counters.processed, outcome.counters.attempt_failures), (2, 2));
}
#[tokio::test(start_paused = true)]
async fn typed_lock_contention_allows_only_two_forward_pages() {
let storage = Arc::new(pages_storage(&[&["a"], &["b"], &["c"], &["d"]]));
fail_once(&storage, "a");
let task = bucket_task(storage.clone());
let execution = task.execute();
tokio::pin!(execution);
assert!(tokio::time::timeout(Duration::from_secs(1), &mut execution).await.is_err());
assert_eq!(storage.heal_object_calls.lock().expect("calls").as_slice(), ["a", "b", "c"]);
assert_eq!(storage.listing_tokens.lock().expect("tokens").len(), 3);
execution.await.expect("all objects complete");
assert_eq!(storage.heal_object_calls.lock().expect("calls").as_slice(), ["a", "b", "c", "a", "d"]);
assert_eq!(task.get_outcome().await.counters.processed, 4);
}
#[tokio::test(start_paused = true)]
async fn due_retry_runs_before_next_object_in_a_slow_healthy_page() {
let mut storage = pages_storage(&[&["a"], &["b", "c"]]);
storage.retry_test_delays.insert("b".to_string(), Duration::from_secs(3));
fail_once(&storage, "a");
let storage = Arc::new(storage);
bucket_task(storage.clone()).execute().await.expect("all objects complete");
assert_eq!(storage.heal_object_calls.lock().expect("calls").as_slice(), ["a", "b", "a", "c"]);
}
#[tokio::test(start_paused = true)]
async fn expired_retry_is_terminal_without_an_extra_storage_attempt() {
let mut storage = pages_storage(&[&["a"], &["b"]]);
storage.retry_test_delays.insert("b".to_string(), Duration::from_secs(31));
fail_once(&storage, "a");
let storage = Arc::new(storage);
let task = bucket_task(storage.clone());
task.execute().await.expect_err("aged pending responsibility is not success");
assert_eq!(storage.heal_object_calls.lock().expect("calls").as_slice(), ["a", "b"]);
let outcome = task.get_outcome().await;
assert_eq!(outcome.counters.processed, 2);
assert_eq!(outcome.counters.attempt_failures, 1);
assert_eq!(outcome.counters.failed, 1);
assert_eq!(
outcome
.objects
.iter()
.find(|item| item.identity.object == "a")
.expect("a outcome")
.disposition,
HealObjectDisposition::Failed(HealFailureClass::RetryExhausted)
);
}
#[tokio::test(start_paused = true)]
async fn cancellation_drains_owned_retries_once() {
let storage = Arc::new(pages_storage(&[&["a"], &["b"]]));
fail_once(&storage, "a");
let task = bucket_task(storage.clone());
let execution = task.execute();
tokio::pin!(execution);
assert!(tokio::time::timeout(Duration::from_secs(1), &mut execution).await.is_err());
task.cancel().await.expect("cancel");
assert!(matches!(execution.await, Err(Error::TaskCancelled)));
tokio::time::advance(Duration::from_secs(60)).await;
assert_eq!(storage.heal_object_calls.lock().expect("calls").as_slice(), ["a", "b"]);
let outcome = task.get_outcome().await;
assert_eq!(outcome.counters.processed, 2);
assert_eq!(outcome.objects.iter().filter(|item| item.identity.object == "a").count(), 1);
assert_eq!(
outcome
.objects
.iter()
.find(|item| item.identity.object == "a")
.expect("a")
.disposition,
HealObjectDisposition::Cancelled
);
}
#[tokio::test(start_paused = true)]
async fn deadline_drains_owned_retries_without_false_completion() {
let storage = Arc::new(pages_storage(&[&["a"], &["b"]]));
fail_once(&storage, "a");
let mut task = bucket_task(storage.clone());
task.options.timeout = Some(Duration::from_secs(1));
assert!(matches!(task.execute().await, Err(Error::TaskTimeout)));
let outcome = task.get_outcome().await;
assert_eq!(outcome.counters.processed, 2);
assert_eq!(
outcome
.objects
.iter()
.find(|item| item.identity.object == "a")
.expect("a")
.disposition,
HealObjectDisposition::Deferred {
reason: HealDeferredReason::Deadline,
retry_not_before: None
}
);
tokio::time::advance(Duration::from_secs(60)).await;
assert_eq!(storage.heal_object_calls.lock().expect("calls").as_slice(), ["a", "b"]);
}
#[tokio::test(start_paused = true)]
async fn full_window_backpressures_without_losing_the_current_page_tail() {
let names: Vec<String> = (0..258).map(|index| format!("blocked-{index}")).collect();
let mut storage = MockStorage {
retry_test_pages: Some(vec![names.iter().map(|name| heal_item(name)).collect(), vec![heal_item("healthy")]]),
..Default::default()
};
for name in &names {
fail_once(&storage, name);
}
// The last item has a version, proving the current-page tail is not rebuilt
// from names alone when the window fills.
storage.retry_test_pages.as_mut().expect("pages")[0][257].version_id = Some("version-tail".to_string());
let storage = Arc::new(storage);
let task = bucket_task(storage.clone());
let execution = task.execute();
tokio::pin!(execution);
assert!(tokio::time::timeout(Duration::from_secs(1), &mut execution).await.is_err());
assert_eq!(storage.heal_object_calls.lock().expect("calls").len(), 257);
assert_eq!(storage.listing_tokens.lock().expect("tokens").len(), 1);
execution.await.expect("every owned item eventually completes");
assert_eq!(task.get_outcome().await.counters.processed, 259);
let calls = storage.heal_object_calls.lock().expect("calls");
for name in &names {
assert_eq!(calls.iter().filter(|called| *called == name).count(), 2);
}
let versions = storage.heal_object_version_ids.lock().expect("versions");
for (name, version) in calls.iter().zip(versions.iter()) {
if name == "blocked-257" {
assert_eq!(version.as_deref(), Some("version-tail"));
}
}
}
#[tokio::test(start_paused = true)]
async fn oversized_identity_stays_inline_without_losing_version() {
let name = "k".repeat(256 * 1024);
let mut item = heal_item(&name);
item.version_id = Some("v".repeat(1024));
let storage = Arc::new(MockStorage {
retry_test_pages: Some(vec![vec![item], vec![heal_item("healthy")]]),
..Default::default()
});
fail_once(&storage, &name);
let task = bucket_task(storage.clone());
let execution = task.execute();
tokio::pin!(execution);
assert!(tokio::time::timeout(Duration::from_secs(1), &mut execution).await.is_err());
assert_eq!(storage.listing_tokens.lock().expect("tokens").len(), 1);
execution.await.expect("oversized identity retries inline");
assert_eq!(task.get_outcome().await.counters.processed, 2);
let versions = storage.heal_object_version_ids.lock().expect("versions");
assert_eq!(versions[0], versions[1]);
assert_eq!(versions[0].as_ref().expect("version").len(), 1024);
}
#[tokio::test(start_paused = true)]
async fn terminal_listing_failure_keeps_deferred_identity_unknown() {
let storage = Arc::new(MockStorage {
fail_second_listing_page: true,
..Default::default()
});
fail_once(&storage, "object-a");
let task = bucket_task(storage.clone());
task.execute().await.expect_err("listing cannot continue");
let outcome = task.get_outcome().await;
assert_eq!(outcome.counters.processed, 1);
assert_eq!(outcome.objects[0].disposition, HealObjectDisposition::Unknown);
assert_eq!(outcome.coverage, crate::heal::outcome::HealTraversalCoverage::Partial);
assert_eq!(storage.heal_object_calls.lock().expect("calls").as_slice(), ["object-a"]);
}
#[tokio::test(start_paused = true)]
async fn healthy_second_page_advances_before_first_retry_is_due() {
let storage = Arc::new(MockStorage {
recoverable_second_page_failures: Mutex::new(Some(0)),
..Default::default()
});
storage
.heal_object_outcomes
.lock()
.expect("outcomes")
.insert("object-a".to_string(), VecDeque::from([MockHealObjectOutcome::RetryableSlowDown]));
let task = HealTask::from_request(
HealRequest::new(
HealType::Bucket {
bucket: "bucket-a".to_string(),
},
HealOptions {
recursive: true,
timeout: None,
..Default::default()
},
HealPriority::Normal,
),
storage.clone(),
);
let execution = task.execute();
tokio::pin!(execution);
assert!(
tokio::time::timeout(Duration::from_secs(1), &mut execution).await.is_err(),
"the deferred first object must remain pending before its retry is due"
);
assert_eq!(
storage.heal_object_calls.lock().expect("calls").as_slice(),
["object-a", "object-b"],
"a retryable page head must not hold the healthy second page behind its backoff"
);
execution.await.expect("retry eventually succeeds");
let outcome = task.get_outcome().await;
assert_eq!(outcome.counters.processed, 2);
assert_eq!(outcome.counters.attempt_failures, 1);
assert_eq!(
storage.heal_object_calls.lock().expect("calls").as_slice(),
["object-a", "object-b", "object-a"]
);
}
@@ -0,0 +1,76 @@
// Copyright 2024 RustFS Team
//
// Licensed under the Apache License, Version 2.0 (the "License");
// you may not use this file except in compliance with the License.
// You may obtain a copy of the License at
//
// http://www.apache.org/licenses/LICENSE-2.0
//
// Unless required by applicable law or agreed to in writing, software
// distributed under the License is distributed on an "AS IS" BASIS,
// WITHOUT WARRANTIES OR CONDITIONS OF ANY KIND, either express or implied.
// See the License for the specific language governing permissions and
// limitations under the License.
use super::*;
fn item(name: String, version_id: Option<String>) -> DeferredObject {
DeferredObject::new(
HealListItem {
name,
version_id,
mod_time_unix_nanos: None,
lifecycle_object_info: None,
is_delete_marker: false,
},
1,
)
}
#[tokio::test(start_paused = true)]
async fn count_cap_and_next_item_preserve_ownership() {
let mut window = DeferredWindow::default();
for _ in 0..MAX_DEFERRED_OBJECTS {
assert!(window.push(item("key".to_string(), None)).is_ok());
}
let rejected = window
.push(item("next".to_string(), Some("version".to_string())))
.expect_err("count cap");
assert_eq!(rejected.name, "next");
assert_eq!(rejected.version_id.as_deref(), Some("version"));
assert_eq!(window.objects.len(), MAX_DEFERRED_OBJECTS);
assert!(window.bytes <= MAX_DEFERRED_BYTES);
assert!(!window.can_advance(1));
assert!(window.pop_due().is_some());
assert!(window.push(rejected).is_ok());
}
#[tokio::test(start_paused = true)]
async fn byte_cap_counts_key_version_and_reserved_slots() {
let mut window = DeferredWindow::default();
let available = MAX_DEFERRED_BYTES - window.bytes;
let key = "k".repeat(available / 2);
let version = "v".repeat(available - key.capacity());
assert_eq!(key.capacity() + version.capacity(), available);
assert!(window.push(item(key, Some(version))).is_ok());
assert_eq!(window.bytes, MAX_DEFERRED_BYTES);
assert!(!window.can_advance(1));
assert!(window.push(item("x".to_string(), None)).is_err());
assert!(window.pop_due().is_some());
assert_eq!(window.bytes, MAX_DEFERRED_OBJECTS * size_of::<DeferredObject>());
assert!(window.push(item("x".to_string(), None)).is_ok());
}
#[tokio::test(start_paused = true)]
async fn retry_age_caps_due_time_and_is_not_reset_by_rescheduling() {
let mut entry = item("a".to_string(), None);
entry.defer(Duration::from_secs(2));
let first = entry.first_failure.expect("first failure");
tokio::time::advance(Duration::from_secs(29)).await;
entry.defer(Duration::from_secs(8));
assert_eq!(entry.first_failure, Some(first));
assert_eq!(entry.due, first + MAX_DEFERRED_AGE);
assert!(!entry.expired());
tokio::time::advance(Duration::from_secs(1)).await;
assert!(entry.expired());
}
+82 -4
View File
@@ -167,6 +167,13 @@ pub struct HealTaskStatus {
/// Live progress snapshot; the exact shape is owned by the heal runtime.
#[serde(default)]
pub progress: Option<serde_json::Value>,
/// Canonical heal-owner result. Missing or future states are not repair proof.
#[serde(default)]
pub outcome: Option<serde_json::Value>,
#[serde(default, alias = "next_seq")]
pub next_seq: Option<u64>,
#[serde(default, alias = "min_seq")]
pub min_seq: Option<u64>,
}
/// `POST /v3/background-heal/status` response. Known top-level fields are
@@ -358,8 +365,22 @@ impl AdminClient {
prefix: Option<&str>,
client_token: &str,
) -> Result<HealTaskStatus, AdminClientError> {
self.post_json(&heal_path(bucket, prefix), &[("clientToken", client_token.to_string())], Vec::new())
.await
self.heal_status_since(bucket, prefix, client_token, None).await
}
/// Query a retained result window. Missing cursors and outcome remain unknown.
pub async fn heal_status_since(
&self,
bucket: Option<&str>,
prefix: Option<&str>,
client_token: &str,
since_seq: Option<u64>,
) -> Result<HealTaskStatus, AdminClientError> {
let mut query = vec![("clientToken", client_token.to_string())];
if let Some(since_seq) = since_seq {
query.push(("sinceSeq", since_seq.to_string()));
}
self.post_json(&heal_path(bucket, prefix), &query, Vec::new()).await
}
/// Stop a heal: with a `client_token` only that task is cancelled and its
@@ -378,7 +399,7 @@ impl AdminClient {
match client_token {
Some(_) => {
let status: HealTaskStatus = self.post_json(&heal_path(bucket, prefix), &query, Vec::new()).await?;
Ok(HealStopOutcome::Stopped(status))
Ok(HealStopOutcome::Stopped(Box::new(status)))
}
None => {
let success: HealStartSuccess = self.post_json(&heal_path(bucket, prefix), &query, Vec::new()).await?;
@@ -533,7 +554,7 @@ impl AdminClient {
/// start-success-shaped receipt.
#[derive(Debug, Clone)]
pub enum HealStopOutcome {
Stopped(HealTaskStatus),
Stopped(Box<HealTaskStatus>),
PathStopped(HealStartSuccess),
}
@@ -635,6 +656,24 @@ mod tests {
assert!(status.progress.is_none());
}
#[test]
fn outcome_v3_decoder_preserves_canonical_unknown_and_future_fields() {
let cases: serde_json::Value =
serde_json::from_str(include_str!("../tests/fixtures/heal-outcome-v3.json")).expect("shared fixtures");
for case in cases.as_array().expect("cases") {
let status: HealTaskStatus = serde_json::from_value(case["response"].clone()).expect("optional outcome response");
assert_eq!(status.outcome.as_ref(), Some(&case["response"]["outcome"]));
assert_eq!((status.next_seq, status.min_seq), (Some(9), Some(4)));
assert!(status.truncated);
}
let old: HealTaskStatus = serde_json::from_value(json!({"summary":"finished"})).expect("legacy response");
assert!(old.outcome.is_none() && old.next_seq.is_none() && old.min_seq.is_none());
let future = json!({"execution":{"state":"future_state"},"newField":7});
let status: HealTaskStatus =
serde_json::from_value(json!({"summary":"running","outcome":future})).expect("future outcome remains opaque");
assert_eq!(status.outcome, Some(future));
}
#[test]
fn background_heal_status_types_known_fields_and_passes_the_rest_through() {
let raw = json!({
@@ -750,6 +789,26 @@ mod tests {
assert!(!request.query.contains("forceStop"));
}
#[tokio::test]
async fn outcome_v3_since_query_preserves_cursor_and_never_sends_force_start() {
let server = TestServer::spawn(
r#"{"summary":"running","nextSeq":9,"minSeq":4,"truncated":true,"outcome":{"execution":{"state":"future_state"}}}"#,
200,
)
.await;
let client = AdminClient::new(&format!("http://{}", server.addr), "ak", "sk").expect("test client");
let status = client
.heal_status_since(Some("bucket"), None, "token-1", Some(3))
.await
.expect("window response");
assert_eq!((status.next_seq, status.min_seq), (Some(9), Some(4)));
assert!(status.truncated);
assert_eq!(status.outcome.expect("future state is preserved")["execution"]["state"], "future_state");
let request = server.recorded();
assert!(request.query.contains("sinceSeq=3") && request.query.contains("clientToken=token-1"));
assert!(!request.query.contains("forceStart") && !request.query.contains("forceStop"));
}
#[tokio::test]
async fn stop_without_token_takes_the_path_cancel_branch() {
let server = TestServer::spawn(r#"{"clientToken":"path","clientAddress":"c","startTime":"t"}"#, 200).await;
@@ -762,6 +821,25 @@ mod tests {
assert!(!request.query.contains("clientToken"));
}
#[tokio::test]
async fn stop_with_token_decodes_boxed_task_status() {
let body = r#"{"summary":"stopped","detail":"","settings":{"recursive":false},"items":[],"truncated":false}"#;
let server = TestServer::spawn(body, 200).await;
let client = AdminClient::new(&format!("http://{}", server.addr), "ak", "sk").unwrap();
let outcome = client
.heal_stop(Some("bucket"), None, Some("token-1"))
.await
.expect("token stop decodes");
let super::HealStopOutcome::Stopped(status) = outcome else {
panic!("token stop should return task status");
};
assert_eq!(status.summary, "stopped");
let request = server.recorded();
assert!(request.query.contains("forceStop=true"));
assert!(request.query.contains("clientToken=token-1"));
}
#[tokio::test]
async fn background_heal_status_posts_to_the_registered_route() {
let body = r#"{"state":"idle","healQueueLength":0,"healActiveTasks":0,"clusterStatusComplete":true}"#;
+472
View File
@@ -0,0 +1,472 @@
[
{
"name": "completed",
"cliExit": 0,
"response": {
"summary": "finished",
"detail": "heal result items were truncated",
"startTime": "2026-01-01T00:00:00Z",
"settings": {
"recursive": true,
"scanMode": 1
},
"items": [],
"truncated": true,
"nextSeq": 9,
"minSeq": 4,
"progress": {
"objectsScanned": 11,
"objectsHealed": 7
},
"outcome": {
"execution": {
"state": "completed"
},
"coverage": "complete",
"counters": {
"processed": 0,
"healed": 0,
"unchanged": 0,
"skipped": 0,
"failed": 0,
"unknown": 0,
"attemptFailures": 0,
"overflowed": false
},
"objects": [],
"objectsTruncated": false
}
}
},
{
"name": "unknown",
"cliExit": 0,
"response": {
"summary": "finished",
"detail": "heal traversal completed; authoritative storage proof is unavailable for 1 objects; heal result items were truncated",
"startTime": "2026-01-01T00:00:00Z",
"settings": {
"recursive": true,
"scanMode": 1
},
"items": [],
"truncated": true,
"nextSeq": 9,
"minSeq": 4,
"progress": {
"objectsScanned": 11,
"objectsHealed": 7
},
"outcome": {
"execution": {
"state": "completed"
},
"coverage": "complete",
"counters": {
"processed": 1,
"healed": 0,
"unchanged": 0,
"skipped": 1,
"failed": 0,
"unknown": 1,
"attemptFailures": 0,
"overflowed": false
},
"objects": [
{
"identity": {
"kind": "object",
"bucket": "bucket",
"object": "object",
"versionId": null,
"bucketIncarnationId": null,
"poolIndex": null,
"setIndex": null
},
"disposition": {
"state": "unknown"
},
"detail": null
}
],
"objectsTruncated": false
}
}
},
{
"name": "completed_with_errors",
"cliExit": 1,
"response": {
"summary": "stopped",
"detail": "heal traversal completed with errors: 1 failed objects; heal result items were truncated",
"startTime": "2026-01-01T00:00:00Z",
"settings": {
"recursive": true,
"scanMode": 1
},
"items": [],
"truncated": true,
"nextSeq": 9,
"minSeq": 4,
"progress": {
"objectsScanned": 11,
"objectsHealed": 7
},
"outcome": {
"execution": {
"state": "completed_with_errors"
},
"coverage": "complete",
"counters": {
"processed": 1,
"healed": 0,
"unchanged": 0,
"skipped": 0,
"failed": 1,
"unknown": 0,
"attemptFailures": 1,
"overflowed": false
},
"objects": [
{
"identity": {
"kind": "object",
"bucket": "bucket",
"object": "object",
"versionId": null,
"bucketIncarnationId": null,
"poolIndex": null,
"setIndex": null
},
"disposition": {
"state": "failed",
"details": "retry_exhausted"
},
"detail": null
}
],
"objectsTruncated": false
}
}
},
{
"name": "cancelled",
"cliExit": 1,
"response": {
"summary": "stopped",
"detail": "heal task cancelled; heal result items were truncated",
"startTime": "2026-01-01T00:00:00Z",
"settings": {
"recursive": true,
"scanMode": 1
},
"items": [],
"truncated": true,
"nextSeq": 9,
"minSeq": 4,
"progress": {
"objectsScanned": 11,
"objectsHealed": 7
},
"outcome": {
"execution": {
"state": "aborted",
"reason": "cancelled"
},
"coverage": "partial",
"counters": {
"processed": 0,
"healed": 0,
"unchanged": 0,
"skipped": 0,
"failed": 0,
"unknown": 0,
"attemptFailures": 0,
"overflowed": false
},
"objects": [],
"objectsTruncated": false
}
}
},
{
"name": "deadline",
"cliExit": 1,
"response": {
"summary": "stopped",
"detail": "heal task timed out; heal result items were truncated",
"startTime": "2026-01-01T00:00:00Z",
"settings": {
"recursive": true,
"scanMode": 1
},
"items": [],
"truncated": true,
"nextSeq": 9,
"minSeq": 4,
"progress": {
"objectsScanned": 11,
"objectsHealed": 7
},
"outcome": {
"execution": {
"state": "aborted",
"reason": "deadline"
},
"coverage": "partial",
"counters": {
"processed": 0,
"healed": 0,
"unchanged": 0,
"skipped": 0,
"failed": 0,
"unknown": 0,
"attemptFailures": 0,
"overflowed": false
},
"objects": [],
"objectsTruncated": false
}
}
},
{
"name": "untraversable",
"cliExit": 1,
"response": {
"summary": "stopped",
"detail": "heal listing is untraversable; heal result items were truncated",
"startTime": "2026-01-01T00:00:00Z",
"settings": {
"recursive": true,
"scanMode": 1
},
"items": [],
"truncated": true,
"nextSeq": 9,
"minSeq": 4,
"progress": {
"objectsScanned": 11,
"objectsHealed": 7
},
"outcome": {
"execution": {
"state": "aborted",
"reason": "untraversable"
},
"coverage": "partial",
"counters": {
"processed": 0,
"healed": 0,
"unchanged": 0,
"skipped": 0,
"failed": 0,
"unknown": 0,
"attemptFailures": 0,
"overflowed": false
},
"objects": [],
"objectsTruncated": false
}
}
},
{
"name": "remote_completed_with_errors",
"cliExit": 1,
"response": {
"summary": "stopped",
"detail": "heal traversal completed with errors: 1 failed objects; heal result items were truncated",
"startTime": "2026-01-01T00:00:00Z",
"settings": {
"recursive": true,
"scanMode": 1
},
"items": [],
"truncated": true,
"nextSeq": 9,
"minSeq": 4,
"progress": {
"objectsScanned": 11,
"objectsHealed": 7
},
"outcome": {
"execution": {
"state": "completed_with_errors",
"futureExtension": {
"value": 7
}
},
"coverage": "complete",
"counters": {
"processed": 1,
"healed": 0,
"unchanged": 0,
"skipped": 0,
"failed": 1,
"unknown": 0,
"attemptFailures": 1,
"overflowed": false,
"futureCounter": 11
},
"objects": [
{
"identity": {
"kind": "object",
"bucket": "bucket",
"object": "object",
"versionId": null,
"bucketIncarnationId": null,
"poolIndex": null,
"setIndex": null
},
"disposition": {
"state": "failed",
"details": "retry_exhausted"
},
"detail": null
}
],
"objectsTruncated": false
}
},
"remoteResponse": {
"summary": "finished",
"detail": "",
"startTime": "2026-01-01T00:00:00Z",
"settings": {
"recursive": true,
"scanMode": 1
},
"items": [],
"truncated": true,
"nextSeq": 9,
"minSeq": 4,
"progress": {
"objectsScanned": 11,
"objectsHealed": 7
},
"outcome": {
"execution": {
"state": "completed_with_errors",
"futureExtension": {
"value": 7
}
},
"coverage": "complete",
"counters": {
"processed": 1,
"healed": 0,
"unchanged": 0,
"skipped": 0,
"failed": 1,
"unknown": 0,
"attemptFailures": 1,
"overflowed": false,
"futureCounter": 11
},
"objects": [
{
"identity": {
"kind": "object",
"bucket": "bucket",
"object": "object",
"versionId": null,
"bucketIncarnationId": null,
"poolIndex": null,
"setIndex": null
},
"disposition": {
"state": "failed",
"details": "retry_exhausted"
},
"detail": null
}
],
"objectsTruncated": false
}
}
},
{
"name": "remote_cancelled",
"cliExit": 1,
"response": {
"summary": "stopped",
"detail": "heal task cancelled; heal result items were truncated",
"startTime": "2026-01-01T00:00:00Z",
"settings": {
"recursive": true,
"scanMode": 1
},
"items": [],
"truncated": true,
"nextSeq": 9,
"minSeq": 4,
"progress": {
"objectsScanned": 11,
"objectsHealed": 7
},
"outcome": {
"execution": {
"state": "aborted",
"reason": "cancelled",
"futureExtension": {
"value": 7
}
},
"coverage": "partial",
"counters": {
"processed": 0,
"healed": 0,
"unchanged": 0,
"skipped": 0,
"failed": 0,
"unknown": 0,
"attemptFailures": 0,
"overflowed": false,
"futureCounter": 11
},
"objects": [],
"objectsTruncated": false
}
},
"remoteResponse": {
"summary": "finished",
"detail": "",
"startTime": "2026-01-01T00:00:00Z",
"settings": {
"recursive": true,
"scanMode": 1
},
"items": [],
"truncated": true,
"nextSeq": 9,
"minSeq": 4,
"progress": {
"objectsScanned": 11,
"objectsHealed": 7
},
"outcome": {
"execution": {
"state": "aborted",
"reason": "cancelled",
"futureExtension": {
"value": 7
}
},
"coverage": "partial",
"counters": {
"processed": 0,
"healed": 0,
"unchanged": 0,
"skipped": 0,
"failed": 0,
"unknown": 0,
"attemptFailures": 0,
"overflowed": false,
"futureCounter": 11
},
"objects": [],
"objectsTruncated": false
}
}
}
]
+1
View File
@@ -106,6 +106,7 @@ bytes.workspace = true
hex-simd.workspace = true
[dev-dependencies]
rustfs-heal.workspace = true
tracing-subscriber = { workspace = true, features = ["json", "env-filter", "time"] }
serial_test = { workspace = true }
temp-env = { workspace = true, features = ["async_closure"] }
+2 -2
View File
@@ -85,8 +85,8 @@ pub use rustfs_scanner_metrics::last_minute;
pub use scanner::{
ScannerCycleRecoveryMarker, ScannerCycleRecoveryStatus, ScannerCycleScheduleStatus, ScannerPauseBacklogAlertReason,
ScannerPauseBacklogPhase, ScannerPauseBacklogStatus, ScannerPauseBacklogThresholds, ScannerUsageStateResetResult,
init_data_scanner, reset_scanner_cycle_recovery, reset_scanner_usage_state_for_full_rebuild, scanner_cycle_recovery_status,
scanner_cycle_schedule_status, scanner_pause_backlog_status, scanner_topology_digest,
init_data_scanner, init_scanner_with_recovery, reset_scanner_cycle_recovery, reset_scanner_usage_state_for_full_rebuild,
scanner_cycle_recovery_status, scanner_cycle_schedule_status, scanner_pause_backlog_status, scanner_topology_digest,
};
pub use scanner_io::{
ScannerDirtyUsageAckError, ScannerDirtyUsageBucket, ScannerDirtyUsageSnapshot, ScannerDirtyUsageState,
+61 -10
View File
@@ -14,7 +14,6 @@
use std::collections::BTreeMap;
use std::future::Future;
#[cfg(test)]
use std::sync::Mutex as StdMutex;
use std::sync::atomic::{AtomicBool, Ordering};
use std::sync::{Arc, LazyLock, RwLock};
@@ -948,6 +947,33 @@ pub async fn init_data_scanner(ctx: CancellationToken, storeapi: Arc<ECStore>) {
init_data_scanner_with_storage(ctx, storeapi).await;
}
/// Start normal scanning when enabled, or one resume-only cleanup attempt.
/// The disabled branch returns a finite task for the startup owner to join;
/// it never enables ordinary namespace scanning or accepts a new reset intent.
pub async fn init_scanner_with_recovery(
ctx: CancellationToken,
storeapi: Arc<ECStore>,
enabled: bool,
) -> Option<tokio::task::JoinHandle<()>> {
if enabled {
init_data_scanner(ctx, storeapi).await;
return None;
}
Some(tokio::spawn(async move {
if let Err(error) = resume_scanner_cycle_cleanup(ctx, storeapi).await {
warn!(
target: "rustfs::scanner",
event = EVENT_SCANNER_PERSIST_STATE,
component = LOG_COMPONENT_SCANNER,
subsystem = LOG_SUBSYSTEM_RUNTIME,
state = "disabled_cleanup_deferred",
error = %error,
"Disabled scanner cleanup remains pending for an operator retry"
);
}
}))
}
async fn init_data_scanner_with_storage<S>(ctx: CancellationToken, storeapi: Arc<S>)
where
S: ScannerStorage,
@@ -1558,6 +1584,11 @@ async fn mark_scan_cycle_idle(cycle_info: &mut CurrentCycle, cycle_metrics_guard
cycle_metrics_guard.finish(cycle_info.clone()).await;
}
struct ScannerCycleScheduling {
requires_full_scan: bool,
service_cohort: Option<Arc<StdMutex<crate::scanner_io::ScannerServiceCohort>>>,
}
#[cfg(test)]
async fn run_data_scanner_cycle<S>(
ctx: &CancellationToken,
@@ -1570,7 +1601,19 @@ where
S: ScannerStorage,
{
let cycle_budget = ScannerCycleBudget::new(ctx, scanner_cycle_budget_config());
run_data_scanner_cycle_with_budget(ctx, storeapi, cycle_info, cycle_revision, leader_epoch, cycle_budget, true).await
run_data_scanner_cycle_with_budget(
ctx,
storeapi,
cycle_info,
cycle_revision,
leader_epoch,
cycle_budget,
ScannerCycleScheduling {
requires_full_scan: true,
service_cohort: None,
},
)
.await
}
#[instrument(skip_all)]
@@ -1582,7 +1625,7 @@ async fn run_data_scanner_cycle_with_budget<S>(
cycle_revision: &mut DataUsageCacheRevision,
leader_epoch: u64,
cycle_budget: Arc<ScannerCycleBudget>,
requires_full_scan: bool,
scheduling: ScannerCycleScheduling,
) -> ScannerCycleOutcome
where
S: ScannerStorage,
@@ -1721,7 +1764,8 @@ where
scan_mode,
scan_scope: crate::scanner_io::ScannerBucketScanScope::default(),
persisted_usage_baseline: usage_persist_baseline.data.clone(),
requires_full_scan,
requires_full_scan: scheduling.requires_full_scan,
service_cohort: scheduling.service_cohort,
#[cfg(test)]
resolved_scope_observer: None,
},
@@ -2583,6 +2627,7 @@ where
let mut clean_idle_backoff = ScannerCleanIdleBackoff::default();
let mut superseded_backoff = ScannerRetryBackoff::default();
let mut deferred_backoff = ScannerRetryBackoff::default();
let service_cohort = Arc::new(StdMutex::new(crate::scanner_io::ScannerServiceCohort::default()));
let initial_runtime_config = resolve_scanner_runtime_config();
if clean_idle_topology_supported && maintenance_generation_seen.is_none() {
let Some((features, generation)) = detect_stable_scanner_maintenance_features(&ctx, &storeapi).await else {
@@ -2792,7 +2837,10 @@ where
&mut cycle_revision,
leader_epoch,
cycle_budget.clone(),
true,
ScannerCycleScheduling {
requires_full_scan: true,
service_cohort: Some(service_cohort.clone()),
},
),
guard.lock_lost_notified(),
)
@@ -3083,11 +3131,14 @@ where
&mut cycle_revision,
leader_epoch,
cycle_budget.clone(),
maintenance_features.requires_full_scan(
maintenance_generation_seen,
scanner_maintenance_generation(),
wake_reason,
),
ScannerCycleScheduling {
requires_full_scan: maintenance_features.requires_full_scan(
maintenance_generation_seen,
scanner_maintenance_generation(),
wake_reason,
),
service_cohort: Some(service_cohort.clone()),
},
),
guard.lock_lost_notified(),
)
+244 -19
View File
@@ -18,6 +18,7 @@ use crate::data_usage_define::{
DATA_USAGE_BLOOM_RECOVERY_PATH, DATA_USAGE_RECOVERY_PATH, usage_floor_primary_read_error_allows_backup,
};
use crate::storage_api::owner::ObjectIO as _;
use std::sync::atomic::AtomicU64;
use tokio::io::AsyncReadExt as _;
const SCANNER_CYCLE_RECOVERY_SCHEMA_VERSION: u16 = 1;
@@ -34,6 +35,86 @@ const CACHE_CYCLE_AHEAD: &str = "cache_cycle_ahead";
const SCANNER_USAGE_STATE_RESET_MODE_FULL_REBUILD: &str = "full-rebuild";
#[cfg(test)]
pub(super) mod cleanup_io_fault {
use super::*;
#[derive(Clone, Copy, PartialEq, Eq)]
pub(in crate::scanner) enum Stage {
PrimaryRead,
PrimaryWrite,
UsageFence,
}
struct Injection {
store: std::sync::Weak<ECStore>,
stage: Stage,
fired: AtomicBool,
owned: AtomicBool,
newer_completion: bool,
}
static INJECTION: StdMutex<Option<Arc<Injection>>> = StdMutex::new(None);
pub(in crate::scanner) struct Guard(Arc<Injection>);
impl Guard {
pub(in crate::scanner) fn fired_while_owned(&self) -> bool {
self.0.fired.load(Ordering::Relaxed) && self.0.owned.load(Ordering::Relaxed)
}
}
impl Drop for Guard {
fn drop(&mut self) {
let mut slot = INJECTION.lock().unwrap_or_else(|poisoned| poisoned.into_inner());
if slot.as_ref().is_some_and(|current| Arc::ptr_eq(current, &self.0)) {
*slot = None;
}
}
}
pub(in crate::scanner) fn install(store: &Arc<ECStore>, stage: Stage, newer_completion: bool) -> Guard {
let injection = Arc::new(Injection {
store: Arc::downgrade(store),
stage,
fired: AtomicBool::new(false),
owned: AtomicBool::new(false),
newer_completion,
});
let mut slot = INJECTION.lock().expect("cleanup injection slot");
assert!(slot.is_none(), "only one cleanup I/O injection may be installed");
*slot = Some(injection.clone());
Guard(injection)
}
pub(super) fn check(store: &Arc<ECStore>, stage: Stage, owned: bool) -> Result<(), ScannerError> {
let injection = {
let mut slot = INJECTION.lock().expect("cleanup injection slot");
if slot
.as_ref()
.is_some_and(|injection| injection.stage == stage && injection.store.ptr_eq(&Arc::downgrade(store)))
{
slot.take()
} else {
None
}
};
let Some(injection) = injection else {
return Ok(());
};
injection.fired.store(true, Ordering::Relaxed);
injection.owned.store(owned, Ordering::Relaxed);
if injection.newer_completion {
set_scanner_cycle_recovery_status(recovery_status("healthy", None, false));
}
let reason = match stage {
Stage::PrimaryRead => "injected primary read failure",
Stage::PrimaryWrite => "injected primary write failure",
Stage::UsageFence => "injected usage fence failure",
};
Err(ScannerError::Io(std::io::Error::other(reason)))
}
}
#[derive(Clone, Debug, Default, Serialize)]
pub struct ScannerCycleRecoveryStatus {
/// The immutable primary object whose revision is being guarded.
@@ -81,6 +162,8 @@ static SCANNER_CYCLE_RECOVERY_STATUS: LazyLock<RwLock<ScannerCycleRecoveryStatus
..Default::default()
})
});
// An old startup observation must not overwrite a newer explicit reset status.
static SCANNER_CYCLE_RECOVERY_STATUS_VERSION: AtomicU64 = AtomicU64::new(0);
pub fn scanner_cycle_recovery_status() -> ScannerCycleRecoveryStatus {
SCANNER_CYCLE_RECOVERY_STATUS
@@ -90,6 +173,24 @@ pub fn scanner_cycle_recovery_status() -> ScannerCycleRecoveryStatus {
}
fn set_scanner_cycle_recovery_status(status: ScannerCycleRecoveryStatus) {
let _ = publish_scanner_cleanup_status(status, None);
}
pub(super) fn scanner_cleanup_status_version() -> u64 {
let _status = SCANNER_CYCLE_RECOVERY_STATUS
.read()
.unwrap_or_else(|poisoned| poisoned.into_inner());
SCANNER_CYCLE_RECOVERY_STATUS_VERSION.load(Ordering::Relaxed)
}
pub(super) fn publish_scanner_cleanup_status(status: ScannerCycleRecoveryStatus, expected: Option<u64>) -> Option<u64> {
let mut current = SCANNER_CYCLE_RECOVERY_STATUS
.write()
.unwrap_or_else(|poisoned| poisoned.into_inner());
let version = SCANNER_CYCLE_RECOVERY_STATUS_VERSION.load(Ordering::Relaxed);
if expected.is_some_and(|expected| expected == u64::MAX || expected != version) {
return None;
}
let recovery_required = if matches!(
status.state.as_str(),
"blocked"
@@ -106,9 +207,27 @@ fn set_scanner_cycle_recovery_status(status: ScannerCycleRecoveryStatus) {
};
metrics::gauge!(METRIC_SCANNER_CYCLE_RECOVERY_REQUIRED).set(recovery_required);
metrics::gauge!(METRIC_SCANNER_CYCLE_RECOVERY_RETRY_COUNT).set(status.retry_count as f64);
*SCANNER_CYCLE_RECOVERY_STATUS
.write()
.unwrap_or_else(|poisoned| poisoned.into_inner()) = status;
*current = status;
let next = version.saturating_add(1);
SCANNER_CYCLE_RECOVERY_STATUS_VERSION.store(next, Ordering::Relaxed);
Some(next)
}
fn publish_scanner_cleanup_failure(reason: String, expected: u64) {
let mut status = {
let current = SCANNER_CYCLE_RECOVERY_STATUS
.read()
.unwrap_or_else(|poisoned| poisoned.into_inner());
if SCANNER_CYCLE_RECOVERY_STATUS_VERSION.load(Ordering::Relaxed) != expected {
return;
}
current.clone()
};
// Preserve the latest core progress, including a newly written primary's
// revision and epoch. The original marker may predate that durable write.
status.reason = Some(reason);
status.last_attempt_at_unix_secs = Some(unix_now_secs());
let _ = publish_scanner_cleanup_status(status, Some(expected));
}
pub(super) fn record_scanner_usage_floor_failure(reason: String) {
@@ -932,10 +1051,81 @@ pub(crate) async fn load_scanner_cycle_state_for_startup(
}
}
/// Reset a blocked cycle state after an operator has explicitly requested a full
/// usage rebuild. The primary object is changed first with its observed ETag;
/// the recovery marker is removed only when its own ETag still matches.
/// Reset a blocked cycle state after an explicit full-rescan request. Durable
/// cleanup state fences primary rewrites; marker removal retains its ETag and
/// usage-epoch checks.
pub async fn reset_scanner_cycle_recovery(ctx: CancellationToken, storeapi: Arc<ECStore>) -> Result<(), ScannerError> {
reset_scanner_cycle_recovery_for_intent(ctx, storeapi, None, None).await
}
/// Resume only an operator reset whose cleanup phase is already durable.
/// Missing or merely blocked markers never authorize an automatic reset.
pub(super) async fn resume_scanner_cycle_cleanup(ctx: CancellationToken, storeapi: Arc<ECStore>) -> Result<(), ScannerError> {
let status_version = scanner_cleanup_status_version();
let (marker, revision) = match read_scanner_cleanup_marker(storeapi.clone(), &ctx).await {
Ok(Some(marker)) => marker,
Ok(None) => return Ok(()),
Err(error) => {
let _ =
publish_scanner_cleanup_status(recovery_status("blocked", Some(&error.to_string()), false), Some(status_version));
return Err(error);
}
};
let mut observation =
publish_scanner_cleanup_status(recovery_status_from_marker(&marker, &marker.state), Some(status_version));
if marker.state != "cleanup-pending" {
return Ok(());
}
let result = reset_scanner_cycle_recovery_for_intent(ctx, storeapi, Some(revision), Some(&mut observation)).await;
if let Err(error) = &result
&& let Some(observation) = observation
{
publish_scanner_cleanup_failure(error.to_string(), observation);
}
result
}
pub(super) async fn read_scanner_cleanup_marker(
storeapi: Arc<impl ScannerObjectIO>,
ctx: &CancellationToken,
) -> Result<Option<(ScannerCycleRecoveryMarker, DataUsageCacheRevision)>, ScannerError> {
let (data, revision) = tokio::select! {
biased;
_ = ctx.cancelled() => return Err(ScannerError::Other("scanner cleanup recovery was cancelled".to_string())),
result = tokio::time::timeout(data_usage_persist_timeout(), read_cycle_recovery_marker_bytes(storeapi)) => {
result.map_err(|_| ScannerError::Other("scanner cleanup marker inspection timed out".to_string()))?
.map_err(|err| ScannerError::Other(format!("failed to inspect pending scanner cleanup: {err}")))?
}
};
let Some(data) = data else {
return Ok(None);
};
let marker: ScannerCycleRecoveryMarker = serde_json::from_slice(&data)
.map_err(|err| ScannerError::Other(format!("pending scanner cleanup marker is invalid: {err}")))?;
validate_recovery_marker(&marker)
.map_err(|err| ScannerError::Other(format!("pending scanner cleanup marker is invalid: {err}")))?;
Ok(Some((marker, revision)))
}
pub(super) async fn reset_scanner_cycle_recovery_for_intent(
ctx: CancellationToken,
storeapi: Arc<ECStore>,
expected_cleanup_revision: Option<DataUsageCacheRevision>,
mut observation: Option<&mut Option<u64>>,
) -> Result<(), ScannerError> {
#[cfg(test)]
let resume_only = expected_cleanup_revision.is_some();
// The outer Some distinguishes a tracked resume whose version may be
// invalidated from an explicit v3 reset with no observation owner.
let mut publish_status = |status| {
if let Some(version) = observation.as_deref_mut() {
if let Some(expected) = *version {
*version = publish_scanner_cleanup_status(status, Some(expected));
}
} else {
set_scanner_cycle_recovery_status(status);
}
};
let lock = storeapi
.new_ns_lock(RUSTFS_META_BUCKET, "leader.lock")
.await
@@ -964,6 +1154,21 @@ pub async fn reset_scanner_cycle_recovery(ctx: CancellationToken, storeapi: Arc<
}
Err(err) => return Err(ScannerError::Other(format!("failed to read cycle recovery marker: {err}"))),
};
if let Some(expected) = expected_cleanup_revision {
if marker_revision != expected || !owns_reset() {
return Err(ScannerError::Other(
"pending scanner cleanup changed before recovery acquired ownership".to_string(),
));
}
let marker: ScannerCycleRecoveryMarker = marker_data
.as_deref()
.and_then(|data| serde_json::from_slice(data).ok())
.filter(|marker| validate_recovery_marker(marker).is_ok() && marker.state == "cleanup-pending")
.ok_or_else(|| {
ScannerError::Other("scanner cleanup recovery requires an unchanged cleanup-pending marker".to_string())
})?;
publish_status(recovery_status_from_marker(&marker, "cleanup-pending"));
}
let Some(marker_data) = marker_data else {
// A delete may commit before its reply is lost. Confirm both durable
// fences before treating a retry without its marker as completed.
@@ -981,7 +1186,7 @@ pub async fn reset_scanner_cycle_recovery(ctx: CancellationToken, storeapi: Arc<
"scanner cycle recovery marker is absent without a completed reset fence".to_string(),
));
}
set_scanner_cycle_recovery_status(recovery_status("healthy", None, false));
publish_status(recovery_status("healthy", None, false));
super::notify_scanner_cycle_recovery_wake();
return Ok(());
};
@@ -997,6 +1202,10 @@ pub async fn reset_scanner_cycle_recovery(ctx: CancellationToken, storeapi: Arc<
));
}
#[cfg(test)]
if resume_only {
cleanup_io_fault::check(&storeapi, cleanup_io_fault::Stage::PrimaryRead, owns_reset())?;
}
let (mut primary_reader, primary_revision) = match storeapi
.get_object_reader(
RUSTFS_META_BUCKET,
@@ -1062,7 +1271,7 @@ pub async fn reset_scanner_cycle_recovery(ctx: CancellationToken, storeapi: Arc<
let (cleanup_marker, cleanup_marker_revision) =
mark_cycle_recovery_cleanup_pending(storeapi.clone(), marker.clone(), &marker_revision, reset_epoch, &owns_reset)
.await?;
set_scanner_cycle_recovery_status(recovery_status_from_marker(&cleanup_marker, "cleanup-pending"));
publish_status(recovery_status_from_marker(&cleanup_marker, "cleanup-pending"));
let usage_floor = persisted_usage_floor(storeapi.clone()).await?;
let fence_epoch = primary_epoch
.max(usage_floor.leader_epoch)
@@ -1082,6 +1291,10 @@ pub async fn reset_scanner_cycle_recovery(ctx: CancellationToken, storeapi: Arc<
));
}
verify_cycle_reset_intent(storeapi.clone(), &cleanup_marker_revision, &owns_reset).await?;
#[cfg(test)]
if resume_only {
cleanup_io_fault::check(&storeapi, cleanup_io_fault::Stage::PrimaryWrite, owns_reset())?;
}
let preserved_info = save_reset_config(
storeapi.clone(),
DATA_USAGE_BLOOM_NAME_PATH.as_str(),
@@ -1155,7 +1368,7 @@ pub async fn reset_scanner_cycle_recovery(ctx: CancellationToken, storeapi: Arc<
ScannerError::Other(format!("failed to clear stale cycle recovery marker: {err}"))
}
})?;
set_scanner_cycle_recovery_status(recovery_status("healthy", None, false));
publish_status(recovery_status("healthy", None, false));
super::notify_scanner_cycle_recovery_wake();
return Ok(());
} else if !force_full_rescan && !marker_cleanup_pending {
@@ -1228,11 +1441,23 @@ pub async fn reset_scanner_cycle_recovery(ctx: CancellationToken, storeapi: Arc<
));
}
verify_cycle_reset_intent(storeapi.clone(), &marker_revision, &owns_reset).await?;
if let Err(err) =
fence_scanner_usage_epoch_with_expected_epoch(&ctx, storeapi.clone(), leader_epoch, Some(reset_epoch), false, &owns_reset)
.await
{
set_scanner_cycle_recovery_status(ScannerCycleRecoveryStatus {
let usage_fence = fence_scanner_usage_epoch_with_expected_epoch(
&ctx,
storeapi.clone(),
leader_epoch,
Some(reset_epoch),
false,
&owns_reset,
);
#[cfg(test)]
let usage_fence = async {
if resume_only {
cleanup_io_fault::check(&storeapi, cleanup_io_fault::Stage::UsageFence, owns_reset())?;
}
usage_fence.await
};
if let Err(err) = usage_fence.await {
publish_status(ScannerCycleRecoveryStatus {
path: DATA_USAGE_BLOOM_NAME_PATH.clone(),
quarantine_path: Some(DATA_USAGE_BLOOM_RECOVERY_PATH.clone()),
state: "cleanup-pending".to_string(),
@@ -1260,7 +1485,7 @@ pub async fn reset_scanner_cycle_recovery(ctx: CancellationToken, storeapi: Arc<
}
};
if current_revision != rebuilt_revision {
set_scanner_cycle_recovery_status(ScannerCycleRecoveryStatus {
publish_status(ScannerCycleRecoveryStatus {
path: DATA_USAGE_BLOOM_NAME_PATH.clone(),
quarantine_path: Some(DATA_USAGE_BLOOM_RECOVERY_PATH.clone()),
state: "cleanup-pending".to_string(),
@@ -1281,7 +1506,7 @@ pub async fn reset_scanner_cycle_recovery(ctx: CancellationToken, storeapi: Arc<
}
if guard.is_lock_lost() {
set_scanner_cycle_recovery_status(ScannerCycleRecoveryStatus {
publish_status(ScannerCycleRecoveryStatus {
path: DATA_USAGE_BLOOM_NAME_PATH.clone(),
quarantine_path: Some(DATA_USAGE_BLOOM_RECOVERY_PATH.clone()),
state: "cleanup-pending".to_string(),
@@ -1318,7 +1543,7 @@ pub async fn reset_scanner_cycle_recovery(ctx: CancellationToken, storeapi: Arc<
.await
{
if scanner_publication_epoch_changed(&err) {
set_scanner_cycle_recovery_status(ScannerCycleRecoveryStatus {
publish_status(ScannerCycleRecoveryStatus {
path: DATA_USAGE_BLOOM_NAME_PATH.clone(),
quarantine_path: Some(DATA_USAGE_BLOOM_RECOVERY_PATH.clone()),
state: "cleanup-pending".to_string(),
@@ -1336,7 +1561,7 @@ pub async fn reset_scanner_cycle_recovery(ctx: CancellationToken, storeapi: Arc<
"scanner recovery reset deferred by a movement epoch change".to_string(),
));
}
set_scanner_cycle_recovery_status(ScannerCycleRecoveryStatus {
publish_status(ScannerCycleRecoveryStatus {
path: DATA_USAGE_BLOOM_NAME_PATH.clone(),
quarantine_path: Some(DATA_USAGE_BLOOM_RECOVERY_PATH.clone()),
state: "cleanup-pending".to_string(),
@@ -1352,7 +1577,7 @@ pub async fn reset_scanner_cycle_recovery(ctx: CancellationToken, storeapi: Arc<
});
return Err(ScannerError::Other(format!("failed to clear cycle recovery marker: {err}")));
}
set_scanner_cycle_recovery_status(ScannerCycleRecoveryStatus {
publish_status(ScannerCycleRecoveryStatus {
path: DATA_USAGE_BLOOM_NAME_PATH.clone(),
quarantine_path: Some(DATA_USAGE_BLOOM_RECOVERY_PATH.clone()),
state: "healthy".to_string(),
+76 -2
View File
@@ -36,6 +36,8 @@ use tokio::time::{Duration, advance};
const TEST_DEFAULT_SCANNER_CYCLE_SECS: u64 = 24 * 60 * 60;
mod recovery_control;
async fn setup_scanner_cycle_store() -> (tempfile::TempDir, Arc<ECStore>) {
setup_scanner_cycle_store_with_usage_baseline(true).await
}
@@ -1219,7 +1221,18 @@ async fn coordinator_walks_during_pending_put_without_persisting_or_acknowledgin
let mut revision = DataUsageCacheRevision::Missing;
let outcome = tokio::time::timeout(
Duration::from_secs(30),
run_data_scanner_cycle_with_budget(&ctx, &store, &mut cycle_info, &mut revision, 1, Arc::clone(&budget), true),
run_data_scanner_cycle_with_budget(
&ctx,
&store,
&mut cycle_info,
&mut revision,
1,
Arc::clone(&budget),
ScannerCycleScheduling {
requires_full_scan: true,
service_cohort: None,
},
),
)
.await
.expect("the coordinator must finish its namespace walk while a PUT is pending");
@@ -1263,7 +1276,18 @@ async fn coordinator_walks_during_pending_put_without_persisting_or_acknowledgin
let retry_budget = ScannerCycleBudget::new_with_progress_tracking(&ctx, ScannerCycleBudgetConfig::default());
let outcome = tokio::time::timeout(
Duration::from_secs(30),
run_data_scanner_cycle_with_budget(&ctx, &store, &mut cycle_info, &mut revision, 1, Arc::clone(&retry_budget), true),
run_data_scanner_cycle_with_budget(
&ctx,
&store,
&mut cycle_info,
&mut revision,
1,
Arc::clone(&retry_budget),
ScannerCycleScheduling {
requires_full_scan: true,
service_cohort: None,
},
),
)
.await
.expect("the same cycle must converge after the pending PUT drains");
@@ -8514,6 +8538,56 @@ async fn test_wait_for_next_scanner_cycle_wakes_for_dirty_usage() {
crate::scanner_io::clear_dirty_usage_buckets_for_tests();
}
#[tokio::test(start_paused = true)]
#[serial]
async fn service_cohort_aging_preserves_explicit_cycle_wait() {
crate::scanner_io::clear_dirty_usage_buckets_for_tests();
let config = ScannerRuntimeConfig {
cycle_interval: Duration::from_secs(3600),
cycle_interval_source: ScannerRuntimeConfigSource::Env,
..Default::default()
};
let observed = ScannerCycleObservedGenerations::for_wait(
&config,
None,
crate::scanner_io::dirty_usage_generation(),
crate::runtime_config::scanner_runtime_config_generation(),
crate::scanner_io::scanner_maintenance_generation(),
);
assert_eq!(observed.dirty_usage, None);
let inventory = HashMap::from([(
crate::data_usage_define::DataUsageCacheSource::new(0, 0),
vec![crate::storage_api::scanner_io::BucketInfo {
name: "waiting-bootstrap".to_string(),
..Default::default()
}],
)]);
let mut cohort = crate::scanner_io::ScannerServiceCohort::default();
cohort.refresh(&inventory);
let ctx = CancellationToken::new();
let mut wait = Box::pin(wait_for_next_scanner_cycle(
&ctx,
config.cycle_interval,
observed.dirty_usage,
observed.runtime_config,
observed.maintenance,
|| false,
));
assert!(matches!(futures::poll!(&mut wait), Poll::Pending));
for _ in 0..59 {
tokio::time::advance(Duration::from_secs(60)).await;
cohort.refresh(&inventory);
crate::scanner_io::record_dirty_usage_bucket("hot");
assert!(
matches!(futures::poll!(&mut wait), Poll::Pending),
"aging/dirty must not shorten the explicit hour"
);
}
tokio::time::advance(Duration::from_secs(60)).await;
assert_eq!(wait.await, ScannerCycleWakeReason::Timer);
crate::scanner_io::clear_dirty_usage_buckets_for_tests();
}
#[tokio::test]
#[serial]
async fn test_wait_for_next_scanner_cycle_sees_unattempted_dirty_usage() {
@@ -0,0 +1,475 @@
// Copyright 2026 RustFS Team
//
// Licensed under the Apache License, Version 2.0 (the "License");
// you may not use this file except in compliance with the License.
// You may obtain a copy of the License at
//
// http://www.apache.org/licenses/LICENSE-2.0
//
// Unless required by applicable law or agreed to in writing, software
// distributed under the License is distributed on an "AS IS" BASIS,
// WITHOUT WARRANTIES OR CONDITIONS OF ANY KIND, either express or implied.
// See the License for the specific language governing permissions and
// limitations under the License.
use super::super::cycle_state::cleanup_io_fault;
use super::*;
use crate::storage_api::owner::{EcstoreRebalStatus, EcstoreRebalanceInfo, EcstoreRebalanceMeta, EcstoreRebalanceStats};
async fn seed_cleanup(store: &Arc<ECStore>, state: &str) -> ScannerCycleRecoveryMarker {
let cycle = CurrentCycle {
current: 3,
next: 42,
..Default::default()
};
save_config(
store.clone(),
DATA_USAGE_BLOOM_NAME_PATH.as_str(),
encode_scanner_cycle_state(&cycle, 7).expect("cycle encoding"),
)
.await
.expect("persist cycle");
let usage = DataUsageInfo {
scanner_epoch: Some(7),
scanner_cycle: Some(41),
..complete_usage_with_bucket_count(Some(std::time::SystemTime::UNIX_EPOCH), 0)
};
save_config(
store.clone(),
DATA_USAGE_OBJ_NAME_PATH.as_str(),
serde_json::to_vec(&usage).expect("usage encoding"),
)
.await
.expect("persist usage floor");
let marker = ScannerCycleRecoveryMarker {
schema_version: 1,
primary_revision: "previous-primary".to_string(),
generation: 41,
leader_epoch: 7,
classification: "corrupt".to_string(),
first_detected_at_unix_secs: 1,
last_attempt_at_unix_secs: 2,
retry_count: 1,
reason: "operator reset in progress".to_string(),
path: DATA_USAGE_BLOOM_NAME_PATH.clone(),
quarantine_path: DATA_USAGE_BLOOM_RECOVERY_PATH.clone(),
state: state.to_string(),
};
save_config(
store.clone(),
DATA_USAGE_BLOOM_RECOVERY_PATH.as_str(),
serde_json::to_vec(&marker).expect("marker encoding"),
)
.await
.expect("persist operator marker");
marker
}
async fn persisted_state(store: &Arc<ECStore>) -> Vec<(Option<Vec<u8>>, DataUsageCacheRevision)> {
let mut state = Vec::new();
for path in [
DATA_USAGE_BLOOM_NAME_PATH.as_str(),
DATA_USAGE_BLOOM_RECOVERY_PATH.as_str(),
DATA_USAGE_OBJ_NAME_PATH.as_str(),
] {
state.push(
read_config_with_revision(store.clone(), path)
.await
.expect("read exact metadata revision"),
);
}
state
}
async fn run_disabled_startup(ctx: CancellationToken, store: Arc<ECStore>) {
let initialized_before = crate::scanner_runtime_initialized();
let cleanup = init_scanner_with_recovery(ctx, store, false).await;
if let Some(cleanup) = cleanup {
tokio::time::timeout(Duration::from_secs(15), cleanup)
.await
.expect("finite disabled cleanup attempt")
.expect("cleanup task should not panic");
}
assert_eq!(
crate::scanner_runtime_initialized(),
initialized_before,
"disabled recovery must not start the normal scanner runtime"
);
}
async fn assert_reset_fences(store: &Arc<ECStore>) {
let data = read_config(store.clone(), DATA_USAGE_BLOOM_NAME_PATH.as_str())
.await
.expect("cycle remains durable");
let (cycle, epoch) = decode_scanner_cycle_state(&data).expect("valid preserved cycle");
assert_eq!((cycle.current, cycle.next, epoch), (3, 42, 8));
let usage: DataUsageInfo = serde_json::from_slice(
&read_config(store.clone(), DATA_USAGE_OBJ_NAME_PATH.as_str())
.await
.expect("durable usage fence"),
)
.expect("valid usage");
assert_eq!(usage.scanner_epoch, Some(8));
assert_eq!(usage.scanner_cycle, Some(41));
assert!(matches!(
read_config(store.clone(), DATA_USAGE_BLOOM_RECOVERY_PATH.as_str()).await,
Err(EcstoreError::ConfigNotFound)
));
}
#[tokio::test]
#[serial]
async fn disabled_cleanup_reopens_persisted_intent_without_starting_scanner() {
let (_dir, store) = setup_scanner_cycle_store().await;
seed_cleanup(&store, "cleanup-pending").await;
let restarted = restart_scanner_cycle_store_from(&store).await;
run_disabled_startup(CancellationToken::new(), restarted.clone()).await;
assert_reset_fences(&restarted).await;
let completed = persisted_state(&restarted).await;
run_disabled_startup(CancellationToken::new(), restarted.clone()).await;
assert_eq!(
persisted_state(&restarted).await,
completed,
"a later startup without an intent must not reset again"
);
}
#[tokio::test]
#[serial]
async fn disabled_cleanup_does_not_authorize_blocked_unknown_or_corrupt_markers() {
let (_dir, store) = setup_scanner_cycle_store().await;
for kind in ["blocked", "unknown-phase", "future-version", "unknown-field", "corrupt"] {
let marker = seed_cleanup(&store, "blocked").await;
let mut value = serde_json::to_value(marker).expect("marker value");
match kind {
"unknown-phase" => value["state"] = "future-phase".into(),
"future-version" => value["schema_version"] = 99.into(),
"unknown-field" => value["future_hint"] = true.into(),
_ => {}
}
let bytes = if kind == "corrupt" {
b"{broken".to_vec()
} else {
serde_json::to_vec(&value).expect("marker JSON")
};
save_config(store.clone(), DATA_USAGE_BLOOM_RECOVERY_PATH.as_str(), bytes)
.await
.expect("persist rejected marker");
let before = persisted_state(&store).await;
run_disabled_startup(CancellationToken::new(), store.clone()).await;
assert_eq!(persisted_state(&store).await, before, "{kind} must not become an automatic full rescan");
}
}
#[tokio::test]
#[serial]
async fn disabled_cleanup_rechecks_revision_after_waiting_for_leader_lock() {
let (_dir, store) = setup_scanner_cycle_store().await;
let mut marker = seed_cleanup(&store, "cleanup-pending").await;
let expected = read_config_with_revision(store.clone(), DATA_USAGE_BLOOM_RECOVERY_PATH.as_str())
.await
.expect("intent revision")
.1;
let lock = store
.new_ns_lock(RUSTFS_META_BUCKET, "leader.lock")
.await
.expect("leader lock");
let guard = lock
.get_write_lock_quiet(Duration::from_secs(1))
.await
.expect("hold leader ownership");
let mut recovery = Box::pin(reset_scanner_cycle_recovery_for_intent(
CancellationToken::new(),
store.clone(),
Some(expected),
None,
));
assert!(matches!(futures::poll!(&mut recovery), Poll::Pending));
marker.state = "blocked".to_string();
save_config(
store.clone(),
DATA_USAGE_BLOOM_RECOVERY_PATH.as_str(),
serde_json::to_vec(&marker).expect("replacement marker"),
)
.await
.expect("replace intent while the fixture owns leader lock");
let replaced = persisted_state(&store).await;
drop(guard);
let error = recovery.await.expect_err("old preflight cannot authorize replacement marker");
assert!(error.to_string().contains("changed before recovery acquired ownership"));
assert_eq!(persisted_state(&store).await, replaced);
}
#[tokio::test]
#[serial]
async fn disabled_cleanup_requires_phase_even_when_revision_matches() {
let (_dir, store) = setup_scanner_cycle_store().await;
seed_cleanup(&store, "blocked").await;
let before = persisted_state(&store).await;
let error = reset_scanner_cycle_recovery_for_intent(CancellationToken::new(), store.clone(), Some(before[1].1.clone()), None)
.await
.expect_err("a matching ETag alone is not operator cleanup authorization");
assert!(error.to_string().contains("unchanged cleanup-pending"));
assert_eq!(persisted_state(&store).await, before);
reset_scanner_cycle_recovery(CancellationToken::new(), store.clone())
.await
.expect("explicit v3 core retains full reset authorization");
assert_reset_fences(&store).await;
}
#[tokio::test]
#[serial]
async fn disabled_cleanup_lock_busy_preserves_intent_without_force_unlock() {
let (_dir, store) = setup_scanner_cycle_store().await;
seed_cleanup(&store, "cleanup-pending").await;
let before = persisted_state(&store).await;
let lock = store
.new_ns_lock(RUSTFS_META_BUCKET, "leader.lock")
.await
.expect("leader lock");
let guard = lock
.get_write_lock_quiet(Duration::from_secs(1))
.await
.expect("hold live leader");
let error = resume_scanner_cycle_cleanup(CancellationToken::new(), store.clone())
.await
.expect_err("busy leader must block recovery");
assert!(error.to_string().contains("leader lock is busy"));
let status = scanner_cycle_recovery_status();
assert_eq!(status.state, "cleanup-pending");
assert!(
status
.reason
.as_deref()
.is_some_and(|reason| reason.contains("leader lock is busy"))
);
assert!(!status.retryable, "disabled startup makes one attempt, not an automatic retry loop");
assert!(!guard.is_lock_lost(), "recovery must not revoke the live owner");
assert_eq!(persisted_state(&store).await, before);
drop(guard);
run_disabled_startup(CancellationToken::new(), store.clone()).await;
assert_reset_fences(&store).await;
}
#[tokio::test]
#[serial]
async fn disabled_cleanup_movement_pause_preserves_intent_for_later_startup() {
let (_dir, store) = setup_scanner_cycle_store().await;
seed_cleanup(&store, "cleanup-pending").await;
let before = persisted_state(&store).await;
*store.rebalance_meta.write().await = Some(EcstoreRebalanceMeta {
id: "cleanup-movement".to_string(),
pool_stats: vec![EcstoreRebalanceStats {
participating: true,
info: EcstoreRebalanceInfo {
start_time: Some(time::OffsetDateTime::now_utc()),
status: EcstoreRebalStatus::Started,
..Default::default()
},
..Default::default()
}],
..Default::default()
});
let error = resume_scanner_cycle_cleanup(CancellationToken::new(), store.clone())
.await
.expect_err("movement must block reset publication");
assert!(error.to_string().contains("blocked by data movement"));
let status = scanner_cycle_recovery_status();
assert_eq!(status.state, "cleanup-pending");
assert!(
status
.reason
.as_deref()
.is_some_and(|reason| reason.contains("blocked by data movement"))
);
assert_eq!(persisted_state(&store).await, before);
*store.rebalance_meta.write().await = None;
run_disabled_startup(CancellationToken::new(), store.clone()).await;
assert_reset_fences(&store).await;
}
#[tokio::test]
#[serial]
async fn disabled_cleanup_cancelled_startup_preserves_persisted_work() {
let (_dir, store) = setup_scanner_cycle_store().await;
seed_cleanup(&store, "cleanup-pending").await;
let before = persisted_state(&store).await;
let ctx = CancellationToken::new();
ctx.cancel();
run_disabled_startup(ctx, store.clone()).await;
assert_eq!(persisted_state(&store).await, before);
}
#[tokio::test(start_paused = true)]
#[serial]
async fn disabled_cleanup_probe_obeys_cancellation_and_existing_io_deadline() {
for cancel in [false, true] {
let store = Arc::new(MemoryConfigStore::default());
store.delayed_gets.lock().await.insert(
memory_config_key(RUSTFS_META_BUCKET, DATA_USAGE_BLOOM_RECOVERY_PATH.as_str()),
data_usage_persist_timeout().saturating_add(Duration::from_secs(60)),
);
let ctx = CancellationToken::new();
let mut probe = Box::pin(read_scanner_cleanup_marker(store.clone(), &ctx));
assert!(matches!(futures::poll!(&mut probe), Poll::Pending));
if cancel {
ctx.cancel();
} else {
advance(data_usage_persist_timeout()).await;
}
let error = probe.await.expect_err("pending read must be bounded");
assert!(error.to_string().contains(if cancel { "cancelled" } else { "timed out" }));
assert!(store.put_counts.lock().await.is_empty(), "probe must remain read-only");
}
}
#[test]
#[serial]
fn disabled_cleanup_old_observation_cannot_overwrite_a_new_completion() {
let original = scanner_cycle_recovery_status();
let healthy = ScannerCycleRecoveryStatus {
state: "healthy".to_string(),
..Default::default()
};
publish_scanner_cleanup_status(healthy.clone(), None).expect("first status version");
let old = scanner_cleanup_status_version();
publish_scanner_cleanup_status(healthy, None).expect("a newer completion may have identical fields");
assert!(
publish_scanner_cleanup_status(
ScannerCycleRecoveryStatus {
state: "cleanup-pending".to_string(),
reason: Some("old lock wait failed".to_string()),
..Default::default()
},
Some(old)
)
.is_none()
);
assert_eq!(scanner_cycle_recovery_status().state, "healthy");
publish_scanner_cleanup_status(original, None).expect("restore prior observation");
}
#[tokio::test]
#[serial]
async fn disabled_cleanup_owned_read_and_write_failures_keep_specific_status() {
for (stage, newer_completion) in [
(cleanup_io_fault::Stage::PrimaryRead, false),
(cleanup_io_fault::Stage::PrimaryWrite, false),
(cleanup_io_fault::Stage::PrimaryWrite, true),
] {
let (_dir, store) = setup_scanner_cycle_store().await;
seed_cleanup(&store, "cleanup-pending").await;
let before = persisted_state(&store).await;
let injection = cleanup_io_fault::install(&store, stage, newer_completion);
let error = resume_scanner_cycle_cleanup(CancellationToken::new(), store.clone())
.await
.expect_err("injected owned I/O boundary");
assert!(
injection.fired_while_owned(),
"fault must occur after real leader ownership and marker validation"
);
let expected_error = match stage {
cleanup_io_fault::Stage::PrimaryRead => "injected primary read failure",
cleanup_io_fault::Stage::PrimaryWrite => "injected primary write failure",
cleanup_io_fault::Stage::UsageFence => "injected usage fence failure",
};
assert!(error.to_string().contains(expected_error));
let status = scanner_cycle_recovery_status();
if newer_completion {
assert_eq!(status.state, "healthy", "old error cannot overwrite a newer completion observation");
assert!(status.reason.is_none());
} else {
assert_eq!(status.state, "cleanup-pending");
assert!(
status.reason.as_deref().is_some_and(|reason| reason.contains(expected_error)),
"{status:?}"
);
}
let after = persisted_state(&store).await;
assert_eq!(after[0], before[0], "failed primary I/O must preserve its prior revision");
assert_eq!(after[2], before[2], "failed primary I/O must not advance the usage fence");
let marker: ScannerCycleRecoveryMarker =
serde_json::from_slice(after[1].0.as_deref().expect("durable marker retained")).expect("valid cleanup marker");
assert_eq!(marker.state, "cleanup-pending");
drop(injection);
run_disabled_startup(CancellationToken::new(), store.clone()).await;
assert_reset_fences(&store).await;
}
}
#[tokio::test]
#[serial]
async fn disabled_cleanup_invalidated_observation_never_becomes_unconditional() {
let (_dir, store) = setup_scanner_cycle_store().await;
seed_cleanup(&store, "cleanup-pending").await;
let revision = read_config_with_revision(store.clone(), DATA_USAGE_BLOOM_RECOVERY_PATH.as_str())
.await
.expect("marker revision")
.1;
let newer = ScannerCycleRecoveryStatus {
state: "healthy".to_string(),
reason: Some("newer completion owner".to_string()),
..Default::default()
};
publish_scanner_cleanup_status(newer.clone(), None).expect("newer observation");
let mut invalidated = None;
reset_scanner_cycle_recovery_for_intent(CancellationToken::new(), store.clone(), Some(revision), Some(&mut invalidated))
.await
.expect("metadata cleanup may complete without owning the newest status observation");
assert!(invalidated.is_none());
assert_eq!(
serde_json::to_value(scanner_cycle_recovery_status()).expect("observed status"),
serde_json::to_value(newer).expect("newer status")
);
assert_reset_fences(&store).await;
}
#[tokio::test]
#[serial]
async fn disabled_cleanup_later_failure_preserves_rebuilt_primary_status_identity() {
for newer_completion in [false, true] {
let (_dir, store) = setup_scanner_cycle_store().await;
seed_cleanup(&store, "cleanup-pending").await;
save_config(store.clone(), DATA_USAGE_BLOOM_NAME_PATH.as_str(), b"corrupt-cycle".to_vec())
.await
.expect("force the full reconstruction branch");
let before = persisted_state(&store).await;
let injection = cleanup_io_fault::install(&store, cleanup_io_fault::Stage::UsageFence, newer_completion);
let error = resume_scanner_cycle_cleanup(CancellationToken::new(), store.clone())
.await
.expect_err("fail after primary publication");
assert!(injection.fired_while_owned());
assert!(error.to_string().contains("injected usage fence failure"));
let after = persisted_state(&store).await;
assert_ne!(after[0].1, before[0].1, "the primary write must actually commit before this failure");
let (cycle, epoch) =
decode_scanner_cycle_state(after[0].0.as_deref().expect("rebuilt primary")).expect("valid durable reconstruction");
assert_eq!((cycle.current, cycle.next, epoch), (0, 42, 8));
assert_eq!(after[2], before[2], "usage fence publication was rejected");
let marker: ScannerCycleRecoveryMarker =
serde_json::from_slice(after[1].0.as_deref().expect("cleanup marker retained")).expect("valid cleanup marker");
assert_eq!(marker.state, "cleanup-pending");
let status = scanner_cycle_recovery_status();
if newer_completion {
assert_eq!(status.state, "healthy");
assert!(
status.reason.is_none(),
"old core and outer failure must both retain invalidated ownership"
);
} else {
let DataUsageCacheRevision::Etag(etag) = &after[0].1 else {
panic!("rebuilt primary must have a revision");
};
assert_eq!(status.state, "cleanup-pending");
assert_eq!(status.primary_revision.as_deref(), Some(etag.as_str()));
assert_eq!(status.generation, Some(cycle.next));
assert_eq!(status.leader_epoch, Some(epoch));
assert!(
status
.reason
.as_deref()
.is_some_and(|reason| reason.contains("injected usage fence failure"))
);
}
}
}
+15 -2
View File
@@ -710,6 +710,10 @@ pub struct FolderScanner {
coverage_frontier: Option<String>,
resume_frontier: Option<String>,
coverage_gap: bool,
pending_heal_sync_deferred: bool,
pending_heal_batch_dirty: bool,
#[cfg(test)]
pending_heal_sync_count: usize,
pending_size_reconciliation_keys: HashSet<String>,
pending_size_reconciliation_scopes: HashSet<String>,
pending_size_reconciliation_truncated: bool,
@@ -1080,7 +1084,7 @@ impl FolderScanner {
scan_mode,
result,
);
if result.is_admitted() {
if result.is_admitted() || matches!(priority, HealChannelPriority::Low) {
return Ok(result);
}
@@ -1828,7 +1832,12 @@ impl FolderScanner {
}
}
FolderScanSource::Existing => {
if !forward_sweep && !into.compacted && self.old_cache.is_compacted(&h) {
// Usage sampling is not proof that a Deep check ran.
if self.scan_mode != HealScanMode::Deep
&& !forward_sweep
&& !into.compacted
&& self.old_cache.is_compacted(&h)
{
let next_cycle = self.old_cache.info.next_cycle as u32;
if !h.mod_(next_cycle, data_usage_update_dir_cycles()) {
// Transfer and add as child...
@@ -2435,6 +2444,10 @@ pub async fn scan_data_folder(
coverage_frontier: resume_frontier.clone(),
resume_frontier,
coverage_gap: false,
pending_heal_sync_deferred: false,
pending_heal_batch_dirty: false,
#[cfg(test)]
pending_heal_sync_count: 0,
pending_size_reconciliation_keys: HashSet::new(),
pending_size_reconciliation_scopes: HashSet::new(),
pending_size_reconciliation_truncated: false,
+135 -83
View File
@@ -11,13 +11,58 @@
// WITHOUT WARRANTIES OR CONDITIONS OF ANY KIND, either express or implied.
// See the License for the specific language governing permissions and
// limitations under the License.
/// The pending-scanner-heal ledger: durable heal intents recorded during scans and retried after MRF consumption.
/// Persisted best-effort retry hints. Existing TTL/count pruning applies only
/// to this hint cache, never to a committed durable repair obligation.
use super::*;
const PENDING_HEAL_RETRY_BASE_SECS: u64 = 15 * 60;
const PENDING_HEAL_RETRY_CAP_SECS: u64 = 6 * 60 * 60;
pub(super) struct PendingHealSyncBatch<'a> {
pub(super) scanner: &'a mut FolderScanner,
}
impl<'a> PendingHealSyncBatch<'a> {
pub(super) fn new(scanner: &'a mut FolderScanner) -> Self {
scanner.pending_heal_sync_deferred = true;
scanner.pending_heal_batch_dirty = false;
Self { scanner }
}
}
impl Drop for PendingHealSyncBatch<'_> {
fn drop(&mut self) {
self.scanner.pending_heal_sync_deferred = false;
if self.scanner.pending_heal_batch_dirty {
self.scanner.pending_heal_batch_dirty = false;
self.scanner.sync_pending_heals();
}
}
}
pub(super) fn record_pending_heal_attempt(entry: &mut PendingScannerHeal, now: u64) {
entry.last_attempt = now;
entry.attempts = entry.attempts.saturating_add(1);
}
pub(super) fn observe_pending_heal_admission(entry: &mut PendingScannerHeal, result: HealAdmissionResult) {
// Rediscovery and coalesced admissions must not postpone an armed retry.
entry.last_admission_result = result.result_label().to_string();
entry.last_admission_reason = result.reason_label().to_string();
}
impl FolderScanner {
pub(super) fn sync_pending_heals(&mut self) {
self.update_cache.info.pending_heals = self.new_cache.info.pending_heals.clone();
self.pending_heals_changed = true;
if self.pending_heal_sync_deferred {
self.pending_heal_batch_dirty = true;
return;
}
self.update_cache.info.pending_heals = self.new_cache.info.pending_heals.clone();
#[cfg(test)]
{
self.pending_heal_sync_count += 1;
}
}
pub(super) fn clear_pending_scanner_heal(
@@ -37,32 +82,6 @@ impl FolderScanner {
}
}
/// Batched variant of [`Self::clear_pending_scanner_heal`] for repaired
/// notices (backlog#1894 axis B): one retain pass and one ledger sync
/// for the whole notice set, so a mass-recovery first sweep cannot turn
/// into thousands of full-table clones on the scan task. Only Object
/// entries match — bucket-level heals are never the MRF consumer's work.
pub(super) fn clear_pending_scanner_heals_for_repaired(&mut self, events: &[rustfs_common::mrf_channel::MrfRepairedEvent]) {
// Pre-resolve the notice version strings once; each ledger entry then
// compares against plain Option<&str>.
let targets: Vec<(&str, &str, Option<String>)> = events
.iter()
.map(|event| (event.bucket.as_ref(), event.object.as_ref(), mrf_repaired_version_id(event.version_id)))
.collect();
let before = self.new_cache.info.pending_heals.len();
self.new_cache.info.pending_heals.retain(|entry| {
entry.kind != PendingScannerHealKind::Object
|| !targets.iter().any(|(bucket, object, version)| {
entry.bucket.as_str() == *bucket
&& entry.object.as_deref() == Some(*object)
&& entry.version_id.as_deref() == version.as_deref()
})
});
if self.new_cache.info.pending_heals.len() != before {
self.sync_pending_heals();
}
}
pub(super) fn record_pending_scanner_heal(
&mut self,
kind: PendingScannerHealKind,
@@ -80,10 +99,7 @@ impl FolderScanner {
.iter_mut()
.find(|entry| pending_scanner_heal_matches(entry, kind, bucket, object, version_id))
{
entry.last_attempt = now;
entry.attempts = entry.attempts.saturating_add(1);
entry.last_admission_result = result.result_label().to_string();
entry.last_admission_reason = result.reason_label().to_string();
observe_pending_heal_admission(entry, result);
self.sync_pending_heals();
return;
}
@@ -198,47 +214,54 @@ impl FolderScanner {
result: HealAdmissionResult,
) {
match result {
HealAdmissionResult::Accepted | HealAdmissionResult::Merged => {
self.clear_pending_scanner_heal(kind, bucket, object, version_id);
}
HealAdmissionResult::Full | HealAdmissionResult::Dropped(HealAdmissionDropReason::QueueFull) => {
self.record_pending_scanner_heal(kind, bucket, object, version_id, scan_mode, result);
}
HealAdmissionResult::Dropped(HealAdmissionDropReason::PolicyDropped) => {
self.clear_pending_scanner_heal(kind, bucket, object, version_id);
}
// Admin-only overlap rejections (HS-06); the scanner never sees
// them, but if it ever does, treat them as terminal like any
// other policy drop rather than endlessly retrying.
HealAdmissionResult::Dropped(HealAdmissionDropReason::AlreadyRunning)
HealAdmissionResult::Accepted
| HealAdmissionResult::Merged
| HealAdmissionResult::Dropped(HealAdmissionDropReason::PolicyDropped)
| HealAdmissionResult::Dropped(HealAdmissionDropReason::AlreadyRunning)
| HealAdmissionResult::Dropped(HealAdmissionDropReason::OverlappingPaths) => {
self.clear_pending_scanner_heal(kind, bucket, object, version_id);
// Admission is neither repair completion nor a durable
// successor receipt. Preserve existing responsibility without
// turning every newly admitted hint into a persisted intent.
if let Some(entry) = self
.new_cache
.info
.pending_heals
.iter_mut()
.find(|entry| pending_scanner_heal_matches(entry, kind, bucket, object, version_id))
{
observe_pending_heal_admission(entry, result);
self.sync_pending_heals();
}
}
}
}
pub(super) async fn retry_pending_scanner_heals(&mut self) -> Result<(), ScannerError> {
if !self.should_heal().await {
let batch = PendingHealSyncBatch::new(self);
let scanner = &mut *batch.scanner;
if !scanner.should_heal().await {
return Ok(());
}
let bucket = self.new_cache.info.name.clone();
// Backlog#1894 axis B: repairs the MRF consumer landed hand the
// manager the heal task, so the matching pending-ledger entries are
// retried nowhere — drop them here. Best-effort: a lost notice just
// leaves the entry to expire through its own attempts/age limits.
let bucket = scanner.new_cache.info.name.clone();
// Legacy notices cannot bind a verified disposition to the current
// incarnation, kind, set scope and responsibility generation.
let repaired = rustfs_common::mrf_channel::take_mrf_repaired_events_for(&bucket);
if !repaired.is_empty() {
self.clear_pending_scanner_heals_for_repaired(&repaired);
counter!("rustfs_scanner_unverified_repair_notices_total")
.increment(u64::try_from(repaired.len()).unwrap_or(u64::MAX));
}
self.prune_pending_scanner_heals();
for pending in pending_scanner_heal_retry_candidates(&self.new_cache.info.pending_heals, &bucket) {
if !self.should_heal().await {
scanner.prune_pending_scanner_heals();
for pending in pending_scanner_heal_retry_candidates(&scanner.new_cache.info.pending_heals, &bucket) {
if !scanner.should_heal().await {
break;
}
let Some(request) = build_pending_scanner_heal_request(&pending) else {
self.clear_pending_scanner_heal(pending.kind, &pending.bucket, None, pending.version_id.as_deref());
scanner.clear_pending_scanner_heal(pending.kind, &pending.bucket, None, pending.version_id.as_deref());
counter!(
METRIC_SCANNER_PENDING_HEAL_MALFORMED_TOTAL,
"bucket" => pending.bucket.clone(),
@@ -257,14 +280,27 @@ impl FolderScanner {
continue;
};
self.send_required_scanner_heal_request(
pending.kind,
pending.bucket.clone(),
pending.object.clone(),
pending.version_id.clone(),
request,
)
.await?;
if let Some(entry) = scanner.new_cache.info.pending_heals.iter_mut().find(|entry| {
pending_scanner_heal_matches(
entry,
pending.kind,
&pending.bucket,
pending.object.as_deref(),
pending.version_id.as_deref(),
)
}) {
record_pending_heal_attempt(entry, Self::now_secs());
scanner.sync_pending_heals();
}
scanner
.send_required_scanner_heal_request(
pending.kind,
pending.bucket.clone(),
pending.object.clone(),
pending.version_id.clone(),
request,
)
.await?;
}
Ok(())
@@ -295,16 +331,6 @@ pub(super) fn pending_scanner_heal_identity(entry: &PendingScannerHeal) -> (u8,
(kind, entry.bucket.as_str(), entry.object.as_deref(), entry.version_id.as_deref())
}
/// Decode an MRF repaired-notice version id for ledger matching. A nil UUID
/// means "no value" per the repo-wide defensive-UUID invariant, so it maps
/// to `None` and matches unversioned ledger entries only.
pub(super) fn mrf_repaired_version_id(version_id: Option<[u8; 16]>) -> Option<String> {
version_id
.map(uuid::Uuid::from_bytes)
.filter(|uuid| !uuid.is_nil())
.map(|uuid| uuid.to_string())
}
pub(super) fn sort_pending_scanner_heals_for_retry(entries: &mut [PendingScannerHeal]) {
entries.sort_by(|a, b| {
a.last_attempt
@@ -318,30 +344,56 @@ pub(super) fn pending_scanner_heal_retry_candidates(
pending_heals: &[PendingScannerHeal],
bucket: &str,
) -> Vec<PendingScannerHeal> {
let mut entries: Vec<PendingScannerHeal> = pending_heals.iter().filter(|entry| entry.bucket == bucket).cloned().collect();
sort_pending_scanner_heals_for_retry(&mut entries);
pending_scanner_heal_retry_candidates_at(pending_heals, bucket, FolderScanner::now_secs())
}
pub(super) fn pending_scanner_heal_retry_candidates_at(
pending_heals: &[PendingScannerHeal],
bucket: &str,
now: u64,
) -> Vec<PendingScannerHeal> {
// Schedule across scanner cycles rather than allocating a timer per hint.
// A later Full response must not reset an already retried hint's backoff.
let mut entries: Vec<&PendingScannerHeal> = pending_heals
.iter()
.filter(|entry| {
let exponent = entry.attempts.saturating_sub(1).min(31);
let delay = PENDING_HEAL_RETRY_BASE_SECS
.saturating_mul(1_u64 << exponent)
.min(PENDING_HEAL_RETRY_CAP_SECS);
entry.bucket == bucket && now.checked_sub(entry.last_attempt).is_some_and(|age| age >= delay)
})
.collect();
entries.sort_by(|a, b| {
a.last_attempt
.cmp(&b.last_attempt)
.then_with(|| a.attempts.cmp(&b.attempts))
.then_with(|| pending_scanner_heal_identity(a).cmp(&pending_scanner_heal_identity(b)))
});
entries.truncate(MAX_PENDING_SCANNER_HEAL_RETRIES_PER_BUCKET);
entries
entries.into_iter().cloned().collect()
}
pub(super) fn build_pending_scanner_heal_request(entry: &PendingScannerHeal) -> Option<HealChannelRequest> {
let priority = if entry.last_admission_result == "full"
|| (entry.last_admission_result == "dropped" && entry.last_admission_reason == "queue_full")
{
HealChannelPriority::High
} else {
HealChannelPriority::Low
};
match entry.kind {
PendingScannerHealKind::Bucket => Some(build_bucket_heal_request(entry.bucket.clone(), HealChannelPriority::High)),
PendingScannerHealKind::Bucket => Some(build_bucket_heal_request(entry.bucket.clone(), priority)),
PendingScannerHealKind::Object => entry.object.as_ref().map(|object| {
if entry.version_id.is_none() {
build_non_destructive_object_heal_request(
entry.bucket.clone(),
object.clone(),
entry.scan_mode,
HealChannelPriority::High,
)
build_non_destructive_object_heal_request(entry.bucket.clone(), object.clone(), entry.scan_mode, priority)
} else {
build_object_heal_request(
entry.bucket.clone(),
object.clone(),
entry.version_id.clone(),
entry.scan_mode,
HealChannelPriority::High,
priority,
)
}
}),
+19 -28
View File
@@ -15,6 +15,8 @@
use crate::SCANNER_SLEEPER;
use super::*;
mod mrf_ownership;
use crate::storage_api::VersionPurgeStatusType;
use crate::{DiskOption, Endpoint, STORAGE_FORMAT_FILE, TierStats, new_disk, storageclass};
use rustfs_filemeta::{FileInfo, FileMeta, MetadataResolutionParams};
@@ -350,6 +352,9 @@ async fn build_test_scanner() -> (FolderScanner, std::path::PathBuf) {
coverage_frontier: None,
resume_frontier: None,
coverage_gap: false,
pending_heal_sync_deferred: false,
pending_heal_batch_dirty: false,
pending_heal_sync_count: 0,
pending_size_reconciliation_keys: HashSet::new(),
pending_size_reconciliation_scopes: HashSet::new(),
pending_size_reconciliation_truncated: false,
@@ -1132,23 +1137,8 @@ fn pending_heal(
}
}
/// The nil-UUID branch of the defensive-UUID invariant: a nil version in
/// a repaired notice means "no value" and must match unversioned ledger
/// entries only.
#[test]
fn test_mrf_repaired_version_id_maps_nil_to_none() {
assert_eq!(mrf_repaired_version_id(None), None);
assert_eq!(mrf_repaired_version_id(Some([0u8; 16])), None);
let uuid = Uuid::new_v4();
assert_eq!(mrf_repaired_version_id(Some(*uuid.as_bytes())), Some(uuid.to_string()));
}
/// Full wiring of backlog#1894 axis B: notes taken for the scanned bucket
/// clear exactly the matching Object ledger entries — bucket-level
/// entries, other buckets' entries, and version-mismatched entries
/// survive; a real (non-nil) version matches only the same version.
#[tokio::test]
async fn test_mrf_repaired_notices_clear_matching_ledger_entries() {
async fn mrf_ownership_legacy_notices_preserve_pending_entries() {
use rustfs_common::mrf_channel::note_mrf_repaired;
let (mut scanner, temp_dir) = build_test_scanner().await;
@@ -1176,8 +1166,7 @@ async fn test_mrf_repaired_notices_clear_matching_ledger_entries() {
note_mrf_repaired("bucket", "object-a", None);
note_mrf_repaired("bucket", "object-b", Some(*Uuid::parse_str(&version).unwrap().as_bytes()));
// A nil-UUID notice for object-c means "no value": it clears the
// unversioned entry but must not touch the versioned one.
// Neither nil nor a matching version proves incarnation, scope or owner.
note_mrf_repaired("bucket", "object-c", Some([0u8; 16]));
// A notice for a target the ledger does not track must be a no-op.
note_mrf_repaired("bucket", "object-untracked", None);
@@ -1194,12 +1183,12 @@ async fn test_mrf_repaired_notices_clear_matching_ledger_entries() {
.iter()
.map(|entry| (entry.kind, entry.bucket.as_str(), entry.object.as_deref(), entry.version_id.as_deref()))
.collect();
// Cleared: object-a (no version), object-b (exact version match), and
// object-c's unversioned entry (the nil branch matched no-version
// only — the versioned object-c entry survives).
assert_eq!(
survivors,
vec![
(PendingScannerHealKind::Object, "bucket", Some("object-a"), None),
(PendingScannerHealKind::Object, "bucket", Some("object-b"), Some(version.as_str())),
(PendingScannerHealKind::Object, "bucket", Some("object-c"), None),
(
PendingScannerHealKind::Object,
"bucket",
@@ -1338,7 +1327,7 @@ async fn test_pending_heal_update_keeps_stale_entry_until_retry_prune() {
);
assert_eq!(scanner.new_cache.info.pending_heals.len(), 1);
assert_eq!(scanner.new_cache.info.pending_heals[0].attempts, 2);
assert_eq!(scanner.new_cache.info.pending_heals[0].attempts, 1);
assert_eq!(scanner.new_cache.info.pending_heals[0].object.as_deref(), Some("object"));
assert_eq!(scanner.update_cache.info.pending_heals, scanner.new_cache.info.pending_heals);
}
@@ -1371,7 +1360,7 @@ async fn test_pending_heal_queue_full_deduplicates_object_entry() {
let pending = &scanner.new_cache.info.pending_heals[0];
assert_eq!(pending.object.as_deref(), Some("object"));
assert_eq!(pending.version_id.as_deref(), Some("version-a"));
assert_eq!(pending.attempts, 2);
assert_eq!(pending.attempts, 1);
assert_eq!(pending.last_admission_result, "dropped");
assert_eq!(pending.last_admission_reason, "queue_full");
assert_eq!(scanner.update_cache.info.pending_heals, scanner.new_cache.info.pending_heals);
@@ -1379,7 +1368,7 @@ async fn test_pending_heal_queue_full_deduplicates_object_entry() {
}
#[tokio::test]
async fn test_pending_heal_admitted_results_clear_matching_entry() {
async fn mrf_ownership_admission_preserves_existing_pending() {
let (mut scanner, temp_dir) = build_test_scanner().await;
let _guard = TestGuard::new(u64::MAX, usize::MAX, &mut scanner, temp_dir);
@@ -1400,7 +1389,8 @@ async fn test_pending_heal_admitted_results_clear_matching_entry() {
HealAdmissionResult::Accepted,
);
assert!(scanner.new_cache.info.pending_heals.is_empty());
assert_eq!(scanner.new_cache.info.pending_heals.len(), 1);
assert_eq!(scanner.new_cache.info.pending_heals[0].last_admission_result, "accepted");
scanner.update_pending_scanner_heal_after_admission(
PendingScannerHealKind::Bucket,
@@ -1419,11 +1409,12 @@ async fn test_pending_heal_admitted_results_clear_matching_entry() {
HealAdmissionResult::Merged,
);
assert!(scanner.new_cache.info.pending_heals.is_empty());
assert_eq!(scanner.new_cache.info.pending_heals.len(), 2);
assert_eq!(scanner.new_cache.info.pending_heals[1].last_admission_result, "merged");
}
#[tokio::test]
async fn test_pending_heal_policy_dropped_clears_without_creating_entry() {
async fn mrf_ownership_policy_drop_does_not_discharge_existing_pending() {
let (mut scanner, temp_dir) = build_test_scanner().await;
let _guard = TestGuard::new(u64::MAX, usize::MAX, &mut scanner, temp_dir);
@@ -1454,7 +1445,7 @@ async fn test_pending_heal_policy_dropped_clears_without_creating_entry() {
HealAdmissionResult::Dropped(HealAdmissionDropReason::PolicyDropped),
);
assert!(scanner.new_cache.info.pending_heals.is_empty());
assert_eq!(scanner.new_cache.info.pending_heals.len(), 1);
}
#[test]
@@ -20,6 +20,7 @@ use crate::{DataUsageCacheSource, DataUsageScanPlanDigest};
use std::io::Cursor;
use tokio::io::AsyncReadExt;
mod deep_compacted;
mod segment_observation;
const CACHE_NAME: &str = "bucket/checkpoint-fixture.bin";
@@ -0,0 +1,204 @@
// Copyright 2026 RustFS Team
// Licensed under the Apache License, Version 2.0.
use super::*;
const PREFIX: &str = "bucket/prefix";
const OBJECTS: u64 = 4;
struct CompactedFixture {
disk: Arc<Disk>,
root: std::path::PathBuf,
cache: DataUsageCache,
identity: crate::DataUsageScanIdentity,
store: Arc<FixtureStore>,
_cleanup: TestGuard,
}
async fn scan(
disk: &Arc<Disk>,
cache: DataUsageCache,
mode: HealScanMode,
max_objects: u64,
) -> (ScannerDiskScanOutcome, Arc<ScannerCycleBudget>) {
let budget = ScannerCycleBudget::new_with_progress_tracking(
&CancellationToken::new(),
ScannerCycleBudgetConfig {
max_objects: Some(max_objects),
..Default::default()
},
);
let outcome = disk
.clone()
.nsscanner_disk(budget.token(), budget.clone(), vec![disk.clone()], cache, None, mode)
.await
.expect("bounded real disk scan");
(outcome, budget)
}
async fn save_reload(store: &Arc<FixtureStore>, cache: &DataUsageCache) -> DataUsageCache {
let revisions = DataUsageCache::default()
.load_with_revisions(store.clone(), CACHE_NAME)
.await
.expect("fixture save revisions");
cache
.save_with_revisions_for_epoch(store.clone(), CACHE_NAME, &revisions, 0)
.await
.expect("save compacted checkpoint through real codec and revision checks");
let loaded = store.strict_load().await;
assert_eq!(loaded.info.snapshot_complete, cache.info.snapshot_complete);
assert_eq!(loaded.info.scan_checkpoint, cache.info.scan_checkpoint);
assert_eq!(loaded.info.scan_identity, cache.info.scan_identity);
assert_eq!(loaded.info.scan_plan_digest, cache.info.scan_plan_digest);
assert_eq!(
loaded.checked_flatten("bucket").expect("reloaded root").size,
cache.checked_flatten("bucket").expect("returned root").size
);
loaded
}
impl CompactedFixture {
async fn new(mode: HealScanMode) -> Self {
let (scanner, root) = build_test_scanner().await;
let cleanup = TestGuard {
temp_dir: Some(root.clone()),
};
for index in 0..OBJECTS {
write_checkpoint_object(&root, &format!("prefix/{index:04}"), &[(None, 1)]).await;
}
let identity = crate::DataUsageScanIdentity {
scan_mode: mode,
tier_registry_generation: crate::runtime_tier_registry_for_cycle(11, 7).await.generation,
..bound_checkpoint().1
};
let mut cache = DataUsageCache::default();
// The first real scan builds coverage; the second same-plan scan takes
// the normal compaction path. No synthetic compacted cache is injected.
for cycle in [11, 12] {
cache.prepare_bucket_checkpoint("bucket", cycle, 7, SOURCE, PLAN, identity);
cache.info.skip_healing = true;
let (outcome, budget) = scan(&scanner.local_disk, cache, mode, OBJECTS + 1).await;
let ScannerDiskScanOutcome::Complete(completed) = outcome else {
panic!("fixture baseline must complete")
};
assert_eq!(budget.progress().0, OBJECTS, "baseline must read every metadata object");
cache = completed;
}
let store = FixtureStore::new();
cache = save_reload(&store, &cache).await;
assert!(cache.find(PREFIX).expect("baseline prefix").compacted);
assert_eq!(cache.checked_flatten("bucket").expect("complete baseline").size, 4);
assert!(cache.info.scan_progress.is_none());
Self {
disk: scanner.local_disk,
root,
cache,
identity,
store,
_cleanup: cleanup,
}
}
fn next_cycle(&self, sampled: bool) -> u64 {
let first = self.cache.info.next_cycle + 1;
(first..first + 16)
.find(|cycle| hash_path(PREFIX).mod_(u32::try_from(*cycle).expect("bounded cycle"), 16) == sampled)
.expect("one selected cycle and non-selected cycles exist within the fixed rotation")
}
fn prepare(&mut self, cycle: u64) {
let state = crate::scanner_io::current_cache_root_or_prepare_with_generation(
&mut self.cache,
"bucket",
SOURCE,
cycle,
7,
PLAN,
crate::scanner_io::DataUsageCacheReuseOptions {
checkpoint_identity: Some(self.identity),
..Default::default()
},
);
assert!(matches!(state, crate::scanner_io::DataUsageCacheScanState::Prepared { .. }));
assert_eq!(self.cache.info.scan_identity, Some(self.identity));
assert_eq!(self.cache.info.scan_plan_digest, Some(PLAN));
assert!(
self.cache.info.scan_progress.is_none(),
"same-strength complete baseline uses the existing tree"
);
assert!(self.cache.find(PREFIX).expect("prepared prefix").compacted);
}
async fn change_metadata_without_activity_event(&self) {
// This models a local metadata change not announced by a segment
// producer. Deep traversal must not depend on a usage-clean signal.
// Healing is disabled: the oracle proves metadata re-entry, not repair.
write_checkpoint_object(&self.root, "prefix/0000", &[(None, 7)]).await;
}
}
#[tokio::test]
#[serial]
async fn deep_compacted_same_plan_rechecks_unsampled_prefix() {
temp_env::async_with_vars([(ENV_DATA_USAGE_UPDATE_DIR_CYCLES, Some("16"))], async {
let mut fixture = CompactedFixture::new(HealScanMode::Deep).await;
fixture.change_metadata_without_activity_event().await;
fixture.prepare(fixture.next_cycle(false));
let (outcome, budget) = scan(&fixture.disk, fixture.cache.clone(), HealScanMode::Deep, OBJECTS + 1).await;
assert_eq!(
budget.progress().0,
OBJECTS,
"Deep must inspect compacted children even outside the usage sample cycle"
);
let ScannerDiskScanOutcome::Complete(cache) = outcome else {
panic!("bounded Deep scan must complete")
};
let loaded = save_reload(&fixture.store, &cache).await;
let root = loaded.checked_flatten("bucket").expect("Deep scan root");
assert_eq!((root.objects, root.size), (4, 10), "Deep must observe the changed metadata");
})
.await;
}
#[tokio::test]
#[serial]
async fn deep_compacted_normal_scan_preserves_periodic_sampling() {
temp_env::async_with_vars([(ENV_DATA_USAGE_UPDATE_DIR_CYCLES, Some("16"))], async {
let mut fixture = CompactedFixture::new(HealScanMode::Normal).await;
fixture.change_metadata_without_activity_event().await;
fixture.prepare(fixture.next_cycle(false));
let (outcome, budget) = scan(&fixture.disk, fixture.cache.clone(), HealScanMode::Normal, OBJECTS + 1).await;
assert_eq!(budget.progress().0, 0, "Normal retains its existing unsampled-subtree policy");
let ScannerDiskScanOutcome::Complete(cache) = outcome else { panic!("normal sampling completes") };
assert_eq!(cache.checked_flatten("bucket").expect("sampled root").size, 4);
fixture.cache = save_reload(&fixture.store, &cache).await;
fixture.prepare(fixture.next_cycle(true));
let (outcome, budget) = scan(&fixture.disk, fixture.cache.clone(), HealScanMode::Normal, OBJECTS + 1).await;
assert_eq!(budget.progress().0, OBJECTS);
let ScannerDiskScanOutcome::Complete(cache) = outcome else {
panic!("selected Normal rotation completes")
};
assert_eq!(cache.checked_flatten("bucket").expect("refreshed root").size, 10);
})
.await;
}
#[tokio::test]
#[serial]
async fn deep_compacted_budget_preserves_partial_checkpoint() {
temp_env::async_with_vars([(ENV_DATA_USAGE_UPDATE_DIR_CYCLES, Some("16"))], async {
let mut fixture = CompactedFixture::new(HealScanMode::Deep).await;
fixture.prepare(fixture.next_cycle(false));
let (outcome, budget) = scan(&fixture.disk, fixture.cache.clone(), HealScanMode::Deep, 2).await;
assert_eq!(budget.progress().0, 2);
assert_eq!(budget.reason(), Some(ScannerCycleBudgetReason::Objects));
let ScannerDiskScanOutcome::Partial(cache) = outcome else {
panic!("Deep must retain budget interruption as partial")
};
assert!(!cache.info.snapshot_complete);
let loaded = save_reload(&fixture.store, &cache).await;
assert!(!loaded.info.snapshot_complete);
assert!(loaded.checked_flatten("bucket").expect("partial root").objects > 0);
})
.await;
}
@@ -0,0 +1,410 @@
// Copyright 2026 RustFS Team
//
// Licensed under the Apache License, Version 2.0 (the "License");
// you may not use this file except in compliance with the License.
// You may obtain a copy of the License at
//
// http://www.apache.org/licenses/LICENSE-2.0
//
// Unless required by applicable law or agreed to in writing, software
// distributed under the License is distributed on an "AS IS" BASIS,
// WITHOUT WARRANTIES OR CONDITIONS OF ANY KIND, either express or implied.
// See the License for the specific language governing permissions and
// limitations under the License.
use super::*;
use crate::storage_api::EcstoreHealResultItem as HealItem;
use crate::storage_api::scanner_io::BucketInfo;
use rustfs_common::mrf_channel::{
MrfIngressResult, MrfKind, MrfScope, note_mrf_repaired, take_mrf_repaired_events_for, try_send_mrf_intent_typed,
};
use rustfs_heal::heal::{
manager::{HealConfig, HealManager},
mrf_queue::spawn_mrf_consumer,
storage::{HealListItem, HealObjectInfo, HealStorageAPI},
};
use rustfs_heal_contracts::heal_channel::HealOpts;
#[tokio::test]
async fn mrf_ownership_admission_observation_does_not_postpone_retry() {
let (mut scanner, temp_dir) = build_test_scanner().await;
let _guard = TestGuard::new(u64::MAX, usize::MAX, &mut scanner, temp_dir);
scanner.new_cache.info.pending_heals.push(pending_heal(
PendingScannerHealKind::Object,
"bucket",
Some("object"),
None,
100,
2,
));
for result in [
HealAdmissionResult::Accepted,
HealAdmissionResult::Merged,
HealAdmissionResult::Full,
HealAdmissionResult::Dropped(HealAdmissionDropReason::QueueFull),
HealAdmissionResult::Dropped(HealAdmissionDropReason::PolicyDropped),
] {
scanner.update_pending_scanner_heal_after_admission(
PendingScannerHealKind::Object,
"bucket",
Some("object"),
None,
HealScanMode::Deep,
result,
);
let entry = &scanner.new_cache.info.pending_heals[0];
assert_eq!((entry.last_attempt, entry.attempts), (100, 2));
assert!(pending_scanner_heal_retry_candidates_at(&scanner.new_cache.info.pending_heals, "bucket", 1899).is_empty());
assert_eq!(
pending_scanner_heal_retry_candidates_at(&scanner.new_cache.info.pending_heals, "bucket", 1900).len(),
1
);
}
scanner.update_pending_scanner_heal_after_admission(
PendingScannerHealKind::Object,
"bucket",
Some("new-object"),
None,
HealScanMode::Deep,
HealAdmissionResult::Accepted,
);
assert_eq!(
scanner.new_cache.info.pending_heals.len(),
1,
"successful admission does not create a new ledger"
);
}
#[test]
fn mrf_ownership_retry_due_boundaries_and_priority_are_bounded() {
let mut entry = pending_heal(PendingScannerHealKind::Object, "bucket", Some("object"), None, 100, 1);
entry.last_admission_result = "accepted".to_string();
assert!(pending_scanner_heal_retry_candidates_at(std::slice::from_ref(&entry), "bucket", 999).is_empty());
assert_eq!(
pending_scanner_heal_retry_candidates_at(std::slice::from_ref(&entry), "bucket", 1000).len(),
1
);
assert_eq!(
build_pending_scanner_heal_request(&entry).expect("request").priority,
HealChannelPriority::Low
);
record_pending_heal_attempt(&mut entry, 1000);
observe_pending_heal_admission(&mut entry, HealAdmissionResult::Full);
assert!(pending_scanner_heal_retry_candidates_at(std::slice::from_ref(&entry), "bucket", 2799).is_empty());
assert_eq!(
pending_scanner_heal_retry_candidates_at(std::slice::from_ref(&entry), "bucket", 2800).len(),
1
);
assert_eq!(
build_pending_scanner_heal_request(&entry).expect("request").priority,
HealChannelPriority::High
);
entry.attempts = u32::MAX;
assert!(pending_scanner_heal_retry_candidates_at(std::slice::from_ref(&entry), "bucket", 22599).is_empty());
assert_eq!(
pending_scanner_heal_retry_candidates_at(std::slice::from_ref(&entry), "bucket", 22600).len(),
1
);
entry.last_attempt = u64::MAX;
assert!(pending_scanner_heal_retry_candidates_at(&[entry], "bucket", 22600).is_empty());
}
#[tokio::test]
async fn mrf_ownership_full_hint_table_has_bounded_multicycle_work_and_sync() {
let (mut scanner, temp_dir) = build_test_scanner().await;
let _guard = TestGuard::new(u64::MAX, usize::MAX, &mut scanner, temp_dir);
let base = 1_700_000_000;
scanner.new_cache.info.pending_heals = (0..MAX_PENDING_SCANNER_HEALS_PER_BUCKET)
.map(|index| {
let mut entry =
pending_heal(PendingScannerHealKind::Object, "bucket", Some(&format!("object-{index}")), None, base, 1);
entry.first_seen = base;
entry.last_admission_result = "accepted".to_string();
entry
})
.collect();
let indices: HashMap<String, usize> = scanner
.new_cache
.info
.pending_heals
.iter()
.enumerate()
.map(|(index, entry)| (entry.object.clone().expect("object identity"), index))
.collect();
scanner.sync_pending_heals();
let initial_syncs = scanner.pending_heal_sync_count;
let mut requests = 0usize;
let mut nonempty_batches = 0;
for minute in 0..24 * 60 {
let now = base + minute * 60;
let candidates = pending_scanner_heal_retry_candidates_at(&scanner.new_cache.info.pending_heals, "bucket", now);
assert!(candidates.len() <= MAX_PENDING_SCANNER_HEAL_RETRIES_PER_BUCKET);
if candidates.is_empty() {
continue;
}
nonempty_batches += 1;
let before = scanner.pending_heal_sync_count;
{
let batch = PendingHealSyncBatch::new(&mut scanner);
for candidate in candidates {
assert_eq!(
build_pending_scanner_heal_request(&candidate)
.expect("retry request")
.priority,
HealChannelPriority::Low
);
let index = indices[candidate.object.as_ref().expect("object identity")];
record_pending_heal_attempt(&mut batch.scanner.new_cache.info.pending_heals[index], now);
observe_pending_heal_admission(
&mut batch.scanner.new_cache.info.pending_heals[index],
HealAdmissionResult::Accepted,
);
batch.scanner.sync_pending_heals();
requests += 1;
}
}
assert_eq!(scanner.pending_heal_sync_count, before + 1, "one table clone per changed retry batch");
assert_eq!(scanner.new_cache.info.pending_heals.len(), MAX_PENDING_SCANNER_HEALS_PER_BUCKET);
}
assert!(requests >= MAX_PENDING_SCANNER_HEALS_PER_BUCKET, "every retained hint receives a retry");
assert!(
requests <= 7 * MAX_PENDING_SCANNER_HEALS_PER_BUCKET,
"15min..6h backoff bounds repeated work within 24h"
);
assert!(scanner.new_cache.info.pending_heals.iter().all(|entry| entry.attempts >= 2));
assert_eq!(scanner.pending_heal_sync_count - initial_syncs, nonempty_batches);
assert_eq!(scanner.update_cache.info.pending_heals, scanner.new_cache.info.pending_heals);
}
#[tokio::test]
async fn mrf_ownership_cancelled_batch_restores_sync_without_per_item_clones() {
let (mut scanner, temp_dir) = build_test_scanner().await;
let _guard = TestGuard::new(u64::MAX, usize::MAX, &mut scanner, temp_dir);
scanner
.new_cache
.info
.pending_heals
.push(pending_heal(PendingScannerHealKind::Object, "bucket", Some("object"), None, 1, 1));
let before = scanner.pending_heal_sync_count;
let mut work = Box::pin(async {
let batch = PendingHealSyncBatch::new(&mut scanner);
record_pending_heal_attempt(&mut batch.scanner.new_cache.info.pending_heals[0], 100);
batch.scanner.sync_pending_heals();
batch.scanner.sync_pending_heals();
std::future::pending::<()>().await;
});
assert!(futures::poll!(&mut work).is_pending());
drop(work);
assert!(!scanner.pending_heal_sync_deferred);
assert!(!scanner.pending_heal_batch_dirty);
assert_eq!(scanner.pending_heal_sync_count, before + 1);
assert_eq!(scanner.new_cache.info.pending_heals[0].attempts, 2);
assert!(pending_scanner_heal_retry_candidates_at(&scanner.new_cache.info.pending_heals, "bucket", 101).is_empty());
assert_eq!(scanner.update_cache.info.pending_heals, scanner.new_cache.info.pending_heals);
let result: std::result::Result<(), &'static str> = async {
let batch = PendingHealSyncBatch::new(&mut scanner);
record_pending_heal_attempt(&mut batch.scanner.new_cache.info.pending_heals[0], 200);
observe_pending_heal_admission(&mut batch.scanner.new_cache.info.pending_heals[0], HealAdmissionResult::Merged);
batch.scanner.sync_pending_heals();
Err("injected retry batch failure")
}
.await;
assert!(result.is_err());
assert_eq!(scanner.pending_heal_sync_count, before + 2);
assert!(!scanner.pending_heal_sync_deferred);
assert_eq!(scanner.update_cache.info.pending_heals, scanner.new_cache.info.pending_heals);
}
#[derive(Default)]
struct NoticeStorage {
calls: std::sync::Mutex<HashMap<String, u32>>,
retry_started: tokio::sync::Notify,
}
#[async_trait::async_trait]
impl HealStorageAPI for NoticeStorage {
async fn get_object_meta(&self, _: &str, _: &str) -> rustfs_heal::Result<Option<HealObjectInfo>> {
Ok(None)
}
async fn ec_decode_rebuild(&self, _: &str, _: &str) -> rustfs_heal::Result<Vec<u8>> {
Err(rustfs_heal::Error::other("unused decode fixture"))
}
async fn get_bucket_info(&self, bucket: &str) -> rustfs_heal::Result<Option<BucketInfo>> {
Ok(Some(BucketInfo {
name: bucket.to_string(),
..Default::default()
}))
}
async fn list_buckets(&self) -> rustfs_heal::Result<Vec<BucketInfo>> {
Ok(Vec::new())
}
async fn object_exists(&self, _: &str, _: &str) -> rustfs_heal::Result<bool> {
Ok(true)
}
async fn heal_object(
&self,
_: &str,
object: &str,
_: Option<&str>,
_: &HealOpts,
) -> rustfs_heal::Result<(HealItem, Option<rustfs_heal::Error>)> {
let retry = {
let mut calls = self.calls.lock().expect("fixture calls");
let count = calls.entry(object.to_string()).or_default();
*count += 1;
*count > 1
};
if retry {
self.retry_started.notify_one();
std::future::pending::<()>().await;
}
match object {
"grace" => Ok((
HealItem::default(),
Some(rustfs_heal::Error::Disk(crate::DiskError::other(
"dangling object deletion deferred by heal grace window; retry_after_secs=3599; grace_secs=3600",
))),
)),
"failed" => Err(rustfs_heal::Error::other("permanent fixture failure")),
"cancelled" => Err(rustfs_heal::Error::TaskCancelled),
_ => Ok((HealItem::default(), None)),
}
}
async fn heal_bucket(&self, _: &str, _: &HealOpts) -> rustfs_heal::Result<HealItem> {
Ok(HealItem::default())
}
async fn heal_format(&self, _: bool) -> rustfs_heal::Result<(HealItem, Option<rustfs_heal::Error>)> {
Ok((HealItem::default(), None))
}
async fn list_objects_for_heal_page(
&self,
_: &str,
_: &str,
_: Option<&str>,
_: bool,
) -> rustfs_heal::Result<(Vec<HealListItem>, Option<String>, bool)> {
Ok((Vec::new(), None, false))
}
async fn get_disk_for_resume(&self, _: &str) -> rustfs_heal::Result<crate::DiskStore> {
Err(rustfs_heal::Error::other("unused resume fixture"))
}
}
#[tokio::test]
#[serial]
async fn mrf_ownership_manager_completion_preserves_scanner_pending() {
const CHILD: &str = "RUSTFS_MRF_OWNERSHIP_TEST_CHILD";
if std::env::var_os(CHILD).is_none() {
let output = std::process::Command::new(std::env::current_exe().expect("test executable"))
.args([
"--exact",
"scanner_folder::tests::mrf_ownership::mrf_ownership_manager_completion_preserves_scanner_pending",
"--nocapture",
])
.env(CHILD, "1")
.env("RUSTFS_HEAL_MRF_ENABLE", "true")
.output()
.expect("isolated ingress test process");
let stdout = String::from_utf8_lossy(&output.stdout);
assert!(
output.status.success() && stdout.contains("1 passed;"),
"{stdout}\n{}",
String::from_utf8_lossy(&output.stderr)
);
return;
}
// The production ingress channel is a process singleton; isolation keeps
// its receiver and lease generations independent from other scanner tests.
let (mut scanner, temp_dir) = build_test_scanner().await;
let _guard = TestGuard::new(u64::MAX, usize::MAX, &mut scanner, temp_dir);
let bucket = format!("mrf-ownership-{}", Uuid::new_v4());
scanner.new_cache.info.name = bucket.clone();
scanner.update_cache.info.name = bucket.clone();
scanner.heal_object_select = 1;
let storage = Arc::new(NoticeStorage::default());
let manager = Arc::new(HealManager::new(
storage.clone(),
Some(HealConfig {
enable_auto_heal: false,
mainline_throttle_enable: false,
heal_interval: Duration::from_millis(10),
..Default::default()
}),
));
manager.start().await.expect("production manager starts");
spawn_mrf_consumer(manager.clone());
for (index, object) in ["grace", "unknown", "failed", "cancelled"].iter().enumerate() {
let version = Uuid::new_v4();
scanner.new_cache.info.pending_heals.push(pending_heal(
PendingScannerHealKind::Object,
&bucket,
Some(object),
Some(&version.to_string()),
1,
1,
));
let scope = Some(MrfScope {
pool_index: 0,
set_index: 0,
});
assert_eq!(
try_send_mrf_intent_typed(MrfKind::PartialWrite, &bucket, object, Some(version), scope),
MrfIngressResult::Enqueued
);
// Re-admission establishes that the first terminal callback released
// its ingress lease. Statistics alone precede notice publication.
tokio::time::timeout(Duration::from_secs(5), async {
loop {
match try_send_mrf_intent_typed(MrfKind::PartialWrite, &bucket, object, Some(version), scope) {
MrfIngressResult::Enqueued => break,
MrfIngressResult::Coalesced => tokio::task::yield_now().await,
other => panic!("unexpected retry ingress result: {other:?}"),
}
}
})
.await
.expect("production terminal releases its ingress lease");
tokio::time::timeout(Duration::from_secs(5), storage.retry_started.notified())
.await
.expect("the real consumer starts the second generation");
assert!(
take_mrf_repaired_events_for(&bucket).is_empty(),
"{object}: task completion must not emit an unproved repair"
);
if *object == "unknown" {
assert_eq!(
manager.get_statistics().await.total_objects_healed,
1,
"legacy healed count is not repair proof"
);
}
assert_eq!(
try_send_mrf_intent_typed(MrfKind::PartialWrite, &bucket, object, Some(version), scope),
MrfIngressResult::Coalesced,
"the in-flight retry retains its new ingress lease"
);
note_mrf_repaired(&bucket, object, Some(*version.as_bytes()));
let syncs_before_retry = scanner.pending_heal_sync_count;
scanner
.retry_pending_scanner_heals()
.await
.expect("real scanner ledger retry");
assert_eq!(scanner.pending_heal_sync_count, syncs_before_retry + 1, "the real retry batch syncs once");
assert_eq!(
scanner.new_cache.info.pending_heals.len(),
index + 1,
"{object}: pending responsibility survives"
);
let restored = DataUsageCache::unmarshal(&scanner.new_cache.marshal_msg().expect("serialize pending cache"))
.expect("decode pending cache");
assert_eq!(restored.info.pending_heals.len(), index + 1);
assert_eq!(
manager
.cancel_tasks_for_path(&format!("{bucket}/{object}"))
.await
.expect("cancel blocked retry"),
1
);
}
manager.stop().await.expect("production manager stops");
}
+2
View File
@@ -286,6 +286,7 @@ pub struct ScannerBucketScanPlan {
/// Includes mutation generations even when the set planner uses a structural digest.
bucket_coverage_digest: DataUsageScanPlanDigest,
requires_full_scan: bool,
service_cohort: Option<Arc<StdMutex<ScannerServiceCohort>>>,
// Cache work must invalidate on namespace completion even when its scoped baseline remains reusable.
execution_digest: DataUsageScanPlanDigest,
leader_epoch: u64,
@@ -973,6 +974,7 @@ impl ScannerCycleResult {
mod cache;
mod dirty_usage;
mod guards;
pub(crate) use guards::ScannerServiceCohort;
mod io_cache;
mod io_cycle;
#[cfg(test)]
+605
View File
@@ -14,6 +14,312 @@
/// scan concurrency accounting: gauge recorders, RAII guards, and worker limits.
use super::*;
const SCANNER_SERVICE_COHORT_MAX_MEMBERS: usize = 4096;
const SCANNER_SERVICE_COHORT_MAX_NAME_BYTES: usize = 128 * 1024;
static SERVICE_COHORT_METRICS_OWNER: StdMutex<std::sync::Weak<()>> = StdMutex::new(std::sync::Weak::new());
struct ScannerCohortMetricsOwner(Arc<()>);
impl Default for ScannerCohortMetricsOwner {
fn default() -> Self {
let owner = Arc::new(());
let mut current = SERVICE_COHORT_METRICS_OWNER
.lock()
.unwrap_or_else(|poisoned| poisoned.into_inner());
*current = Arc::downgrade(&owner);
write_service_cohort_metrics(0, 0.0, false);
Self(owner)
}
}
impl Drop for ScannerCohortMetricsOwner {
fn drop(&mut self) {
let mut current = SERVICE_COHORT_METRICS_OWNER
.lock()
.unwrap_or_else(|poisoned| poisoned.into_inner());
if current.ptr_eq(&Arc::downgrade(&self.0)) {
*current = std::sync::Weak::new();
write_service_cohort_metrics(0, 0.0, false);
}
}
}
fn write_service_cohort_metrics(waiting: usize, oldest: f64, overflowed: bool) {
metrics::gauge!("rustfs_scanner_service_cohort_waiting").set(waiting as f64);
metrics::gauge!("rustfs_scanner_service_cohort_oldest_wait_seconds").set(oldest);
metrics::gauge!("rustfs_scanner_service_cohort_capacity_fallback").set(if overflowed { 1.0 } else { 0.0 });
}
struct ScannerCohortWait {
order: u64,
queued_at: Instant,
admitted: bool,
present: bool,
}
/// Leader-local admission order, never evidence of completed scan coverage.
/// Retains at most 4096 members and 128 KiB of name payload, including the
/// cursor shared with its last member. Candidate selection borrows at most
/// 4096 inventory entries; the existing full inventory is not bounded here.
pub(crate) struct ScannerServiceCohort {
members: HashMap<DataUsageCacheSource, HashMap<Arc<str>, ScannerCohortWait>>,
cursor: Option<(DataUsageCacheSource, Arc<str>)>,
next_order: u64,
max_members: usize,
max_name_bytes: usize,
overflowed: bool,
metrics_owner: ScannerCohortMetricsOwner,
waiting: usize,
oldest_wait_at_refresh: f64,
#[cfg(test)]
metric_members_examined: usize,
}
impl Default for ScannerServiceCohort {
fn default() -> Self {
Self {
members: HashMap::new(),
cursor: None,
next_order: 0,
max_members: SCANNER_SERVICE_COHORT_MAX_MEMBERS,
max_name_bytes: SCANNER_SERVICE_COHORT_MAX_NAME_BYTES,
overflowed: false,
metrics_owner: ScannerCohortMetricsOwner::default(),
waiting: 0,
oldest_wait_at_refresh: 0.0,
#[cfg(test)]
metric_members_examined: 0,
}
}
}
impl ScannerServiceCohort {
pub(crate) fn refresh(&mut self, inventory: &HashMap<DataUsageCacheSource, Vec<BucketInfo>>) {
let count = inventory
.values()
.fold(0usize, |count, buckets| count.saturating_add(buckets.len()));
let name_bytes = inventory
.values()
.flatten()
.fold(0usize, |bytes, bucket| bytes.saturating_add(bucket.name.len()));
self.overflowed = count > self.max_members || name_bytes > self.max_name_bytes;
for wait in self.members.values_mut().flat_map(HashMap::values_mut) {
wait.present = false;
}
for (source, buckets) in inventory {
for bucket in buckets {
if let Some(wait) = self
.members
.get_mut(source)
.and_then(|members| members.get_mut(bucket.name.as_str()))
{
wait.present = true;
}
}
}
self.members.retain(|_, buckets| {
buckets.retain(|_, wait| wait.present);
!buckets.is_empty()
});
if self.members.values().flat_map(HashMap::values).all(|wait| wait.admitted) {
self.members.clear();
self.next_order = 0;
}
if count == 0 {
self.cursor = None;
}
let mut member_count = self.members.values().map(HashMap::len).sum::<usize>();
let mut retained_bytes = self
.members
.values()
.flat_map(HashMap::keys)
.map(|name| name.len())
.sum::<usize>();
let mut incoming = self.admission_candidates(inventory, true);
if incoming.is_empty() {
incoming = self.admission_candidates(inventory, false);
}
for (pool, set, bucket) in incoming {
if member_count >= self.max_members {
break;
}
if retained_bytes.saturating_add(bucket.len()) > self.max_name_bytes {
continue;
}
let Some(next_order) = self.next_order.checked_add(1) else {
self.overflowed = true;
break;
};
let source = DataUsageCacheSource::new(pool, set);
let members = self.members.entry(source).or_default();
if members.contains_key(bucket) {
continue;
}
let name: Arc<str> = bucket.into();
retained_bytes += name.len();
member_count += 1;
members.insert(
name.clone(),
ScannerCohortWait {
order: self.next_order,
queued_at: Instant::now(),
admitted: false,
present: true,
},
);
self.cursor = Some((source, name));
self.next_order = next_order;
}
self.refresh_metrics();
}
fn admission_candidates<'a>(
&self,
inventory: &'a HashMap<DataUsageCacheSource, Vec<BucketInfo>>,
after_cursor: bool,
) -> Vec<(usize, usize, &'a str)> {
let mut candidates = std::collections::BinaryHeap::new();
for (source, buckets) in inventory {
for bucket in buckets {
let key = (source.pool_index, source.set_index, bucket.name.as_str());
let after = self
.cursor
.as_ref()
.is_none_or(|(source, name)| key > (source.pool_index, source.set_index, name.as_ref()));
if after != after_cursor
|| bucket.name.len() > self.max_name_bytes
|| self
.members
.get(source)
.is_some_and(|members| members.contains_key(bucket.name.as_str()))
{
continue;
}
if candidates.len() < self.max_members {
candidates.push(key);
} else if candidates.peek().is_some_and(|last| key < *last) {
candidates.pop();
candidates.push(key);
}
}
}
candidates.into_sorted_vec()
}
pub(crate) fn order_set_indices(&self, sets: &[Arc<SetDisks>]) -> Vec<usize> {
let ranks = self
.members
.iter()
.map(|(source, buckets)| {
(
*source,
buckets
.values()
.filter(|wait| !wait.admitted)
.map(|wait| wait.order)
.min()
.unwrap_or(u64::MAX),
)
})
.collect::<HashMap<_, _>>();
let mut indices = (0..sets.len()).collect::<Vec<_>>();
indices.sort_by_key(|index| {
(
ranks
.get(&DataUsageCacheSource::new(sets[*index].pool_index, sets[*index].set_index))
.copied()
.unwrap_or(u64::MAX),
*index,
)
});
indices
}
pub(crate) fn order_buckets(&self, source: DataUsageCacheSource, buckets: &mut [BucketInfo]) {
let rank = |bucket: &str| {
self.members
.get(&source)
.and_then(|members| members.get(bucket))
.filter(|wait| !wait.admitted)
.map_or(u64::MAX, |wait| wait.order)
};
// Stable sorting preserves the existing dispatch order in the tail.
buckets.sort_by_key(|bucket| rank(&bucket.name));
}
pub(crate) fn record_admitted(&mut self, source: DataUsageCacheSource, bucket: &str) {
let Some(wait) = self.members.get_mut(&source).and_then(|members| members.get_mut(bucket)) else {
return;
};
if wait.admitted {
return;
}
wait.admitted = true;
self.waiting -= 1;
if self.waiting == 0 {
self.oldest_wait_at_refresh = 0.0;
}
self.record_metrics();
}
#[cfg(test)]
pub(super) fn admitted_members(&self) -> Vec<(DataUsageCacheSource, String)> {
self.members
.iter()
.flat_map(|(source, buckets)| {
buckets
.iter()
.filter(|(_, wait)| wait.admitted)
.map(|(bucket, _)| (*source, bucket.to_string()))
})
.collect()
}
fn refresh_metrics(&mut self) {
// Oldest age is an inventory-refresh snapshot, not a per-admission
// scan of the cohort. Clear it immediately when no waiters remain.
let (mut waiting, mut oldest) = (0usize, 0.0f64);
for wait in self.members.values().flat_map(HashMap::values) {
#[cfg(test)]
{
self.metric_members_examined += 1;
}
if !wait.admitted {
waiting += 1;
oldest = oldest.max(wait.queued_at.elapsed().as_secs_f64());
}
}
self.waiting = waiting;
self.oldest_wait_at_refresh = oldest;
self.record_metrics();
}
fn record_metrics(&self) {
// Serialize owner replacement, publication and retirement. A retired
// scanner must neither publish nor clear a replacement's gauges.
let current = SERVICE_COHORT_METRICS_OWNER
.lock()
.unwrap_or_else(|poisoned| poisoned.into_inner());
if current.ptr_eq(&Arc::downgrade(&self.metrics_owner.0)) {
write_service_cohort_metrics(self.waiting, self.oldest_wait_at_refresh, self.overflowed);
}
}
}
pub(super) async fn wait_for_bucket_scan_permit(
semaphore: &Arc<Semaphore>,
ctx: &CancellationToken,
complete: &CancellationToken,
) -> Option<tokio::sync::OwnedSemaphorePermit> {
tokio::select! {
biased;
_ = complete.cancelled() => None,
_ = ctx.cancelled() => None,
permit = semaphore.clone().acquire_owned() => permit.ok(),
}
}
pub(super) fn bucket_usage_scan_order(
buckets: &[BucketInfo],
old_cache: &DataUsageCache,
@@ -288,6 +594,305 @@ mod tests {
use rustfs_scanner_metrics::metrics::{ScannerWorkSource, global_metrics};
use tokio::sync::oneshot;
#[derive(Default)]
struct RecordedGauge(AtomicU64);
impl metrics::GaugeFn for RecordedGauge {
fn increment(&self, value: f64) {
self.set(f64::from_bits(self.0.load(Ordering::Relaxed)) + value);
}
fn decrement(&self, value: f64) {
self.increment(-value);
}
fn set(&self, value: f64) {
self.0.store(value.to_bits(), Ordering::Relaxed);
}
}
#[derive(Default)]
struct CohortGaugeRecorder(StdMutex<HashMap<String, Arc<RecordedGauge>>>);
impl metrics::Recorder for CohortGaugeRecorder {
fn describe_counter(&self, _: metrics::KeyName, _: Option<metrics::Unit>, _: metrics::SharedString) {}
fn describe_gauge(&self, _: metrics::KeyName, _: Option<metrics::Unit>, _: metrics::SharedString) {}
fn describe_histogram(&self, _: metrics::KeyName, _: Option<metrics::Unit>, _: metrics::SharedString) {}
fn register_counter(&self, _: &metrics::Key, _: &metrics::Metadata<'_>) -> metrics::Counter {
metrics::Counter::noop()
}
fn register_histogram(&self, _: &metrics::Key, _: &metrics::Metadata<'_>) -> metrics::Histogram {
metrics::Histogram::noop()
}
fn register_gauge(&self, key: &metrics::Key, _: &metrics::Metadata<'_>) -> metrics::Gauge {
metrics::Gauge::from_arc(
self.0
.lock()
.expect("gauge recorder")
.entry(key.name().to_string())
.or_default()
.clone(),
)
}
}
impl CohortGaugeRecorder {
fn value(&self, name: &str) -> f64 {
f64::from_bits(self.0.lock().expect("gauge recorder")[name].0.load(Ordering::Relaxed))
}
}
#[test]
#[serial_test::serial]
fn service_cohort_metrics_retire_only_the_current_owner() {
let recorder = CohortGaugeRecorder::default();
metrics::with_local_recorder(&recorder, || {
let mut old = ScannerServiceCohort::default();
old.refresh(&cohort_inventory(&["old"]));
let mut current = ScannerServiceCohort {
max_members: 1,
..Default::default()
};
current.refresh(&cohort_inventory(&["a", "b"]));
for wait in current.members.values_mut().flat_map(HashMap::values_mut) {
wait.queued_at = Instant::now() - Duration::from_secs(60);
}
current.refresh_metrics();
old.refresh(&cohort_inventory(&["old", "more"]));
drop(old);
assert_eq!(recorder.value("rustfs_scanner_service_cohort_waiting"), 1.0);
assert_eq!(recorder.value("rustfs_scanner_service_cohort_capacity_fallback"), 1.0);
assert!(recorder.value("rustfs_scanner_service_cohort_oldest_wait_seconds") >= 60.0);
drop(current);
for metric in [
"rustfs_scanner_service_cohort_waiting",
"rustfs_scanner_service_cohort_oldest_wait_seconds",
"rustfs_scanner_service_cohort_capacity_fallback",
] {
assert_eq!(recorder.value(metric), 0.0, "owner retirement must clear {metric}");
}
});
}
#[test]
#[serial_test::serial]
fn service_cohort_admission_metrics_do_not_rescan_a_full_window() {
let recorder = CohortGaugeRecorder::default();
metrics::with_local_recorder(&recorder, || {
let source = DataUsageCacheSource::new(0, 0);
let names = (0..SCANNER_SERVICE_COHORT_MAX_MEMBERS)
.map(|index| format!("bucket-{index:04}"))
.collect::<Vec<_>>();
let inventory = cohort_inventory(&names.iter().map(String::as_str).collect::<Vec<_>>());
let mut cohort = ScannerServiceCohort::default();
cohort.refresh(&inventory);
assert_eq!(cohort.metric_members_examined, SCANNER_SERVICE_COHORT_MAX_MEMBERS);
assert_eq!(cohort.waiting, SCANNER_SERVICE_COHORT_MAX_MEMBERS);
for (index, name) in names.iter().enumerate() {
cohort.record_admitted(source, name);
for _ in 0..10 {
cohort.record_admitted(source, name);
cohort.record_admitted(source, "untracked-overflow-name");
cohort.record_admitted(DataUsageCacheSource::new(99, 0), name);
}
assert_eq!(cohort.waiting, SCANNER_SERVICE_COHORT_MAX_MEMBERS - index - 1);
assert_eq!(
cohort.metric_members_examined, SCANNER_SERVICE_COHORT_MAX_MEMBERS,
"tracked, repeated and overflow admissions must not scan cohort members"
);
}
assert_eq!(recorder.value("rustfs_scanner_service_cohort_waiting"), 0.0);
assert_eq!(recorder.value("rustfs_scanner_service_cohort_oldest_wait_seconds"), 0.0);
cohort.refresh(&inventory);
assert_eq!(
cohort.metric_members_examined,
2 * SCANNER_SERVICE_COHORT_MAX_MEMBERS,
"one inventory refresh performs one metrics traversal"
);
});
}
#[tokio::test]
#[serial_test::serial]
async fn service_cohort_queued_permit_cancel_and_drop_return_the_same_capacity() {
let semaphore = Arc::new(Semaphore::new(1));
let active = Arc::new(AtomicUsize::new(0));
let mut cohort = ScannerServiceCohort::default();
cohort.refresh(&cohort_inventory(&["waiting"]));
let gauge_reset = DiskBucketScanGaugeReset::new("cohort-wait".to_string(), "0".to_string());
record_disk_bucket_scans_queued(1, "cohort-wait", "0");
record_disk_bucket_scans_active(0, "cohort-wait", "0");
for cancel in [true, false] {
let held = semaphore
.clone()
.acquire_owned()
.await
.expect("hold the sole permit as a barrier");
let ctx = CancellationToken::new();
let complete = CancellationToken::new();
let mut waiter = Box::pin(wait_for_bucket_scan_permit(&semaphore, &ctx, &complete));
assert!(
futures::poll!(&mut waiter).is_pending(),
"the production wait must actually enqueue behind the barrier"
);
assert_eq!(semaphore.available_permits(), 0);
if cancel {
ctx.cancel();
assert!(waiter.as_mut().await.is_none());
}
drop(waiter);
assert_eq!(semaphore.available_permits(), 0, "cancelling a waiter must not release the held permit");
assert!(cohort.admitted_members().is_empty());
drop(held);
assert_eq!(semaphore.available_permits(), 1, "no queued waiter may leak or steal released capacity");
}
let ctx = CancellationToken::new();
let complete = CancellationToken::new();
let permit = wait_for_bucket_scan_permit(&semaphore, &ctx, &complete)
.await
.expect("same semaphore remains usable");
let active_guard = DiskBucketScanActiveGuard::new(active.clone(), "cohort-wait".to_string(), "0".to_string());
assert_eq!(active.load(Ordering::Relaxed), 1);
drop(active_guard);
drop(permit);
drop(gauge_reset);
assert_eq!(active.load(Ordering::Relaxed), 0);
assert_eq!(semaphore.available_permits(), 1);
let state = global_metrics()
.scanner_runtime_details_report()
.disk_bucket_scan_states
.into_iter()
.find(|state| state.pool == "cohort-wait" && state.set == "0")
.expect("fixture gauges");
assert_eq!((state.queued, state.active), (0, 0));
assert!(cohort.admitted_members().is_empty(), "permit ownership alone does not admit a bucket");
}
fn cohort_inventory(names: &[&str]) -> HashMap<DataUsageCacheSource, Vec<BucketInfo>> {
HashMap::from([(
DataUsageCacheSource::new(0, 0),
names
.iter()
.map(|name| BucketInfo {
name: (*name).to_string(),
..Default::default()
})
.collect(),
)])
}
#[test]
#[serial_test::serial]
fn service_cohort_visits_fixed_members_within_service_round_bound() {
let inventory = cohort_inventory(&["a", "b", "c", "d", "e"]);
let source = DataUsageCacheSource::new(0, 0);
let mut cohort = ScannerServiceCohort::default();
let mut admitted = HashSet::new();
for _ in 0..3 {
cohort.refresh(&inventory);
let mut buckets = inventory[&source].clone();
cohort.order_buckets(source, &mut buckets);
for bucket in buckets.iter().take(2) {
admitted.insert(bucket.name.clone());
cohort.record_admitted(source, &bucket.name);
}
}
assert_eq!(admitted.len(), 5, "ceil(5/2) service rounds must include every member");
}
#[test]
#[serial_test::serial]
fn service_cohort_keeps_waiting_bootstrap_ahead_of_new_work() {
let source = DataUsageCacheSource::new(0, 0);
let mut cohort = ScannerServiceCohort::default();
cohort.refresh(&cohort_inventory(&["a-hot", "z-bootstrap"]));
cohort.record_admitted(source, "a-hot");
let queued_at = cohort.members[&source]["z-bootstrap"].queued_at;
let inventory = cohort_inventory(&["a-hot", "aaa-new-bootstrap", "z-bootstrap"]);
for _ in 0..10 {
cohort.refresh(&inventory);
let mut buckets = inventory[&source].clone();
cohort.order_buckets(source, &mut buckets);
assert_eq!(buckets[0].name, "z-bootstrap");
assert_eq!(buckets[1].name, "aaa-new-bootstrap");
assert_eq!(cohort.members[&source]["z-bootstrap"].queued_at, queued_at);
}
}
#[test]
#[serial_test::serial]
fn service_cohort_overflow_preserves_waiters_and_rotates_finished_windows() {
let source = DataUsageCacheSource::new(0, 0);
let mut cohort = ScannerServiceCohort {
max_members: 2,
max_name_bytes: 4,
..Default::default()
};
cohort.refresh(&cohort_inventory(&["aa", "bb"]));
cohort.record_admitted(source, "aa");
for names in [["aa", "bb", "c"], ["aa", "bb", "d"]] {
let inventory = cohort_inventory(&names);
cohort.refresh(&inventory);
assert!(cohort.overflowed);
assert_eq!(cohort.members[&source].len(), 2);
assert!(cohort.members[&source].contains_key("aa"));
let mut fallback = inventory[&source].clone();
fallback.reverse();
cohort.order_buckets(source, &mut fallback);
assert_eq!(fallback[0].name, "bb", "overflow must not discard a waiting member's priority");
assert_eq!(fallback.len(), 3, "unknown tail must remain dispatchable");
}
cohort.record_admitted(source, "bb");
let inventory = cohort_inventory(&["aa", "bb", "c", "d"]);
cohort.refresh(&inventory);
assert_eq!(
cohort.members[&source].keys().map(AsRef::as_ref).collect::<HashSet<&str>>(),
HashSet::from(["c", "d"])
);
cohort.record_admitted(source, "c");
cohort.record_admitted(source, "d");
cohort.refresh(&inventory);
assert!(
cohort.members[&source].contains_key("aa"),
"finite inventory must wrap after the last window"
);
cohort.refresh(&cohort_inventory(&["bb"]));
assert!(!cohort.overflowed);
assert_eq!(cohort.members[&source].len(), 1);
cohort.next_order = u64::MAX;
cohort.refresh(&cohort_inventory(&["bb", "c"]));
assert!(cohort.overflowed);
assert_eq!(cohort.members[&source].len(), 1);
}
#[test]
#[serial_test::serial]
fn service_cohort_bounds_names_and_does_not_reset_duplicate_dirty_age() {
let source = DataUsageCacheSource::new(0, 0);
let mut cohort = ScannerServiceCohort {
max_members: 2,
max_name_bytes: 4,
..Default::default()
};
cohort.refresh(&cohort_inventory(&["aa", "bb", "long-name"]));
let queued_at = cohort.members[&source]["bb"].queued_at;
for _ in 0..10 {
cohort.refresh(&cohort_inventory(&["aa", "aa", "bb", "long-name"]));
assert_eq!(cohort.members.values().map(HashMap::len).sum::<usize>(), 2);
assert_eq!(
cohort
.members
.values()
.flat_map(HashMap::keys)
.map(|name| name.len())
.sum::<usize>(),
4
);
assert_eq!(cohort.members[&source]["bb"].queued_at, queued_at);
}
cohort.refresh(&cohort_inventory(&[]));
assert!(cohort.members.is_empty());
assert!(cohort.cursor.is_none());
}
fn active_bucket_drive_count(source: ScannerWorkSource, bucket: &str, drive: &str) -> u64 {
global_metrics()
.scanner_runtime_details_report()
+31 -25
View File
@@ -117,6 +117,7 @@ impl ScannerIOCache for SetDisks {
digest: scan_plan_digest,
bucket_coverage_digest,
requires_full_scan,
service_cohort,
execution_digest,
leader_epoch,
tier_registry_generation,
@@ -500,7 +501,13 @@ impl ScannerIOCache for SetDisks {
let mut permutes = buckets.clone();
permutes.shuffle(&mut rand::rng());
let scan_order = bucket_usage_scan_order(&permutes, &old_cache, &dirty_usage_buckets);
let mut scan_order = bucket_usage_scan_order(&permutes, &old_cache, &dirty_usage_buckets);
if let Some(cohort) = &service_cohort {
cohort
.lock()
.unwrap_or_else(|poisoned| poisoned.into_inner())
.order_buckets(source, &mut scan_order);
}
for bucket in scan_order.iter() {
if let Some(c) = old_cache.find(&bucket.name) {
@@ -558,6 +565,7 @@ impl ScannerIOCache for SetDisks {
let remaining_bucket_work = Arc::new(AtomicUsize::new(buckets.len()));
let bucket_work_complete = CancellationToken::new();
for (disk, worker_mode) in workers {
let service_cohort_clone = service_cohort.clone();
let bucket_rx_mutex_clone = bucket_rx_mutex.clone();
let bucket_tx_clone = bucket_tx.clone();
let remaining_bucket_work_clone = remaining_bucket_work.clone();
@@ -587,6 +595,18 @@ impl ScannerIOCache for SetDisks {
let remote_session_id = uuid::Uuid::new_v4();
let mut remote_session_sequence = 0_u64;
loop {
// Do not prefetch a FIFO member into an independently
// scheduled permit waiter: that can reorder admissions.
let permit_wait_start = Instant::now();
let Some(_permit) =
wait_for_bucket_scan_permit(&disk_scan_semaphore_clone, &ctx_clone, &bucket_work_complete_clone).await
else {
break;
};
if ctx_clone.is_cancelled() || budget_clone.budget_elapsed() {
break;
}
let permit_wait_elapsed = permit_wait_start.elapsed();
let bucket = tokio::select! {
_ = bucket_work_complete_clone.cancelled() => break,
_ = ctx_clone.cancelled() => break,
@@ -600,41 +620,27 @@ impl ScannerIOCache for SetDisks {
let mut work_guard =
BucketWorkGuard::new(remaining_bucket_work_clone.clone(), bucket_work_complete_clone.clone());
let permit_wait = ctx_clone.clone();
let permit_wait_start = Instant::now();
let _permit = tokio::select! {
permit = disk_scan_semaphore_clone.clone().acquire_owned() => match permit {
Ok(permit) => permit,
Err(_) => {
decrement_disk_bucket_scans_queued(
&queued_disk_bucket_scans_clone,
&pool_label_clone,
&set_label_clone,
);
break;
},
},
_ = permit_wait.cancelled() => {
decrement_disk_bucket_scans_queued(
&queued_disk_bucket_scans_clone,
&pool_label_clone,
&set_label_clone,
);
break;
},
};
metrics::histogram!(
METRIC_SCANNER_DISK_SCAN_WAIT_SECONDS,
"pool" => pool_label_clone.clone(),
"set" => set_label_clone.clone()
)
.record(permit_wait_start.elapsed().as_secs_f64());
.record(permit_wait_elapsed.as_secs_f64());
decrement_disk_bucket_scans_queued(&queued_disk_bucket_scans_clone, &pool_label_clone, &set_label_clone);
let _active_guard = DiskBucketScanActiveGuard::new(
active_disk_bucket_scans_clone.clone(),
pool_label_clone.clone(),
set_label_clone.clone(),
);
if ctx_clone.is_cancelled() || budget_clone.budget_elapsed() {
break;
}
if let Some(cohort) = &service_cohort_clone {
cohort
.lock()
.unwrap_or_else(|poisoned| poisoned.into_inner())
.record_admitted(source, &bucket.name);
}
debug!(
target: "rustfs::scanner::io",
+40 -11
View File
@@ -73,6 +73,7 @@ where
scan_scope: ScannerBucketScanScope::default(),
persisted_usage_baseline: None,
requires_full_scan: true,
service_cohort: None,
#[cfg(test)]
resolved_scope_observer: None,
};
@@ -90,6 +91,7 @@ pub(crate) struct ScannerCycleRequest {
pub(crate) persisted_usage_baseline: Option<Bytes>,
/// Scheduled maintenance must visit clean buckets even with a valid dirty scope.
pub(crate) requires_full_scan: bool,
pub(crate) service_cohort: Option<Arc<StdMutex<ScannerServiceCohort>>>,
#[cfg(test)]
pub(crate) resolved_scope_observer: Option<tokio::sync::oneshot::Sender<ScannerBucketScanScope>>,
}
@@ -184,6 +186,7 @@ where
scan_scope,
persisted_usage_baseline,
requires_full_scan,
service_cohort,
#[cfg(test)]
resolved_scope_observer,
} = request;
@@ -275,6 +278,12 @@ where
}
bucket_plan_complete &= buckets_by_source.keys().copied().collect::<HashSet<_>>() == *expected_sources;
bucket_plan_complete &= scanner_bucket_inventory_is_complete(&all_buckets, &buckets_by_source);
if bucket_plan_complete && let Some(cohort) = &service_cohort {
cohort
.lock()
.unwrap_or_else(|poisoned| poisoned.into_inner())
.refresh(&buckets_by_source);
}
let structural_scan_plan_digest =
scanner_bucket_plan_digest(&all_buckets, crate::scanner::scanner_activity_structural_digest(&activity_before));
let scan_plan_digest = scanner_bucket_work_digest(structural_scan_plan_digest, scan_mode, requires_full_scan);
@@ -399,7 +408,32 @@ where
let first_err_mutex: Arc<Mutex<Option<Error>>> = Arc::new(Mutex::new(None));
let mut wait_futs = Vec::new();
for (results_index, set) in set_disks.iter().enumerate() {
let set_order = service_cohort.as_ref().map_or_else(
|| (0..set_disks.len()).collect::<Vec<_>>(),
|cohort| {
cohort
.lock()
.unwrap_or_else(|poisoned| poisoned.into_inner())
.order_set_indices(&set_disks)
},
);
for results_index in set_order {
let set = &set_disks[results_index];
// Acquire in dispatch order, not in independently scheduled tasks.
// A whole set still shares the existing parent budget; this is not
// a per-bucket quantum or a cross-source completion guarantee.
let permit_wait_start = Instant::now();
let permit = tokio::select! {
biased;
_ = child_token.cancelled() => break,
permit = set_scan_semaphore.clone().acquire_owned() => match permit {
Ok(permit) => permit,
Err(_) => break,
},
};
if child_token.is_cancelled() || budget.budget_elapsed() {
break;
}
let results_index_clone = results_index;
// Clone the Arc to move it into the spawned task
let set_clone: Arc<SetDisks> = Arc::clone(set);
@@ -414,7 +448,6 @@ where
let scan_mode_clone = scan_mode;
let results_mutex_clone = results_mutex.clone();
let first_err_mutex_clone = first_err_mutex.clone();
let set_scan_semaphore_clone = set_scan_semaphore.clone();
let queued_set_scans_clone = queued_set_scans.clone();
let active_set_scans_clone = active_set_scans.clone();
@@ -437,6 +470,7 @@ where
digest: structural_scan_plan_digest,
bucket_coverage_digest,
requires_full_scan,
service_cohort: service_cohort.clone(),
execution_digest,
leader_epoch,
tier_registry_generation,
@@ -448,15 +482,10 @@ where
};
// Spawn task to run the scanner
let scanner_fut = tokio::spawn(async move {
let permit_wait = child_token_clone.clone();
let permit_wait_start = Instant::now();
let _permit = tokio::select! {
permit = set_scan_semaphore_clone.acquire_owned() => match permit {
Ok(permit) => permit,
Err(_) => return,
},
_ = permit_wait.cancelled() => return,
};
let _permit = permit;
if child_token_clone.is_cancelled() || budget_clone.budget_elapsed() {
return;
}
metrics::histogram!(
METRIC_SCANNER_SET_SCAN_WAIT_SECONDS,
"pool" => pool_label.clone(),
+22
View File
@@ -40,6 +40,7 @@ use time::OffsetDateTime;
use uuid::Uuid;
mod scoped_entry_fallback;
mod service_cohort;
#[derive(Clone)]
struct FixedWorkloadProvider {
@@ -398,6 +399,7 @@ async fn scoped_scan_production_entry_preserves_deep_and_full_maintenance_work()
persisted_usage_baseline: baseline,
requires_full_scan,
resolved_scope_observer: Some(observer),
service_cohort: None,
},
),
)
@@ -450,6 +452,14 @@ async fn scoped_scan_same_cycle_maintenance_rewalks_after_root_delivery_failure(
.put_object(bucket, "initial", &mut reader, &ScannerObjectOptions::default())
.await
.expect("initial object should persist");
let lock = store.pools[0].disk_set[0]
.new_ns_lock(bucket, "initial")
.await
.expect("fixture namespace lock should be created");
let _settled = lock
.get_write_lock(Duration::from_secs(30))
.await
.expect("fixture rename tail should finish before the usage scan");
}
let ctx = CancellationToken::new();
let budget = ScannerCycleBudget::new(&ctx, ScannerCycleBudgetConfig::default());
@@ -470,6 +480,7 @@ async fn scoped_scan_same_cycle_maintenance_rewalks_after_root_delivery_failure(
persisted_usage_baseline: None,
requires_full_scan: false,
resolved_scope_observer: None,
service_cohort: None,
},
),
)
@@ -498,6 +509,15 @@ async fn scoped_scan_same_cycle_maintenance_rewalks_after_root_delivery_failure(
.put_object("cold-bucket", "new", &mut reader, &ScannerObjectOptions::default())
.await
.expect("new cold object should persist");
let lock = store.pools[0].disk_set[0]
.new_ns_lock("cold-bucket", "new")
.await
.expect("fixture namespace lock should be created");
let _settled = lock
.get_write_lock(Duration::from_secs(30))
.await
.expect("fixture rename tail should finish before the usage scan");
drop(_settled);
record_dirty_usage_bucket("hot-bucket");
if scan_mode == HealScanMode::Normal && !requires_full_scan {
record_dirty_usage_bucket("cold-bucket");
@@ -520,6 +540,7 @@ async fn scoped_scan_same_cycle_maintenance_rewalks_after_root_delivery_failure(
persisted_usage_baseline: None,
requires_full_scan,
resolved_scope_observer: None,
service_cohort: None,
},
),
)
@@ -1261,6 +1282,7 @@ async fn set_snapshot_reuse_requires_execution_identity_and_fences_stale_writers
ctx.clone(),
ScannerCycleBudget::new(&ctx, ScannerCycleBudgetConfig::default()),
ScannerBucketScanPlan {
service_cohort: None,
buckets: Vec::new(),
all_buckets: Arc::new(Vec::new()),
scope: ScannerBucketScanScope::default(),
@@ -127,6 +127,7 @@ async fn run_entry(store: &Arc<ECStore>, cycle: u64, selected: Option<&str>, exp
scan_scope: ScannerBucketScanScope::default(),
persisted_usage_baseline: root_before.0.clone().map(Bytes::from),
requires_full_scan: false,
service_cohort: None,
resolved_scope_observer: Some(observer),
},
),
@@ -0,0 +1,242 @@
// Copyright 2026 RustFS Team
//
// Licensed under the Apache License, Version 2.0 (the "License");
// you may not use this file except in compliance with the License.
// You may obtain a copy of the License at
//
// http://www.apache.org/licenses/LICENSE-2.0
//
// Unless required by applicable law or agreed to in writing, software
// distributed under the License is distributed on an "AS IS" BASIS,
// WITHOUT WARRANTIES OR CONDITIONS OF ANY KIND, either express or implied.
// See the License for the specific language governing permissions and
// limitations under the License.
use super::*;
use crate::data_usage_define::{DATA_USAGE_OBJ_NAME_PATH, read_config_with_revision};
async fn create_cohort_bucket(store: &ECStore, bucket: &str) {
store
.make_bucket(bucket, &MakeBucketOptions::default())
.await
.expect("fixture bucket");
for set in store.all_set_disks() {
let mut reader = ScannerPutObjReader::from_vec(b"cohort".to_vec());
set.put_object(
bucket,
"initial",
&mut reader,
&ScannerObjectOptions {
no_lock: true,
..Default::default()
},
)
.await
.expect("fixture object and all rename tails should persist");
}
}
async fn run_cohort_cycle(
store: &Arc<ECStore>,
cohort: Arc<StdMutex<ScannerServiceCohort>>,
cycle: u64,
budget: Arc<ScannerCycleBudget>,
) -> (ScannerCycleResult, Option<DataUsageInfo>) {
let root_before = read_config_with_revision(store.clone(), DATA_USAGE_OBJ_NAME_PATH.as_str())
.await
.expect("root before candidate");
let dirty_before = dirty_usage_buckets_for_tests();
let generation_before = dirty_usage_generation();
let (updates, mut receiver) = mpsc::channel(1);
let result = tokio::time::timeout(
Duration::from_secs(30),
nsscanner_with_storage_status_scoped(
store.as_ref(),
ScannerCycleRequest {
ctx: budget.token(),
budget,
updates,
want_cycle: cycle,
leader_epoch: 11,
scan_mode: HealScanMode::Normal,
scan_scope: ScannerBucketScanScope::default(),
persisted_usage_baseline: None,
requires_full_scan: false,
service_cohort: Some(cohort),
resolved_scope_observer: None,
},
),
)
.await
.expect("cohort cycle should finish")
.expect("cohort cycle should return its status");
let usage = receiver.recv().await;
assert!(receiver.recv().await.is_none());
assert_eq!(
read_config_with_revision(store.clone(), DATA_USAGE_OBJ_NAME_PATH.as_str())
.await
.expect("root after candidate"),
root_before
);
assert_eq!(
dirty_usage_buckets_for_tests(),
dirty_before,
"candidate production must not ACK pending work"
);
assert_eq!(dirty_usage_generation(), generation_before);
(result, usage)
}
#[tokio::test]
#[serial]
async fn service_cohort_production_dispatch_services_waiters_across_sources() {
let (_dir, store) = setup_two_pool_scanner_store().await;
clear_dirty_usage_buckets_for_tests();
let hot = format!("a-hot-{}", Uuid::new_v4().simple());
let bootstrap = format!("z-bootstrap-{}", Uuid::new_v4().simple());
create_cohort_bucket(&store, &hot).await;
create_cohort_bucket(&store, &bootstrap).await;
let cohort = Arc::new(StdMutex::new(ScannerServiceCohort::default()));
let expected = store
.all_set_disks()
.iter()
.flat_map(|set| {
let source = DataUsageCacheSource::new(set.pool_index, set.set_index);
[(source, hot.clone()), (source, bootstrap.clone())]
})
.collect::<HashSet<_>>();
let mut seen = HashSet::new();
for cycle in 1..=4 {
// Both newly bootstrapped names and repeated dirty work sort ahead of
// the original bootstrap in the old dirty-first policy.
if cycle > 1 {
create_cohort_bucket(&store, &format!("b-new-{cycle}")).await;
}
record_dirty_usage_bucket(&hot);
let ctx = CancellationToken::new();
let budget = ScannerCycleBudget::new_with_progress_tracking(
&ctx,
ScannerCycleBudgetConfig {
max_objects: Some(1),
..Default::default()
},
);
run_cohort_cycle(&store, cohort.clone(), cycle, budget.clone()).await;
assert!(budget.budget_elapsed());
assert_eq!(
budget.progress().0,
1,
"each round must reach one real object, not just mark an admission"
);
let admitted = cohort
.lock()
.expect("cohort lock")
.admitted_members()
.into_iter()
.collect::<HashSet<_>>();
let newly_admitted = admitted.difference(&seen).cloned().collect::<Vec<_>>();
assert_eq!(
newly_admitted.len(),
1,
"serial parent object budget must stop before another bucket admission"
);
seen.extend(newly_admitted);
}
assert!(
expected.is_subset(&seen),
"ongoing dirty/new bootstrap must not displace the original cohort"
);
// Admission fairness is not completed coverage: prior budgeted prefixes
// were observed under changing plans. A clean tail must not certify them.
let ctx = CancellationToken::new();
let (result, usage) =
run_cohort_cycle(&store, cohort, 5, ScannerCycleBudget::new(&ctx, ScannerCycleBudgetConfig::default())).await;
assert_eq!(result.status, ScannerCycleStatus::Incomplete);
assert!(usage.is_none(), "neither source has a complete mixed-plan baseline to publish");
for set in store.all_set_disks() {
let mut cache = DataUsageCache::default();
cache
.load(set, &path_join_buf(&[&hot, DATA_USAGE_CACHE_NAME]))
.await
.expect("retained hot prefix");
assert!(!cache.info.snapshot_complete);
assert!(cache.info.scan_progress.is_some());
assert!(cache.info.scan_plan_digest.is_none(), "mixed coverage must remain non-authoritative");
}
clear_dirty_usage_buckets_for_tests();
}
#[tokio::test]
#[serial]
async fn service_cohort_fresh_complete_aggregate_preserves_reordered_sources() {
let (_dir, store) = setup_two_pool_scanner_store().await;
clear_dirty_usage_buckets_for_tests();
for bucket in ["cohort-first", "cohort-second"] {
create_cohort_bucket(&store, bucket).await;
}
let sets = store.all_set_disks();
let listing = store
.list_bucket_for_scanner(&BucketOptions::default())
.await
.expect("fresh inventory");
let inventory = listing
.set_buckets
.into_iter()
.map(|set| (DataUsageCacheSource::new(set.pool_index, set.set_index), set.buckets))
.collect::<HashMap<_, _>>();
let cohort = Arc::new(StdMutex::new(ScannerServiceCohort::default()));
{
let mut cohort = cohort.lock().expect("cohort lock");
cohort.refresh(&inventory);
for bucket in &inventory[&DataUsageCacheSource::new(0, 0)] {
cohort.record_admitted(DataUsageCacheSource::new(0, 0), &bucket.name);
}
assert_eq!(cohort.order_set_indices(&sets), vec![1, 0]);
}
let ctx = CancellationToken::new();
let (result, usage) =
run_cohort_cycle(&store, cohort, 1, ScannerCycleBudget::new(&ctx, ScannerCycleBudgetConfig::default())).await;
assert_eq!(result.status, ScannerCycleStatus::Complete);
let usage = usage.expect("fresh complete aggregate");
assert_eq!(usage.objects_total_count, 4);
assert!(usage.buckets_usage.values().all(|bucket| bucket.objects_count == 2));
assert_eq!(usage.usage_snapshot_set_states.len(), 2);
assert_eq!(
usage
.usage_snapshot_set_states
.iter()
.map(|set| (set.pool_index, set.set_index))
.collect::<HashSet<_>>(),
HashSet::from([(0, 0), (1, 0)])
);
clear_dirty_usage_buckets_for_tests();
}
#[tokio::test]
#[serial]
async fn service_cohort_cancelled_dispatch_does_not_consume_waiters_or_leak_permits() {
let (_dir, store) = setup_two_pool_scanner_store().await;
clear_dirty_usage_buckets_for_tests();
let bucket = format!("cancel-{}", Uuid::new_v4().simple());
create_cohort_bucket(&store, &bucket).await;
let cohort = Arc::new(StdMutex::new(ScannerServiceCohort::default()));
let ctx = CancellationToken::new();
let budget = ScannerCycleBudget::new(&ctx, ScannerCycleBudgetConfig::default());
ctx.cancel();
run_cohort_cycle(&store, cohort.clone(), 1, budget).await;
assert!(cohort.lock().expect("cohort lock").admitted_members().is_empty());
let report = rustfs_scanner_metrics::metrics::global_metrics().scanner_runtime_details_report();
assert!(report.active_bucket_drive_scans.is_empty());
let ctx = CancellationToken::new();
let (result, usage) =
run_cohort_cycle(&store, cohort, 1, ScannerCycleBudget::new(&ctx, ScannerCycleBudgetConfig::default())).await;
assert_eq!(
result.status,
ScannerCycleStatus::Complete,
"cancellation must not block a subsequent scan"
);
assert_eq!(usage.expect("retry aggregate").objects_total_count, 2);
clear_dirty_usage_buckets_for_tests();
}
+3
View File
@@ -126,6 +126,9 @@ pub(crate) use rustfs_lifecycle::{
};
use rustfs_storage_api as storage_contracts;
#[cfg(test)]
pub(crate) type EcstoreHealResultItem = <EcstoreStore as storage_contracts::HealOperations>::HealResultItem;
pub(crate) mod owner {
#[cfg(test)]
pub(crate) use rustfs_ecstore::api::set_disk::test_util::hold_namespace_commit as ecstore_hold_namespace_commit;
@@ -168,6 +168,8 @@ New intents use a 15-minute expiry. A peer-only terminal tombstone is retained u
The coordinator creates its durable record and peer `Prepare` blocks new reference creation, drains exact tier-operation leases, and proves that edit/remove/clear will not strand authoritative references. Prepare, Commit, and Abort use all-node fanout rather than quorum: independent peer calls use a work-conserving concurrency limit of four, a 30-second per-peer deadline, and a 30-second fanout-wide deadline; Prepare is additionally capped by the intent expiry. The coordinator collects every completed outcome. A timed-out or otherwise ambiguous started Prepare is included in compensating Abort because cancellation does not prove the peer failed to persist its fence; peers not started before the fanout deadline make Prepare fail but do not require Abort. The coordinator then conditionally writes tier config, durably commits the coordinator intent, releases its exclusive guards, requires every prepared peer to commit, publishes the runtime candidate, and clears the block. Per-mutation sharded mutexes serialize local phases only; persisted intent plus tier-config ETag is authoritative.
Terminal recovery does not reinstall a process-local operation fence when the published in-memory manager has the exact committed candidate digest. This exception affects only ordinary tier-operation leases: recovery still replays peer `Commit`, retains and conditionally cleans the durable evidence, and blocks a new tier configuration mutation until the recovery snapshot is quiescent. A different local digest remains fenced until the committed candidate is safely published.
### Recovery decisions
| Observed durable state/input | Unique current owner | Current recovery decision | Destructive/config admission |
@@ -179,6 +179,14 @@ The reset does not delete metadata files by hand and does not publish an authori
| data movement | wait for decommission or rebalance to leave the scanner metadata path, then retry |
| invalid scanner cycle state | run `POST /v3/scanner/cycle-state/reset` with `{"mode":"full-rescan"}` first |
## Cleanup With The Scanner Disabled
With `RUSTFS_SCANNER_ENABLED=false`, startup makes one controlled attempt to finish a previously persisted cycle reset whose validated recovery marker is already `cleanup-pending`. This is metadata cleanup only: it does not start the ordinary scanner loop, scan namespaces, accept a new reset request, or automatically perform a usage-state `full-rebuild`. Missing, merely `blocked`, unknown-version, unknown-phase, or corrupt markers do not authorize an automatic reset.
The attempt uses the existing leader lock and revalidates the observed marker revision and phase after acquiring it. A busy leader or data-movement pause leaves the marker intact and is reported through `cycle_recovery.state` and `cycle_recovery.reason` in the existing scanner status response. There is no automatic retry loop while disabled. After resolving the blocker, explicitly retry `POST /v3/scanner/cycle-state/reset` with `{"mode":"full-rescan"}`, or restart to make another controlled attempt. The v3 reset routes remain synchronous and return their existing successful HTTP 200 responses; no asynchronous HTTP 202 acceptance is introduced.
The startup probe is cancellation-aware and uses the existing cache persistence I/O timeout. Shutdown waits only for the existing server shutdown timeout. If the cleanup task cannot join in that window, the `scanner_cleanup_not_joined` warning means completion is unconfirmed, not drained. The task is not force-aborted or force-unlocked while its runtime remains alive; it retains its existing namespace/admission guards, and durable marker/fence state remains authoritative. Inspect status before retrying. This does not establish a hard deadline for an unresponsive storage operation or prove that I/O has drained when the process or runtime subsequently exits. Task-ownership timeout tests are not storage fsync, commit-tail, or process-crash durability evidence.
## Data Movement Pauses
RustFS uses a `global_pause` policy while pool decommission or rebalance can hide scanner metadata: usage publication, lifecycle discovery, tier cleanup discovery, scanner-originated heal and bitrot checks, and replication discovery are deferred together. A failed or canceled decommission remains a publication barrier until an operator retries or clears it. The same pause and estimate objects are included in `GET /v3/ilm/expiry/status`.
@@ -301,6 +309,24 @@ The pacing gate holds neither namespace locks nor I/O/page permits while sleepin
A missing provider, zero pause, or both class thresholds set to zero preserves unpaced execution. Missing counts follow the existing shared pressure interpreter; they are observations, not health, quorum or resource-ownership proof. The current provider exposes node-level workload classes, so this does not claim independent per-set foreground measurements or a hard global resource budget. Runtime waits increment `rustfs_heal_mainline_throttle_total` with `source=admin`, `result=delayed`, and a foreground-pressure or `recovery_window` reason. Real p99/throughput protection requires the separate W20 fixed-load ABBA measurements.
## Pending Heal Hints
The scanner's persisted pending-heal cache is a best-effort retry backstop, bounded to 10,000 hints per bucket and a 24-hour age limit. These limits do not authorize garbage collection of committed durable repair obligations. A durable owner must retain its independent replay record until verified object completion or an equivalent durable successor permits removal.
Accepted, merged, or policy-dropped admission does not clear an existing hint. Task completion and legacy repair notices also lack the incarnation, set scope, generation, and storage verification needed to prove repair responsibility was discharged. The legacy success path therefore retains hints conservatively; this is not a complete durable MRF handoff protocol.
Pending retries use their persisted attempt count and last-attempt timestamp, starting at 15 minutes and doubling up to six hours. Each bucket submits at most 128 due hints per cycle. Already admitted or policy-dropped hints retry at Low priority; queue-full hints keep High priority but obey the same due-time bound. A changed retry batch synchronizes its pending cache once, including when cancelled, rather than copying the entire table after every admission.
Rediscovery and admission observations update the recorded result but do not postpone an already armed retry. The actual retry loop advances the attempt count and timestamp before awaiting admission, so cancellation or repeated queue-full results cannot reset the retry budget.
| Producer | Current identity and compensation | Durable handoff boundary |
|---|---|---|
| Scanner corrupt metadata | Metadata kind with no invented version/set; an existing pending-cache hint remains available for bounded retries. | Cache publication is separate from MRF ingress. Its age/count limits mean it is not an irrevocable repair-obligation ledger. |
| Read decode failure | Decode kind, available version and erasure-set scope; a later failing read can rediscover the repair. | Nonblocking ingress and in-memory read-repair admission do not acknowledge durable acceptance. |
| Partial write | Partial-write kind, available version and erasure-set scope; an in-memory heal request is the fast path. | The caller's documented restart-survival requirement is not fulfilled by ignoring the ingress result or by removing the unaccepted journal record at manager admission. Verified durable ownership remains pending. |
Legacy notices carry only bucket/object/version, not a verified storage disposition, incarnation, scope, or durable responsibility generation. They are drained without clearing hints. Terminal callbacks release only their exact node-local ingress lease so rediscovery remains possible; lease generations are not durable successor receipts. Pending migration staging is not activated, and this change does not enable durable tombstones or garbage collection. Positive cleanup requires a storage-owner receipt with the complete responsibility identity and validated commit/fence evidence; neither task status nor the bounded diagnostic outcome window supplies it.
## Deliberate non-parity with MinIO
These differences from MinIO are design decisions, recorded so they are not re-filed as gaps.
+144 -56
View File
@@ -237,18 +237,13 @@ struct HealStartSuccess {
#[derive(Debug, Serialize)]
#[serde(rename_all = "camelCase")]
struct HealTaskStatus {
summary: String,
#[serde(flatten)]
payload: HealTaskStatusPayload,
#[serde(rename = "detail")]
failure_detail: String,
start_time: String,
#[serde(rename = "settings")]
heal_settings: HealOpts,
#[serde(skip_serializing_if = "Vec::is_empty")]
items: Vec<rustfs_madmin::heal_commands::HealResultItem>,
#[serde(skip_serializing_if = "std::ops::Not::not")]
truncated: bool,
#[serde(skip_serializing_if = "Option::is_none")]
progress: Option<serde_json::Value>,
}
#[derive(Debug, Serialize)]
@@ -1055,15 +1050,23 @@ async fn submit_cluster_heal_channel_command(
}
}
#[derive(Debug, Deserialize)]
#[derive(Debug, Default, Serialize, Deserialize)]
struct HealTaskStatusPayload {
#[serde(skip)]
adapted_detail: Option<String>,
summary: String,
#[serde(default)]
#[serde(default, skip_serializing_if = "Vec::is_empty")]
items: Vec<rustfs_madmin::heal_commands::HealResultItem>,
#[serde(default)]
#[serde(default, skip_serializing_if = "std::ops::Not::not")]
truncated: bool,
#[serde(default)]
#[serde(default, skip_serializing_if = "Option::is_none")]
progress: Option<serde_json::Value>,
#[serde(default, skip_serializing_if = "Option::is_none")]
outcome: Option<serde_json::Value>,
#[serde(default, rename = "nextSeq", alias = "next_seq", skip_serializing_if = "Option::is_none")]
next_seq: Option<u64>,
#[serde(default, rename = "minSeq", alias = "min_seq", skip_serializing_if = "Option::is_none")]
min_seq: Option<u64>,
}
#[cfg(test)]
@@ -1103,21 +1106,16 @@ fn encode_heal_start_success(client_token: String, client_address: String) -> S3
}
fn encode_heal_task_status(
summary: String,
mut payload: HealTaskStatusPayload,
failure_detail: String,
heal_settings: HealOpts,
items: Vec<rustfs_madmin::heal_commands::HealResultItem>,
truncated: bool,
progress: Option<serde_json::Value>,
) -> S3Result<Vec<u8>> {
let failure_detail = payload.adapted_detail.take().unwrap_or(failure_detail);
encode_json(&HealTaskStatus {
summary,
payload,
failure_detail,
start_time: current_rfc3339_time()?,
heal_settings,
items,
truncated,
progress,
})
}
@@ -1162,42 +1160,63 @@ fn build_heal_channel_request(hip: &HealInitParams) -> HealChannelRequest {
fn heal_channel_response_status(
response: &rustfs_heal_contracts::heal_channel::HealChannelResponse,
) -> (String, Vec<rustfs_madmin::heal_commands::HealResultItem>, bool, Option<serde_json::Value>) {
) -> S3Result<HealTaskStatusPayload> {
let Some(data) = response.data.as_deref() else {
return ("running".to_string(), Vec::new(), false, None);
return Ok(HealTaskStatusPayload {
summary: "running".to_string(),
..Default::default()
});
};
if let Ok(payload) = serde_json::from_slice::<HealTaskStatusPayload>(data)
&& !payload.summary.is_empty()
if let Ok(mut payload) = serde_json::from_slice::<HealTaskStatusPayload>(data)
&& matches!(payload.summary.as_str(), "running" | "finished" | "stopped" | "notFound")
{
return (payload.summary, payload.items, payload.truncated, payload.progress);
let adapted = payload
.outcome
.as_ref()
.map(|outcome| {
rustfs_heal::heal::outcome::legacy_wire_status(&payload.summary, outcome, payload.truncated)
.map(|(summary, detail)| (summary.to_string(), detail))
})
.transpose();
if let Ok(adapted) = adapted {
if let Some((summary, detail)) = adapted {
payload.summary = summary;
payload.adapted_detail = detail;
}
return Ok(payload);
}
}
let summary = std::str::from_utf8(data)
.ok()
.filter(|summary| !summary.is_empty())
.unwrap_or("running")
.to_string();
(summary, Vec::new(), false, None)
if let Ok(summary @ ("running" | "finished" | "stopped" | "notFound")) = std::str::from_utf8(data) {
return Ok(HealTaskStatusPayload {
summary: summary.to_string(),
..Default::default()
});
}
Err(s3s::S3Error::with_message(
s3s::S3ErrorCode::InternalError,
"invalid heal status payload or unsupported summary",
))
}
#[cfg(test)]
fn heal_channel_response_summary(response: &rustfs_heal_contracts::heal_channel::HealChannelResponse) -> String {
heal_channel_response_status(response).0
heal_channel_response_status(response).expect("valid status fixture").summary
}
#[cfg(test)]
fn heal_channel_response_items(
response: &rustfs_heal_contracts::heal_channel::HealChannelResponse,
) -> Vec<rustfs_madmin::heal_commands::HealResultItem> {
heal_channel_response_status(response).1
heal_channel_response_status(response).expect("valid status fixture").items
}
#[cfg(test)]
fn heal_channel_response_progress(
response: &rustfs_heal_contracts::heal_channel::HealChannelResponse,
) -> Option<serde_json::Value> {
heal_channel_response_status(response).3
heal_channel_response_status(response).expect("valid status fixture").progress
}
fn encode_background_heal_status(
@@ -1385,15 +1404,8 @@ impl Operation for HealHandler {
response.error.unwrap_or_else(|| "query heal status failed".to_string())
));
}
let (summary, items, truncated, progress) = heal_channel_response_status(&response);
let body = encode_heal_task_status(
summary,
response.error.unwrap_or_default(),
HealOpts::default(),
items,
truncated,
progress,
)?;
let payload = heal_channel_response_status(&response)?;
let body = encode_heal_task_status(payload, response.error.unwrap_or_default(), HealOpts::default())?;
info!(
event = EVENT_ADMIN_RESPONSE_EMITTED,
component = LOG_COMPONENT_ADMIN_API,
@@ -1430,8 +1442,8 @@ impl Operation for HealHandler {
let body = if client_token.is_empty() {
encode_heal_start_success(response.request_id, client_address)?
} else {
let (summary, items, truncated, progress) = heal_channel_response_status(&response);
encode_heal_task_status(summary, response.error.unwrap_or_default(), hip.hs, items, truncated, progress)?
let payload = heal_channel_response_status(&response)?;
encode_heal_task_status(payload, response.error.unwrap_or_default(), hip.hs)?
};
info!(
event = EVENT_ADMIN_RESPONSE_EMITTED,
@@ -2761,12 +2773,12 @@ mod tests {
#[test]
fn test_encode_heal_task_status_uses_client_wire_shape() {
let encoded = encode_heal_task_status(
"Heal status query accepted".to_string(),
super::HealTaskStatusPayload {
summary: "Heal status query accepted".to_string(),
..Default::default()
},
String::new(),
HealOpts::default(),
Vec::new(),
false,
None,
)
.expect("status response should serialize");
let json: serde_json::Value = serde_json::from_slice(&encoded).expect("json should deserialize");
@@ -2783,12 +2795,13 @@ mod tests {
#[test]
fn test_encode_heal_task_status_reports_truncated_items() {
let encoded = encode_heal_task_status(
"running".to_string(),
super::HealTaskStatusPayload {
summary: "running".to_string(),
truncated: true,
..Default::default()
},
"heal result items were truncated".to_string(),
HealOpts::default(),
Vec::new(),
true,
None,
)
.expect("truncated status response should serialize");
let json: serde_json::Value = serde_json::from_slice(&encoded).expect("json should deserialize");
@@ -2804,12 +2817,13 @@ mod tests {
"currentObject": "bucket-a/object-a"
});
let encoded = encode_heal_task_status(
"running".to_string(),
super::HealTaskStatusPayload {
summary: "running".to_string(),
progress: Some(progress.clone()),
..Default::default()
},
String::new(),
HealOpts::default(),
Vec::new(),
false,
Some(progress.clone()),
)
.expect("status response should serialize");
let json: serde_json::Value = serde_json::from_slice(&encoded).expect("json should deserialize");
@@ -2817,6 +2831,80 @@ mod tests {
assert_eq!(json["progress"], progress);
}
#[test]
fn outcome_v3_admin_forwards_outcome_cursors_and_progress_without_recounting() {
let cases: serde_json::Value =
serde_json::from_str(include_str!("../../../../crates/madmin/tests/fixtures/heal-outcome-v3.json"))
.expect("shared fixtures");
for case in cases.as_array().expect("cases") {
let expected = &case["response"];
let mut channel_payload = case.get("remoteResponse").unwrap_or(expected).clone();
let payload = channel_payload.as_object_mut().expect("payload");
let next_seq = payload.remove("nextSeq").expect("cursor");
let min_seq = payload.remove("minSeq").expect("cursor");
payload.insert("next_seq".to_string(), next_seq);
payload.insert("min_seq".to_string(), min_seq);
let response = rustfs_heal_contracts::heal_channel::HealChannelResponse {
request_id: "token".into(),
success: true,
data: Some(serde_json::to_vec(&channel_payload).expect("channel bytes")),
error: None,
};
let payload = super::heal_channel_response_status(&response).expect("valid owner payload");
let encoded =
encode_heal_task_status(payload, expected["detail"].as_str().expect("detail").into(), HealOpts::default())
.expect("public response");
let actual: serde_json::Value = serde_json::from_slice(&encoded).expect("public JSON");
for key in ["summary", "detail", "outcome", "progress", "truncated", "nextSeq", "minSeq"] {
assert_eq!(actual[key], expected[key], "{}: {key}", case["name"]);
}
assert_eq!(actual["progress"]["objectsHealed"], 7);
assert_eq!(actual["outcome"]["counters"]["healed"], 0);
}
}
#[test]
fn outcome_v3_rejects_corrupt_status_without_inventing_a_terminal() {
for data in [
br#"{"summary":"future_state"}"#.as_slice(),
br#"{"summary":"finished","nextSeq":9,"next_seq":8}"#.as_slice(),
br#"{"outcome":{"execution":{"state":"completed"}}}"#.as_slice(),
b"future_state".as_slice(),
] {
let response = rustfs_heal_contracts::heal_channel::HealChannelResponse {
request_id: "token".into(),
success: true,
data: Some(data.to_vec()),
error: None,
};
assert!(super::heal_channel_response_status(&response).is_err());
}
}
#[test]
fn outcome_v3_admin_preserves_future_nonterminal_without_validating_success() {
let outcome = serde_json::json!({
"execution": {"state": "future_execution", "extension": {"value": 7}},
"futureCounter": 9
});
let mut wire = serde_json::json!({"summary": "running", "outcome": outcome, "next_seq": 9, "min_seq": 4});
let mut response = rustfs_heal_contracts::heal_channel::HealChannelResponse {
request_id: "token".into(),
success: true,
data: Some(serde_json::to_vec(&wire).expect("future running wire")),
error: None,
};
let payload = super::heal_channel_response_status(&response).expect("future nonterminal is opaque");
let bytes = encode_heal_task_status(payload, String::new(), HealOpts::default()).expect("public nonterminal");
let public: serde_json::Value = serde_json::from_slice(&bytes).expect("public JSON");
assert_eq!(public["summary"], "running");
assert_eq!(public["outcome"], outcome);
assert_eq!((public["nextSeq"].as_u64(), public["minSeq"].as_u64()), (Some(9), Some(4)));
wire["summary"] = serde_json::json!("finished");
response.data = Some(serde_json::to_vec(&wire).expect("unprovable success wire"));
assert!(super::heal_channel_response_status(&response).is_err());
}
#[test]
fn test_build_heal_channel_request_preserves_safe_client_options() {
let hip = HealInitParams {
+81 -6
View File
@@ -15,7 +15,9 @@
use crate::storage_api::startup::lifecycle::ECStore;
use crate::{
connect::runtime::shutdown_connect_runtimes,
server::{ServiceStateManager, ShutdownHandle, start_persisted_event_notifier_reconciler, wait_for_shutdown},
server::{
SHUTDOWN_TIMEOUT, ServiceStateManager, ShutdownHandle, start_persisted_event_notifier_reconciler, wait_for_shutdown,
},
startup_iam::{IamBootstrapDisposition, publish_ready_for_iam_bootstrap},
startup_runtime_sources,
startup_services::StartupServiceRuntime,
@@ -23,7 +25,7 @@ use crate::{
};
use rustfs_common::GlobalReadiness;
use rustfs_object_capacity::capacity_manager::CapacityBackgroundTasks;
use rustfs_scanner::init_data_scanner;
use rustfs_scanner::init_scanner_with_recovery;
use std::{
io::{Error, Result},
net::{IpAddr, Ipv4Addr, Ipv6Addr, SocketAddr},
@@ -150,9 +152,7 @@ pub(crate) async fn run_startup_runtime_lifecycle(lifecycle: StartupRuntimeLifec
startup_runtime_sources::publish_init_time_now().await;
let event_notifier_reconciler = start_persisted_event_notifier_reconciler(store.clone(), shutdown_token.clone());
if enable_scanner {
init_data_scanner(shutdown_token.clone(), store).await;
}
let scanner_cleanup = init_scanner_with_recovery(shutdown_token.clone(), store, enable_scanner).await;
let shutdown_signal = wait_for_shutdown().await;
run_startup_shutdown_sequence(
@@ -166,6 +166,9 @@ pub(crate) async fn run_startup_runtime_lifecycle(lifecycle: StartupRuntimeLifec
)
.await;
shutdown_connect_runtimes(heartbeat, inventory).await;
if let Some(cleanup) = scanner_cleanup {
let _ = wait_for_scanner_cleanup(cleanup).await;
}
if let Err(err) = event_notifier_reconciler.await {
tracing::warn!(
target: "rustfs::main::run",
@@ -192,6 +195,40 @@ pub(crate) async fn run_startup_runtime_lifecycle(lifecycle: StartupRuntimeLifec
Ok(())
}
async fn wait_for_scanner_cleanup(cleanup: tokio::task::JoinHandle<()>) -> bool {
// Dropping a JoinHandle detaches rather than aborts the task. Keep an
// in-flight reset's guards owned while this runtime remains alive. This
// bounded wait does not prove I/O drain at a later runtime/process exit.
match tokio::time::timeout(SHUTDOWN_TIMEOUT, cleanup).await {
Ok(Ok(())) => true,
Ok(Err(error)) => {
tracing::warn!(
target: "rustfs::main::run",
event = EVENT_SERVER_SHUTDOWN_STATE,
component = LOG_COMPONENT_MAIN,
subsystem = LOG_SUBSYSTEM_STARTUP,
state = "scanner_cleanup_join_failed",
reason = if error.is_cancelled() { "task_cancelled" } else { "task_panicked" },
"Scanner cleanup task failed to join"
);
false
}
Err(_) => {
tracing::warn!(
target: "rustfs::main::run",
event = EVENT_SERVER_SHUTDOWN_STATE,
component = LOG_COMPONENT_MAIN,
subsystem = LOG_SUBSYSTEM_STARTUP,
state = "scanner_cleanup_not_joined",
reason = "timeout",
timeout_secs = SHUTDOWN_TIMEOUT.as_secs(),
"Scanner cleanup completion is unconfirmed; task was not aborted"
);
false
}
}
}
pub(crate) async fn publish_embedded_startup_ready(
iam_bootstrap: IamBootstrapDisposition,
readiness: &GlobalReadiness,
@@ -226,12 +263,50 @@ pub(crate) fn log_embedded_server_ready(endpoint_address: SocketAddr) {
#[cfg(test)]
mod tests {
use super::{embedded_endpoint_address, mark_embedded_global_init_started};
use super::{embedded_endpoint_address, mark_embedded_global_init_started, wait_for_scanner_cleanup};
use std::{
net::{IpAddr, Ipv4Addr, Ipv6Addr, SocketAddr},
sync::atomic::{AtomicBool, Ordering},
};
#[tokio::test]
async fn disabled_cleanup_shutdown_joins_a_finished_task() {
assert!(wait_for_scanner_cleanup(tokio::spawn(async {})).await);
}
#[tokio::test]
async fn disabled_cleanup_shutdown_reports_task_failure() {
assert!(!wait_for_scanner_cleanup(tokio::spawn(async { panic!("fixture cleanup failure") })).await);
}
#[tokio::test(start_paused = true)]
async fn disabled_cleanup_shutdown_timeout_does_not_abort_owned_work() {
struct OwnedWork(std::sync::Arc<AtomicBool>);
impl Drop for OwnedWork {
fn drop(&mut self) {
self.0.store(true, Ordering::SeqCst);
}
}
let dropped = std::sync::Arc::new(AtomicBool::new(false));
let owned = OwnedWork(dropped.clone());
let (started, ready) = tokio::sync::oneshot::channel();
let (release, resume) = tokio::sync::oneshot::channel();
let (finished, done) = tokio::sync::oneshot::channel();
let task = tokio::spawn(async move {
let owned = owned;
started.send(()).expect("work started");
resume.await.expect("fixture releases owned work");
drop(owned);
finished.send(()).expect("work completed");
});
ready.await.expect("task must actually be in flight");
assert!(!wait_for_scanner_cleanup(task).await, "timeout is not a completed join");
assert!(!dropped.load(Ordering::SeqCst), "timeout must not abort the reset's owned guards");
release.send(()).expect("detached task remains alive");
done.await.expect("owned work should finish after explicit release");
assert!(dropped.load(Ordering::SeqCst));
}
#[test]
fn embedded_global_init_guard_allows_local_retry_before_mark() {
let server_started = AtomicBool::new(false);
@@ -1,8 +1,8 @@
{
"bytes": "eyJmb3JtYXRWZXJzaW9uIjoicnVzdGZzLmNvbm5lY3Qub2ZmbGluZS5lbnJvbGxtZW50Q2hhbGxlbmdlLzEiLCJwcm90b2NvbFZlcnNpb24iOiJ2MSIsImNoYWxsZW5nZUlkIjoiMDE4ZjdlNmQtOWQ2YS03ZDkzLThmNjQtOGIyMGIzMzg0NzEyIiwib3JnYW5pemF0aW9uTmFtZSI6Im9yZ2FuaXphdGlvbnMvMDE4ZjdlNmQtOWQ2YS03ZDkzLThmNjQtOGIyMGIzMzg0NzEzIiwiY2x1c3Rlck5hbWUiOiJvcmdhbml6YXRpb25zLzAxOGY3ZTZkLTlkNmEtN2Q5My04ZjY0LThiMjBiMzM4NDcxMy9jbHVzdGVycy8wMThmN2U2ZC05ZDZhLTdkOTMtOGY2NC04YjIwYjMzODQ3MTQiLCJub25jZSI6InBLU2twS1NrcEtTa3BLU2twS1NrcEtTa3BLU2twS1NrcEtTa3BLU2twS1EiLCJpc3N1ZWRBdCI6IjIwOTktMDEtMDFUMDA6MDA6MDBaIiwiZXhwaXJlc0F0IjoiMjA5OS0wMS0wOFQwMDowMDowMFoiLCJjb25uZWN0S2V5SWQiOiJmMGI5NGMwNDIxZmY4OTRhOTU5MjZmMjViNTJiODVjNTk4ZjI4ZDJkN2MwYzljNTA1YjdjMTgwMTcwZTlhZmZkIiwidHJ1c3RDaGFpbiI6W3siYnl0ZXMiOiJleUptYjNKdFlYUldaWEp6YVc5dUlqb2ljblZ6ZEdaekxtTnZibTVsWTNRdWIyWm1iR2x1WlM1MGNuVnpkRXhwYm1zdk1TSXNJbkJ5YjNSdlkyOXNWbVZ5YzJsdmJpSTZJbll4SWl3aWMyVnlhV0ZzSWpvaVpUQTBZVEF3TURBd01EQXdNREF3TURBd01EQXdNREF3TURBd01EQXdNREVpTENKeWIyeGxJam9pYVc1MFpYSnRaV1JwWVhSbElpd2lhWE56ZFdWeVMyVjVTV1FpT2lJNU5qRmlaR1l3TlRneU5USmtNREU0TWpZNE1tVXdZbUUyT0RRek5EWTJOamxsWW1RMU5tVmhOalE0WlRBM1l6Z3hPRGMxTTJSbVpUZzNNV0prTldNMUlpd2ljM1ZpYW1WamRFdGxlVWxrSWpvaVpHWTRZbUZqTUdGa05ETTVNMkUwWmpGa01HVmlZalptWTJFeVpqUXhZekkzTnpCaE5tTmlZVFEzTVRFek9ESmpOVFE0WlRneE1XVmpNMkV4TTJFMU9TSXNJbk4xWW1wbFkzUlFkV0pzYVdOTFpYa2lPaUpDUTI5S1ZsZFBhVEYxT1Vwd1RIWjFSMGMzWjI5QmIyeEhZMTlUVG1waFpWaHRVVzh5T0dSaVJFdFNaRGg0UVdVNU9HZzNhbWxqYldvM0xWaEtVVVZNVG5OU1oyRldhM2hWY1dRdE5IZ3Rla2R6ZUdGM1VHOGlMQ0p1YjNSQ1pXWnZjbVVpT2lJeU1EazRMVEF4TFRBeFZEQXdPakF3T2pBd1dpSXNJbTV2ZEVGbWRHVnlJam9pTWpBNU9TMHdNUzB3TVZRd01Eb3dNRG93TUZvaWZRPT0iLCJzaWduYXR1cmUiOnsiYWxnb3JpdGhtIjoiRVMyNTYiLCJrZXlJZCI6Ijk2MWJkZjA1ODI1MmQwMTgyNjgyZTBiYTY4NDM0NjY2OWViZDU2ZWE2NDhlMDdjODE4NzUzZGZlODcxYmQ1YzUiLCJ2YWx1ZSI6Ijk3aVF3d0w5U3lKZkNEYnpBOWRFRFVZUXVzMDFha2xTOElXY0hmMVFLNE1VdHlHR2I3d2lRdkhPTWhDNFlhUFBXM21UUk5wejQtWV9HYXVnSXFMcTdnIn19LHsiYnl0ZXMiOiJleUptYjNKdFlYUldaWEp6YVc5dUlqb2ljblZ6ZEdaekxtTnZibTVsWTNRdWIyWm1iR2x1WlM1MGNuVnpkRXhwYm1zdk1TSXNJbkJ5YjNSdlkyOXNWbVZ5YzJsdmJpSTZJbll4SWl3aWMyVnlhV0ZzSWpvaVpUQTBZVEF3TURBd01EQXdNREF3TURBd01EQXdNREF3TURBd01EQXdNRElpTENKeWIyeGxJam9pYzJsbmJtbHVaeUlzSW1semMzVmxja3RsZVVsa0lqb2laR1k0WW1Gak1HRmtORE01TTJFMFpqRmtNR1ZpWWpabVkyRXlaalF4WXpJM056QmhObU5pWVRRM01URXpPREpqTlRRNFpUZ3hNV1ZqTTJFeE0yRTFPU0lzSW5OMVltcGxZM1JMWlhsSlpDSTZJbVl3WWprMFl6QTBNakZtWmpnNU5HRTVOVGt5Tm1ZeU5XSTFNbUk0TldNMU9UaG1NamhrTW1RM1l6QmpPV00xTURWaU4yTXhPREF4TnpCbE9XRm1abVFpTENKemRXSnFaV04wVUhWaWJHbGpTMlY1SWpvaVFrMHpkamxmU0hwelJubFRUMXB1Y1hsUmFERTVkbWRHZFdZeFpqVjRhV3RvVlUweFRsWmlhSFZzYVZObVkycEtWRFJCY25Jd2FuVXdTV04wTmtaaFYybDJjbWRzV0dwTmRtMVVOM2h2UzNWNFYyMHRablJuSWl3aWJtOTBRbVZtYjNKbElqb2lNakE1T0MweE1pMHdNVlF3TURvd01Eb3dNRm9pTENKdWIzUkJablJsY2lJNklqSXdPVGt0TURFdE1ERlVNREE2TURBNk1EQmFJbjA9Iiwic2lnbmF0dXJlIjp7ImFsZ29yaXRobSI6IkVTMjU2Iiwia2V5SWQiOiJkZjhiYWMwYWQ0MzkzYTRmMWQwZWJiNmZjYTJmNDFjMjc3MGE2Y2JhNDcxMTM4MmM1NDhlODExZWMzYTEzYTU5IiwidmFsdWUiOiJpOXpFbVdleTlFSVZyMXlvanhzdmpILWxMVjloQWxJek5wQWpWUW82MzB0bmE5dFBiOVBpbVp5TlMtV1R5TW5nX2YyZVVOcF9sdEZKRmhuSDBWdHB6dyJ9fV19",
"bytes": "eyJmb3JtYXRWZXJzaW9uIjoicnVzdGZzLmNvbm5lY3Qub2ZmbGluZS5lbnJvbGxtZW50Q2hhbGxlbmdlLzEiLCJwcm90b2NvbFZlcnNpb24iOiJ2MSIsImNoYWxsZW5nZUlkIjoiMDE4ZjdlNmQtOWQ2YS03ZDkzLThmNjQtOGIyMGIzMzg0NzEyIiwib3JnYW5pemF0aW9uTmFtZSI6Im9yZ2FuaXphdGlvbnMvMDE4ZjdlNmQtOWQ2YS03ZDkzLThmNjQtOGIyMGIzMzg0NzEzIiwiY2x1c3Rlck5hbWUiOiJvcmdhbml6YXRpb25zLzAxOGY3ZTZkLTlkNmEtN2Q5My04ZjY0LThiMjBiMzM4NDcxMy9jbHVzdGVycy8wMThmN2U2ZC05ZDZhLTdkOTMtOGY2NC04YjIwYjMzODQ3MTQiLCJub25jZSI6InBLU2twS1NrcEtTa3BLU2twS1NrcEtTa3BLU2twS1NrcEtTa3BLU2twS1EiLCJpc3N1ZWRBdCI6IjIwOTktMDEtMDFUMDA6MDA6MDBaIiwiZXhwaXJlc0F0IjoiMjA5OS0wMS0wOFQwMDowMDowMFoiLCJjb25uZWN0S2V5SWQiOiIwNjA3NWY0ODRkY2U1YzA3NDVjYTc2NWE4ODk5MzA5YmQ3MTc2MTI5NDdhMzc3MGEwZDI3YjhjY2I4YmY5MDUyIiwidHJ1c3RDaGFpbiI6W3siYnl0ZXMiOiJleUptYjNKdFlYUldaWEp6YVc5dUlqb2ljblZ6ZEdaekxtTnZibTVsWTNRdWIyWm1iR2x1WlM1MGNuVnpkRXhwYm1zdk1TSXNJbkJ5YjNSdlkyOXNWbVZ5YzJsdmJpSTZJbll4SWl3aWMyVnlhV0ZzSWpvaVpUQTBZVEF3TURBd01EQXdNREF3TURBd01EQXdNREF3TURBd01EQXdNREVpTENKeWIyeGxJam9pYVc1MFpYSnRaV1JwWVhSbElpd2lhWE56ZFdWeVMyVjVTV1FpT2lJNVlUVmpNemcxWVdKa09UZGpOMlppT0RSak5UUXdZalZtTldVME1tUTNPVGt4T1RNd1lUUTBOMk01TURJMk56azVaVGhtWkRSak5ESXpNR0kxWXpOaklpd2ljM1ZpYW1WamRFdGxlVWxrSWpvaVlUazFOVGxpWkRSbE1EazBPV0ZqWXpFeU1tRm1abU0xTldVMlpHSTRaVGt4Wmpoa01EazNaVFUxWldNNE9UbGtZVFl4T1RGbE5EWTVZelE0T0RKaE1pSXNJbk4xWW1wbFkzUlFkV0pzYVdOTFpYa2lPaUpDVG13elZFeDFTazV0Tld4NFRGUmFNRGxUWVdwWVRHMUZSM0ZqZHpGaVQyZzROVWhEYmpWdVVUazJWVlZUYUZVNFZHeEhVVWsxYmxaSldWUnJRWFpLYjFWRVMwWmhVVlp0WVZGVk9WRkhaemsyVDJ0RU1EUWlMQ0p1YjNSQ1pXWnZjbVVpT2lJeU1ESXdMVEF4TFRBeFZEQXdPakF3T2pBd1dpSXNJbTV2ZEVGbWRHVnlJam9pTWpBNU9TMHdNUzB3TVZRd01Eb3dNRG93TUZvaWZRPT0iLCJzaWduYXR1cmUiOnsiYWxnb3JpdGhtIjoiRVMyNTYiLCJrZXlJZCI6IjlhNWMzODVhYmQ5N2M3ZmI4NGM1NDBiNWY1ZTQyZDc5OTE5MzBhNDQ3YzkwMjY3OTllOGZkNGM0MjMwYjVjM2MiLCJ2YWx1ZSI6IklUSThKVGFURjRoRHJ0bF9tSk0zYmZ0eUlhMlJaSjFNNVpPVk1xaEE2cVJSSzFNcEcxQlF0emRRVzB6bHo4eG1RZUJNWl84clViTUlFcnFBel8tSWZRIn19LHsiYnl0ZXMiOiJleUptYjNKdFlYUldaWEp6YVc5dUlqb2ljblZ6ZEdaekxtTnZibTVsWTNRdWIyWm1iR2x1WlM1MGNuVnpkRXhwYm1zdk1TSXNJbkJ5YjNSdlkyOXNWbVZ5YzJsdmJpSTZJbll4SWl3aWMyVnlhV0ZzSWpvaVpUQTBZVEF3TURBd01EQXdNREF3TURBd01EQXdNREF3TURBd01EQXdNRElpTENKeWIyeGxJam9pYzJsbmJtbHVaeUlzSW1semMzVmxja3RsZVVsa0lqb2lZVGsxTlRsaVpEUmxNRGswT1dGall6RXlNbUZtWm1NMU5XVTJaR0k0WlRreFpqaGtNRGszWlRVMVpXTTRPVGxrWVRZeE9URmxORFk1WXpRNE9ESmhNaUlzSW5OMVltcGxZM1JMWlhsSlpDSTZJakEyTURjMVpqUTROR1JqWlRWak1EYzBOV05oTnpZMVlUZzRPVGt6TURsaVpEY3hOell4TWprME4yRXpOemN3WVRCa01qZGlPR05qWWpoaVpqa3dOVElpTENKemRXSnFaV04wVUhWaWJHbGpTMlY1SWpvaVFrRk9lWFpITFdkR1YwdFRaM0pMWTNkUVpGUmhNRWN3TTBKdlVtRkNSbWhvZG10cWRFUjZlVk5tYm5weFYxcHROa2xLV0U1RWRVZEdlVXBFZVZWSmNYZzJSa1p5TlZSV2NsOXVhbUZCYzFWb2FEbE1VMlJ2SWl3aWJtOTBRbVZtYjNKbElqb2lNakF5TUMwd01TMHdNVlF3TURvd01Eb3dNRm9pTENKdWIzUkJablJsY2lJNklqSXdPVGt0TURFdE1ERlVNREE2TURBNk1EQmFJbjA9Iiwic2lnbmF0dXJlIjp7ImFsZ29yaXRobSI6IkVTMjU2Iiwia2V5SWQiOiJhOTU1OWJkNGUwOTQ5YWNjMTIyYWZmYzU1ZTZkYjhlOTFmOGQwOTdlNTVlYzg5OWRhNjE5MWU0NjljNDg4MmEyIiwidmFsdWUiOiI4MTVrVGNMY1hkZXZORFRia1dBck1KSnpORTVmaEdxbTNUb3hTM3Exdl9ZQkRVcmFieldmTFhjMEc5TjZiVXZFeEd3WEJUMVFpVzJvUDBCM3JKUS0ydyJ9fV19",
"signature": {
"algorithm": "ES256",
"keyId": "f0b94c0421ff894a95926f25b52b85c598f28d2d7c0c9c505b7c180170e9affd",
"value": "BHXk_PVnu7aSUEOw-0V9BKVsGVx9y9CooQWrihytOOdxA1fVIyoizpmTGfKDAWqUXrTBsfY9PaAQwwP6woqDsA"
"keyId": "06075f484dce5c0745ca765a8899309bd717612947a3770a0d27b8ccb8bf9052",
"value": "8i2nvYhNsZbL1UPF82Otr4pcecYfKhdRV1Q7m3Geqcx-TdvYk486Q_cZHSQ7OaqnIhTZwPgMYFYKUuEhwAaYEQ"
}
}
+2 -2
View File
@@ -1,4 +1,4 @@
{
"keyId": "961bdf058252d0182682e0ba684346669ebd56ea648e07c818753dfe871bd5c5",
"publicKey": "BGSX3hCszqEXrRtz0qYiJlGRp7Ejd5XUArOEvQpJlWreFQonquagbtHfeu89PFRvhHMisjaCBWDrHvjbwxFAu5g"
"keyId": "9a5c385abd97c7fb84c540b5f5e42d7991930a447c9026799e8fd4c4230b5c3c",
"publicKey": "BIPyiA1W2NDuy3ftHLtlY2tO2WNjkjGINZ_9QQvyyN9syzbMb91QYG2SN0AqZPylFsTL-loF4M1tVySZtXJpKhM"
}
@@ -1 +1 @@
[{"bytes":"eyJmb3JtYXRWZXJzaW9uIjoicnVzdGZzLmNvbm5lY3Qub2ZmbGluZS50cnVzdExpbmsvMSIsInByb3RvY29sVmVyc2lvbiI6InYxIiwic2VyaWFsIjoiZTA0YTAwMDAwMDAwMDAwMDAwMDAwMDAwMDAwMDAwMDEiLCJyb2xlIjoiaW50ZXJtZWRpYXRlIiwiaXNzdWVyS2V5SWQiOiI5NjFiZGYwNTgyNTJkMDE4MjY4MmUwYmE2ODQzNDY2NjllYmQ1NmVhNjQ4ZTA3YzgxODc1M2RmZTg3MWJkNWM1Iiwic3ViamVjdEtleUlkIjoiZGY4YmFjMGFkNDM5M2E0ZjFkMGViYjZmY2EyZjQxYzI3NzBhNmNiYTQ3MTEzODJjNTQ4ZTgxMWVjM2ExM2E1OSIsInN1YmplY3RQdWJsaWNLZXkiOiJCQ29KVldPaTF1OUpwTHZ1R0c3Z29Bb2xHY19TTmphZVhtUW8yOGRiREtSZDh4QWU5OGg3amljbWo3LVhKUUVMTnNSZ2FWa3hVcWQtNHgtekdzeGF3UG8iLCJub3RCZWZvcmUiOiIyMDk4LTAxLTAxVDAwOjAwOjAwWiIsIm5vdEFmdGVyIjoiMjA5OS0wMS0wMVQwMDowMDowMFoifQ==","signature":{"algorithm":"ES256","keyId":"961bdf058252d0182682e0ba684346669ebd56ea648e07c818753dfe871bd5c5","value":"97iQwwL9SyJfCDbzA9dEDUYQus01aklS8IWcHf1QK4MUtyGGb7wiQvHOMhC4YaPPW3mTRNpz4-Y_GaugIqLq7g"}},{"bytes":"eyJmb3JtYXRWZXJzaW9uIjoicnVzdGZzLmNvbm5lY3Qub2ZmbGluZS50cnVzdExpbmsvMSIsInByb3RvY29sVmVyc2lvbiI6InYxIiwic2VyaWFsIjoiZTA0YTAwMDAwMDAwMDAwMDAwMDAwMDAwMDAwMDAwMDIiLCJyb2xlIjoic2lnbmluZyIsImlzc3VlcktleUlkIjoiZGY4YmFjMGFkNDM5M2E0ZjFkMGViYjZmY2EyZjQxYzI3NzBhNmNiYTQ3MTEzODJjNTQ4ZTgxMWVjM2ExM2E1OSIsInN1YmplY3RLZXlJZCI6ImYwYjk0YzA0MjFmZjg5NGE5NTkyNmYyNWI1MmI4NWM1OThmMjhkMmQ3YzBjOWM1MDViN2MxODAxNzBlOWFmZmQiLCJzdWJqZWN0UHVibGljS2V5IjoiQk0zdjlfSHpzRnlTT1pucXlRaDE5dmdGdWYxZjV4aWtoVU0xTlZiaHVsaVNmY2pKVDRBcnIwanUwSWN0NkZhV2l2cmdsWGpNdm1UN3hvS3V4V20tZnRnIiwibm90QmVmb3JlIjoiMjA5OC0xMi0wMVQwMDowMDowMFoiLCJub3RBZnRlciI6IjIwOTktMDEtMDFUMDA6MDA6MDBaIn0=","signature":{"algorithm":"ES256","keyId":"df8bac0ad4393a4f1d0ebb6fca2f41c2770a6cba4711382c548e811ec3a13a59","value":"i9zEmWey9EIVr1yojxsvjH-lLV9hAlIzNpAjVQo630tna9tPb9PimZyNS-WTyMng_f2eUNp_ltFJFhnH0Vtpzw"}}]
[{"bytes":"eyJmb3JtYXRWZXJzaW9uIjoicnVzdGZzLmNvbm5lY3Qub2ZmbGluZS50cnVzdExpbmsvMSIsInByb3RvY29sVmVyc2lvbiI6InYxIiwic2VyaWFsIjoiZTA0YTAwMDAwMDAwMDAwMDAwMDAwMDAwMDAwMDAwMDEiLCJyb2xlIjoiaW50ZXJtZWRpYXRlIiwiaXNzdWVyS2V5SWQiOiI5YTVjMzg1YWJkOTdjN2ZiODRjNTQwYjVmNWU0MmQ3OTkxOTMwYTQ0N2M5MDI2Nzk5ZThmZDRjNDIzMGI1YzNjIiwic3ViamVjdEtleUlkIjoiYTk1NTliZDRlMDk0OWFjYzEyMmFmZmM1NWU2ZGI4ZTkxZjhkMDk3ZTU1ZWM4OTlkYTYxOTFlNDY5YzQ4ODJhMiIsInN1YmplY3RQdWJsaWNLZXkiOiJCTmwzVEx1Sk5tNWx4TFRaMDlTYWpYTG1FR3FjdzFiT2g4NUhDbjVuUTk2VVVTaFU4VGxHUUk1blZJWVRrQXZKb1VES0ZhUVZtYVFVOVFHZzk2T2tEMDQiLCJub3RCZWZvcmUiOiIyMDIwLTAxLTAxVDAwOjAwOjAwWiIsIm5vdEFmdGVyIjoiMjA5OS0wMS0wMVQwMDowMDowMFoifQ==","signature":{"algorithm":"ES256","keyId":"9a5c385abd97c7fb84c540b5f5e42d7991930a447c9026799e8fd4c4230b5c3c","value":"ITI8JTaTF4hDrtl_mJM3bftyIa2RZJ1M5ZOVMqhA6qRRK1MpG1BQtzdQW0zlz8xmQeBMZ_8rUbMIErqAz_-IfQ"}},{"bytes":"eyJmb3JtYXRWZXJzaW9uIjoicnVzdGZzLmNvbm5lY3Qub2ZmbGluZS50cnVzdExpbmsvMSIsInByb3RvY29sVmVyc2lvbiI6InYxIiwic2VyaWFsIjoiZTA0YTAwMDAwMDAwMDAwMDAwMDAwMDAwMDAwMDAwMDIiLCJyb2xlIjoic2lnbmluZyIsImlzc3VlcktleUlkIjoiYTk1NTliZDRlMDk0OWFjYzEyMmFmZmM1NWU2ZGI4ZTkxZjhkMDk3ZTU1ZWM4OTlkYTYxOTFlNDY5YzQ4ODJhMiIsInN1YmplY3RLZXlJZCI6IjA2MDc1ZjQ4NGRjZTVjMDc0NWNhNzY1YTg4OTkzMDliZDcxNzYxMjk0N2EzNzcwYTBkMjdiOGNjYjhiZjkwNTIiLCJzdWJqZWN0UHVibGljS2V5IjoiQkFOeXZHLWdGV0tTZ3JLY3dQZFRhMEcwM0JvUmFCRmhodmtqdER6eVNmbnpxV1ptNklKWE5EdUdGeUpEeVVJcXg2RkZyNVRWcl9uamFBc1VoaDlMU2RvIiwibm90QmVmb3JlIjoiMjAyMC0wMS0wMVQwMDowMDowMFoiLCJub3RBZnRlciI6IjIwOTktMDEtMDFUMDA6MDA6MDBaIn0=","signature":{"algorithm":"ES256","keyId":"a9559bd4e0949acc122affc55e6db8e91f8d097e55ec899da6191e469c4882a2","value":"815kTcLcXdevNDTbkWArMJJzNE5fhGqm3ToxS3q1v_YBDUrabzWfLXc0G9N6bUvExGwXBT1QiW2oP0B3rJQ-2w"}}]
+33
View File
@@ -0,0 +1,33 @@
# Legacy Heal Outcome Compatibility
This fixture executes the real `madmin-go` HTTP decoder and a pinned `mc` binary against synthetic v3 responses. Rust owner, admin adapter, and SDK tests validate the same JSON cases in `crates/madmin/tests/fixtures/heal-outcome-v3.json`. It does not run a storage repair or prove distributed recovery.
Pinned primary sources:
- `mc` release `RELEASE.2025-08-13T08-35-41Z`, commit `7394ce0dd2a80935aded936b09fa12cbb3cb8096`: [polling implementation](https://github.com/minio/mc/blob/7394ce0dd2a80935aded936b09fa12cbb3cb8096/cmd/admin-heal-ui.go#L414).
- Its `madmin-go/v3` dependency is `v3.0.107-0.20250415152934-4b504b82db63`: [decoder and response type](https://github.com/minio/madmin-go/blob/4b504b82db633e978a57d49443b2be75824244c3/heal-commands.go#L101).
The old decoder ignores additional JSON fields. The old poller returns success for `finished` without examining `detail`; only `stopped` returns a terminal error. Consequently `completed_with_errors` retains its canonical outcome and complete traversal coverage, but uses legacy summary `stopped`. `completed` describes execution only: unknown storage receipts remain `unknown`, not `repaired`.
Run from the repository root with an isolated tool cache and binary directory:
```sh
(
set -eu
compat_dir=$(mktemp -d)
trap 'rm -rf "$compat_dir"' EXIT
export GOPATH="$compat_dir/gopath" GOMODCACHE="$compat_dir/mod" GOCACHE="$compat_dir/cache" GOBIN="$compat_dir/bin"
export CGO_ENABLED=0 GOTOOLCHAIN=local GOMAXPROCS=2
go install github.com/minio/mc@v0.0.0-20250813083541-7394ce0dd2a8
cd scripts/compat/heal-outcome
MC_BINARY="$compat_dir/bin/mc" NO_PROXY=127.0.0.1,localhost go test -mod=readonly -p 2 -count=1 -v ./...
)
```
The subshell keeps the calling shell unchanged. `MC_BINARY` is mandatory and its Go build metadata must identify the pinned commit. Each subprocess gets a temporary mc configuration directory and synthetic credentials; it never edits the user's mc configuration. Loopback socket permission is required. The Go tests do not skip unavailable prerequisites.
Six cases cover completed traversal, unknown repair proof, completed traversal with failures, cancellation, deadline, and untraversable listing. Two receiver cases carry a remote `finished` summary that contradicts an aborted or completed-with-errors outcome. The admin test applies the heal owner's wire validator to each `remoteResponse` and must produce the corresponding public `response`; the old CLI must then exit with an error. Unknown extension fields remain intact. Unknown or missing execution fields cannot validate a successful summary.
New counters do not replace or reinterpret legacy progress. Outcome is a cumulative snapshot, not a page delta; `sinceSeq` only pages legacy result items. Result cursors and truncation markers remain separate from execution and traversal coverage.
Two existing CLI limitations remain explicit: this mc does not terminate on `notFound`, and `-f` polling sends `forceStart` together with `clientToken`, a combination the RustFS v3 request contract rejects. The fixture uses the standard non-force polling flow. Neither limitation is hidden by emitting a new summary string or reporting a missing task as completed.
+137
View File
@@ -0,0 +1,137 @@
// Copyright 2026 RustFS Team
// Licensed under the Apache License, Version 2.0.
package compat_test
import (
"context"
"debug/buildinfo"
"encoding/json"
"fmt"
"net/http"
"net/http/httptest"
"os"
"os/exec"
"path/filepath"
"strings"
"sync/atomic"
"testing"
"time"
madmin "github.com/minio/madmin-go/v3"
)
type fixture struct {
Name string `json:"name"`
CLIExit int `json:"cliExit"`
Response json.RawMessage `json:"response"`
}
func fixtures(t *testing.T) []fixture {
t.Helper()
data, err := os.ReadFile("../../../crates/madmin/tests/fixtures/heal-outcome-v3.json")
if err != nil {
t.Fatal(err)
}
var cases []fixture
if err := json.Unmarshal(data, &cases); err != nil {
t.Fatal(err)
}
if len(cases) != 8 {
t.Fatalf("expected eight owner/receiver-validated fixtures, got %d", len(cases))
}
return cases
}
func fixtureServer(t *testing.T, response []byte, polls *atomic.Int32) *httptest.Server {
t.Helper()
server := httptest.NewServer(http.HandlerFunc(func(w http.ResponseWriter, r *http.Request) {
if r.Method != http.MethodPost || !strings.HasPrefix(r.URL.Path, "/minio/admin/v3/heal/") {
t.Errorf("unexpected client request %s %s", r.Method, r.URL.Path)
http.Error(w, "unexpected request", http.StatusBadRequest)
return
}
w.Header().Set("Content-Type", "application/json")
if r.URL.Query().Get("clientToken") == "" {
fmt.Fprint(w, `{"clientToken":"fixture-token","clientAddress":"","startTime":"2026-01-01T00:00:00Z"}`)
return
}
polls.Add(1)
w.Write(response)
}))
t.Cleanup(server.Close)
return server
}
func TestLegacyMadminDecoder(t *testing.T) {
for _, f := range fixtures(t) {
t.Run(f.Name, func(t *testing.T) {
var polls atomic.Int32
server := fixtureServer(t, f.Response, &polls)
client, err := madmin.New(strings.TrimPrefix(server.URL, "http://"), "fixture-access", "fixture-secret", false)
if err != nil {
t.Fatal(err)
}
ctx, cancel := context.WithTimeout(context.Background(), 5*time.Second)
defer cancel()
_, status, err := client.Heal(ctx, "bucket", "", madmin.HealOpts{}, "fixture-token", false, false)
if err != nil {
t.Fatal(err)
}
var expected struct {
Summary string `json:"summary"`
Detail string `json:"detail"`
}
if err := json.Unmarshal(f.Response, &expected); err != nil {
t.Fatal(err)
}
if status.Summary != expected.Summary || status.FailureDetail != expected.Detail || polls.Load() != 1 {
t.Fatalf("decoder changed legacy fields: %+v, polls=%d", status, polls.Load())
}
})
}
}
func TestLegacyMCPoll(t *testing.T) {
binary := os.Getenv("MC_BINARY")
if binary == "" {
t.Fatal("MC_BINARY must point to the pinned mc release; this check cannot be skipped")
}
info, err := buildinfo.ReadFile(binary)
if err != nil {
t.Fatal(err)
}
if info.Main.Path != "github.com/minio/mc" || !strings.Contains(info.Main.Version, "7394ce0dd2a8") {
t.Fatalf("expected mc RELEASE.2025-08-13T08-35-41Z (7394ce0dd2a8), got %+v", info.Main)
}
for _, f := range fixtures(t) {
t.Run(f.Name, func(t *testing.T) {
var polls atomic.Int32
server := fixtureServer(t, f.Response, &polls)
ctx, cancel := context.WithTimeout(context.Background(), 10*time.Second)
defer cancel()
cmd := exec.CommandContext(ctx, binary, "--config-dir", filepath.Join(t.TempDir(), "mc"), "--json", "admin", "heal", "--recursive", "w23/bucket")
cmd.Env = append(os.Environ(), "MC_HOST_w23="+strings.Replace(server.URL, "http://", "http://fixture-access:fixture-secret@", 1), "MC_NO_COLOR=1")
output, err := cmd.CombinedOutput()
if ctx.Err() != nil {
t.Fatalf("legacy poll did not terminate: %s", output)
}
exit := 0
if err != nil {
var ok bool
var status *exec.ExitError
status, ok = err.(*exec.ExitError)
if !ok {
t.Fatal(err)
}
exit = status.ExitCode()
}
if exit != f.CLIExit || polls.Load() != 1 {
t.Fatalf("exit=%d expected=%d polls=%d output=%s", exit, f.CLIExit, polls.Load(), output)
}
if f.CLIExit != 0 && !strings.Contains(string(output), "Heal had an error") {
t.Fatalf("failure was not the expected legacy terminal result: %s", output)
}
})
}
}
+34
View File
@@ -0,0 +1,34 @@
module rustfs.local/heal-outcome-compat
go 1.24.0
require github.com/minio/madmin-go/v3 v3.0.107-0.20250415152934-4b504b82db63
require (
github.com/cespare/xxhash/v2 v2.3.0 // indirect
github.com/dustin/go-humanize v1.0.1 // indirect
github.com/go-ini/ini v1.67.0 // indirect
github.com/goccy/go-json v0.10.5 // indirect
github.com/golang-jwt/jwt/v4 v4.5.2 // indirect
github.com/golang/protobuf v1.5.4 // indirect
github.com/matttproud/golang_protobuf_extensions v1.0.4 // indirect
github.com/minio/md5-simd v1.1.2 // indirect
github.com/minio/minio-go/v7 v7.0.90 // indirect
github.com/munnerz/goautoneg v0.0.0-20191010083416-a7dc8b61c822 // indirect
github.com/philhofer/fwd v1.1.3-0.20240916144458-20a13a1f6b7c // indirect
github.com/prometheus/client_model v0.6.2 // indirect
github.com/prometheus/common v0.63.0 // indirect
github.com/prometheus/procfs v0.16.0 // indirect
github.com/prometheus/prom2json v1.4.2 // indirect
github.com/prometheus/prometheus v0.303.0 // indirect
github.com/rs/xid v1.6.0 // indirect
github.com/secure-io/sio-go v0.3.1 // indirect
github.com/shirou/gopsutil/v3 v3.24.5 // indirect
github.com/shoenig/go-m1cpu v0.1.6 // indirect
github.com/tinylib/msgp v1.2.5 // indirect
github.com/tklauser/go-sysconf v0.3.15 // indirect
golang.org/x/crypto v0.37.0 // indirect
golang.org/x/net v0.39.0 // indirect
golang.org/x/sys v0.32.0 // indirect
google.golang.org/protobuf v1.36.6 // indirect
)
+64
View File
@@ -0,0 +1,64 @@
github.com/cespare/xxhash/v2 v2.3.0 h1:UL815xU9SqsFlibzuggzjXhog7bL6oX9BbNZnL2UFvs=
github.com/cespare/xxhash/v2 v2.3.0/go.mod h1:VGX0DQ3Q6kWi7AoAeZDth3/j3BFtOZR5XLFGgcrjCOs=
github.com/dustin/go-humanize v1.0.1 h1:GzkhY7T5VNhEkwH0PVJgjz+fX1rhBrR7pRT3mDkpeCY=
github.com/dustin/go-humanize v1.0.1/go.mod h1:Mu1zIs6XwVuF/gI1OepvI0qD18qycQx+mFykh5fBlto=
github.com/go-ini/ini v1.67.0 h1:z6ZrTEZqSWOTyH2FlglNbNgARyHG8oLW9gMELqKr06A=
github.com/go-ini/ini v1.67.0/go.mod h1:ByCAeIL28uOIIG0E3PJtZPDL8WnHpFKFOtgjp+3Ies8=
github.com/goccy/go-json v0.10.5 h1:Fq85nIqj+gXn/S5ahsiTlK3TmC85qgirsdTP/+DeaC4=
github.com/goccy/go-json v0.10.5/go.mod h1:oq7eo15ShAhp70Anwd5lgX2pLfOS3QCiwU/PULtXL6M=
github.com/golang-jwt/jwt/v4 v4.5.2 h1:YtQM7lnr8iZ+j5q71MGKkNw9Mn7AjHM68uc9g5fXeUI=
github.com/golang-jwt/jwt/v4 v4.5.2/go.mod h1:m21LjoU+eqJr34lmDMbreY2eSTRJ1cv77w39/MY0Ch0=
github.com/golang/protobuf v1.2.0/go.mod h1:6lQm79b+lXiMfvg/cZm0SGofjICqVBUtrP5yJMmIC1U=
github.com/golang/protobuf v1.5.4 h1:i7eJL8qZTpSEXOPTxNKhASYpMn+8e5Q6AdndVa1dWek=
github.com/golang/protobuf v1.5.4/go.mod h1:lnTiLA8Wa4RWRcIUkrtSVa5nRhsEGBg48fD6rSs7xps=
github.com/klauspost/cpuid/v2 v2.0.1/go.mod h1:FInQzS24/EEf25PyTYn52gqo7WaD8xa0213Md/qVLRg=
github.com/matttproud/golang_protobuf_extensions v1.0.4 h1:mmDVorXM7PCGKw94cs5zkfA9PSy5pEvNWRP0ET0TIVo=
github.com/matttproud/golang_protobuf_extensions v1.0.4/go.mod h1:BSXmuO+STAnVfrANrmjBb36TMTDstsz7MSK+HVaYKv4=
github.com/minio/madmin-go/v3 v3.0.107-0.20250415152934-4b504b82db63 h1:ktN/FrMuM9sjvjIbPZYRKeHEzBDOXQdpYUDiNO0CutE=
github.com/minio/madmin-go/v3 v3.0.107-0.20250415152934-4b504b82db63/go.mod h1:U0bL6ip4yKFwvo0keonUcWFQp0Hd462tOLLeVyPzWmE=
github.com/minio/md5-simd v1.1.2 h1:Gdi1DZK69+ZVMoNHRXJyNcxrMA4dSxoYHZSQbirFg34=
github.com/minio/md5-simd v1.1.2/go.mod h1:MzdKDxYpY2BT9XQFocsiZf/NKVtR7nkE4RoEpN+20RM=
github.com/minio/minio-go/v7 v7.0.90 h1:TmSj1083wtAD0kEYTx7a5pFsv3iRYMsOJ6A4crjA1lE=
github.com/minio/minio-go/v7 v7.0.90/go.mod h1:uvMUcGrpgeSAAI6+sD3818508nUyMULw94j2Nxku/Go=
github.com/munnerz/goautoneg v0.0.0-20191010083416-a7dc8b61c822 h1:C3w9PqII01/Oq1c1nUAm88MOHcQC9l5mIlSMApZMrHA=
github.com/munnerz/goautoneg v0.0.0-20191010083416-a7dc8b61c822/go.mod h1:+n7T8mK8HuQTcFwEeznm/DIxMOiR9yIdICNftLE1DvQ=
github.com/philhofer/fwd v1.1.3-0.20240916144458-20a13a1f6b7c h1:dAMKvw0MlJT1GshSTtih8C2gDs04w8dReiOGXrGLNoY=
github.com/philhofer/fwd v1.1.3-0.20240916144458-20a13a1f6b7c/go.mod h1:RqIHx9QI14HlwKwm98g9Re5prTQ6LdeRQn+gXJFxsJM=
github.com/prometheus/client_model v0.6.2 h1:oBsgwpGs7iVziMvrGhE53c/GrLUsZdHnqNwqPLxwZyk=
github.com/prometheus/client_model v0.6.2/go.mod h1:y3m2F6Gdpfy6Ut/GBsUqTWZqCUvMVzSfMLjcu6wAwpE=
github.com/prometheus/common v0.63.0 h1:YR/EIY1o3mEFP/kZCD7iDMnLPlGyuU2Gb3HIcXnA98k=
github.com/prometheus/common v0.63.0/go.mod h1:VVFF/fBIoToEnWRVkYoXEkq3R3paCoxG9PXP74SnV18=
github.com/prometheus/procfs v0.16.0 h1:xh6oHhKwnOJKMYiYBDWmkHqQPyiY40sny36Cmx2bbsM=
github.com/prometheus/procfs v0.16.0/go.mod h1:8veyXUu3nGP7oaCxhX6yeaM5u4stL2FeMXnCqhDthZg=
github.com/prometheus/prom2json v1.4.2 h1:PxCTM+Whqi/eykO1MKsEL0p/zMpxp9ybpsmdFamw6po=
github.com/prometheus/prom2json v1.4.2/go.mod h1:zuvPm7u3epZSbXPWHny6G+o8ETgu6eAK3oPr6yFkRWE=
github.com/prometheus/prometheus v0.303.0 h1:wsNNsbd4EycMCphYnTmNY9JASBVbp7NWwJna857cGpA=
github.com/prometheus/prometheus v0.303.0/go.mod h1:8PMRi+Fk1WzopMDeb0/6hbNs9nV6zgySkU/zds5Lu3o=
github.com/rs/xid v1.6.0 h1:fV591PaemRlL6JfRxGDEPl69wICngIQ3shQtzfy2gxU=
github.com/rs/xid v1.6.0/go.mod h1:7XoLgs4eV+QndskICGsho+ADou8ySMSjJKDIan90Nz0=
github.com/secure-io/sio-go v0.3.1 h1:dNvY9awjabXTYGsTF1PiCySl9Ltofk9GA3VdWlo7rRc=
github.com/secure-io/sio-go v0.3.1/go.mod h1:+xbkjDzPjwh4Axd07pRKSNriS9SCiYksWnZqdnfpQxs=
github.com/shirou/gopsutil/v3 v3.24.5 h1:i0t8kL+kQTvpAYToeuiVk3TgDeKOFioZO3Ztz/iZ9pI=
github.com/shirou/gopsutil/v3 v3.24.5/go.mod h1:bsoOS1aStSs9ErQ1WWfxllSeS1K5D+U30r2NfcubMVk=
github.com/shoenig/go-m1cpu v0.1.6 h1:nxdKQNcEB6vzgA2E2bvzKIYRuNj7XNJ4S/aRSwKzFtM=
github.com/shoenig/go-m1cpu v0.1.6/go.mod h1:1JJMcUBvfNwpq05QDQVAnx3gUHr9IYF7GNg9SUEw2VQ=
github.com/tinylib/msgp v1.2.5 h1:WeQg1whrXRFiZusidTQqzETkRpGjFjcIhW6uqWH09po=
github.com/tinylib/msgp v1.2.5/go.mod h1:ykjzy2wzgrlvpDCRc4LA8UXy6D8bzMSuAF3WD57Gok0=
github.com/tklauser/go-sysconf v0.3.15 h1:VE89k0criAymJ/Os65CSn1IXaol+1wrsFHEB8Ol49K4=
github.com/tklauser/go-sysconf v0.3.15/go.mod h1:Dmjwr6tYFIseJw7a3dRLJfsHAMXZ3nEnL/aZY+0IuI4=
golang.org/x/crypto v0.0.0-20190308221718-c2843e01d9a2/go.mod h1:djNgcEr1/C05ACkg1iLfiJU5Ep61QUkGW8qpdssI0+w=
golang.org/x/crypto v0.0.0-20200302210943-78000ba7a073/go.mod h1:LzIPMQfyMNhhGPhUkYOs5KpL4U8rLKemX1yGLhDgUto=
golang.org/x/crypto v0.37.0 h1:kJNSjF/Xp7kU0iB2Z+9viTPMW4EqqsrywMXLJOOsXSE=
golang.org/x/crypto v0.37.0/go.mod h1:vg+k43peMZ0pUMhYmVAWysMK35e6ioLh3wB8ZCAfbVc=
golang.org/x/net v0.0.0-20190404232315-eb5bcb51f2a3/go.mod h1:t9HGtf8HONx5eT2rtn7q6eTqICYqUVnKs3thJo3Qplg=
golang.org/x/net v0.39.0 h1:ZCu7HMWDxpXpaiKdhzIfaltL9Lp31x/3fCP11bc6/fY=
golang.org/x/net v0.39.0/go.mod h1:X7NRbYVEA+ewNkCNyJ513WmMdQ3BineSwVtN2zD/d+E=
golang.org/x/sync v0.0.0-20181221193216-37e7f081c4d4/go.mod h1:RxMgew5VJxzue5/jJTE5uejpjVlOe/izrB70Jof72aM=
golang.org/x/sys v0.0.0-20190215142949-d0b11bdaac8a/go.mod h1:STP8DvDyc/dI5b8T5hshtkjS+E42TnysNCUPdjciGhY=
golang.org/x/sys v0.0.0-20190412213103-97732733099d/go.mod h1:h1NjWce9XRLGQEsW7wpKNCjG9DtNlClVuFLEZdDNbEs=
golang.org/x/sys v0.0.0-20200302150141-5c8b2ff67527/go.mod h1:h1NjWce9XRLGQEsW7wpKNCjG9DtNlClVuFLEZdDNbEs=
golang.org/x/sys v0.32.0 h1:s77OFDvIQeibCmezSnk/q6iAfkdiQaJi4VzroCFrN20=
golang.org/x/sys v0.32.0/go.mod h1:BJP2sWEmIv4KK5OTEluFJCKSidICx8ciO85XgH3Ak8k=
golang.org/x/text v0.3.0/go.mod h1:NqM8EUOU14njkJ3fqMW+pc6Ldnwhi/IjpwHt7yyuwOQ=
google.golang.org/protobuf v1.36.6 h1:z1NpPI8ku2WgiWnf+t9wTPsn6eP1L7ksHUlkfLvd9xY=
google.golang.org/protobuf v1.36.6/go.mod h1:jduwjTPXsFjZGTmRluh+L6NjiWu7pchiJ2/5YcXBHnY=