64 "%s: ErrorBoundMode::REL is deprecated for this stage and has been "
65 "mapped to PREL (abs_eb = eb * max(|data|)). This does NOT guarantee a "
66 "per-element relative bound. Use PREL explicitly to silence this, or "
67 "QuantizerStage with REL for an exact point-wise bound.",
114static_assert(
sizeof(LorenzoQuantConfig) <=
FZM_STAGE_CONFIG_SIZE,
"LorenzoQuantConfig must fit in FZM_STAGE_CONFIG_SIZE");
141template<
typename TInput =
float,
typename TCode = u
int16_t>
152 std::array<size_t, 3>
dims = {0, 1, 1};
173 Config(TInput eb, TCode radius = 32768,
float outlier_cap = 0.2f,
174 std::array<size_t, 3> d = {0, 1, 1})
179 explicit LorenzoQuantStage(
const Config& config = Config());
180 ~LorenzoQuantStage()
override;
185 const std::vector<void*>& inputs,
186 const std::vector<void*>& outputs,
187 const std::vector<size_t>& sizes
204 return sizeof(uint32_t);
207 std::string
getName()
const override {
return "LorenzoQuant"; }
208 size_t getNumInputs()
const override {
209 return is_inverse_ ? (config_.
centering ? 4 : 3) : 1;
211 size_t getNumOutputs()
const override {
212 return is_inverse_ ? 1 : (config_.
centering ? 4 : 3);
217 return {
"codes",
"outlier_errors",
"outlier_indices",
"means"};
218 return {
"codes",
"outlier_errors",
"outlier_indices"};
222 const std::vector<size_t>& input_sizes
227 std::unordered_map<std::string, size_t> result;
228 for (
size_t i = 0; i < names.size() && i < actual_output_sizes_.size(); i++) {
229 result[names[i]] = actual_output_sizes_[i];
234 return (index >= 0 && index <
static_cast<int>(actual_output_sizes_.size()))
235 ? actual_output_sizes_[index] : 0;
242 void saveState()
override { saved_output_sizes_ = actual_output_sizes_; }
243 void restoreState()
override { actual_output_sizes_ = saved_output_sizes_; }
246 void setErrorBound(TInput error_bound) { config_.
error_bound = error_bound; }
247 void setQuantRadius(TCode radius) { config_.
quant_radius = radius; }
248 void setOutlierCapacity(
float capacity) { config_.
outlier_capacity = capacity; }
249 void setDims(
const std::array<size_t, 3>& dims)
override { config_.
dims = dims; }
260 void setZigzagCodes(
bool enable) { config_.
zigzag_codes = enable; }
266 void setDims(
size_t x,
size_t y = 1,
size_t z = 1) { config_.
dims = {x, y, z}; }
268 TInput getErrorBound()
const {
return config_.
error_bound; }
269 TCode getQuantRadius()
const {
return config_.
quant_radius; }
271 std::array<size_t, 3> getDims()
const {
return config_.
dims; }
279 bool getZigzagCodes()
const {
return config_.
zigzag_codes; }
280 bool getCentering()
const {
return config_.
centering; }
284 if (config_.
dims[2] > 1)
return 3;
285 if (config_.
dims[1] > 1)
return 2;
290 bool isInverse()
const {
return is_inverse_; }
295 return static_cast<uint16_t
>(StageType::LORENZO_QUANT);
299 switch (output_index) {
300 case 0:
return static_cast<uint8_t
>(getCodeDataType());
302 case 2:
return static_cast<uint8_t
>(DataType::UINT32);
303 default:
return static_cast<uint8_t
>(DataType::UINT8);
311 size_t serializeHeader(
size_t output_index, uint8_t* header_buffer,
size_t max_size)
const override {
315 throw std::runtime_error(
"Insufficient buffer for Lorenzo config");
319 config.
error_bound =
static_cast<float>(computed_abs_eb_);
321 config.
num_elements =
static_cast<uint32_t
>(num_elements_);
325 config.
ndim =
static_cast<uint8_t
>(
ndim());
327 config.
dim_x =
static_cast<uint32_t
>(config_.
dims[0]);
328 config.
dim_y =
static_cast<uint32_t
>(config_.
dims[1]);
329 config.
dim_z =
static_cast<uint32_t
>(config_.
dims[2]);
331 config.
value_base =
static_cast<float>(computed_value_base_);
333 config.
value_base_f64 =
static_cast<double>(computed_value_base_);
349 constexpr size_t kLegacySize = 32;
350 if (size < kLegacySize) {
351 throw std::runtime_error(
"Invalid Lorenzo config size");
359 constexpr size_t kSizeBeforeF64 = 44;
360 const bool has_f64 = (size > kSizeBeforeF64 && config.
error_bound_f64 != 0.0);
362 computed_abs_eb_ = has_f64 ?
static_cast<TInput
>(config.
error_bound_f64)
368 constexpr size_t kV1Size = 40;
369 if (size >= kV1Size) {
377 computed_value_base_ = has_f64
383 computed_value_base_ =
static_cast<TInput
>(0);
389 constexpr size_t kV2Size = 44;
390 if (size >= kV2Size) {
401 int eff_ndim = (config.
ndim == 0) ? 1 :
static_cast<int>(config.
ndim);
403 if (config.
dim_x > 0) {
406 size_t yz = std::max<size_t>(1, config.
dim_y) * std::max<size_t>(1, config.
dim_z);
425 std::vector<size_t> actual_output_sizes_;
426 std::vector<size_t> saved_output_sizes_;
427 size_t num_elements_ = 0;
428 uint32_t actual_outlier_count_ = 0;
429 bool is_inverse_ =
false;
433 TInput computed_abs_eb_ = 0;
436 TInput computed_value_base_ =
static_cast<TInput
>(0);
443 uint32_t* d_outlier_count_scratch_ =
nullptr;
451 std::weak_ptr<const void> persistent_pool_alive_;
456 void initOutlierCountScratch(
MemoryPool* pool);
459 if (std::is_same<TInput, float>::value)
return DataType::FLOAT32;
460 if (std::is_same<TInput, double>::value)
return DataType::FLOAT64;
461 return DataType::FLOAT32;
465 if (std::is_same<TCode, uint8_t>::value)
return DataType::UINT8;
466 if (std::is_same<TCode, uint16_t>::value)
return DataType::UINT16;
467 if (std::is_same<TCode, uint32_t>::value)
return DataType::UINT32;
468 return DataType::UINT16;
471 size_t getMaxOutlierCount(
size_t num_elements)
const {
472 return static_cast<size_t>(std::ceil(num_elements * config_.outlier_capacity));
476extern template class LorenzoQuantStage<float, uint16_t>;
477extern template class LorenzoQuantStage<float, uint8_t>;
478extern template class LorenzoQuantStage<double, uint16_t>;
479extern template class LorenzoQuantStage<double, uint32_t>;
483template<
typename TInput,
typename TCode>
485 const TInput* d_input,
size_t n,
486 TInput ebx2_r, TCode quant_radius,
487 TCode* d_codes, TInput* d_outlier_errors,
488 uint32_t* d_outlier_indices, uint32_t* d_outlier_count,
489 size_t max_outliers,
int grid_size,
494 TInput* d_means =
nullptr
497template<
typename TInput,
typename TCode>
499 const TCode* d_codes,
500 const TInput* d_outlier_errors,
const uint32_t* d_outlier_indices,
503 TInput ebx2, TCode quant_radius,
508 const TInput* d_means =
nullptr
512template<
typename TInput,
typename TCode>
514 const TInput* d_input,
size_t nx,
size_t ny,
515 TInput ebx2_r, TCode quant_radius,
516 TCode* d_codes, TInput* d_outlier_errors,
517 uint32_t* d_outlier_indices, uint32_t* d_outlier_count,
524template<
typename TInput,
typename TCode>
526 const TCode* d_codes,
527 const TInput* d_outlier_errors,
const uint32_t* d_outlier_indices,
529 size_t nx,
size_t ny,
530 TInput ebx2, TCode quant_radius,
537template<
typename TInput,
typename TCode>
539 const TInput* d_input,
size_t nx,
size_t ny,
size_t nz,
540 TInput ebx2_r, TCode quant_radius,
541 TCode* d_codes, TInput* d_outlier_errors,
542 uint32_t* d_outlier_indices, uint32_t* d_outlier_count,
549template<
typename TInput,
typename TCode>
551 const TCode* d_codes,
552 const TInput* d_outlier_errors,
const uint32_t* d_outlier_indices,
554 size_t nx,
size_t ny,
size_t nz,
555 TInput ebx2, TCode quant_radius,
Definition lorenzo_quant.h:142
std::unordered_map< std::string, size_t > getActualOutputSizesByName() const override
Definition lorenzo_quant.h:225
int ndim() const
Returns the effective spatial dimensionality (1, 2, or 3).
Definition lorenzo_quant.h:283
void postStreamSync(fz::stream_t stream) override
uint8_t getOutputDataType(size_t output_index) const override
Definition lorenzo_quant.h:298
uint16_t getStageTypeId() const override
Definition lorenzo_quant.h:294
void setCentering(bool enable)
Definition lorenzo_quant.h:265
void setErrorBoundMode(ErrorBoundMode mode)
Definition lorenzo_quant.h:254
size_t getActualOutputSize(int index) const override
Definition lorenzo_quant.h:233
void saveState() override
Definition lorenzo_quant.h:242
size_t serializeHeader(size_t output_index, uint8_t *header_buffer, size_t max_size) const override
Definition lorenzo_quant.h:311
void execute(fz::stream_t stream, MemoryPool *pool, const std::vector< void * > &inputs, const std::vector< void * > &outputs, const std::vector< size_t > &sizes) override
size_t getMaxHeaderSize(size_t output_index) const override
Definition lorenzo_quant.h:342
size_t estimateDeviceFootprintBytes(size_t) const override
Definition lorenzo_quant.h:203
std::string getName() const override
Definition lorenzo_quant.h:207
uint8_t getInputDataType(size_t) const override
Definition lorenzo_quant.h:307
void deserializeHeader(const uint8_t *header_buffer, size_t size) override
Definition lorenzo_quant.h:347
std::vector< std::string > getOutputNames() const override
Definition lorenzo_quant.h:215
void onFinalize(size_t estimated_inlen, MemoryPool *pool) override
void setDims(const std::array< size_t, 3 > &dims) override
Definition lorenzo_quant.h:249
void setInverse(bool inverse)
Definition lorenzo_quant.h:289
std::vector< size_t > estimateOutputSizes(const std::vector< size_t > &input_sizes) const override
TInput getComputedAbsErrorBound() const
Definition lorenzo_quant.h:277
Logging infrastructure and macros.
#define FZ_LOG(level,...)
Definition log.h:201
Definition algorithms.h:48
void launchLorenzoInverseKernel(const TCode *d_codes, const TInput *d_outlier_errors, const uint32_t *d_outlier_indices, uint32_t outlier_n, size_t n, TInput ebx2, TCode quant_radius, TInput *d_output, bool zigzag_codes, fz::stream_t stream, MemoryPool *pool, const TInput *d_means=nullptr)
void launchLorenzoKernel3D(const TInput *d_input, size_t nx, size_t ny, size_t nz, TInput ebx2_r, TCode quant_radius, TCode *d_codes, TInput *d_outlier_errors, uint32_t *d_outlier_indices, uint32_t *d_outlier_count, size_t max_outliers, bool zigzag_codes, fz::stream_t stream)
3-D forward Lorenzo kernel launcher.
ErrorBoundMode
Definition lorenzo_quant.h:40
@ PREL
Pseudo-relative: eb × max(|data|), applied as a single ABS bound.
@ NOA
Value-range relative bound (norm-of-absolute).
@ ABS
Absolute error bound.
@ REL
Exact per-element point-wise relative bound (QuantizerStage only).
ErrorBoundMode resolveApproxRelMode(ErrorBoundMode mode, const char *stage_name)
Definition lorenzo_quant.h:61
void launchLorenzoKernel2D(const TInput *d_input, size_t nx, size_t ny, TInput ebx2_r, TCode quant_radius, TCode *d_codes, TInput *d_outlier_errors, uint32_t *d_outlier_indices, uint32_t *d_outlier_count, size_t max_outliers, bool zigzag_codes, fz::stream_t stream)
2-D forward Lorenzo kernel launcher. nx is the fast (x) dimension.
constexpr size_t FZM_STAGE_CONFIG_SIZE
Per-stage serialized config slot (bytes)
Definition fzm_format.h:65
void launchLorenzoKernel(const TInput *d_input, size_t n, TInput ebx2_r, TCode quant_radius, TCode *d_codes, TInput *d_outlier_errors, uint32_t *d_outlier_indices, uint32_t *d_outlier_count, size_t max_outliers, int grid_size, bool zigzag_codes, fz::stream_t stream, TInput *d_means=nullptr)
DataType
Element data type identifiers used in buffer and stage descriptors.
Definition fzm_format.h:117
void launchLorenzoInverseKernel3D(const TCode *d_codes, const TInput *d_outlier_errors, const uint32_t *d_outlier_indices, uint32_t outlier_n, size_t nx, size_t ny, size_t nz, TInput ebx2, TCode quant_radius, TInput *d_output, bool zigzag_codes, fz::stream_t stream, MemoryPool *pool)
3-D inverse Lorenzo kernel launcher.
@ WARN
Unexpected but recoverable: outlier overflow, fallbacks.
void launchLorenzoInverseKernel2D(const TCode *d_codes, const TInput *d_outlier_errors, const uint32_t *d_outlier_indices, uint32_t outlier_n, size_t nx, size_t ny, TInput ebx2, TCode quant_radius, TInput *d_output, bool zigzag_codes, fz::stream_t stream, MemoryPool *pool)
2-D inverse Lorenzo kernel launcher.
Base class interface for all compression stages.
Definition lorenzo_quant.h:79
uint8_t zigzag_codes
1 if codes are zigzag-encoded, else 0.
Definition lorenzo_quant.h:93
float value_base
value_range (NOA) or max(|data|) (REL) used in conversion.
Definition lorenzo_quant.h:92
uint8_t centering
1 if per-tile mean centering is enabled, else 0.
Definition lorenzo_quant.h:94
DataType input_type
Original input type (1B).
Definition lorenzo_quant.h:84
uint32_t quant_radius
Quantization radius.
Definition lorenzo_quant.h:81
float error_bound
Absolute bound after mode conversion (used by decompressor).
Definition lorenzo_quant.h:80
uint8_t eb_mode
ErrorBoundMode cast to uint8_t.
Definition lorenzo_quant.h:87
uint32_t num_elements
Total element count.
Definition lorenzo_quant.h:82
uint8_t ndim
Spatial dimensionality 1/2/3 (0 treated as 1).
Definition lorenzo_quant.h:86
double value_base_f64
Full-precision value_base; 0 in pre-2026-08-08 headers.
Definition lorenzo_quant.h:103
double error_bound_f64
Definition lorenzo_quant.h:102
uint32_t dim_z
Z dimension (1 for 1-D/2-D).
Definition lorenzo_quant.h:90
uint8_t reserved[2]
Definition lorenzo_quant.h:95
DataType code_type
Quantization code type (1B).
Definition lorenzo_quant.h:85
uint32_t dim_y
Y dimension (1 for 1-D).
Definition lorenzo_quant.h:89
uint32_t outlier_count
Actual number of outliers.
Definition lorenzo_quant.h:83
float user_eb
Original user-specified error bound value.
Definition lorenzo_quant.h:91
uint32_t dim_x
X (fast) dimension; 0 = infer from num_elements.
Definition lorenzo_quant.h:88
Definition lorenzo_quant.h:145
int quant_radius
Quantization radius (2^15 for uint16_t).
Definition lorenzo_quant.h:147
ErrorBoundMode eb_mode
Definition lorenzo_quant.h:156
float error_bound
Error bound (interpretation depends on eb_mode).
Definition lorenzo_quant.h:146
bool zigzag_codes
Definition lorenzo_quant.h:162
float outlier_capacity
Definition lorenzo_quant.h:148
float precomputed_value_base
Definition lorenzo_quant.h:159
bool centering
Definition lorenzo_quant.h:171
std::array< size_t, 3 > dims
Definition lorenzo_quant.h:152
Backend-neutral GPU type aliases.