41#include <unordered_map>
69 , actual_output_size_(0)
70 , cached_orig_bytes_(0)
72 , d_sizes_dev_(
nullptr)
73 , d_clean_dev_(
nullptr)
74 , d_dst_off_dev_(
nullptr)
75 , scratch_capacity_(0)
81 void setInverse(
bool inv)
override { is_inverse_ = inv; }
82 bool isInverse()
const override {
return is_inverse_; }
89 void setChunkSize(
size_t bytes) { chunk_size_ =
static_cast<uint32_t
>(bytes); }
90 void setWordSize(
size_t bytes) { word_size_ =
static_cast<uint8_t
>(bytes); }
92 size_t getChunkSize()
const {
return chunk_size_; }
94 int getWordSize()
const {
return static_cast<int>(word_size_); }
95 uint32_t getCachedOrigBytes()
const {
return cached_orig_bytes_; }
102 if (is_inverse_ || word_size_ != 1 ||
103 (chunk_size_ != 4096u && chunk_size_ != 8192u && chunk_size_ != 16384u))
return {};
104 return FusionSpec{FusionAccess::SegmentCodec, chunk_size_};
108 return FusedOpDecl{FusionStrategy::ChunkCooperative,
"RAZECoder",
109 "fused/chunk_fusion/chunk_fusion.cuh", {}};
114 actual_output_size_ = archive_bytes;
115 cached_orig_bytes_ =
static_cast<uint32_t
>(orig_bytes);
116 tail_readback_pending_ =
false;
126 const std::vector<void*>& inputs,
127 const std::vector<void*>& outputs,
128 const std::vector<size_t>& sizes
133 std::string
getName()
const override {
return "RAZE"; }
134 size_t getNumInputs()
const override {
return 1; }
135 size_t getNumOutputs()
const override {
return 1; }
138 const std::vector<size_t>& input_sizes
141 if (cached_orig_bytes_ > 0)
142 return {
static_cast<size_t>(cached_orig_bytes_)};
143 return {input_sizes.empty() ? 0 : input_sizes[0]};
146 const size_t n_bytes = input_sizes.empty() ? 0 : input_sizes[0];
147 const size_t n_chunks = (n_bytes + chunk_size_ - 1) / chunk_size_;
148 const size_t hdr = 4 + 4 + 4 * n_chunks;
155 const size_t worst = n_bytes + hdr;
156 return {(worst + 3) & ~
size_t(3)};
159 std::unordered_map<std::string, size_t>
172 const std::vector<size_t>& input_sizes
174 if (is_inverse_ || input_sizes.empty())
return 0;
175 const size_t in_bytes = input_sizes[0];
176 const size_t n_chunks = (in_bytes + chunk_size_ - 1) / chunk_size_;
177 return n_chunks * (
static_cast<size_t>(chunk_size_) + 3 *
sizeof(uint32_t));
185 return static_cast<uint8_t
>(DataType::UINT8);
190 size_t output_index, uint8_t* buf,
size_t max_size
193 if (max_size < 9)
return 0;
194 std::memcpy(buf, &chunk_size_,
sizeof(uint32_t));
196 std::memcpy(buf + 5, &cached_orig_bytes_,
sizeof(uint32_t));
201 if (size >= 4) std::memcpy(&chunk_size_, buf,
sizeof(uint32_t));
202 if (size >= 5) word_size_ = buf[4];
203 if (size >= 9) std::memcpy(&cached_orig_bytes_, buf + 5,
sizeof(uint32_t));
209 saved_chunk_size_ = chunk_size_;
210 saved_word_size_ = word_size_;
211 saved_cached_orig_bytes_ = cached_orig_bytes_;
214 void restoreState()
override {
215 chunk_size_ = saved_chunk_size_;
216 word_size_ = saved_word_size_;
217 cached_orig_bytes_ = saved_cached_orig_bytes_;
222 uint32_t chunk_size_;
223 uint32_t saved_chunk_size_ = 0;
225 uint8_t saved_word_size_ = 0;
226 size_t actual_output_size_;
227 uint32_t cached_orig_bytes_ = 0;
228 uint32_t saved_cached_orig_bytes_ = 0;
232 uint32_t* d_sizes_dev_;
233 uint32_t* d_clean_dev_;
234 uint32_t* d_dst_off_dev_;
235 mutable bool tail_readback_pending_ =
false;
236 mutable cudaStream_t tail_readback_stream_ =
nullptr;
237 mutable uint32_t tail_last_index_ = 0;
238 mutable uint8_t* tail_output_ptr_ =
nullptr;
239 size_t scratch_capacity_;
240 MemoryPool* scratch_pool_owner_ =
nullptr;
241 bool scratch_from_pool_ =
false;
243 std::weak_ptr<const void> scratch_alive_;
Definition raze_stage.h:63
std::vector< size_t > estimateOutputSizes(const std::vector< size_t > &input_sizes) const override
Definition raze_stage.h:137
FusionSpec getFusionSpec() const override
Definition raze_stage.h:101
void setFusedResult(size_t archive_bytes, size_t orig_bytes)
Definition raze_stage.h:113
std::unordered_map< std::string, size_t > getActualOutputSizesByName() const override
FusedOpDecl getFusedOp() const override
Definition raze_stage.h:106
size_t getActualOutputSize(int index) const override
void execute(cudaStream_t stream, MemoryPool *pool, const std::vector< void * > &inputs, const std::vector< void * > &outputs, const std::vector< size_t > &sizes) override
size_t getRequiredInputAlignment() const override
Definition raze_stage.h:93
void setInverse(bool inv) override
Definition raze_stage.h:81
void postStreamSync(cudaStream_t stream) override
uint16_t getStageTypeId() const override
Definition raze_stage.h:180
void deserializeHeader(const uint8_t *buf, size_t size) override
Definition raze_stage.h:200
size_t getMaxHeaderSize(size_t) const override
Definition raze_stage.h:206
size_t serializeHeader(size_t output_index, uint8_t *buf, size_t max_size) const override
Definition raze_stage.h:189
std::string getName() const override
Definition raze_stage.h:133
void setFusedArchiveResult(size_t archive_bytes, size_t orig_bytes) override
Definition raze_stage.h:118
bool isGraphCompatible() const override
Definition raze_stage.h:87
size_t estimateScratchBytes(const std::vector< size_t > &input_sizes) const override
Definition raze_stage.h:171
uint8_t getOutputDataType(size_t) const override
Definition raze_stage.h:184
void saveState() override
Definition raze_stage.h:208
@ RAZE
Adaptive leading-zero-bit generalization of RZE (LC component)
Base class interface for all compression stages.
A stage's contribution to a generated fused kernel — the device-op it maps to, where its source lives...
Definition fusion.h:161
A stage's fusion contract. Stages that can participate in a fused kernel override Stage::getFusionSpe...
Definition fusion.h:51
Backend-neutral GPU type aliases.