58 const uint8_t(*
const xtrans)[6]
65 float *
const restrict interpolated
67 float *
const restrict clipping_mask
76 const float *
const restrict input = (
const float *
const restrict)ivoid;
77 float *
const restrict output = (
float *
const restrict)
ovoid;
92 for(
int c = 0; c < 3; c++)
94 clipvaln[c] = clips[c] / (
DT_HL_KNEE_DET * fmaxf(normalization[c], 1e-9f));
109 for(
int c = 0; c < 3; c++)
127 int32_t
lookup[6][6][32] = { { { 0 } } };
175 for(
size_t i = 0;
i < npix;
i++)
179 maskb[
i] = (clipping_mask[
i * 4 + 3] >= 1e-3f);
197 for(
int region_index = 0; region_index < nreg; region_index++)
210 const float *remosaic_input = input;
211 float *input_corr = NULL;
220 remosaic_input = input_corr;
233 _remosaic_and_replace(remosaic_input, input, interpolated, clipping_mask, output, normalization, clips,
280 float *
const restrict interpolated,
float *
const restrict clipping_mask,
288 const uint8_t(*
const xtrans)[6] = (filters == 9u) ? (
const uint8_t(*
const)[6])piece->
dsc_in.
xtrans : NULL;
293 *remosaic_input_out = input;
294 *input_corr_out = NULL;
299 memcpy(knee, knee_pre,
sizeof(knee));
302 for(
int c = 0; c < 3; c++)
304 clipvaln[c] = clips[c] / (
DT_HL_KNEE_DET * fmaxf(normalization[c], 1e-9f));
311 const size_t npix =
size;
321 for(
size_t i = 0;
i < npix;
i++)
324 maskb[
i] = (clipping_mask[
i * 4 + 3] >= 1e-3f);
333 for(
int region_index = 0; region_index < nreg; region_index++)
349 *remosaic_input_out = input_corr;
350 *input_corr_out = input_corr;
358#define HL_CL_RELEASE(mem_obj) \
361 dt_opencl_release_mem_object(mem_obj); \
388 const int devid = pipe->
devid;
389 const size_t n_in = (size_t)roi_in->
width * roi_in->
height;
390 const size_t n_out = (size_t)roi_out->
width * roi_out->
height;
400 if(cl_err != CL_SUCCESS)
goto error;
404 if(
process_harmonic(self, pipe, piece, host_in, host_out, roi_in, roi_out, clips))
442 cl_mem mask_buf, cl_mem *corr_out,
const dt_iop_roi_t *
const roi_in,
448 const int devid = pipe->
devid;
453 const int is_xtrans = (filters == 9u);
461 cl_mem member = NULL;
462 cl_mem depth_dev = NULL;
464 uint8_t *h_seed = NULL;
465 uint8_t *h_member = NULL;
474 memcpy(knee, knee_pre,
sizeof(knee));
477 for(
int c = 0; c < 3; c++)
479 clipvaln[c] = clips[c] / (
DT_HL_KNEE_DET * fmaxf(norm[c], 1e-9f));
488 for(
int c = 0; c < 3; c++) memcpy(lift + c *
DT_HL_KNEE_BINS, knee[c].lift,
sizeof(knee[c].lift));
496 const cl_float4 clip4 = { { clipvaln[0], clipvaln[1], clipvaln[2], 1.f } };
497 const cl_float4 wb4 = { { norm[0], norm[1], norm[2], 1.f } };
514 if(cl_err != CL_SUCCESS)
goto out;
524 is_xtrans, knee_clipraw, knee);
525 if(cl_err != CL_SUCCESS)
goto out;
535 if(!seed || !member || !h_seed || !h_member || !depth)
548 if(cl_err != CL_SUCCESS)
goto out;
552 if(cl_err != CL_SUCCESS)
goto out;
567 if(cl_err != CL_SUCCESS)
goto out;
574 const char *override_env = getenv(
"HL_CL_CPU_PX");
575 if(override_env) cpu_px = (size_t)strtoull(override_env, NULL, 10);
576 for(
int region_index = 0; region_index < nreg && cl_err == CL_SUCCESS; region_index++)
580 const size_t region_px = (size_t)(regions[region_index].rx1 - regions[region_index].rx0 + 1)
581 * (size_t)(regions[region_index].ry1 - regions[region_index].ry0 + 1);
582 if(region_px <= cpu_px)
585 cl_err = _region_cpu_offload_cl(devid, global_data, interp_buf, mask_buf, depth_dev,
width,
592 cl_err = _region_guided_filter_cl(devid, global_data, interp_buf, mask_buf, depth_dev,
width,
598 if(cl_err == CL_SUCCESS)
612 if(cl_err == CL_SUCCESS)
638 const int devid = pipe->
devid;
649 const int is_xtrans = (filters == 9u);
653 const int is_passthrough = (filters == 0u);
654 const size_t in_channels = is_passthrough ? 4 : 1;
658 cl_mem interpolated = NULL;
659 cl_mem clipping_mask = NULL;
661 cl_mem clips_cl = NULL;
662 cl_mem normalization_final = NULL;
663 cl_mem dev_xtrans = NULL;
664 cl_mem lookup_cl = NULL;
665 cl_mem corr_cl = NULL;
666 cl_mem det_clips_cl = NULL;
667 float *h_interp = NULL;
668 float *h_mask = NULL;
670 float *input_corr = NULL;
671 const float *remosaic_input = NULL;
685 int32_t
lookup[6][6][32] = { { { 0 } } };
699 if(cl_err != CL_SUCCESS)
goto fallback;
705 is_xtrans ? (
const uint8_t(*
const)[6])piece->
dsc_in.
xtrans : NULL, norm_host);
707 if(
IS_NULL_PTR(normalization_final))
goto fallback;
717 for(
int c = 0; c < 3; c++) knee_clipraw[c] = clips[c] /
DT_HL_KNEE_DET;
722 size_t korigin[3] = { 0, 0, 0 };
723 size_t kregion[3] = { (size_t)
width, (
size_t)
height, 1 };
725 if(cl_err != CL_SUCCESS)
732 is_xtrans, knee_clipraw, knee, pipe);
734 if(cl_err != CL_SUCCESS)
goto fallback;
739 for(
int c = 0; c < 3; c++)
756 &normalization_final);
771 else if(is_passthrough)
776 sizeof(cl_mem), &dev_in);
778 sizeof(cl_mem), &interpolated);
780 sizeof(cl_mem), &clipping_mask);
782 sizeof(cl_mem), &det_clips_cl);
784 sizeof(cl_mem), &normalization_final);
802 &normalization_final);
811 if(cl_err != CL_SUCCESS)
goto fallback;
819 cl_mem corr_buf = NULL;
820 size_t origin[3] = { 0, 0, 0 };
821 size_t region1[3] = { (size_t)
width, (
size_t)
height, 1 };
825 if(gpu_err == CL_SUCCESS && !is_passthrough)
827 if(gpu_err == CL_SUCCESS)
829 if(gpu_err == CL_SUCCESS)
832 if(gpu_err == CL_SUCCESS)
839 if(!getenv(
"HL_MIDDLE_AB"))
848 clips, norm_host, dev_xtrans, knee);
855 if(gpu_err == CL_SUCCESS && corr_buf)
866 if(gpu_err == CL_SUCCESS && getenv(
"HL_MIDDLE_AB"))
872 if(gpu_interp && host_interp && host_mask && host_raw
881 const float *remosaic_ptr = NULL;
882 float *input_corr_ab = NULL;
884 norm_host, &remosaic_ptr, &input_corr_ab, knee))
886 float max_diff = 0.f;
887 double sum_diff = 0.0;
888 size_t arg_index = 0;
889 for(
size_t i = 0;
i < npix * 4;
i++)
891 const float diff = fabsf(gpu_interp[
i] - host_interp[
i]);
899 fprintf(stderr,
"[hl middle AB] max=%.3e mean=%.3e at px=(%llu,%llu) c=%llu gpu=%f cpu=%f\n", max_diff,
900 sum_diff / (
double)(npix * 4), (
unsigned long long)((arg_index / 4) %
width),
901 (
unsigned long long)((arg_index / 4) /
width), (
unsigned long long)(arg_index % 4),
902 gpu_interp[arg_index], host_interp[arg_index]);
923 if(restore_err == CL_SUCCESS && gpu_err == CL_SUCCESS)
926 if(restore_err == CL_SUCCESS)
929 else if(restore_err == CL_SUCCESS)
933 if(restore_err == CL_SUCCESS)
965 if(restore_err == CL_SUCCESS)
975 if(restore_err != CL_SUCCESS)
981 cl_err = restore_err;
985 else if(gpu_err == CL_SUCCESS)
990 if(restore_err == CL_SUCCESS)
992 if(restore_err != CL_SUCCESS)
998 cl_err = restore_err;
1006 if(gpu_err == CL_SUCCESS)
goto remosaic;
1021 if(cl_err != CL_SUCCESS)
goto fallback;
1023 if(cl_err != CL_SUCCESS)
goto fallback;
1027 &remosaic_input, &input_corr, knee))
1032 if(cl_err != CL_SUCCESS)
goto fallback;
1038 cl_mem remosaic_in_cl = dev_in;
1040 remosaic_in_cl = corr_cl;
1041 else if(remosaic_input != h_raw && remosaic_input != NULL)
1046 if(cl_err != CL_SUCCESS)
goto fallback;
1047 remosaic_in_cl = corr_cl;
1052 const int clip_floor_on =
TRUE;
1064 &normalization_final);
1081 else if(is_passthrough)
1085 const int clip_floor_on =
TRUE;
1087 sizeof(cl_mem), &remosaic_in_cl);
1089 sizeof(cl_mem), &dev_in);
1091 sizeof(cl_mem), &interpolated);
1093 sizeof(cl_mem), &clipping_mask);
1095 sizeof(cl_mem), &dev_out);
1097 sizeof(cl_mem), &normalization_final);
1099 sizeof(cl_mem), &clips_cl);
1101 sizeof(
int), &clip_floor_on);
1103 sizeof(
int), &
width);
1111 const int clip_floor_on =
TRUE;
1123 &normalization_final);
1134 if(cl_err != CL_SUCCESS)
goto fallback;
1154 "[opencl_highlights] harmonic GPU gather failed (%i), falling back to the host roundtrip\n", cl_err);
static void error(char *msg)
void _hl_gauss_cache_flush(void)
typedef void((*dt_cache_allocate_t)(void *userdata, dt_cache_entry_t *entry))
static float lookup(read_only image2d_t lut, const float x)
const dt_colormatrix_t dt_aligned_pixel_t out
__DT_CLONE_TARGETS__ void _interpolate_and_mask_passthrough(const float *const restrict input, float *const restrict interpolated, float *const restrict clipping_mask, const dt_aligned_pixel_t clips, const dt_aligned_pixel_t white_balance, const size_t width, const size_t height)
__DT_CLONE_TARGETS__ void _compute_laplacian_normalization(const float *const restrict input, const dt_iop_roi_t *const roi_in, const uint32_t filters, const uint8_t(*const xtrans)[6], dt_aligned_pixel_t normalization)
__DT_CLONE_TARGETS__ void _remosaic_and_replace_xtrans(const float *const restrict input, const float *const restrict input_raw, const float *const restrict interpolated, const float *const restrict clipping_mask, float *const restrict output, const dt_aligned_pixel_t white_balance, const dt_aligned_pixel_t clips, const int clip_is_floor, const dt_iop_roi_t *const roi_in, const uint8_t(*const xtrans)[6], const size_t width, const size_t height)
__DT_CLONE_TARGETS__ void _interpolate_and_mask(const float *const restrict input, float *const restrict interpolated, float *const restrict clipping_mask, const dt_aligned_pixel_t clips_in, const dt_aligned_pixel_t det_scale, const dt_aligned_pixel_t white_balance, const uint32_t filters, const size_t width, const size_t height)
__DT_CLONE_TARGETS__ void _remosaic_and_replace(const float *const restrict input, const float *const restrict input_raw, const float *const restrict interpolated, const float *const restrict clipping_mask, float *const restrict output, const dt_aligned_pixel_t white_balance, const dt_aligned_pixel_t clips, const int clip_is_floor, const uint32_t filters, const size_t width, const size_t height)
__DT_CLONE_TARGETS__ void _interpolate_and_mask_xtrans(const float *const restrict input, float *const restrict interpolated, float *const restrict clipping_mask, const dt_aligned_pixel_t clips, const dt_aligned_pixel_t white_balance, const dt_iop_roi_t *const roi_in, const int32_t lookup[6][6][32], const uint8_t(*const xtrans)[6], const size_t width, const size_t height)
__DT_CLONE_TARGETS__ void _build_xtrans_bilinear_lookup(int32_t lookup[6][6][32], const dt_iop_roi_t *const roi_in, const uint8_t(*const xtrans)[6])
__DT_CLONE_TARGETS__ void _remosaic_and_replace_passthrough(const float *const restrict input, const float *const restrict input_raw, const float *const restrict interpolated, const float *const restrict clipping_mask, float *const restrict output, const dt_aligned_pixel_t white_balance, const dt_aligned_pixel_t clips, const int clip_is_floor, const size_t width, const size_t height)
static dt_hl_cfa_t _hl_cfa_strategy(const uint32_t filters)
uint32_t dt_dev_get_roi_filters(const dt_dev_pixelpipe_iop_t *const piece, const dt_iop_roi_t *const roi_in)
float dt_dev_get_module_scale(const dt_dev_pixelpipe_t *const pipe, const dt_iop_roi_t *const roi_in)
static float kernel(const float *x, const float *y)
__DT_CLONE_TARGETS__ void _hl_knee_apply_interpolated(float *const restrict interpolated, const size_t npix, const dt_aligned_pixel_t clipvaln, const dt_aligned_pixel_t wb4, const _hl_knee_curve_t curves[3])
__DT_CLONE_TARGETS__ void _hl_knee_estimate(const float *const restrict input, const size_t width, const size_t height, const uint32_t filters, const dt_iop_roi_t *const roi_in, const uint8_t(*const xtrans)[6], const dt_aligned_pixel_t clipval_raw, _hl_knee_curve_t curves[3], const dt_dev_pixelpipe_t *pipe)
__DT_CLONE_TARGETS__ void _hl_knee_apply_cfa(const float *const restrict input, float *const restrict input_corr, const size_t width, const size_t height, const uint32_t filters, const dt_iop_roi_t *const roi_in, const uint8_t(*const xtrans)[6], const dt_aligned_pixel_t clipval_raw, const _hl_knee_curve_t curves[3])
cl_int _hl_knee_estimate_cl(const int devid, void *gd_void, cl_mem dev_in, const size_t width, const size_t height, const uint32_t filters, const dt_iop_roi_t *const roi_in, cl_mem dev_xtrans, const int is_xtrans, const dt_aligned_pixel_t clipval_raw, _hl_knee_curve_t curves[3], const dt_dev_pixelpipe_t *pipe)
cl_int _hl_knee_apply_cfa_cl(const int devid, void *gd_void, cl_mem dev_in, cl_mem dev_out, const size_t width, const size_t height, const uint32_t filters, const dt_iop_roi_t *const roi_in, cl_mem dev_xtrans, const int is_xtrans, const dt_aligned_pixel_t clipval_raw, const _hl_knee_curve_t curves[3])
void dt_print(dt_debug_thread_t thread, const char *msg,...) __attribute__((format(printf
Print to stdout when thread is enabled, prefixed with seconds since startup.
#define IS_NULL_PTR(p)
C is way too permissive with !=, == and if(var) checks, which can mean too many things depending on w...
int dt_opencl_enqueue_kernel_2d(const int dev, const int kernel, const size_t *sizes)
void * dt_opencl_alloc_device_buffer(const int devid, const size_t size)
int dt_opencl_enqueue_copy_buffer_to_image(const int devid, cl_mem src_buffer, cl_mem dst_image, size_t offset, size_t *origin, size_t *region)
int dt_opencl_copy_device_to_host(const int devid, void *host, void *device, const int width, const int height, const int bpp)
void * dt_opencl_alloc_device(const int devid, const int width, const int height, const int bpp)
void * dt_opencl_copy_host_to_device_constant(const int devid, const size_t size, void *host)
int dt_opencl_write_buffer_to_device(const int devid, void *host, void *device, const size_t offset, const size_t size, const int blocking)
int dt_opencl_read_buffer_from_device(const int devid, void *host, void *device, const size_t offset, const size_t size, const int blocking)
int dt_opencl_set_kernel_arg(const int dev, const int kernel, const int num, const size_t size, const void *arg)
gboolean dt_opencl_finish(const int devid)
int dt_opencl_enqueue_copy_image_to_buffer(const int devid, cl_mem src_image, cl_mem dst_buffer, size_t *origin, size_t *region, size_t offset)
void dt_opencl_release_mem_object(cl_mem mem)
int dt_opencl_write_host_to_device(const int devid, void *host, void *device, const int width, const int height, const int bpp)
#define DT_OPENCL_DEFAULT_ERROR
#define __OMP_PARALLEL_FOR__(...)
#define dt_pixelpipe_cache_alloc_align(size, pipe)
#define dt_pixelpipe_cache_free_align(mem)
#define dt_pixelpipe_cache_alloc_align_float(pixels, pipe)
cl_int process_harmonic_cl(struct dt_iop_module_t *self, const dt_dev_pixelpipe_t *pipe, const dt_dev_pixelpipe_iop_t *piece, cl_mem dev_in, cl_mem dev_out, const dt_iop_roi_t *const roi_in, const dt_iop_roi_t *const roi_out, const dt_aligned_pixel_t clips)
__DT_CLONE_TARGETS__ int process_harmonic(struct dt_iop_module_t *self, const dt_dev_pixelpipe_t *pipe, const dt_dev_pixelpipe_iop_t *piece, const void *const restrict ivoid, void *const restrict ovoid, const dt_iop_roi_t *const roi_in, const dt_iop_roi_t *const roi_out, const dt_aligned_pixel_t clips)
#define HL_CL_RELEASE(mem_obj)
static __DT_CLONE_TARGETS__ int _harmonic_reconstruct_host(struct dt_iop_module_t *self, const dt_dev_pixelpipe_t *pipe, const dt_dev_pixelpipe_iop_t *piece, const float *const restrict input, float *const restrict interpolated, float *const restrict clipping_mask, const dt_iop_roi_t *const roi_in, const dt_aligned_pixel_t clips, const dt_aligned_pixel_t normalization, const float **remosaic_input_out, float **input_corr_out, const _hl_knee_curve_t knee_pre[3])
static cl_int _harmonic_cl_roundtrip(struct dt_iop_module_t *self, const dt_dev_pixelpipe_t *pipe, const dt_dev_pixelpipe_iop_t *piece, cl_mem dev_in, cl_mem dev_out, const dt_iop_roi_t *const roi_in, const dt_iop_roi_t *const roi_out, const dt_aligned_pixel_t clips)
static cl_int _harmonic_reconstruct_cl(struct dt_iop_module_t *self, const dt_dev_pixelpipe_t *pipe, const dt_dev_pixelpipe_iop_t *piece, cl_mem raw_buf, cl_mem interp_buf, cl_mem mask_buf, cl_mem *corr_out, const dt_iop_roi_t *const roi_in, const dt_aligned_pixel_t clips, const dt_aligned_pixel_t norm, cl_mem dev_xtrans, const _hl_knee_curve_t knee_pre[3])
void _region_guided_filter(float *const restrict interp, const float *const restrict mask, const float *const restrict depth, const int width, const _hl_region_t *const region, const dt_dev_pixelpipe_t *pipe, const float solid_color, const int max_iter, const float noise_level, const float floor_gate, const float module_scale)
int _segment_clipped_regions(const uint8_t *const restrict maskb, const float *const restrict depth, const int width, const int height, const float pad_factor, const int pad_min, const int pad_max, _hl_region_t **regions_out)
void _hf_stage_cl_selftest(const int devid, void *gd_void, const dt_dev_pixelpipe_t *pipe)
void _region_guided_filter_cl_selftest(const int devid, void *gd_void, const dt_dev_pixelpipe_t *pipe)
void _knee_cl_selftest(const int devid, void *gd_void, const dt_dev_pixelpipe_t *pipe)
void _joint_core_stage_cl_selftest(const int devid, void *gd_void, const dt_dev_pixelpipe_t *pipe)
void _selfdome_stage_cl_selftest(const int devid, void *gd_void, const dt_dev_pixelpipe_t *pipe)
void _aniso_stage_cl_selftest(const int devid, void *gd_void, const dt_dev_pixelpipe_t *pipe)
void _cf_harmonic_fill_cl_selftest(const int devid, void *gd_void, const dt_dev_pixelpipe_t *pipe)
void _cf_stage_cl_selftest(const int devid, void *gd_void, const dt_dev_pixelpipe_t *pipe)
void _region_blur_cl_selftest(const int devid, const dt_dev_pixelpipe_t *pipe)
void _chromaticity_gradient_stage_cl_selftest(const int devid, void *gd_void, const dt_dev_pixelpipe_t *pipe)
void _cf_joint_stage_cl_selftest(const int devid, void *gd_void, const dt_dev_pixelpipe_t *pipe)
void _sp_chol_cl_selftest(const int devid, void *gd_void, const dt_dev_pixelpipe_t *pipe)
DT_ALIGNED_PIXEL float dt_aligned_pixel_t[4]
#define for_four_channels(_var,...)
static cl_mem _sp_cl_upload(const int devid, const void *data, const size_t bytes)
static float _hl_floor_gate(const float clips[4])
#define DT_HL_CL_CPU_REGION_PX
dt_iop_buffer_dsc_t dsc_in
struct dt_iop_module_t *void * data
int kernel_highlights_bilinear_and_mask_passthrough
int kernel_hl_knee_apply_interp
int kernel_highlights_remosaic_and_replace
int kernel_highlights_remosaic_and_replace_passthrough
int kernel_highlights_bilinear_and_mask_xtrans
int kernel_highlights_box_blur
int kernel_highlights_remosaic_and_replace_xtrans
int kernel_highlights_bilinear_and_mask
dt_iop_global_data_t * global_data
Region of interest passed through the pixelpipe.
#define __DT_CLONE_TARGETS__
typedef double((*spd)(unsigned long int wavelength, double TempK))