{
  "status": "seventeen_vae_kernel_component_sums_checked",
  "rows": [
    {
      "scheduler_note": [],
      "input_sha256": "361110b0df425093397551c589c4c8f8e119f195c1b7c8ce7fe463e598338f6e",
      "input_shape": [
        1,
        96,
        6,
        706,
        322
      ],
      "output_shape": [
        1,
        96,
        4,
        704,
        320
      ],
      "ncu_output": "/data/zhoutaichang/feature/Lingbot_world_realtime/runs/analysis_report_20260908/raw/ncu_missing704_0551e0aa26bb7201_v1",
      "total_profiled_us": 3677.9519999999998,
      "components": [
        {
          "category": "convolution_or_gemm",
          "us": 2926.656,
          "fraction_of_profiled_sum": 0.7957297974524954
        },
        {
          "category": "elementwise_add",
          "us": 242.49599999999998,
          "fraction_of_profiled_sum": 0.06593234495719356
        },
        {
          "category": "layout_conversion",
          "us": 508.79999999999995,
          "fraction_of_profiled_sum": 0.13833785759031111
        }
      ],
      "kernels": [
        {
          "id": "0",
          "name": "void cudnn::nchwToNhwcKernel<float, float, float, 0, 1, 0>(cudnn::nchw2nhwc_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 316.928
        },
        {
          "id": "1",
          "name": "void cudnn::nchwToNhwcKernel<float, float, float, 0, 1, 0>(cudnn::nchw2nhwc_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 3.712
        },
        {
          "id": "2",
          "name": "sm90_xmma_fprop_implicit_gemm_f32f32_tf32f32_f32_nhwckrsc_nhwc_tilesize256x32x32_warpgroupsize1x1x1_g1_execute_segment_k_off_kernel__5x_cudnn",
          "category": "convolution_or_gemm",
          "duration_us": 2926.656
        },
        {
          "id": "3",
          "name": "void cudnn::nhwcToNchwKernel<float, float, float, 1, 0, 0>(cudnn::nhwc2nchw_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 188.16
        },
        {
          "id": "4",
          "name": "void at::elementwise_kernel<128, 2, void at::gpu_kernel_impl_nocast<at::CUDAFunctor_add<float>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)",
          "category": "elementwise_add",
          "duration_us": 242.49599999999998
        }
      ]
    },
    {
      "scheduler_note": [],
      "input_sha256": "836c7ee7ca56334d7997004c7d80dc3a7742322bc7befd6ad4a0f29a4ec8ad0f",
      "input_shape": [
        1,
        192,
        6,
        354,
        162
      ],
      "output_shape": [
        1,
        192,
        4,
        352,
        160
      ],
      "ncu_output": "/data/zhoutaichang/feature/Lingbot_world_realtime/runs/analysis_report_20260908/raw/ncu_missing704_1b34e3d0553bbca4_v1",
      "total_profiled_us": 2130.848,
      "components": [
        {
          "category": "convolution_or_gemm",
          "us": 1759.712,
          "fraction_of_profiled_sum": 0.8258270885581703
        },
        {
          "category": "elementwise_add",
          "us": 121.344,
          "fraction_of_profiled_sum": 0.056946342488999685
        },
        {
          "category": "layout_conversion",
          "us": 249.79199999999997,
          "fraction_of_profiled_sum": 0.11722656895283004
        }
      ],
      "kernels": [
        {
          "id": "0",
          "name": "void cudnn::nchwToNhwcKernel<float, float, float, 0, 1, 0>(cudnn::nchw2nhwc_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 154.816
        },
        {
          "id": "1",
          "name": "void cudnn::nchwToNhwcKernel<float, float, float, 0, 1, 0>(cudnn::nchw2nhwc_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 4.992
        },
        {
          "id": "2",
          "name": "sm90_xmma_fprop_implicit_gemm_f32f32_tf32f32_f32_nhwckrsc_nhwc_tilesize128x128x32_warpgroupsize1x1x1_g1_execute_segment_k_off_kernel__5x_cudnn",
          "category": "convolution_or_gemm",
          "duration_us": 1759.712
        },
        {
          "id": "3",
          "name": "void cudnn::nhwcToNchwKernel<float, float, float, 1, 0, 0>(cudnn::nhwc2nchw_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 89.984
        },
        {
          "id": "4",
          "name": "void at::elementwise_kernel<128, 2, void at::gpu_kernel_impl_nocast<at::CUDAFunctor_add<float>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)",
          "category": "elementwise_add",
          "duration_us": 121.344
        }
      ]
    },
    {
      "scheduler_note": [],
      "input_sha256": "ae178ca2bbf227553643572af23755eb3ed51289f32398e11a61f88fb81ea3a1",
      "input_shape": [
        1,
        384,
        4,
        178,
        82
      ],
      "output_shape": [
        1,
        384,
        2,
        176,
        80
      ],
      "ncu_output": "/data/zhoutaichang/feature/Lingbot_world_realtime/runs/analysis_report_20260908/raw/ncu_missing704_ac3438e4ac0a9485_v1",
      "total_profiled_us": 1129.536,
      "components": [
        {
          "category": "convolution_or_gemm",
          "us": 1016.48,
          "fraction_of_profiled_sum": 0.8999093433055697
        },
        {
          "category": "elementwise_add",
          "us": 31.328000000000003,
          "fraction_of_profiled_sum": 0.027735282452263584
        },
        {
          "category": "layout_conversion",
          "us": 81.728,
          "fraction_of_profiled_sum": 0.07235537424216669
        }
      ],
      "kernels": [
        {
          "id": "0",
          "name": "void cudnn::nchwToNhwcKernel<float, float, float, 0, 1, 0>(cudnn::nchw2nhwc_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 49.568
        },
        {
          "id": "1",
          "name": "void cudnn::nchwToNhwcKernel<float, float, float, 0, 1, 0>(cudnn::nchw2nhwc_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 10.144
        },
        {
          "id": "2",
          "name": "sm90_xmma_fprop_implicit_gemm_f32f32_tf32f32_f32_nhwckrsc_nhwc_tilesize128x128x32_warpgroupsize1x1x1_g1_execute_segment_k_off_kernel__5x_cudnn",
          "category": "convolution_or_gemm",
          "duration_us": 1016.48
        },
        {
          "id": "3",
          "name": "void cudnn::nhwcToNchwKernel<float, float, float, 1, 0, 0>(cudnn::nhwc2nchw_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 22.016000000000002
        },
        {
          "id": "4",
          "name": "void at::elementwise_kernel<128, 2, void at::gpu_kernel_impl_nocast<at::CUDAFunctor_add<float>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)",
          "category": "elementwise_add",
          "duration_us": 31.328000000000003
        }
      ]
    },
    {
      "scheduler_note": [],
      "input_sha256": "fd2ac936cea7b4d5d60612a6045f5c612e27536de2424aa111e4bc689fc1e795",
      "input_shape": [
        1,
        384,
        3,
        90,
        42
      ],
      "output_shape": [
        1,
        384,
        1,
        88,
        40
      ],
      "ncu_output": "/data/zhoutaichang/feature/Lingbot_world_realtime/runs/analysis_report_20260908/raw/ncu_missing704_a50d349fe3a8545f_v1",
      "total_profiled_us": 180.32,
      "components": [
        {
          "category": "convolution_or_gemm",
          "us": 147.488,
          "fraction_of_profiled_sum": 0.8179236912156167
        },
        {
          "category": "elementwise_add",
          "us": 6.56,
          "fraction_of_profiled_sum": 0.03637976929902396
        },
        {
          "category": "layout_conversion",
          "us": 26.272,
          "fraction_of_profiled_sum": 0.14569653948535935
        }
      ],
      "kernels": [
        {
          "id": "0",
          "name": "void cudnn::nchwToNhwcKernel<float, float, float, 0, 1, 0>(cudnn::nchw2nhwc_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 10.432
        },
        {
          "id": "1",
          "name": "void cudnn::nchwToNhwcKernel<float, float, float, 0, 1, 0>(cudnn::nchw2nhwc_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 10.272
        },
        {
          "id": "2",
          "name": "sm90_xmma_fprop_implicit_gemm_f32f32_tf32f32_f32_nhwckrsc_nhwc_tilesize128x128x32_warpgroupsize1x1x1_g1_execute_segment_k_off_kernel__5x_cudnn",
          "category": "convolution_or_gemm",
          "duration_us": 147.488
        },
        {
          "id": "3",
          "name": "void cudnn::nhwcToNchwKernel<float, float, float, 1, 0, 0>(cudnn::nhwc2nchw_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 5.568
        },
        {
          "id": "4",
          "name": "void at::elementwise_kernel<128, 2, void at::gpu_kernel_impl_nocast<at::CUDAFunctor_add<float>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)",
          "category": "elementwise_add",
          "duration_us": 6.56
        }
      ]
    },
    {
      "scheduler_note": [],
      "input_sha256": "146fb336db70349e18bee5b6332d0ab63940d20d95e88e53d065f0d87a4673e8",
      "input_shape": [
        1,
        192,
        4,
        178,
        82
      ],
      "output_shape": [
        1,
        384,
        2,
        176,
        80
      ],
      "ncu_output": "/data/zhoutaichang/feature/Lingbot_world_realtime/runs/analysis_report_20260908/raw/ncu_missing704_053cda5cb0c0dcf6_v1",
      "total_profiled_us": 603.968,
      "components": [
        {
          "category": "convolution_or_gemm",
          "us": 519.68,
          "fraction_of_profiled_sum": 0.8604429373741654
        },
        {
          "category": "elementwise_add",
          "us": 30.72,
          "fraction_of_profiled_sum": 0.05086362191374377
        },
        {
          "category": "layout_conversion",
          "us": 53.568,
          "fraction_of_profiled_sum": 0.0886934407120907
        }
      ],
      "kernels": [
        {
          "id": "0",
          "name": "void cudnn::nchwToNhwcKernel<float, float, float, 0, 1, 0>(cudnn::nchw2nhwc_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 24.416
        },
        {
          "id": "1",
          "name": "void cudnn::nchwToNhwcKernel<float, float, float, 0, 1, 0>(cudnn::nchw2nhwc_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 6.752
        },
        {
          "id": "2",
          "name": "sm90_xmma_fprop_implicit_gemm_f32f32_tf32f32_f32_nhwckrsc_nhwc_tilesize128x128x32_warpgroupsize1x1x1_g1_execute_segment_k_off_kernel__5x_cudnn",
          "category": "convolution_or_gemm",
          "duration_us": 519.68
        },
        {
          "id": "3",
          "name": "void cudnn::nhwcToNchwKernel<float, float, float, 1, 0, 0>(cudnn::nhwc2nchw_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 22.4
        },
        {
          "id": "4",
          "name": "void at::elementwise_kernel<128, 2, void at::gpu_kernel_impl_nocast<at::CUDAFunctor_add<float>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)",
          "category": "elementwise_add",
          "duration_us": 30.72
        }
      ]
    },
    {
      "scheduler_note": [],
      "input_sha256": "05ade70ee900de950adaf23171001399a4d6cc88017bf23770bc74ef28c01d3b",
      "input_shape": [
        1,
        384,
        4,
        176,
        80
      ],
      "output_shape": [
        1,
        768,
        2,
        176,
        80
      ],
      "ncu_output": "/data/zhoutaichang/feature/Lingbot_world_realtime/runs/analysis_report_20260908/raw/ncu_missing704_4273bf5ee693569e_v1",
      "total_profiled_us": 299.13599999999997,
      "components": [
        {
          "category": "convolution_or_gemm",
          "us": 129.952,
          "fraction_of_profiled_sum": 0.43442447582370564
        },
        {
          "category": "elementwise_add",
          "us": 60.672,
          "fraction_of_profiled_sum": 0.20282413350449296
        },
        {
          "category": "layout_conversion",
          "us": 108.512,
          "fraction_of_profiled_sum": 0.3627513906718015
        }
      ],
      "kernels": [
        {
          "id": "0",
          "name": "void cudnn::nchwToNhwcKernel<float, float, float, 0, 1, 0>(cudnn::nchw2nhwc_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 48.256
        },
        {
          "id": "1",
          "name": "void cudnn::nchwToNhwcKernel<float, float, float, 0, 1, 0>(cudnn::nchw2nhwc_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 15.2
        },
        {
          "id": "2",
          "name": "sm90_xmma_fprop_implicit_gemm_f32f32_tf32f32_f32_nhwckrsc_nhwc_tilesize128x128x32_warpgroupsize1x1x1_g1_execute_segment_k_off_kernel__5x_cudnn",
          "category": "convolution_or_gemm",
          "duration_us": 129.952
        },
        {
          "id": "3",
          "name": "void cudnn::nhwcToNchwKernel<float, float, float, 1, 0, 0>(cudnn::nhwc2nchw_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 45.056
        },
        {
          "id": "4",
          "name": "void at::elementwise_kernel<128, 2, void at::gpu_kernel_impl_nocast<at::CUDAFunctor_add<float>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)",
          "category": "elementwise_add",
          "duration_us": 60.672
        }
      ]
    },
    {
      "scheduler_note": [],
      "input_sha256": "85c0ba2d39aa4aa6ffbabaa237b9fa5d7721eefd855682c8cf482c661a5943d9",
      "input_shape": [
        1,
        96,
        3,
        706,
        322
      ],
      "output_shape": [
        1,
        96,
        1,
        704,
        320
      ],
      "ncu_output": "/data/zhoutaichang/feature/Lingbot_world_realtime/runs/analysis_report_20260908/raw/ncu_missing704_1ae7dbe8166a0b6b_v1",
      "total_profiled_us": 1006.016,
      "components": [
        {
          "category": "convolution_or_gemm",
          "us": 738.976,
          "fraction_of_profiled_sum": 0.7345569056555761
        },
        {
          "category": "elementwise_add",
          "us": 60.672,
          "fraction_of_profiled_sum": 0.060309179973280745
        },
        {
          "category": "layout_conversion",
          "us": 206.368,
          "fraction_of_profiled_sum": 0.2051339143711432
        }
      ],
      "kernels": [
        {
          "id": "0",
          "name": "void cudnn::nchwToNhwcKernel<float, float, float, 0, 1, 0>(cudnn::nchw2nhwc_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 158.496
        },
        {
          "id": "1",
          "name": "void cudnn::nchwToNhwcKernel<float, float, float, 0, 1, 0>(cudnn::nchw2nhwc_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 3.488
        },
        {
          "id": "2",
          "name": "sm90_xmma_fprop_implicit_gemm_f32f32_tf32f32_f32_nhwckrsc_nhwc_tilesize256x32x32_warpgroupsize1x1x1_g1_execute_segment_k_off_kernel__5x_cudnn",
          "category": "convolution_or_gemm",
          "duration_us": 738.976
        },
        {
          "id": "3",
          "name": "void cudnn::nhwcToNchwKernel<float, float, float, 1, 0, 0>(cudnn::nhwc2nchw_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 44.384
        },
        {
          "id": "4",
          "name": "void at::elementwise_kernel<128, 2, void at::gpu_kernel_impl_nocast<at::CUDAFunctor_add<float>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)",
          "category": "elementwise_add",
          "duration_us": 60.672
        }
      ]
    },
    {
      "scheduler_note": [],
      "input_sha256": "a9625d3e84c044a16224205940b2918538dcbebc7b9e36a51af82b718a774552",
      "input_shape": [
        1,
        192,
        3,
        354,
        162
      ],
      "output_shape": [
        1,
        192,
        1,
        352,
        160
      ],
      "ncu_output": "/data/zhoutaichang/feature/Lingbot_world_realtime/runs/analysis_report_20260908/raw/ncu_missing704_996e506f74aef428_v1",
      "total_profiled_us": 562.496,
      "components": [
        {
          "category": "convolution_or_gemm",
          "us": 427.04,
          "fraction_of_profiled_sum": 0.7591876208897486
        },
        {
          "category": "elementwise_add",
          "us": 30.528,
          "fraction_of_profiled_sum": 0.05427238593696666
        },
        {
          "category": "layout_conversion",
          "us": 104.928,
          "fraction_of_profiled_sum": 0.1865399931732848
        }
      ],
      "kernels": [
        {
          "id": "0",
          "name": "void cudnn::nchwToNhwcKernel<float, float, float, 0, 1, 0>(cudnn::nchw2nhwc_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 77.312
        },
        {
          "id": "1",
          "name": "void cudnn::nchwToNhwcKernel<float, float, float, 0, 1, 0>(cudnn::nchw2nhwc_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 5.152
        },
        {
          "id": "2",
          "name": "sm90_xmma_fprop_implicit_gemm_f32f32_tf32f32_f32_nhwckrsc_nhwc_tilesize128x128x32_warpgroupsize1x1x1_g1_execute_segment_k_off_kernel__5x_cudnn",
          "category": "convolution_or_gemm",
          "duration_us": 427.04
        },
        {
          "id": "3",
          "name": "void cudnn::nhwcToNchwKernel<float, float, float, 1, 0, 0>(cudnn::nhwc2nchw_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 22.464
        },
        {
          "id": "4",
          "name": "void at::elementwise_kernel<128, 2, void at::gpu_kernel_impl_nocast<at::CUDAFunctor_add<float>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)",
          "category": "elementwise_add",
          "duration_us": 30.528
        }
      ]
    },
    {
      "scheduler_note": [],
      "input_sha256": "9b2cc0033aa13a80bc2dd24c544a6b1097e94f10f8c1f3748cbca111210d5fa1",
      "input_shape": [
        1,
        384,
        3,
        178,
        82
      ],
      "output_shape": [
        1,
        384,
        1,
        176,
        80
      ],
      "ncu_output": "/data/zhoutaichang/feature/Lingbot_world_realtime/runs/analysis_report_20260908/raw/ncu_missing704_e70c8df9d1c257cc_v1",
      "total_profiled_us": 585.408,
      "components": [
        {
          "category": "convolution_or_gemm",
          "us": 504.928,
          "fraction_of_profiled_sum": 0.8625232316606537
        },
        {
          "category": "elementwise_add",
          "us": 16.0,
          "fraction_of_profiled_sum": 0.02733136547501913
        },
        {
          "category": "layout_conversion",
          "us": 59.68,
          "fraction_of_profiled_sum": 0.10194599322182137
        },
        {
          "category": "workspace_init",
          "us": 4.8,
          "fraction_of_profiled_sum": 0.008199409642505739
        }
      ],
      "kernels": [
        {
          "id": "0",
          "name": "void cudnn::nchwToNhwcKernel<float, float, float, 0, 1, 0>(cudnn::nchw2nhwc_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 37.088
        },
        {
          "id": "1",
          "name": "void cudnn::nchwToNhwcKernel<float, float, float, 0, 1, 0>(cudnn::nchw2nhwc_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 10.528
        },
        {
          "id": "2",
          "name": "void cask_plugin__5x_cudnn::init_device_workspace_kernel<xmma__5x_cudnn::Warp_specialized_params_non_template<xmma__5x_cudnn::Grid_constant_params>>(T1, bool)",
          "category": "workspace_init",
          "duration_us": 4.8
        },
        {
          "id": "3",
          "name": "sm90_xmma_fprop_implicit_gemm_f32f32_tf32f32_f32_nhwckrsc_nhwc_tilesize128x128x32_warpgroupsize1x1x1_g1_execute_segment_k_on_kernel__5x_cudnn",
          "category": "convolution_or_gemm",
          "duration_us": 504.928
        },
        {
          "id": "4",
          "name": "void cudnn::nhwcToNchwKernel<float, float, float, 1, 0, 0>(cudnn::nhwc2nchw_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 12.064
        },
        {
          "id": "5",
          "name": "void at::elementwise_kernel<128, 2, void at::gpu_kernel_impl_nocast<at::CUDAFunctor_add<float>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)",
          "category": "elementwise_add",
          "duration_us": 16.0
        }
      ]
    },
    {
      "scheduler_note": [],
      "input_sha256": "c09536053b980c5e962fadc017011cff0cd6c94409f5c2270984dfec83c493a3",
      "input_shape": [
        1,
        96,
        6,
        706,
        322
      ],
      "output_shape": [
        1,
        3,
        4,
        704,
        320
      ],
      "ncu_output": "/data/zhoutaichang/feature/Lingbot_world_realtime/runs/analysis_report_20260908/raw/ncu_missing704_0e33e5013ffbea1c_v1",
      "total_profiled_us": 1515.04,
      "components": [
        {
          "category": "convolution_or_gemm",
          "us": 1148.096,
          "fraction_of_profiled_sum": 0.7577991340162636
        },
        {
          "category": "elementwise_add",
          "us": 9.6,
          "fraction_of_profiled_sum": 0.006336466363924384
        },
        {
          "category": "layout_conversion",
          "us": 357.344,
          "fraction_of_profiled_sum": 0.235864399619812
        }
      ],
      "kernels": [
        {
          "id": "0",
          "name": "void cudnn::nchwToNhwcKernel<float, float, float, 0, 1, 2>(cudnn::nchw2nhwc_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 315.68
        },
        {
          "id": "1",
          "name": "void cudnn::nchwToNhwcKernel<float, float, float, 0, 1, 2>(cudnn::nchw2nhwc_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 3.296
        },
        {
          "id": "2",
          "name": "sm80_xmma_fprop_implicit_gemm_indexed_wo_smem_tf32f32_tf32f32_f32_nhwckrsc_nhwc_tilesize128x16x64_stage1_warpsize4x1x1_g1_tensor16x8x8_alignc4_execute_kernel__5x_cudnn",
          "category": "convolution_or_gemm",
          "duration_us": 1148.096
        },
        {
          "id": "3",
          "name": "void cudnn::nhwcToNchwKernel<float, float, float, 1, 0, 0>(cudnn::nhwc2nchw_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 38.368
        },
        {
          "id": "4",
          "name": "void at::elementwise_kernel<128, 2, void at::gpu_kernel_impl_nocast<at::CUDAFunctor_add<float>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)",
          "category": "elementwise_add",
          "duration_us": 9.6
        }
      ]
    },
    {
      "scheduler_note": [],
      "input_sha256": "9dd2254d46cabc12367da79ca54c5220c508380e8b7fd1b985050405f5f81ee3",
      "input_shape": [
        1,
        384,
        3,
        88,
        40
      ],
      "output_shape": [
        1,
        768,
        1,
        88,
        40
      ],
      "ncu_output": "/data/zhoutaichang/feature/Lingbot_world_realtime/runs/analysis_report_20260908/raw/ncu_missing704_fd5ad4e08e7ff9d8_v1",
      "total_profiled_us": 74.752,
      "components": [
        {
          "category": "convolution_or_gemm",
          "us": 27.584,
          "fraction_of_profiled_sum": 0.3690068493150685
        },
        {
          "category": "elementwise_add",
          "us": 9.632,
          "fraction_of_profiled_sum": 0.1288527397260274
        },
        {
          "category": "layout_conversion",
          "us": 33.152,
          "fraction_of_profiled_sum": 0.44349315068493156
        },
        {
          "category": "workspace_init",
          "us": 4.384,
          "fraction_of_profiled_sum": 0.05864726027397261
        }
      ],
      "kernels": [
        {
          "id": "0",
          "name": "void cudnn::nchwToNhwcKernel<float, float, float, 0, 1, 0>(cudnn::nchw2nhwc_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 9.856
        },
        {
          "id": "1",
          "name": "void cudnn::nchwToNhwcKernel<float, float, float, 0, 1, 0>(cudnn::nchw2nhwc_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 15.168
        },
        {
          "id": "2",
          "name": "void cask_plugin__5x_cudnn::init_device_workspace_kernel<xmma__5x_cudnn::Warp_specialized_params_non_template<xmma__5x_cudnn::Grid_constant_params>>(T1, bool)",
          "category": "workspace_init",
          "duration_us": 4.384
        },
        {
          "id": "3",
          "name": "sm90_xmma_fprop_implicit_gemm_f32f32_tf32f32_f32_nhwckrsc_nhwc_tilesize128x128x32_warpgroupsize1x1x1_g1_execute_segment_k_on_kernel__5x_cudnn",
          "category": "convolution_or_gemm",
          "duration_us": 27.584
        },
        {
          "id": "4",
          "name": "void cudnn::nhwcToNchwKernel<float, float, float, 1, 0, 0>(cudnn::nhwc2nchw_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 8.128
        },
        {
          "id": "5",
          "name": "void at::elementwise_kernel<128, 2, void at::gpu_kernel_impl_nocast<at::CUDAFunctor_add<float>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)",
          "category": "elementwise_add",
          "duration_us": 9.632
        }
      ]
    },
    {
      "scheduler_note": [],
      "input_sha256": "bccd4b59806daff52b45f9c87ba32579441de0ed0adb3dd99356b7ebbcc1f4c7",
      "input_shape": [
        1,
        192,
        2,
        176,
        80
      ],
      "output_shape": [
        1,
        384,
        2,
        176,
        80
      ],
      "ncu_output": "/data/zhoutaichang/feature/Lingbot_world_realtime/runs/analysis_report_20260908/raw/ncu_missing704_9a2a65226b52659e_v1",
      "total_profiled_us": 80.96,
      "components": [
        {
          "category": "convolution_or_gemm",
          "us": 33.568,
          "fraction_of_profiled_sum": 0.41462450592885375
        },
        {
          "category": "elementwise_add",
          "us": 30.656,
          "fraction_of_profiled_sum": 0.3786561264822135
        },
        {
          "category": "explicit_copy",
          "us": 16.736,
          "fraction_of_profiled_sum": 0.20671936758893283
        }
      ],
      "kernels": [
        {
          "id": "0",
          "name": "void at::elementwise_kernel<128, 2, void at::gpu_kernel_impl_nocast<at::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)",
          "category": "explicit_copy",
          "duration_us": 16.736
        },
        {
          "id": "1",
          "name": "void cutlass::Kernel2<cutlass_80_tensorop_s1688gemm_256x64_16x4_nn_align4>(Params)",
          "category": "convolution_or_gemm",
          "duration_us": 33.568
        },
        {
          "id": "2",
          "name": "void at::elementwise_kernel<128, 2, void at::gpu_kernel_impl_nocast<at::CUDAFunctor_add<float>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)",
          "category": "elementwise_add",
          "duration_us": 30.656
        }
      ]
    },
    {
      "scheduler_note": [],
      "input_sha256": "d56deba2cf2a7667416ca96682c1bcff892969b687097e1b3ea3921ac1a1d6ac",
      "input_shape": [
        1,
        192,
        3,
        178,
        82
      ],
      "output_shape": [
        1,
        384,
        1,
        176,
        80
      ],
      "ncu_output": "/data/zhoutaichang/feature/Lingbot_world_realtime/runs/analysis_report_20260908/raw/ncu_missing704_740d67537eaca4e1_v1",
      "total_profiled_us": 306.40000000000003,
      "components": [
        {
          "category": "convolution_or_gemm",
          "us": 247.264,
          "fraction_of_profiled_sum": 0.8069973890339425
        },
        {
          "category": "elementwise_add",
          "us": 16.16,
          "fraction_of_profiled_sum": 0.05274151436031331
        },
        {
          "category": "layout_conversion",
          "us": 38.016,
          "fraction_of_profiled_sum": 0.12407310704960833
        },
        {
          "category": "workspace_init",
          "us": 4.96,
          "fraction_of_profiled_sum": 0.01618798955613577
        }
      ],
      "kernels": [
        {
          "id": "0",
          "name": "void cudnn::nchwToNhwcKernel<float, float, float, 0, 1, 0>(cudnn::nchw2nhwc_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 18.976
        },
        {
          "id": "1",
          "name": "void cudnn::nchwToNhwcKernel<float, float, float, 0, 1, 0>(cudnn::nchw2nhwc_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 6.816
        },
        {
          "id": "2",
          "name": "void cask_plugin__5x_cudnn::init_device_workspace_kernel<xmma__5x_cudnn::Warp_specialized_params_non_template<xmma__5x_cudnn::Grid_constant_params>>(T1, bool)",
          "category": "workspace_init",
          "duration_us": 4.96
        },
        {
          "id": "3",
          "name": "sm90_xmma_fprop_implicit_gemm_f32f32_tf32f32_f32_nhwckrsc_nhwc_tilesize128x128x32_warpgroupsize1x1x1_g1_execute_segment_k_on_kernel__5x_cudnn",
          "category": "convolution_or_gemm",
          "duration_us": 247.264
        },
        {
          "id": "4",
          "name": "void cudnn::nhwcToNchwKernel<float, float, float, 1, 0, 0>(cudnn::nhwc2nchw_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 12.224
        },
        {
          "id": "5",
          "name": "void at::elementwise_kernel<128, 2, void at::gpu_kernel_impl_nocast<at::CUDAFunctor_add<float>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)",
          "category": "elementwise_add",
          "duration_us": 16.16
        }
      ]
    },
    {
      "scheduler_note": [],
      "input_sha256": "f8fb1466dc2a1a6e997b5eff656e0d892480f377234df948eb6b06009d0b88b2",
      "input_shape": [
        1,
        16,
        3,
        90,
        42
      ],
      "output_shape": [
        1,
        384,
        1,
        88,
        40
      ],
      "ncu_output": "/data/zhoutaichang/feature/Lingbot_world_realtime/runs/analysis_report_20260908/raw/ncu_missing704_9e24c4a75ab83dea_v1",
      "total_profiled_us": 42.368,
      "components": [
        {
          "category": "convolution_or_gemm",
          "us": 29.408,
          "fraction_of_profiled_sum": 0.6941087613293051
        },
        {
          "category": "elementwise_add",
          "us": 6.432,
          "fraction_of_profiled_sum": 0.15181268882175228
        },
        {
          "category": "layout_conversion",
          "us": 6.5280000000000005,
          "fraction_of_profiled_sum": 0.1540785498489426
        }
      ],
      "kernels": [
        {
          "id": "0",
          "name": "void cudnn::nchwToNhwcKernel<float, float, float, 0, 1, 2>(cudnn::nchw2nhwc_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 3.328
        },
        {
          "id": "1",
          "name": "void cudnn::nchwToNhwcKernel<float, float, float, 0, 1, 2>(cudnn::nchw2nhwc_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 3.2
        },
        {
          "id": "2",
          "name": "sm80_xmma_fprop_implicit_gemm_tf32f32_tf32f32_f32_nhwckrsc_nchw_tilesize128x64x32_stage5_warpsize2x2x1_g1_tensor16x8x8_execute_kernel__5x_cudnn",
          "category": "convolution_or_gemm",
          "duration_us": 29.408
        },
        {
          "id": "3",
          "name": "void at::elementwise_kernel<128, 2, void at::gpu_kernel_impl_nocast<at::CUDAFunctor_add<float>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)",
          "category": "elementwise_add",
          "duration_us": 6.432
        }
      ]
    },
    {
      "scheduler_note": [],
      "input_sha256": "a2673addbb1775eb79e779d7635c4fbcf9dd34b0d4953bdf81e740bec14aa1ef",
      "input_shape": [
        1,
        96,
        3,
        706,
        322
      ],
      "output_shape": [
        1,
        3,
        1,
        704,
        320
      ],
      "ncu_output": "/data/zhoutaichang/feature/Lingbot_world_realtime/runs/analysis_report_20260908/raw/ncu_missing704_aa00674f1a72afcd_v1",
      "total_profiled_us": 502.55999999999995,
      "components": [
        {
          "category": "convolution_or_gemm",
          "us": 324.32,
          "fraction_of_profiled_sum": 0.6453358802929005
        },
        {
          "category": "elementwise_add",
          "us": 4.704,
          "fraction_of_profiled_sum": 0.009360076408787011
        },
        {
          "category": "layout_conversion",
          "us": 173.53599999999997,
          "fraction_of_profiled_sum": 0.3453040432983126
        }
      ],
      "kernels": [
        {
          "id": "0",
          "name": "void cudnn::nchwToNhwcKernel<float, float, float, 0, 1, 2>(cudnn::nchw2nhwc_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 158.016
        },
        {
          "id": "1",
          "name": "void cudnn::nchwToNhwcKernel<float, float, float, 0, 1, 2>(cudnn::nchw2nhwc_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 3.296
        },
        {
          "id": "2",
          "name": "sm80_xmma_fprop_implicit_gemm_indexed_wo_smem_tf32f32_tf32f32_f32_nhwckrsc_nhwc_tilesize128x16x64_stage1_warpsize4x1x1_g1_tensor16x8x8_alignc4_execute_kernel__5x_cudnn",
          "category": "convolution_or_gemm",
          "duration_us": 324.32
        },
        {
          "id": "3",
          "name": "void cudnn::nhwcToNchwKernel<float, float, float, 1, 0, 0>(cudnn::nhwc2nchw_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 12.224
        },
        {
          "id": "4",
          "name": "void at::elementwise_kernel<128, 2, void at::gpu_kernel_impl_nocast<at::CUDAFunctor_add<float>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)",
          "category": "elementwise_add",
          "duration_us": 4.704
        }
      ]
    },
    {
      "scheduler_note": [],
      "input_sha256": "85c1d12d0656fbd621625fe39cf33eef4823fe7d3338e672b380cbbe7e08c3bc",
      "input_shape": [
        1,
        192,
        1,
        176,
        80
      ],
      "output_shape": [
        1,
        384,
        1,
        176,
        80
      ],
      "ncu_output": "/data/zhoutaichang/feature/Lingbot_world_realtime/runs/analysis_report_20260908/raw/ncu_missing704_2ea2cf3e2f86821c_v1",
      "total_profiled_us": 36.704,
      "components": [
        {
          "category": "convolution_or_gemm",
          "us": 20.48,
          "fraction_of_profiled_sum": 0.5579773321708805
        },
        {
          "category": "elementwise_add",
          "us": 16.224,
          "fraction_of_profiled_sum": 0.4420226678291194
        }
      ],
      "kernels": [
        {
          "id": "0",
          "name": "void cutlass::Kernel2<cutlass_80_tensorop_s1688gemm_128x64_16x6_nn_align4>(Params)",
          "category": "convolution_or_gemm",
          "duration_us": 20.48
        },
        {
          "id": "1",
          "name": "void at::elementwise_kernel<128, 2, void at::gpu_kernel_impl_nocast<at::CUDAFunctor_add<float>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)",
          "category": "elementwise_add",
          "duration_us": 16.224
        }
      ]
    },
    {
      "scheduler_note": [],
      "input_sha256": "28dd946d4a53d1263bf5d552d2aacaa22bc7162bea85950320f6d0e02d5750e7",
      "input_shape": [
        1,
        16,
        3,
        88,
        160
      ],
      "output_shape": [
        1,
        16,
        3,
        88,
        160
      ],
      "ncu_output": "/data/zhoutaichang/feature/Lingbot_world_realtime/runs/analysis_report_20260908/raw/ncu_missing704_b611cd0d7be4ea16_v1",
      "total_profiled_us": 10.495999999999999,
      "components": [
        {
          "category": "convolution_or_gemm",
          "us": 5.824,
          "fraction_of_profiled_sum": 0.5548780487804879
        },
        {
          "category": "elementwise_add",
          "us": 4.672,
          "fraction_of_profiled_sum": 0.4451219512195122
        }
      ],
      "kernels": [
        {
          "id": "0",
          "name": "void cutlass::Kernel2<cutlass_80_tensorop_s1688gemm_128x64_16x6_nn_align4>(Params)",
          "category": "convolution_or_gemm",
          "duration_us": 5.824
        },
        {
          "id": "1",
          "name": "void at::elementwise_kernel<128, 2, void at::gpu_kernel_impl_nocast<at::CUDAFunctor_add<float>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)",
          "category": "elementwise_add",
          "duration_us": 4.672
        }
      ]
    }
  ],
  "audit_sha256": "f4401c75f2607b2d513134edc6455173e9568ed165ea3f4b8634d01e329f7a6e",
  "scope": "Disjoint categories inferred from explicit native kernel names, all17 high-resolution profiled conv signatures. Fractions of summed isolated NCU kernel durations, not integrated wall clock, recoverable speedup, hardware overlap or causal optimization proof. Layout changes require controlled numerical and full-cost comparison; previous layout-negative result is another input."
}
