{
  "status": "nine_vae_kernel_component_sums_checked",
  "rows": [
    {
      "input_sha256": "7ea1828a641121c7e50c8fec13aa00d78a4f4b0f419741b8b6e74c3fd8f2b955",
      "input_shape": [
        1,
        192,
        6,
        242,
        106
      ],
      "output_shape": [
        1,
        192,
        4,
        240,
        104
      ],
      "ncu_output": "/data/zhoutaichang/feature/Lingbot_world_realtime/runs/analysis_report_20260908/raw/ncu_missing_41fea95495c28b56_v1",
      "total_profiled_us": 872.416,
      "components": [
        {
          "category": "convolution_or_gemm",
          "us": 706.24,
          "fraction_of_profiled_sum": 0.8095220628690899
        },
        {
          "category": "elementwise_add",
          "us": 53.6,
          "fraction_of_profiled_sum": 0.06143857976011444
        },
        {
          "category": "layout_conversion",
          "us": 112.576,
          "fraction_of_profiled_sum": 0.12903935737079558
        }
      ],
      "kernels": [
        {
          "id": "0",
          "name": "void cudnn::nchwToNhwcKernel<float, float, float, 0, 1, 0>(cudnn::nchw2nhwc_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 68.352
        },
        {
          "id": "1",
          "name": "void cudnn::nchwToNhwcKernel<float, float, float, 0, 1, 0>(cudnn::nchw2nhwc_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 5.216
        },
        {
          "id": "2",
          "name": "sm90_xmma_fprop_implicit_gemm_f32f32_tf32f32_f32_nhwckrsc_nhwc_tilesize128x128x32_warpgroupsize1x1x1_g1_execute_segment_k_off_kernel__5x_cudnn",
          "category": "convolution_or_gemm",
          "duration_us": 706.24
        },
        {
          "id": "3",
          "name": "void cudnn::nhwcToNchwKernel<float, float, float, 1, 0, 0>(cudnn::nhwc2nchw_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 39.008
        },
        {
          "id": "4",
          "name": "void at::elementwise_kernel<128, 2, void at::gpu_kernel_impl_nocast<at::CUDAFunctor_add<float>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)",
          "category": "elementwise_add",
          "duration_us": 53.6
        }
      ]
    },
    {
      "input_sha256": "3da5719db48ceca956fb363d6dbfa423964bbde96b9ce8b8dd9399261d9405da",
      "input_shape": [
        1,
        96,
        6,
        482,
        210
      ],
      "output_shape": [
        1,
        96,
        4,
        480,
        208
      ],
      "ncu_output": "/data/zhoutaichang/feature/Lingbot_world_realtime/runs/analysis_report_20260908/raw/ncu_missing_74aff8f080d200c8_v1",
      "total_profiled_us": 1672.16,
      "components": [
        {
          "category": "convolution_or_gemm",
          "us": 1340.0,
          "fraction_of_profiled_sum": 0.8013587216534303
        },
        {
          "category": "elementwise_add",
          "us": 107.45599999999999,
          "fraction_of_profiled_sum": 0.06426179312984402
        },
        {
          "category": "layout_conversion",
          "us": 224.704,
          "fraction_of_profiled_sum": 0.13437948521672566
        }
      ],
      "kernels": [
        {
          "id": "0",
          "name": "void cudnn::nchwToNhwcKernel<float, float, float, 0, 1, 0>(cudnn::nchw2nhwc_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 140.096
        },
        {
          "id": "1",
          "name": "void cudnn::nchwToNhwcKernel<float, float, float, 0, 1, 0>(cudnn::nchw2nhwc_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 3.648
        },
        {
          "id": "2",
          "name": "sm90_xmma_fprop_implicit_gemm_f32f32_tf32f32_f32_nhwckrsc_nhwc_tilesize256x32x32_warpgroupsize1x1x1_g1_execute_segment_k_off_kernel__5x_cudnn",
          "category": "convolution_or_gemm",
          "duration_us": 1340.0
        },
        {
          "id": "3",
          "name": "void cudnn::nhwcToNchwKernel<float, float, float, 1, 0, 0>(cudnn::nhwc2nchw_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 80.96000000000001
        },
        {
          "id": "4",
          "name": "void at::elementwise_kernel<128, 2, void at::gpu_kernel_impl_nocast<at::CUDAFunctor_add<float>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)",
          "category": "elementwise_add",
          "duration_us": 107.45599999999999
        }
      ]
    },
    {
      "input_sha256": "538cab189b8721f3989e60d331a5e8f3a0b3ea6e3f542b4f5be45a3f1807f370",
      "input_shape": [
        1,
        384,
        4,
        122,
        54
      ],
      "output_shape": [
        1,
        384,
        2,
        120,
        52
      ],
      "ncu_output": "/data/zhoutaichang/feature/Lingbot_world_realtime/runs/analysis_report_20260908/raw/ncu_missing_7fc47a1ee259ec1d_v1",
      "total_profiled_us": 486.24,
      "components": [
        {
          "category": "convolution_or_gemm",
          "us": 427.488,
          "fraction_of_profiled_sum": 0.8791707798617966
        },
        {
          "category": "elementwise_add",
          "us": 14.944,
          "fraction_of_profiled_sum": 0.030733794011187893
        },
        {
          "category": "layout_conversion",
          "us": 43.80799999999999,
          "fraction_of_profiled_sum": 0.09009542612701545
        }
      ],
      "kernels": [
        {
          "id": "0",
          "name": "void cudnn::nchwToNhwcKernel<float, float, float, 0, 1, 0>(cudnn::nchw2nhwc_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 22.304
        },
        {
          "id": "1",
          "name": "void cudnn::nchwToNhwcKernel<float, float, float, 0, 1, 0>(cudnn::nchw2nhwc_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 10.304
        },
        {
          "id": "2",
          "name": "sm90_xmma_fprop_implicit_gemm_f32f32_tf32f32_f32_nhwckrsc_nhwc_tilesize128x128x32_warpgroupsize1x1x1_g1_execute_segment_k_off_kernel__5x_cudnn",
          "category": "convolution_or_gemm",
          "duration_us": 427.488
        },
        {
          "id": "3",
          "name": "void cudnn::nhwcToNchwKernel<float, float, float, 1, 0, 0>(cudnn::nhwc2nchw_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 11.2
        },
        {
          "id": "4",
          "name": "void at::elementwise_kernel<128, 2, void at::gpu_kernel_impl_nocast<at::CUDAFunctor_add<float>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)",
          "category": "elementwise_add",
          "duration_us": 14.944
        }
      ]
    },
    {
      "input_sha256": "6fa08b3e20b8b3a0f9f34750ff5afbc4a19f18369bd70ccbf0ed0d1071ca5f08",
      "input_shape": [
        1,
        192,
        4,
        122,
        54
      ],
      "output_shape": [
        1,
        384,
        2,
        120,
        52
      ],
      "ncu_output": "/data/zhoutaichang/feature/Lingbot_world_realtime/runs/analysis_report_20260908/raw/ncu_missing_e49e1cfe69d26b07_v1",
      "total_profiled_us": 253.024,
      "components": [
        {
          "category": "convolution_or_gemm",
          "us": 209.216,
          "fraction_of_profiled_sum": 0.8268622739344884
        },
        {
          "category": "elementwise_add",
          "us": 14.56,
          "fraction_of_profiled_sum": 0.05754394840015176
        },
        {
          "category": "layout_conversion",
          "us": 29.247999999999998,
          "fraction_of_profiled_sum": 0.1155937776653598
        }
      ],
      "kernels": [
        {
          "id": "0",
          "name": "void cudnn::nchwToNhwcKernel<float, float, float, 0, 1, 0>(cudnn::nchw2nhwc_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 11.456
        },
        {
          "id": "1",
          "name": "void cudnn::nchwToNhwcKernel<float, float, float, 0, 1, 0>(cudnn::nchw2nhwc_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 6.656
        },
        {
          "id": "2",
          "name": "sm90_xmma_fprop_implicit_gemm_f32f32_tf32f32_f32_nhwckrsc_nhwc_tilesize128x128x32_warpgroupsize1x1x1_g1_execute_segment_k_off_kernel__5x_cudnn",
          "category": "convolution_or_gemm",
          "duration_us": 209.216
        },
        {
          "id": "3",
          "name": "void cudnn::nhwcToNchwKernel<float, float, float, 1, 0, 0>(cudnn::nhwc2nchw_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 11.136
        },
        {
          "id": "4",
          "name": "void at::elementwise_kernel<128, 2, void at::gpu_kernel_impl_nocast<at::CUDAFunctor_add<float>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)",
          "category": "elementwise_add",
          "duration_us": 14.56
        }
      ]
    },
    {
      "input_sha256": "3547fbf5eb18cf7da7abff35f3a785e4dd1cfc51a243c23698a162ff25086677",
      "input_shape": [
        1,
        384,
        4,
        120,
        52
      ],
      "output_shape": [
        1,
        768,
        2,
        120,
        52
      ],
      "ncu_output": "/data/zhoutaichang/feature/Lingbot_world_realtime/runs/analysis_report_20260908/raw/ncu_missing_c87dc674a51efcf2_v1",
      "total_profiled_us": 168.22400000000002,
      "components": [
        {
          "category": "convolution_or_gemm",
          "us": 81.536,
          "fraction_of_profiled_sum": 0.4846870838881491
        },
        {
          "category": "elementwise_add",
          "us": 27.712,
          "fraction_of_profiled_sum": 0.16473273730264407
        },
        {
          "category": "layout_conversion",
          "us": 55.456,
          "fraction_of_profiled_sum": 0.3296556971656838
        },
        {
          "category": "workspace_init",
          "us": 3.52,
          "fraction_of_profiled_sum": 0.02092448164352292
        }
      ],
      "kernels": [
        {
          "id": "0",
          "name": "void cudnn::nchwToNhwcKernel<float, float, float, 0, 1, 0>(cudnn::nchw2nhwc_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 20.224
        },
        {
          "id": "1",
          "name": "void cudnn::nchwToNhwcKernel<float, float, float, 0, 1, 0>(cudnn::nchw2nhwc_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 15.2
        },
        {
          "id": "2",
          "name": "void cask_plugin__5x_cudnn::init_device_workspace_kernel<xmma__5x_cudnn::Warp_specialized_params_non_template<xmma__5x_cudnn::Grid_constant_params>>(T1, bool)",
          "category": "workspace_init",
          "duration_us": 3.52
        },
        {
          "id": "3",
          "name": "sm90_xmma_fprop_implicit_gemm_f32f32_tf32f32_f32_nhwckrsc_nhwc_tilesize128x128x32_warpgroupsize1x1x1_g1_execute_segment_k_on_kernel__5x_cudnn",
          "category": "convolution_or_gemm",
          "duration_us": 81.536
        },
        {
          "id": "4",
          "name": "void cudnn::nhwcToNchwKernel<float, float, float, 1, 0, 0>(cudnn::nhwc2nchw_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 20.032
        },
        {
          "id": "5",
          "name": "void at::elementwise_kernel<128, 2, void at::gpu_kernel_impl_nocast<at::CUDAFunctor_add<float>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)",
          "category": "elementwise_add",
          "duration_us": 27.712
        }
      ]
    },
    {
      "input_sha256": "3558a52a268a76189298b60a739c4bc3a01099db809b69c10633a6c964ffd111",
      "input_shape": [
        1,
        96,
        6,
        482,
        210
      ],
      "output_shape": [
        1,
        3,
        4,
        480,
        208
      ],
      "ncu_output": "/data/zhoutaichang/feature/Lingbot_world_realtime/runs/analysis_report_20260908/raw/ncu_missing_27b8a5265a151590_v1",
      "total_profiled_us": 704.1279999999999,
      "components": [
        {
          "category": "convolution_or_gemm",
          "us": 536.64,
          "fraction_of_profiled_sum": 0.7621341574259226
        },
        {
          "category": "elementwise_add",
          "us": 5.984,
          "fraction_of_profiled_sum": 0.008498454826395201
        },
        {
          "category": "layout_conversion",
          "us": 161.504,
          "fraction_of_profiled_sum": 0.22936738774768226
        }
      ],
      "kernels": [
        {
          "id": "0",
          "name": "void cudnn::nchwToNhwcKernel<float, float, float, 0, 1, 2>(cudnn::nchw2nhwc_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 139.52
        },
        {
          "id": "1",
          "name": "void cudnn::nchwToNhwcKernel<float, float, float, 0, 1, 2>(cudnn::nchw2nhwc_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 3.2
        },
        {
          "id": "2",
          "name": "sm80_xmma_fprop_implicit_gemm_indexed_wo_smem_tf32f32_tf32f32_f32_nhwckrsc_nhwc_tilesize128x16x64_stage1_warpsize4x1x1_g1_tensor16x8x8_alignc4_execute_kernel__5x_cudnn",
          "category": "convolution_or_gemm",
          "duration_us": 536.64
        },
        {
          "id": "3",
          "name": "void cudnn::nhwcToNchwKernel<float, float, float, 1, 0, 0>(cudnn::nhwc2nchw_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 18.784
        },
        {
          "id": "4",
          "name": "void at::elementwise_kernel<128, 2, void at::gpu_kernel_impl_nocast<at::CUDAFunctor_add<float>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)",
          "category": "elementwise_add",
          "duration_us": 5.984
        }
      ]
    },
    {
      "input_sha256": "03221b37d95f7c65a91055eae771f796fbf8e0d7758ce6840701ea0c066358ea",
      "input_shape": [
        1,
        384,
        3,
        60,
        26
      ],
      "output_shape": [
        1,
        768,
        1,
        60,
        26
      ],
      "ncu_output": "/data/zhoutaichang/feature/Lingbot_world_realtime/runs/analysis_report_20260908/raw/ncu_missing_d35bb120bedeb7d0_v1",
      "total_profiled_us": 51.712,
      "components": [
        {
          "category": "convolution_or_gemm",
          "us": 18.688,
          "fraction_of_profiled_sum": 0.3613861386138613
        },
        {
          "category": "elementwise_add",
          "us": 6.176,
          "fraction_of_profiled_sum": 0.11943069306930693
        },
        {
          "category": "layout_conversion",
          "us": 26.848000000000003,
          "fraction_of_profiled_sum": 0.5191831683168316
        }
      ],
      "kernels": [
        {
          "id": "0",
          "name": "void cudnn::nchwToNhwcKernel<float, float, float, 0, 1, 0>(cudnn::nchw2nhwc_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 6.144
        },
        {
          "id": "1",
          "name": "void cudnn::nchwToNhwcKernel<float, float, float, 0, 1, 0>(cudnn::nchw2nhwc_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 15.328
        },
        {
          "id": "2",
          "name": "sm90_xmma_fprop_implicit_gemm_f32f32_tf32f32_f32_nhwckrsc_nhwc_tilesize128x128x32_warpgroupsize1x1x1_g1_execute_segment_k_off_kernel__5x_cudnn",
          "category": "convolution_or_gemm",
          "duration_us": 18.688
        },
        {
          "id": "3",
          "name": "void cudnn::nhwcToNchwKernel<float, float, float, 1, 0, 0>(cudnn::nhwc2nchw_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 5.376
        },
        {
          "id": "4",
          "name": "void at::elementwise_kernel<128, 2, void at::gpu_kernel_impl_nocast<at::CUDAFunctor_add<float>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)",
          "category": "elementwise_add",
          "duration_us": 6.176
        }
      ]
    },
    {
      "input_sha256": "5da1ee3cce399169645cbf03383f0c7594f9d9b878d0bc38e2e663bb1e06edd8",
      "input_shape": [
        1,
        192,
        2,
        120,
        52
      ],
      "output_shape": [
        1,
        384,
        2,
        120,
        52
      ],
      "ncu_output": "/data/zhoutaichang/feature/Lingbot_world_realtime/runs/analysis_report_20260908/raw/ncu_missing_6a92f0b3792a465a_v1",
      "total_profiled_us": 43.936,
      "components": [
        {
          "category": "convolution_or_gemm",
          "us": 20.0,
          "fraction_of_profiled_sum": 0.45520757465404227
        },
        {
          "category": "elementwise_add",
          "us": 14.976,
          "fraction_of_profiled_sum": 0.34085943190094686
        },
        {
          "category": "explicit_copy",
          "us": 8.96,
          "fraction_of_profiled_sum": 0.20393299344501095
        }
      ],
      "kernels": [
        {
          "id": "0",
          "name": "void at::elementwise_kernel<128, 2, void at::gpu_kernel_impl_nocast<at::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)",
          "category": "explicit_copy",
          "duration_us": 8.96
        },
        {
          "id": "1",
          "name": "void cutlass::Kernel2<cutlass_80_tensorop_s1688gemm_128x64_16x6_nn_align4>(Params)",
          "category": "convolution_or_gemm",
          "duration_us": 20.0
        },
        {
          "id": "2",
          "name": "void at::elementwise_kernel<128, 2, void at::gpu_kernel_impl_nocast<at::CUDAFunctor_add<float>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)",
          "category": "elementwise_add",
          "duration_us": 14.976
        }
      ]
    },
    {
      "input_sha256": "480f421d034402c9b8b81d025dce79d2061ec150ba4509115415f8dd5d3b37b5",
      "input_shape": [
        1,
        96,
        3,
        482,
        210
      ],
      "output_shape": [
        1,
        3,
        1,
        480,
        208
      ],
      "ncu_output": "/data/zhoutaichang/feature/Lingbot_world_realtime/runs/analysis_report_20260908/raw/ncu_missing_ddb198f9c3730e1d_v1",
      "total_profiled_us": 284.0,
      "components": [
        {
          "category": "convolution_or_gemm",
          "us": 200.416,
          "fraction_of_profiled_sum": 0.7056901408450704
        },
        {
          "category": "elementwise_add",
          "us": 3.584,
          "fraction_of_profiled_sum": 0.012619718309859156
        },
        {
          "category": "layout_conversion",
          "us": 80.0,
          "fraction_of_profiled_sum": 0.28169014084507044
        }
      ],
      "kernels": [
        {
          "id": "0",
          "name": "void cudnn::nchwToNhwcKernel<float, float, float, 0, 1, 2>(cudnn::nchw2nhwc_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 70.304
        },
        {
          "id": "1",
          "name": "void cudnn::nchwToNhwcKernel<float, float, float, 0, 1, 2>(cudnn::nchw2nhwc_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 3.2
        },
        {
          "id": "2",
          "name": "sm80_xmma_fprop_implicit_gemm_indexed_wo_smem_tf32f32_tf32f32_f32_nhwckrsc_nhwc_tilesize128x16x64_stage1_warpsize4x1x1_g1_tensor16x8x8_alignc4_execute_kernel__5x_cudnn",
          "category": "convolution_or_gemm",
          "duration_us": 200.416
        },
        {
          "id": "3",
          "name": "void cudnn::nhwcToNchwKernel<float, float, float, 1, 0, 0>(cudnn::nhwc2nchw_params_t<T3>, const T1 *, T2 *)",
          "category": "layout_conversion",
          "duration_us": 6.496
        },
        {
          "id": "4",
          "name": "void at::elementwise_kernel<128, 2, void at::gpu_kernel_impl_nocast<at::CUDAFunctor_add<float>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)",
          "category": "elementwise_add",
          "duration_us": 3.584
        }
      ]
    }
  ],
  "audit_sha256": "1cd20f22b13dc6e63fd8ed5890420ce4a45db249f756f777f977848cf494bed8",
  "scope": "Disjoint categories inferred from explicit native kernel names, all9 newly profiled conv signatures. Fractions of summed isolated NCU kernel durations, not integrated wall clock, recoverable speedup, hardware overlap or causal optimization proof. Layout changes require controlled numerical and full-cost comparison; previous layout-negative result is another input."
}
