{
  "label": "ledger_capture_704x1280_v1",
  "run": "/data/zhoutaichang/feature/Lingbot_world_realtime/runs/analysis_report_20260908/raw/ledger_capture_704x1280_v1",
  "generated_at": "2026-09-10T16:08:19+0800",
  "kernel_events": 1092185,
  "link_status": {
    "no_nvtx_context": 136373,
    "total": 1092185,
    "context": 955812
  },
  "groups": 6101,
  "roles": {
    "3301965": "vae_rank0",
    "3301966": "vae_rank1",
    "3301967": "vae_rank2",
    "3301968": "vae_rank3",
    "3307870": "dit_rank0",
    "3307871": "dit_rank1",
    "3307872": "dit_rank2",
    "3307873": "dit_rank3",
    "20079181": "vae_unknown_rank",
    "20079182": "vae_unknown_rank",
    "20079183": "vae_unknown_rank",
    "20079184": "vae_unknown_rank"
  },
  "dit_pids": [
    3307870,
    3307871,
    3307872,
    3307873
  ],
  "vae_pids": [
    3301965,
    3301966,
    3301967,
    3301968
  ],
  "clock": {
    "session_systemClockNs": 3015610264500046,
    "anchor_offset_ns": 3015610264465616,
    "anchor_count": 4,
    "anchor_spread_ns": 87996,
    "used_offset_ns": 3015610264465616
  },
  "windows_ns": {
    "measured": [
      [
        278487043706,
        305240051817
      ]
    ],
    "steady": [
      [
        292640032241,
        295180904169
      ],
      [
        295180904169,
        297661369715
      ],
      [
        297661369715,
        300149129456
      ],
      [
        300149129456,
        302632831461
      ]
    ]
  },
  "coverage": {
    "invocations_with_context": 0.8751374538196368,
    "steady_gpu_time_with_context": 0.999610423614959,
    "steady_gpu_ns_total": 38096377424,
    "dit_forward_rows": {
      "3307870": 100,
      "3307871": 100,
      "3307872": 100,
      "3307873": 100
    },
    "vae_dispatch_rows": {
      "0:ep1_chunk0": 2273,
      "0:ep1_chunk5": 2320,
      "1:ep1_chunk0": 2272,
      "1:ep1_chunk5": 2319,
      "2:ep1_chunk0": 2272,
      "2:ep1_chunk5": 2319,
      "3:ep1_chunk0": 2272,
      "3:ep1_chunk5": 2319
    }
  },
  "unknown_top": [
    {
      "role": "dit_rank0",
      "name": "void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)",
      "count": 5288
    },
    {
      "role": "dit_rank3",
      "name": "void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)",
      "count": 5288
    },
    {
      "role": "dit_rank1",
      "name": "void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)",
      "count": 5288
    },
    {
      "role": "dit_rank2",
      "name": "void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)",
      "count": 5288
    },
    {
      "role": "dit_rank3",
      "name": "void cudnn::engines_precompiled::nchwToNhwcKernel<__nv_bfloat16, __nv_bfloat16, float, (bool)0, (bool)1, (cudnnKernelDataType_t)0>(cudnn::engines_precompiled::nchw2nhwc_params_t<T3>, const T1 *, T2 *)",
      "count": 3112
    },
    {
      "role": "dit_rank0",
      "name": "void cudnn::engines_precompiled::nchwToNhwcKernel<__nv_bfloat16, __nv_bfloat16, float, (bool)0, (bool)1, (cudnnKernelDataType_t)0>(cudnn::engines_precompiled::nchw2nhwc_params_t<T3>, const T1 *, T2 *)",
      "count": 3112
    },
    {
      "role": "dit_rank1",
      "name": "void cudnn::engines_precompiled::nchwToNhwcKernel<__nv_bfloat16, __nv_bfloat16, float, (bool)0, (bool)1, (cudnnKernelDataType_t)0>(cudnn::engines_precompiled::nchw2nhwc_params_t<T3>, const T1 *, T2 *)",
      "count": 3112
    },
    {
      "role": "dit_rank2",
      "name": "void cudnn::engines_precompiled::nchwToNhwcKernel<__nv_bfloat16, __nv_bfloat16, float, (bool)0, (bool)1, (cudnnKernelDataType_t)0>(cudnn::engines_precompiled::nchw2nhwc_params_t<T3>, const T1 *, T2 *)",
      "count": 3112
    },
    {
      "role": "dit_rank0",
      "name": "void at::native::elementwise_kernel<(int)128, (int)4, void at::native::gpu_kernel_impl_nocast<at::native::CUDAFunctor_add<c10::BFloat16>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)",
      "count": 1956
    },
    {
      "role": "dit_rank1",
      "name": "void at::native::elementwise_kernel<(int)128, (int)4, void at::native::gpu_kernel_impl_nocast<at::native::CUDAFunctor_add<c10::BFloat16>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)",
      "count": 1956
    },
    {
      "role": "dit_rank3",
      "name": "void at::native::elementwise_kernel<(int)128, (int)4, void at::native::gpu_kernel_impl_nocast<at::native::CUDAFunctor_add<c10::BFloat16>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)",
      "count": 1956
    },
    {
      "role": "dit_rank2",
      "name": "void at::native::elementwise_kernel<(int)128, (int)4, void at::native::gpu_kernel_impl_nocast<at::native::CUDAFunctor_add<c10::BFloat16>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)",
      "count": 1956
    },
    {
      "role": "vae_rank0",
      "name": "void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)",
      "count": 1605
    },
    {
      "role": "dit_rank1",
      "name": "void at::native::vectorized_elementwise_kernel<(int)8, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)",
      "count": 1568
    },
    {
      "role": "dit_rank2",
      "name": "void at::native::vectorized_elementwise_kernel<(int)8, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)",
      "count": 1568
    },
    {
      "role": "dit_rank3",
      "name": "void at::native::vectorized_elementwise_kernel<(int)8, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)",
      "count": 1568
    },
    {
      "role": "dit_rank0",
      "name": "void at::native::vectorized_elementwise_kernel<(int)8, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)",
      "count": 1568
    },
    {
      "role": "dit_rank3",
      "name": "void cudnn::engines_precompiled::nhwcToNchwKernel<__nv_bfloat16, __nv_bfloat16, float, (bool)1, (bool)0, (cudnnKernelDataType_t)0>(cudnn::engines_precompiled::nhwc2nchw_params_t<T3>, const T1 *, T2 *)",
      "count": 1556
    },
    {
      "role": "dit_rank0",
      "name": "void cudnn::engines_precompiled::nhwcToNchwKernel<__nv_bfloat16, __nv_bfloat16, float, (bool)1, (bool)0, (cudnnKernelDataType_t)0>(cudnn::engines_precompiled::nhwc2nchw_params_t<T3>, const T1 *, T2 *)",
      "count": 1556
    },
    {
      "role": "dit_rank2",
      "name": "void cudnn::engines_precompiled::nhwcToNchwKernel<__nv_bfloat16, __nv_bfloat16, float, (bool)1, (bool)0, (cudnnKernelDataType_t)0>(cudnn::engines_precompiled::nhwc2nchw_params_t<T3>, const T1 *, T2 *)",
      "count": 1556
    },
    {
      "role": "dit_rank1",
      "name": "void cudnn::engines_precompiled::nhwcToNchwKernel<__nv_bfloat16, __nv_bfloat16, float, (bool)1, (bool)0, (cudnnKernelDataType_t)0>(cudnn::engines_precompiled::nhwc2nchw_params_t<T3>, const T1 *, T2 *)",
      "count": 1556
    },
    {
      "role": "dit_rank0",
      "name": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)",
      "count": 1448
    },
    {
      "role": "dit_rank1",
      "name": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)",
      "count": 1448
    },
    {
      "role": "dit_rank3",
      "name": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)",
      "count": 1448
    },
    {
      "role": "dit_rank2",
      "name": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)",
      "count": 1448
    },
    {
      "role": "dit_rank1",
      "name": "void at::native::elementwise_kernel<(int)128, (int)4, void at::native::gpu_kernel_impl<at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)",
      "count": 1418
    },
    {
      "role": "dit_rank2",
      "name": "void at::native::elementwise_kernel<(int)128, (int)4, void at::native::gpu_kernel_impl<at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)",
      "count": 1418
    },
    {
      "role": "dit_rank3",
      "name": "void at::native::elementwise_kernel<(int)128, (int)4, void at::native::gpu_kernel_impl<at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)",
      "count": 1418
    },
    {
      "role": "dit_rank0",
      "name": "void at::native::elementwise_kernel<(int)128, (int)4, void at::native::gpu_kernel_impl<at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)",
      "count": 1418
    },
    {
      "role": "dit_rank1",
      "name": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)",
      "count": 1344
    },
    {
      "role": "dit_rank0",
      "name": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)",
      "count": 1344
    },
    {
      "role": "dit_rank3",
      "name": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)",
      "count": 1344
    },
    {
      "role": "dit_rank2",
      "name": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)",
      "count": 1344
    },
    {
      "role": "dit_rank0",
      "name": "void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::NormTwoOps<c10::BFloat16, float, float, (bool)1>, unsigned int, float, (int)4, (int)4>>(T3)",
      "count": 1320
    },
    {
      "role": "dit_rank0",
      "name": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)",
      "count": 1320
    },
    {
      "role": "dit_rank3",
      "name": "void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::NormTwoOps<c10::BFloat16, float, float, (bool)1>, unsigned int, float, (int)4, (int)4>>(T3)",
      "count": 1320
    },
    {
      "role": "dit_rank3",
      "name": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)",
      "count": 1320
    },
    {
      "role": "dit_rank0",
      "name": "void at::native::elementwise_kernel<(int)128, (int)4, void at::native::gpu_kernel_impl<at::native::BinaryFunctor<float, float, float, at::native::binary_internal::DivFunctor<float>>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)",
      "count": 1320
    },
    {
      "role": "dit_rank3",
      "name": "void at::native::elementwise_kernel<(int)128, (int)4, void at::native::gpu_kernel_impl<at::native::BinaryFunctor<float, float, float, at::native::binary_internal::DivFunctor<float>>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)",
      "count": 1320
    },
    {
      "role": "dit_rank1",
      "name": "void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::NormTwoOps<c10::BFloat16, float, float, (bool)1>, unsigned int, float, (int)4, (int)4>>(T3)",
      "count": 1320
    }
  ],
  "seconds": 47.48069143295288,
  "scope": "Diagnostic nsys trace under production reduce-overhead mode. Context comes from NVTX ranges on the launching thread; graph kernels inherit the cudaGraphLaunch context and carry in-graph position. GPU time is trace time, not clean timing; invocation-with-context does not equal shape/counter attribution."
}
