{
  "label": "ledger_capture_480x832_v1",
  "run": "/data/zhoutaichang/feature/Lingbot_world_realtime/runs/analysis_report_20260908/raw/ledger_capture_480x832_v1",
  "generated_at": "2026-09-10T15:56:30+0800",
  "kernel_events": 1092983,
  "link_status": {
    "no_nvtx_context": 135025,
    "total": 1092983,
    "context": 957958
  },
  "groups": 6211,
  "roles": {
    "3163357": "vae_rank0",
    "3163358": "vae_rank1",
    "3163359": "vae_rank2",
    "3163360": "vae_rank3",
    "3168673": "dit_rank0",
    "3168674": "dit_rank1",
    "3168675": "dit_rank2",
    "3168676": "dit_rank3",
    "19940573": "vae_unknown_rank",
    "19940574": "vae_unknown_rank",
    "19940575": "vae_unknown_rank",
    "19940576": "vae_unknown_rank"
  },
  "dit_pids": [
    3168673,
    3168674,
    3168675,
    3168676
  ],
  "vae_pids": [
    3163357,
    3163358,
    3163359,
    3163360
  ],
  "clock": {
    "session_systemClockNs": 3014606511863650,
    "anchor_offset_ns": 3014606511824156,
    "anchor_count": 4,
    "anchor_spread_ns": 122212,
    "used_offset_ns": 3014606511824156
  },
  "windows_ns": {
    "measured": [
      [
        253743914870,
        263832309519
      ]
    ],
    "steady": [
      [
        259419853196,
        260366664851
      ],
      [
        260366664851,
        261218193875
      ],
      [
        261218193875,
        262070595850
      ],
      [
        262070595850,
        262924720589
      ]
    ]
  },
  "coverage": {
    "invocations_with_context": 0.8764619394812179,
    "steady_gpu_time_with_context": 0.999447236636732,
    "steady_gpu_ns_total": 12224388317,
    "dit_forward_rows": {
      "3168673": 100,
      "3168674": 100,
      "3168675": 100,
      "3168676": 100
    },
    "vae_dispatch_rows": {
      "0:ep1_chunk0": 2273,
      "0:ep1_chunk5": 2320,
      "1:ep1_chunk0": 2272,
      "1:ep1_chunk5": 2319,
      "2:ep1_chunk0": 2272,
      "2:ep1_chunk5": 2319,
      "3:ep1_chunk0": 2272,
      "3:ep1_chunk5": 2319
    }
  },
  "unknown_top": [
    {
      "role": "dit_rank1",
      "name": "void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)",
      "count": 5288
    },
    {
      "role": "dit_rank0",
      "name": "void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)",
      "count": 5288
    },
    {
      "role": "dit_rank2",
      "name": "void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)",
      "count": 5288
    },
    {
      "role": "dit_rank3",
      "name": "void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)",
      "count": 5288
    },
    {
      "role": "dit_rank1",
      "name": "void cudnn::engines_precompiled::nchwToNhwcKernel<__nv_bfloat16, __nv_bfloat16, float, (bool)0, (bool)1, (cudnnKernelDataType_t)0>(cudnn::engines_precompiled::nchw2nhwc_params_t<T3>, const T1 *, T2 *)",
      "count": 3112
    },
    {
      "role": "dit_rank2",
      "name": "void cudnn::engines_precompiled::nchwToNhwcKernel<__nv_bfloat16, __nv_bfloat16, float, (bool)0, (bool)1, (cudnnKernelDataType_t)0>(cudnn::engines_precompiled::nchw2nhwc_params_t<T3>, const T1 *, T2 *)",
      "count": 3112
    },
    {
      "role": "dit_rank0",
      "name": "void cudnn::engines_precompiled::nchwToNhwcKernel<__nv_bfloat16, __nv_bfloat16, float, (bool)0, (bool)1, (cudnnKernelDataType_t)0>(cudnn::engines_precompiled::nchw2nhwc_params_t<T3>, const T1 *, T2 *)",
      "count": 3112
    },
    {
      "role": "dit_rank3",
      "name": "void cudnn::engines_precompiled::nchwToNhwcKernel<__nv_bfloat16, __nv_bfloat16, float, (bool)0, (bool)1, (cudnnKernelDataType_t)0>(cudnn::engines_precompiled::nchw2nhwc_params_t<T3>, const T1 *, T2 *)",
      "count": 3112
    },
    {
      "role": "dit_rank1",
      "name": "void at::native::elementwise_kernel<(int)128, (int)4, void at::native::gpu_kernel_impl_nocast<at::native::CUDAFunctor_add<c10::BFloat16>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)",
      "count": 1956
    },
    {
      "role": "dit_rank3",
      "name": "void at::native::elementwise_kernel<(int)128, (int)4, void at::native::gpu_kernel_impl_nocast<at::native::CUDAFunctor_add<c10::BFloat16>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)",
      "count": 1956
    },
    {
      "role": "dit_rank2",
      "name": "void at::native::elementwise_kernel<(int)128, (int)4, void at::native::gpu_kernel_impl_nocast<at::native::CUDAFunctor_add<c10::BFloat16>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)",
      "count": 1956
    },
    {
      "role": "dit_rank0",
      "name": "void at::native::elementwise_kernel<(int)128, (int)4, void at::native::gpu_kernel_impl_nocast<at::native::CUDAFunctor_add<c10::BFloat16>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)",
      "count": 1956
    },
    {
      "role": "vae_rank0",
      "name": "void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)",
      "count": 1605
    },
    {
      "role": "dit_rank3",
      "name": "void at::native::vectorized_elementwise_kernel<(int)8, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)",
      "count": 1568
    },
    {
      "role": "dit_rank2",
      "name": "void at::native::vectorized_elementwise_kernel<(int)8, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)",
      "count": 1568
    },
    {
      "role": "dit_rank1",
      "name": "void at::native::vectorized_elementwise_kernel<(int)8, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)",
      "count": 1568
    },
    {
      "role": "dit_rank0",
      "name": "void at::native::vectorized_elementwise_kernel<(int)8, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)",
      "count": 1568
    },
    {
      "role": "dit_rank1",
      "name": "void cudnn::engines_precompiled::nhwcToNchwKernel<__nv_bfloat16, __nv_bfloat16, float, (bool)1, (bool)0, (cudnnKernelDataType_t)0>(cudnn::engines_precompiled::nhwc2nchw_params_t<T3>, const T1 *, T2 *)",
      "count": 1556
    },
    {
      "role": "dit_rank2",
      "name": "void cudnn::engines_precompiled::nhwcToNchwKernel<__nv_bfloat16, __nv_bfloat16, float, (bool)1, (bool)0, (cudnnKernelDataType_t)0>(cudnn::engines_precompiled::nhwc2nchw_params_t<T3>, const T1 *, T2 *)",
      "count": 1556
    },
    {
      "role": "dit_rank0",
      "name": "void cudnn::engines_precompiled::nhwcToNchwKernel<__nv_bfloat16, __nv_bfloat16, float, (bool)1, (bool)0, (cudnnKernelDataType_t)0>(cudnn::engines_precompiled::nhwc2nchw_params_t<T3>, const T1 *, T2 *)",
      "count": 1556
    },
    {
      "role": "dit_rank3",
      "name": "void cudnn::engines_precompiled::nhwcToNchwKernel<__nv_bfloat16, __nv_bfloat16, float, (bool)1, (bool)0, (cudnnKernelDataType_t)0>(cudnn::engines_precompiled::nhwc2nchw_params_t<T3>, const T1 *, T2 *)",
      "count": 1556
    },
    {
      "role": "dit_rank1",
      "name": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)",
      "count": 1448
    },
    {
      "role": "dit_rank3",
      "name": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)",
      "count": 1448
    },
    {
      "role": "dit_rank2",
      "name": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)",
      "count": 1448
    },
    {
      "role": "dit_rank0",
      "name": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)",
      "count": 1448
    },
    {
      "role": "dit_rank3",
      "name": "void at::native::elementwise_kernel<(int)128, (int)4, void at::native::gpu_kernel_impl<at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)",
      "count": 1418
    },
    {
      "role": "dit_rank2",
      "name": "void at::native::elementwise_kernel<(int)128, (int)4, void at::native::gpu_kernel_impl<at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)",
      "count": 1418
    },
    {
      "role": "dit_rank1",
      "name": "void at::native::elementwise_kernel<(int)128, (int)4, void at::native::gpu_kernel_impl<at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)",
      "count": 1418
    },
    {
      "role": "dit_rank0",
      "name": "void at::native::elementwise_kernel<(int)128, (int)4, void at::native::gpu_kernel_impl<at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)",
      "count": 1418
    },
    {
      "role": "dit_rank1",
      "name": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)",
      "count": 1344
    },
    {
      "role": "dit_rank2",
      "name": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)",
      "count": 1344
    },
    {
      "role": "dit_rank3",
      "name": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)",
      "count": 1344
    },
    {
      "role": "dit_rank0",
      "name": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)",
      "count": 1344
    },
    {
      "role": "dit_rank1",
      "name": "void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::NormTwoOps<c10::BFloat16, float, float, (bool)1>, unsigned int, float, (int)4, (int)4>>(T3)",
      "count": 1320
    },
    {
      "role": "dit_rank1",
      "name": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)",
      "count": 1320
    },
    {
      "role": "dit_rank1",
      "name": "void at::native::elementwise_kernel<(int)128, (int)4, void at::native::gpu_kernel_impl<at::native::BinaryFunctor<float, float, float, at::native::binary_internal::DivFunctor<float>>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)",
      "count": 1320
    },
    {
      "role": "dit_rank2",
      "name": "void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::NormTwoOps<c10::BFloat16, float, float, (bool)1>, unsigned int, float, (int)4, (int)4>>(T3)",
      "count": 1320
    },
    {
      "role": "dit_rank2",
      "name": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)",
      "count": 1320
    },
    {
      "role": "dit_rank2",
      "name": "void at::native::elementwise_kernel<(int)128, (int)4, void at::native::gpu_kernel_impl<at::native::BinaryFunctor<float, float, float, at::native::binary_internal::DivFunctor<float>>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)",
      "count": 1320
    },
    {
      "role": "dit_rank0",
      "name": "void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::NormTwoOps<c10::BFloat16, float, float, (bool)1>, unsigned int, float, (int)4, (int)4>>(T3)",
      "count": 1320
    }
  ],
  "seconds": 50.229904890060425,
  "scope": "Diagnostic nsys trace under production reduce-overhead mode. Context comes from NVTX ranges on the launching thread; graph kernels inherit the cudaGraphLaunch context and carry in-graph position. GPU time is trace time, not clean timing; invocation-with-context does not equal shape/counter attribution."
}
