{
 "generated_at": "2026-09-10T16:07:31+0800",
 "run": "raw/ledger_capture_704x1280_v1",
 "wrappers": {
  "compile_cache/lingbot-u4-2005-3307870-28mbeafj/inductor/cq/ccqoxx7jjyr33c4s4jro2vkuatbsrnggsz5rufatbba4nx6e5udw.py": 34,
  "compile_cache/lingbot-u4-2005-3307870-28mbeafj/inductor/gx/cgx3bttfyltshi47nqabsdx7k5apmiiadllmh7ic3ertvtbyrkqa.py": 34,
  "compile_cache/lingbot-u4-2005-3307871-lvvjyc31/inductor/zd/czdafwzgo2o2qgfzrvtjq7dkaxxwxcanneg2iwudmtz7xox333ob.py": 34,
  "compile_cache/lingbot-u4-2005-3307871-lvvjyc31/inductor/zd/czdnynyf6zgi2f744d3oesrek3ht65x6wbsjte3lqq3miv6eelpa.py": 34,
  "compile_cache/lingbot-u4-2005-3307872-_vjdui5b/inductor/io/ciohqitass5zun5e5v6yzelnnzql5r5d6qpvffedo7vvf66qdjct.py": 34,
  "compile_cache/lingbot-u4-2005-3307872-_vjdui5b/inductor/s2/cs2e2lt2b2cvg4flurwrsu2zdygh7elbfkexceb6ou435fbx2xe2.py": 34,
  "compile_cache/lingbot-u4-2005-3307873-0o0_tsgy/inductor/fs/cfsq3e3mtbbv33gfsvnmzmbgvgnfmeez7oz5rvmwagysy4fcfocn.py": 34,
  "compile_cache/lingbot-u4-2005-3307873-0o0_tsgy/inductor/pi/cpii3hsbpyer6uikkv7grbtf7tr74x6abdq7lpf6li6pb7xlkjmz.py": 34
 },
 "summary": {
  "graphs": 160,
  "kernels": 6720,
  "unmatched_kernels": 0
 },
 "graphs": {
  "3307870:5": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307870-28mbeafj/inductor/cq/ccqoxx7jjyr33c4s4jro2vkuatbsrnggsz5rufatbba4nx6e5udw.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307870:8": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307870-28mbeafj/inductor/cq/ccqoxx7jjyr33c4s4jro2vkuatbsrnggsz5rufatbba4nx6e5udw.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307870:11": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307870-28mbeafj/inductor/cq/ccqoxx7jjyr33c4s4jro2vkuatbsrnggsz5rufatbba4nx6e5udw.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307870:14": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307870-28mbeafj/inductor/cq/ccqoxx7jjyr33c4s4jro2vkuatbsrnggsz5rufatbba4nx6e5udw.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307870:17": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307870-28mbeafj/inductor/cq/ccqoxx7jjyr33c4s4jro2vkuatbsrnggsz5rufatbba4nx6e5udw.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307870:20": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307870-28mbeafj/inductor/cq/ccqoxx7jjyr33c4s4jro2vkuatbsrnggsz5rufatbba4nx6e5udw.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307870:23": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307870-28mbeafj/inductor/cq/ccqoxx7jjyr33c4s4jro2vkuatbsrnggsz5rufatbba4nx6e5udw.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307870:26": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307870-28mbeafj/inductor/cq/ccqoxx7jjyr33c4s4jro2vkuatbsrnggsz5rufatbba4nx6e5udw.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307870:29": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307870-28mbeafj/inductor/cq/ccqoxx7jjyr33c4s4jro2vkuatbsrnggsz5rufatbba4nx6e5udw.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307870:32": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307870-28mbeafj/inductor/cq/ccqoxx7jjyr33c4s4jro2vkuatbsrnggsz5rufatbba4nx6e5udw.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307870:35": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307870-28mbeafj/inductor/cq/ccqoxx7jjyr33c4s4jro2vkuatbsrnggsz5rufatbba4nx6e5udw.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307870:38": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307870-28mbeafj/inductor/cq/ccqoxx7jjyr33c4s4jro2vkuatbsrnggsz5rufatbba4nx6e5udw.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307870:41": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307870-28mbeafj/inductor/cq/ccqoxx7jjyr33c4s4jro2vkuatbsrnggsz5rufatbba4nx6e5udw.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307870:44": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307870-28mbeafj/inductor/cq/ccqoxx7jjyr33c4s4jro2vkuatbsrnggsz5rufatbba4nx6e5udw.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307870:47": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307870-28mbeafj/inductor/cq/ccqoxx7jjyr33c4s4jro2vkuatbsrnggsz5rufatbba4nx6e5udw.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307870:50": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307870-28mbeafj/inductor/cq/ccqoxx7jjyr33c4s4jro2vkuatbsrnggsz5rufatbba4nx6e5udw.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307870:53": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307870-28mbeafj/inductor/cq/ccqoxx7jjyr33c4s4jro2vkuatbsrnggsz5rufatbba4nx6e5udw.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307870:56": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307870-28mbeafj/inductor/cq/ccqoxx7jjyr33c4s4jro2vkuatbsrnggsz5rufatbba4nx6e5udw.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307870:59": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307870-28mbeafj/inductor/cq/ccqoxx7jjyr33c4s4jro2vkuatbsrnggsz5rufatbba4nx6e5udw.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307870:62": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307870-28mbeafj/inductor/cq/ccqoxx7jjyr33c4s4jro2vkuatbsrnggsz5rufatbba4nx6e5udw.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307870:65": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307870-28mbeafj/inductor/cq/ccqoxx7jjyr33c4s4jro2vkuatbsrnggsz5rufatbba4nx6e5udw.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307870:68": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307870-28mbeafj/inductor/cq/ccqoxx7jjyr33c4s4jro2vkuatbsrnggsz5rufatbba4nx6e5udw.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307870:71": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307870-28mbeafj/inductor/cq/ccqoxx7jjyr33c4s4jro2vkuatbsrnggsz5rufatbba4nx6e5udw.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307870:74": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307870-28mbeafj/inductor/cq/ccqoxx7jjyr33c4s4jro2vkuatbsrnggsz5rufatbba4nx6e5udw.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307870:77": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307870-28mbeafj/inductor/cq/ccqoxx7jjyr33c4s4jro2vkuatbsrnggsz5rufatbba4nx6e5udw.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307870:80": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307870-28mbeafj/inductor/cq/ccqoxx7jjyr33c4s4jro2vkuatbsrnggsz5rufatbba4nx6e5udw.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307870:83": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307870-28mbeafj/inductor/cq/ccqoxx7jjyr33c4s4jro2vkuatbsrnggsz5rufatbba4nx6e5udw.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307870:86": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307870-28mbeafj/inductor/cq/ccqoxx7jjyr33c4s4jro2vkuatbsrnggsz5rufatbba4nx6e5udw.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307870:89": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307870-28mbeafj/inductor/cq/ccqoxx7jjyr33c4s4jro2vkuatbsrnggsz5rufatbba4nx6e5udw.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307870:92": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307870-28mbeafj/inductor/cq/ccqoxx7jjyr33c4s4jro2vkuatbsrnggsz5rufatbba4nx6e5udw.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307870:95": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307870-28mbeafj/inductor/cq/ccqoxx7jjyr33c4s4jro2vkuatbsrnggsz5rufatbba4nx6e5udw.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307870:98": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307870-28mbeafj/inductor/cq/ccqoxx7jjyr33c4s4jro2vkuatbsrnggsz5rufatbba4nx6e5udw.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307870:101": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307870-28mbeafj/inductor/cq/ccqoxx7jjyr33c4s4jro2vkuatbsrnggsz5rufatbba4nx6e5udw.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307870:104": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307870-28mbeafj/inductor/cq/ccqoxx7jjyr33c4s4jro2vkuatbsrnggsz5rufatbba4nx6e5udw.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307870:107": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307870-28mbeafj/inductor/cq/ccqoxx7jjyr33c4s4jro2vkuatbsrnggsz5rufatbba4nx6e5udw.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307870:110": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307870-28mbeafj/inductor/cq/ccqoxx7jjyr33c4s4jro2vkuatbsrnggsz5rufatbba4nx6e5udw.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307870:113": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307870-28mbeafj/inductor/cq/ccqoxx7jjyr33c4s4jro2vkuatbsrnggsz5rufatbba4nx6e5udw.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307870:116": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307870-28mbeafj/inductor/cq/ccqoxx7jjyr33c4s4jro2vkuatbsrnggsz5rufatbba4nx6e5udw.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307870:119": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307870-28mbeafj/inductor/cq/ccqoxx7jjyr33c4s4jro2vkuatbsrnggsz5rufatbba4nx6e5udw.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307870:122": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307870-28mbeafj/inductor/cq/ccqoxx7jjyr33c4s4jro2vkuatbsrnggsz5rufatbba4nx6e5udw.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307871:5": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307871-lvvjyc31/inductor/zd/czdafwzgo2o2qgfzrvtjq7dkaxxwxcanneg2iwudmtz7xox333ob.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307871:8": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307871-lvvjyc31/inductor/zd/czdafwzgo2o2qgfzrvtjq7dkaxxwxcanneg2iwudmtz7xox333ob.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307871:11": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307871-lvvjyc31/inductor/zd/czdafwzgo2o2qgfzrvtjq7dkaxxwxcanneg2iwudmtz7xox333ob.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307871:14": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307871-lvvjyc31/inductor/zd/czdafwzgo2o2qgfzrvtjq7dkaxxwxcanneg2iwudmtz7xox333ob.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307871:17": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307871-lvvjyc31/inductor/zd/czdafwzgo2o2qgfzrvtjq7dkaxxwxcanneg2iwudmtz7xox333ob.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307871:20": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307871-lvvjyc31/inductor/zd/czdafwzgo2o2qgfzrvtjq7dkaxxwxcanneg2iwudmtz7xox333ob.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307871:23": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307871-lvvjyc31/inductor/zd/czdafwzgo2o2qgfzrvtjq7dkaxxwxcanneg2iwudmtz7xox333ob.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307871:26": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307871-lvvjyc31/inductor/zd/czdafwzgo2o2qgfzrvtjq7dkaxxwxcanneg2iwudmtz7xox333ob.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307871:29": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307871-lvvjyc31/inductor/zd/czdafwzgo2o2qgfzrvtjq7dkaxxwxcanneg2iwudmtz7xox333ob.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307871:32": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307871-lvvjyc31/inductor/zd/czdafwzgo2o2qgfzrvtjq7dkaxxwxcanneg2iwudmtz7xox333ob.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307871:35": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307871-lvvjyc31/inductor/zd/czdafwzgo2o2qgfzrvtjq7dkaxxwxcanneg2iwudmtz7xox333ob.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307871:38": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307871-lvvjyc31/inductor/zd/czdafwzgo2o2qgfzrvtjq7dkaxxwxcanneg2iwudmtz7xox333ob.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307871:41": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307871-lvvjyc31/inductor/zd/czdafwzgo2o2qgfzrvtjq7dkaxxwxcanneg2iwudmtz7xox333ob.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307871:44": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307871-lvvjyc31/inductor/zd/czdafwzgo2o2qgfzrvtjq7dkaxxwxcanneg2iwudmtz7xox333ob.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307871:47": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307871-lvvjyc31/inductor/zd/czdafwzgo2o2qgfzrvtjq7dkaxxwxcanneg2iwudmtz7xox333ob.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307871:50": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307871-lvvjyc31/inductor/zd/czdafwzgo2o2qgfzrvtjq7dkaxxwxcanneg2iwudmtz7xox333ob.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307871:53": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307871-lvvjyc31/inductor/zd/czdafwzgo2o2qgfzrvtjq7dkaxxwxcanneg2iwudmtz7xox333ob.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307871:56": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307871-lvvjyc31/inductor/zd/czdafwzgo2o2qgfzrvtjq7dkaxxwxcanneg2iwudmtz7xox333ob.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307871:59": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307871-lvvjyc31/inductor/zd/czdafwzgo2o2qgfzrvtjq7dkaxxwxcanneg2iwudmtz7xox333ob.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307871:62": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307871-lvvjyc31/inductor/zd/czdafwzgo2o2qgfzrvtjq7dkaxxwxcanneg2iwudmtz7xox333ob.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307871:65": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307871-lvvjyc31/inductor/zd/czdafwzgo2o2qgfzrvtjq7dkaxxwxcanneg2iwudmtz7xox333ob.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307871:68": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307871-lvvjyc31/inductor/zd/czdafwzgo2o2qgfzrvtjq7dkaxxwxcanneg2iwudmtz7xox333ob.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307871:71": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307871-lvvjyc31/inductor/zd/czdafwzgo2o2qgfzrvtjq7dkaxxwxcanneg2iwudmtz7xox333ob.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307871:74": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307871-lvvjyc31/inductor/zd/czdafwzgo2o2qgfzrvtjq7dkaxxwxcanneg2iwudmtz7xox333ob.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307871:77": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307871-lvvjyc31/inductor/zd/czdafwzgo2o2qgfzrvtjq7dkaxxwxcanneg2iwudmtz7xox333ob.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307871:80": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307871-lvvjyc31/inductor/zd/czdafwzgo2o2qgfzrvtjq7dkaxxwxcanneg2iwudmtz7xox333ob.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307871:83": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307871-lvvjyc31/inductor/zd/czdafwzgo2o2qgfzrvtjq7dkaxxwxcanneg2iwudmtz7xox333ob.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307871:86": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307871-lvvjyc31/inductor/zd/czdafwzgo2o2qgfzrvtjq7dkaxxwxcanneg2iwudmtz7xox333ob.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307871:89": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307871-lvvjyc31/inductor/zd/czdafwzgo2o2qgfzrvtjq7dkaxxwxcanneg2iwudmtz7xox333ob.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307871:92": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307871-lvvjyc31/inductor/zd/czdafwzgo2o2qgfzrvtjq7dkaxxwxcanneg2iwudmtz7xox333ob.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307871:95": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307871-lvvjyc31/inductor/zd/czdafwzgo2o2qgfzrvtjq7dkaxxwxcanneg2iwudmtz7xox333ob.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307871:98": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307871-lvvjyc31/inductor/zd/czdafwzgo2o2qgfzrvtjq7dkaxxwxcanneg2iwudmtz7xox333ob.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307871:101": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307871-lvvjyc31/inductor/zd/czdafwzgo2o2qgfzrvtjq7dkaxxwxcanneg2iwudmtz7xox333ob.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307871:104": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307871-lvvjyc31/inductor/zd/czdafwzgo2o2qgfzrvtjq7dkaxxwxcanneg2iwudmtz7xox333ob.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307871:107": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307871-lvvjyc31/inductor/zd/czdafwzgo2o2qgfzrvtjq7dkaxxwxcanneg2iwudmtz7xox333ob.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307871:110": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307871-lvvjyc31/inductor/zd/czdafwzgo2o2qgfzrvtjq7dkaxxwxcanneg2iwudmtz7xox333ob.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307871:113": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307871-lvvjyc31/inductor/zd/czdafwzgo2o2qgfzrvtjq7dkaxxwxcanneg2iwudmtz7xox333ob.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307871:116": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307871-lvvjyc31/inductor/zd/czdafwzgo2o2qgfzrvtjq7dkaxxwxcanneg2iwudmtz7xox333ob.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307871:119": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307871-lvvjyc31/inductor/zd/czdafwzgo2o2qgfzrvtjq7dkaxxwxcanneg2iwudmtz7xox333ob.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307871:122": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307871-lvvjyc31/inductor/zd/czdafwzgo2o2qgfzrvtjq7dkaxxwxcanneg2iwudmtz7xox333ob.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307872:5": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307872-_vjdui5b/inductor/io/ciohqitass5zun5e5v6yzelnnzql5r5d6qpvffedo7vvf66qdjct.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307872:8": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307872-_vjdui5b/inductor/io/ciohqitass5zun5e5v6yzelnnzql5r5d6qpvffedo7vvf66qdjct.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307872:11": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307872-_vjdui5b/inductor/io/ciohqitass5zun5e5v6yzelnnzql5r5d6qpvffedo7vvf66qdjct.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307872:14": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307872-_vjdui5b/inductor/io/ciohqitass5zun5e5v6yzelnnzql5r5d6qpvffedo7vvf66qdjct.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307872:17": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307872-_vjdui5b/inductor/io/ciohqitass5zun5e5v6yzelnnzql5r5d6qpvffedo7vvf66qdjct.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307872:20": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307872-_vjdui5b/inductor/io/ciohqitass5zun5e5v6yzelnnzql5r5d6qpvffedo7vvf66qdjct.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307872:23": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307872-_vjdui5b/inductor/io/ciohqitass5zun5e5v6yzelnnzql5r5d6qpvffedo7vvf66qdjct.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307872:26": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307872-_vjdui5b/inductor/io/ciohqitass5zun5e5v6yzelnnzql5r5d6qpvffedo7vvf66qdjct.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307872:29": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307872-_vjdui5b/inductor/io/ciohqitass5zun5e5v6yzelnnzql5r5d6qpvffedo7vvf66qdjct.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307872:32": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307872-_vjdui5b/inductor/io/ciohqitass5zun5e5v6yzelnnzql5r5d6qpvffedo7vvf66qdjct.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307872:35": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307872-_vjdui5b/inductor/io/ciohqitass5zun5e5v6yzelnnzql5r5d6qpvffedo7vvf66qdjct.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307872:38": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307872-_vjdui5b/inductor/io/ciohqitass5zun5e5v6yzelnnzql5r5d6qpvffedo7vvf66qdjct.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307872:41": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307872-_vjdui5b/inductor/io/ciohqitass5zun5e5v6yzelnnzql5r5d6qpvffedo7vvf66qdjct.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307872:44": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307872-_vjdui5b/inductor/io/ciohqitass5zun5e5v6yzelnnzql5r5d6qpvffedo7vvf66qdjct.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307872:47": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307872-_vjdui5b/inductor/io/ciohqitass5zun5e5v6yzelnnzql5r5d6qpvffedo7vvf66qdjct.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307872:50": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307872-_vjdui5b/inductor/io/ciohqitass5zun5e5v6yzelnnzql5r5d6qpvffedo7vvf66qdjct.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307872:53": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307872-_vjdui5b/inductor/io/ciohqitass5zun5e5v6yzelnnzql5r5d6qpvffedo7vvf66qdjct.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307872:56": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307872-_vjdui5b/inductor/io/ciohqitass5zun5e5v6yzelnnzql5r5d6qpvffedo7vvf66qdjct.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307872:59": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307872-_vjdui5b/inductor/io/ciohqitass5zun5e5v6yzelnnzql5r5d6qpvffedo7vvf66qdjct.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307872:62": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307872-_vjdui5b/inductor/io/ciohqitass5zun5e5v6yzelnnzql5r5d6qpvffedo7vvf66qdjct.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307872:65": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307872-_vjdui5b/inductor/io/ciohqitass5zun5e5v6yzelnnzql5r5d6qpvffedo7vvf66qdjct.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307872:68": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307872-_vjdui5b/inductor/io/ciohqitass5zun5e5v6yzelnnzql5r5d6qpvffedo7vvf66qdjct.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307872:71": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307872-_vjdui5b/inductor/io/ciohqitass5zun5e5v6yzelnnzql5r5d6qpvffedo7vvf66qdjct.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307872:74": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307872-_vjdui5b/inductor/io/ciohqitass5zun5e5v6yzelnnzql5r5d6qpvffedo7vvf66qdjct.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307872:77": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307872-_vjdui5b/inductor/io/ciohqitass5zun5e5v6yzelnnzql5r5d6qpvffedo7vvf66qdjct.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307872:80": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307872-_vjdui5b/inductor/io/ciohqitass5zun5e5v6yzelnnzql5r5d6qpvffedo7vvf66qdjct.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307872:83": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307872-_vjdui5b/inductor/io/ciohqitass5zun5e5v6yzelnnzql5r5d6qpvffedo7vvf66qdjct.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307872:86": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307872-_vjdui5b/inductor/io/ciohqitass5zun5e5v6yzelnnzql5r5d6qpvffedo7vvf66qdjct.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307872:89": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307872-_vjdui5b/inductor/io/ciohqitass5zun5e5v6yzelnnzql5r5d6qpvffedo7vvf66qdjct.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307872:92": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307872-_vjdui5b/inductor/io/ciohqitass5zun5e5v6yzelnnzql5r5d6qpvffedo7vvf66qdjct.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307872:95": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307872-_vjdui5b/inductor/io/ciohqitass5zun5e5v6yzelnnzql5r5d6qpvffedo7vvf66qdjct.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307872:98": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307872-_vjdui5b/inductor/io/ciohqitass5zun5e5v6yzelnnzql5r5d6qpvffedo7vvf66qdjct.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307872:101": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307872-_vjdui5b/inductor/io/ciohqitass5zun5e5v6yzelnnzql5r5d6qpvffedo7vvf66qdjct.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307872:104": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307872-_vjdui5b/inductor/io/ciohqitass5zun5e5v6yzelnnzql5r5d6qpvffedo7vvf66qdjct.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307872:107": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307872-_vjdui5b/inductor/io/ciohqitass5zun5e5v6yzelnnzql5r5d6qpvffedo7vvf66qdjct.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307872:110": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307872-_vjdui5b/inductor/io/ciohqitass5zun5e5v6yzelnnzql5r5d6qpvffedo7vvf66qdjct.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307872:113": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307872-_vjdui5b/inductor/io/ciohqitass5zun5e5v6yzelnnzql5r5d6qpvffedo7vvf66qdjct.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307872:116": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307872-_vjdui5b/inductor/io/ciohqitass5zun5e5v6yzelnnzql5r5d6qpvffedo7vvf66qdjct.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307872:119": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307872-_vjdui5b/inductor/io/ciohqitass5zun5e5v6yzelnnzql5r5d6qpvffedo7vvf66qdjct.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307872:122": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307872-_vjdui5b/inductor/io/ciohqitass5zun5e5v6yzelnnzql5r5d6qpvffedo7vvf66qdjct.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307873:5": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307873-0o0_tsgy/inductor/fs/cfsq3e3mtbbv33gfsvnmzmbgvgnfmeez7oz5rvmwagysy4fcfocn.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307873:8": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307873-0o0_tsgy/inductor/fs/cfsq3e3mtbbv33gfsvnmzmbgvgnfmeez7oz5rvmwagysy4fcfocn.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307873:11": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307873-0o0_tsgy/inductor/fs/cfsq3e3mtbbv33gfsvnmzmbgvgnfmeez7oz5rvmwagysy4fcfocn.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307873:14": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307873-0o0_tsgy/inductor/fs/cfsq3e3mtbbv33gfsvnmzmbgvgnfmeez7oz5rvmwagysy4fcfocn.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307873:17": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307873-0o0_tsgy/inductor/fs/cfsq3e3mtbbv33gfsvnmzmbgvgnfmeez7oz5rvmwagysy4fcfocn.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307873:20": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307873-0o0_tsgy/inductor/fs/cfsq3e3mtbbv33gfsvnmzmbgvgnfmeez7oz5rvmwagysy4fcfocn.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307873:23": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307873-0o0_tsgy/inductor/fs/cfsq3e3mtbbv33gfsvnmzmbgvgnfmeez7oz5rvmwagysy4fcfocn.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307873:26": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307873-0o0_tsgy/inductor/fs/cfsq3e3mtbbv33gfsvnmzmbgvgnfmeez7oz5rvmwagysy4fcfocn.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307873:29": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307873-0o0_tsgy/inductor/fs/cfsq3e3mtbbv33gfsvnmzmbgvgnfmeez7oz5rvmwagysy4fcfocn.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307873:32": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307873-0o0_tsgy/inductor/fs/cfsq3e3mtbbv33gfsvnmzmbgvgnfmeez7oz5rvmwagysy4fcfocn.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307873:35": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307873-0o0_tsgy/inductor/fs/cfsq3e3mtbbv33gfsvnmzmbgvgnfmeez7oz5rvmwagysy4fcfocn.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307873:38": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307873-0o0_tsgy/inductor/fs/cfsq3e3mtbbv33gfsvnmzmbgvgnfmeez7oz5rvmwagysy4fcfocn.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307873:41": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307873-0o0_tsgy/inductor/fs/cfsq3e3mtbbv33gfsvnmzmbgvgnfmeez7oz5rvmwagysy4fcfocn.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307873:44": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307873-0o0_tsgy/inductor/fs/cfsq3e3mtbbv33gfsvnmzmbgvgnfmeez7oz5rvmwagysy4fcfocn.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307873:47": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307873-0o0_tsgy/inductor/fs/cfsq3e3mtbbv33gfsvnmzmbgvgnfmeez7oz5rvmwagysy4fcfocn.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307873:50": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307873-0o0_tsgy/inductor/fs/cfsq3e3mtbbv33gfsvnmzmbgvgnfmeez7oz5rvmwagysy4fcfocn.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307873:53": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307873-0o0_tsgy/inductor/fs/cfsq3e3mtbbv33gfsvnmzmbgvgnfmeez7oz5rvmwagysy4fcfocn.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307873:56": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307873-0o0_tsgy/inductor/fs/cfsq3e3mtbbv33gfsvnmzmbgvgnfmeez7oz5rvmwagysy4fcfocn.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307873:59": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307873-0o0_tsgy/inductor/fs/cfsq3e3mtbbv33gfsvnmzmbgvgnfmeez7oz5rvmwagysy4fcfocn.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307873:62": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307873-0o0_tsgy/inductor/fs/cfsq3e3mtbbv33gfsvnmzmbgvgnfmeez7oz5rvmwagysy4fcfocn.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307873:65": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307873-0o0_tsgy/inductor/fs/cfsq3e3mtbbv33gfsvnmzmbgvgnfmeez7oz5rvmwagysy4fcfocn.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307873:68": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307873-0o0_tsgy/inductor/fs/cfsq3e3mtbbv33gfsvnmzmbgvgnfmeez7oz5rvmwagysy4fcfocn.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307873:71": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307873-0o0_tsgy/inductor/fs/cfsq3e3mtbbv33gfsvnmzmbgvgnfmeez7oz5rvmwagysy4fcfocn.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307873:74": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307873-0o0_tsgy/inductor/fs/cfsq3e3mtbbv33gfsvnmzmbgvgnfmeez7oz5rvmwagysy4fcfocn.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307873:77": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307873-0o0_tsgy/inductor/fs/cfsq3e3mtbbv33gfsvnmzmbgvgnfmeez7oz5rvmwagysy4fcfocn.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307873:80": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307873-0o0_tsgy/inductor/fs/cfsq3e3mtbbv33gfsvnmzmbgvgnfmeez7oz5rvmwagysy4fcfocn.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307873:83": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307873-0o0_tsgy/inductor/fs/cfsq3e3mtbbv33gfsvnmzmbgvgnfmeez7oz5rvmwagysy4fcfocn.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307873:86": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307873-0o0_tsgy/inductor/fs/cfsq3e3mtbbv33gfsvnmzmbgvgnfmeez7oz5rvmwagysy4fcfocn.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307873:89": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307873-0o0_tsgy/inductor/fs/cfsq3e3mtbbv33gfsvnmzmbgvgnfmeez7oz5rvmwagysy4fcfocn.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307873:92": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307873-0o0_tsgy/inductor/fs/cfsq3e3mtbbv33gfsvnmzmbgvgnfmeez7oz5rvmwagysy4fcfocn.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307873:95": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307873-0o0_tsgy/inductor/fs/cfsq3e3mtbbv33gfsvnmzmbgvgnfmeez7oz5rvmwagysy4fcfocn.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307873:98": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307873-0o0_tsgy/inductor/fs/cfsq3e3mtbbv33gfsvnmzmbgvgnfmeez7oz5rvmwagysy4fcfocn.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307873:101": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307873-0o0_tsgy/inductor/fs/cfsq3e3mtbbv33gfsvnmzmbgvgnfmeez7oz5rvmwagysy4fcfocn.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307873:104": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307873-0o0_tsgy/inductor/fs/cfsq3e3mtbbv33gfsvnmzmbgvgnfmeez7oz5rvmwagysy4fcfocn.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307873:107": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307873-0o0_tsgy/inductor/fs/cfsq3e3mtbbv33gfsvnmzmbgvgnfmeez7oz5rvmwagysy4fcfocn.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307873:110": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307873-0o0_tsgy/inductor/fs/cfsq3e3mtbbv33gfsvnmzmbgvgnfmeez7oz5rvmwagysy4fcfocn.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307873:113": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307873-0o0_tsgy/inductor/fs/cfsq3e3mtbbv33gfsvnmzmbgvgnfmeez7oz5rvmwagysy4fcfocn.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307873:116": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307873-0o0_tsgy/inductor/fs/cfsq3e3mtbbv33gfsvnmzmbgvgnfmeez7oz5rvmwagysy4fcfocn.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307873:119": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307873-0o0_tsgy/inductor/fs/cfsq3e3mtbbv33gfsvnmzmbgvgnfmeez7oz5rvmwagysy4fcfocn.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 19,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3307873:122": {
   "wrapper": "compile_cache/lingbot-u4-2005-3307873-0o0_tsgy/inductor/fs/cfsq3e3mtbbv33gfsvnmzmbgvgnfmeez7oz5rvmwagysy4fcfocn.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_192x208_64x4_2x1_v_bz_coopB_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x240_64x4_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_192x192_64x4_1x2_h_bz_coopB_bias_TNN",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  }
 },
 "seconds": 18.2139892578125,
 "scope": "Sub-operation labels come from retained inductor wrapper source-node comments aligned to the recorded in-graph kernel order of one representative replay per (process, graphId). Alignment is greedy; unmatched kernels stay unlabeled. Labels identify the fused source ops, not tensor values."
}
